Hovedartikkel og oppsummering av serien om data maskiner kan stole på
«44 071 1 000 tonn CO2-ekvivalenter.»
Setningen ble skrevet av en språkmodell i Faktaportalens datalager i september 2026. Et menneske ville stusset over de to tallene etter hverandre. Modellen gjorde ikke det. Den gjentok strengen den fikk, like sikkert som den ville gjentatt et riktig tall.
Denne serien i fem deler handler om hva som skal til for at et datasett kan brukes av maskiner, og særlig av KI. Hovedpoenget kan sies kort: Maskinlesbart er ikke det samme som brukbart. Et tall må kunne forklare seg selv, fordi maskinen ikke spør.
Den røde tråden: ett tall
Serien følger ett tall hele veien: Norges klimagassutslipp i 2025, 44,1 millioner tonn CO2-ekvivalenter, fra SSBs tabell 13931.
Tallet har vært riktig hele tiden. Likevel har det i løpet av 2026 gått galt med nesten alt rundt det hos Faktaportalen. Enheten ble lest feil. Portalen brukte ordet «transport» om to av SSBs kategorier uten at en maskin kunne se det. Kildemerkene pekte på Miljødirektoratet. Sidene viste 2023 etter at SSB hadde publisert både 2024 og 2025. Og grensesnittet for KI-agenter oppga et 2024-tall som ikke stemte med SSB.
Hver del stiller ett av spørsmålene en maskin må kunne få svar på før den kan bruke tallet.
De fem delene
- Metadata er ikke pynt. Hva er tallet? Enheten, skalafaktoren og beregningsgrunnlaget sto i én tekststreng hos SSB. Om hva et tall trenger ved siden av verdien, og hvorfor det som ikke er et felt, ikke kan testes.
- Ontologi uten store ord. Hva betyr tallet? SSBs tabell har ingen kategori som heter transport. Om ordlister, begreper, kunnskapskartets fire koblingstyper, og prisen for å velge bort standardene.
- Kildehenvisningen er en påstand. Hvor kommer tallet fra? Kildemerkene ved utslippstallene var feil, og KI-verktøyet sendte en feil kilde videre som fakta. Om opphav, sporbarhet bakover og kildehenvisninger som ikke er skrevet for hånd.
- Et tall som endrer seg. Hva har endret seg? En fast liste med årstall holdt energisidene på 2023 mens alt var grønt. Om revisjoner, omlegginger og rettelser, og om skillet mellom «fra kilden» og «av oss».
- Når maskinen spør. Hvordan når maskinen tallet? Brukertesten av KI-grensesnittet fant et velformet galt svar. Om hva et grensesnitt for agenter må gjøre, og om forskjellen på maskinlesbar og tilgjengelig for maskiner.
Serien på én side
| Spørsmål | Hva maskinen trenger | Hva Faktaportalen gjør | Hva som mangler |
|---|---|---|---|
| Hva er tallet? | Enhet, skala, periode, beregningsgrunnlag og presisjon som egne felter | Enhet og skala er skilt, feil stoppes ved inngangen, hvert tall har periode og dato | Beregningsgrunnlag og aggregering står bare i kommentarer |
| Hva betyr tallet? | Definerte begreper og relasjoner | Små ordlister med én kilde hver, fire koblingstyper, årsakspåstander med begrunnelse | Ingen standardformat, ingen datasettbeskrivelse på sidene, «kadens» betyr tre ting |
| Hvor kommer det fra? | Kilden som faktisk leverte tallet, og hvordan | Én adressebok for lenker, kildemerke ved hver graf, opphav som felt | Kildemerket kontrolleres ikke mot hentingen |
| Hva har endret seg? | Versjon, historikk og hvem som endret | Datoen flyttes bare ved nye data, automatisk endringshistorikk, «fra kilden» og «av oss» | Datalageret har fortsatt en fast årsliste |
| Hvordan når maskinen det? | Et grensesnitt som bærer alt over i svaret | Versjon, periode og advarsler i hvert svar, ingen gjetning | Enheten står i etiketten, grensesnittet krever nøkkel, ingen nedlasting |
Tre ting som går igjen
Det som bare står i tekst, kan ikke kontrolleres. «1 000 tonn» i en overskrift, «transport» i en kodekommentar, «Miljødirektoratet» i et kildemerke skrevet for hånd. Hver gang betydningen lå i en fritekst, drev den fra virkeligheten uten at noe sa fra. Hver gang den ble gjort om til et felt med kjente verdier, kunne en test vokte den.
Hvert begrep skal defineres ett sted. Portalen motsa seg selv når det samme begrepet var definert to steder: 91 datasett på forsiden mot 167 i kildeoversikten, eller en ferskhetsterskel på 60 dager for leseren og 120 for KI-agenten. Én kilde per begrep, og en test som sjekker kopiene, er den enkleste formen for ontologi.
Ærlighet om usikkerhet er også metadata. Å merke tolkning som tolkning, skille kildens revisjon fra vår egen rettelse og advare når tall fra ulike år havner i samme svar, er ikke høflighet. Det er informasjon en maskin trenger for å vekte det den får.
Hvorfor KI gjør dette viktigere
Et menneske som leser en tabell, fyller inn det som mangler. Det ser at to tall etter hverandre er rart, at 2023 er et gammelt år, og at en kilde ikke passer til temaet.
En språkmodell fyller også inn, men med det som er mest sannsynlig, og den sier ikke fra når den gjetter. Det alvorligste funnet i brukertesten av portalens KI-grensesnitt var nettopp et svar der alt så riktig ut: etikett, periode og kilde. Bare tallet var feil.
Jo mer av betydningen som ligger i dataene selv, jo mindre er det igjen å gjette på.
Slik leser du serien
Delene bygger på hverandre og er skrevet for å leses i rekkefølge, men hver del kan også leses alene. Hver del har lenker til forrige og neste del, avsluttes med det portalen fortsatt ikke gjør, og har kildene nederst.