Del 1 av 5 i serien om data maskiner kan stole på
← Hovedartikkel: Et tall må kunne forklare seg selv
I begynnelsen av september 2026 skrev en språkmodell en kort oppsummering av Norges klimagassutslipp for Faktaportalens datalager [4]. Setningen inneholdt tallet «44 071 1 000 tonn CO2-ekvivalenter».
Et menneske ville stoppet ved de to tallene etter hverandre. Er det 44 071 eller 1 000? Eller 44 071 ganger 1 000? Modellen stoppet ikke. Den fikk en streng og gjenga den ordrett, like sikkert som den ville gjengitt et riktig tall.
Denne serien handler om hva som skal til for at et datasett kan brukes av maskiner, og særlig av KI. Den følger ett tall gjennom hele serien: Norges klimagassutslipp i 2025, fra SSBs tabell 13931 [1]. I denne første delen er spørsmålet enkelt: Hva er egentlig dette tallet?
Hvor feilen kom fra
Feilen var ikke modellens, og den var heller ikke SSBs. Den oppsto da SSBs overskrift ble kopiert inn i et felt den ikke var laget for.
Statistikkvariabelen i tabell 13931 heter «Utslipp til luft (1 000 tonn CO2-ekvivalenter, AR5)» [1]. I den korte teksten står tre ting: måleenheten (tonn CO2-ekvivalenter), skalafaktoren (tallene er oppgitt i tusen tonn) og beregningsgrunnlaget (AR5, altså hvilke omregningsfaktorer som er brukt for å gjøre metan og lystgass om til CO2-ekvivalenter).
For et menneske som leser tabellen på ssb.no, er det greit. Overskriften står over tallene, og leseren gjør regnestykket i hodet. Men da teksten ble kopiert inn som «enhet» i datalageret, og koden satte tall og enhet sammen, ble resultatet to tall etter hverandre. Språkmodellen som skulle skrive prosa av det, arvet feilen.
Den samme tabellen har en annen statistikkvariabel som viser problemet enda tydeligere: «CO2 i 1 000 tonn, CH4 og N2O i tonn, HFK, PFK og SF6 i kg» [1]. Tre ulike skalaer for ulike gasser i én kolonne, beskrevet i en tekststreng. Et menneske leser det. En maskin må gjette.
Hva et tall trenger ved siden av verdien
Verdien 44 071 er bare én av mange egenskaper tallet har. Resten er metadata, og de fleste av dem har gitt Faktaportalen en feil i løpet av 2026.
| Egenskap | Eksempel fra tabell 13931 | Hva som går galt uten |
|---|---|---|
| Måleenhet | tonn CO2-ekvivalenter | Maskinen vet ikke hva som telles |
| Skalafaktor | tusen | 44 071 tonn i stedet for 44 millioner |
| Periode | 2025 | Tall fra ulike år sammenlignes som om de var like |
| Beregningsgrunnlag | AR5 | Tall med ulike omregningsfaktorer blandes |
| Aggregering | Summen av delkildene er 44 071, tabellens egen total er 44 073 | To «riktige» tall som ikke er like |
| Presisjon | 10,9 og 10,7 millioner tonn | Begge blir «11» og rangeringen forsvinner |
| Ferskhet | Sist hentet, og hvor ofte kilden publiserer | Et gammelt tall ser like ferskt ut som et nytt |
To av radene fortjener en forklaring.
Aggregering. Datalageret regnet ut hovedtallet som summen av de åtte delkildene i tabellen, og fikk 44 071. SSBs egen total for alle kilder er 44 073 tusen tonn. Begge er riktige. SSB skriver selv i tabellen at totaler kan avvike fra summen av undergruppene på grunn av avrunding [1]. Men en maskin som får begge tallene uten å vite hvordan de er laget, ser to ulike svar på samme spørsmål.
Presisjon. Portalens tallformatering runder til heltall når ingen desimaler er oppgitt. Utslippene fra olje- og gassutvinning (10,9 millioner tonn) og fra industrien (10,7) ble dermed «11» begge to, på de samme sidene som rangerte olje og gass foran industrien [5]. Antall desimaler er også metadata, og feil presisjon kan få riktige tall til å motsi hverandre.
Hva standardene sier
Ingenting av dette er nytt. FAIR-prinsippene fra 2016, som mye av forskningens datadeling bygger på, sier at data skal være lett å finne, tilgjengelige, samkjørbare og gjenbrukbare, og de legger vekt på at det skal gjelde for maskiner, ikke bare for mennesker. Et av prinsippene er at data skal beskrives rikt, med presise og relevante egenskaper [2].
W3Cs anbefalinger for data på nettet skiller mellom beskrivende metadata, som sier hva datasettet handler om, og strukturelle metadata, som sier hvordan det er bygget opp og hvordan verdiene skal leses [3]. Måleenhet og skalafaktor er strukturelle metadata. I tabell 13931 var det nettopp den typen som sto i en fritekst.
Hva Faktaportalen gjør
Rettelsen etter «44 071 1 000 tonn» gikk ut på å gjøre en tekst om til felter.
- Enhet og skala er to felter. Enheten er ren måleenhet, «tonn CO2-ekvivalenter». Skalafaktoren er et tall, 1000. Datalageret setter dem sammen til tekst først når tallet skal vises: «44 071 tusen tonn CO2-ekvivalenter».
- Feil stoppes ved inngangen. Innlesingen avviser en enhet som begynner med et tall, og en skalafaktor som ikke har en norsk ordform. Feilen kan dermed ikke lande i datalageret i det hele tatt.
- Samme regel fire steder, og en vokter. Ordformene for skalafaktorene står både i innlesingen, i en speilkopi av den, i transformasjonen og i testene. En sjekk i den automatiske kodeløypa feiler hvis de fire ikke beskriver det samme.
- Hver datafil har en dato. Alle datafilene bak portalen eksporterer når de sist ble oppdatert. Manuelt vedlikeholdte filer har i tillegg en kadens og en terskel, og sida viser et gult varsel når dataene er eldre enn terskelen, og et rødt når de er dobbelt så gamle.
- Et tall skal følges av perioden sin. Portalens grensesnitt for KI-agenter er bygget for å sende hvert tall med periode, selv om ikke alle tallene i grunnlaget har en ennå (se del 5). Begrunnelsen står i koden: et tall uten årstall er ubrukelig for en agent som skal sammenligne, og farlig hvis den ikke merker det [6].
- Utslipp vises med én desimal. En automatisk test feiler nå hvis et utslippstall på energisidene formateres uten desimal.
Det som ikke er et felt, kan ikke testes
Lærdommen fra tabell 13931 er ikke at SSB burde skrevet overskriften annerledes. Den er at metadata som bare finnes som tekst, ikke kan kontrolleres. Ingen test kan sjekke at «1 000 tonn» og «tusen tonn» betyr det samme, men en test kan sjekke at feltet skala har en av et fast sett verdier.
For KI er dette viktigere enn for mennesker. Et menneske fyller inn det som mangler, med sunn fornuft. En språkmodell fyller også inn, men med det som er mest sannsynlig å komme etter, og den sier ikke fra når den gjetter. Jo mer av betydningen som ligger i felter med kjente verdier, jo mindre er det å gjette på.
Egen vurdering: Det mest undervurderte metadatafeltet er ikke enheten, men forskjellen på kildens tall og et tall vi har regnet ut av kildens tall. Summen 44 071 er regnet ut av oss. Totalen 44 073 er SSBs. Begge er ærlige, men bare den ene er kildens tall.
Det portalen fortsatt ikke gjør
Rettelsen dekket enhet og skala. To av radene i tabellen over står fortsatt bare i kodekommentarer.
At utslippstallene er beregnet etter AR5, står i en kommentar i portalens datafil, ikke i et felt. Og at hovedtallet i datalageret er summen av delkildene og ikke SSBs egen total, står i en kommentar i transformasjonen. En maskin som leser dataene, finner ingen av delene.
I neste del: Hva betyr tallet? Tabell 13931 har ingen kategori som heter «transport», men portalen har en side om transportutslipp. Om begreper, relasjoner og ontologi uten store ord.
Les del 2: Ontologi uten store ord →
Kilder
- SSB. Tabell 13931: Klimagasser, etter utslippskilde, energiprodukt og komponent. Statistikkvariabler, fotnote om avrunding og tall for 2025.
- Wilkinson, M. D. mfl. (2016). The FAIR Guiding Principles for scientific data management and stewardship. Scientific Data 3.
- W3C (2017). Data on the Web Best Practices. Anbefalingene om beskrivende og strukturelle metadata.
- Faktaportalen. Bakgrunn og datakilder. Om datalageret og veiene tallene tar inn i portalen.
- Faktaportalen. Klimaeffekt. Utslippstallene fra tabell 13931 slik portalen viser dem.
- Faktaportalen. AI-verktøy og MCP. Om grensesnittet for KI-agenter.