2026-09-28

5 min lesing

Knut Ole Thoreplass

Data maskiner kan stole på: et tall må kunne forklare seg selv

En språkmodell stusser ikke over to tall etter hverandre. Den gjentar det den får. Hovedartikkel og oppsummering av serien i fem deler om hvordan datasett blir maskinlesbare og brukbare for KI, med eksempler fra Faktaportalen.

Foto: Ilya Semenov / Unsplash

Hovedartikkel og oppsummering av serien om data maskiner kan stole på

«44 071 1 000 tonn CO2-ekvivalenter.»

Setningen ble skrevet av en språkmodell i Faktaportalens datalager i september 2026. Et menneske ville stusset over de to tallene etter hverandre. Modellen gjorde ikke det. Den gjentok strengen den fikk, like sikkert som den ville gjentatt et riktig tall.

Denne serien i fem deler handler om hva som skal til for at et datasett kan brukes av maskiner, og særlig av KI. Hovedpoenget kan sies kort: Maskinlesbart er ikke det samme som brukbart. Et tall må kunne forklare seg selv, fordi maskinen ikke spør.

Den røde tråden: ett tall

Serien følger ett tall hele veien: Norges klimagassutslipp i 2025, 44,1 millioner tonn CO2-ekvivalenter, fra SSBs tabell 13931.

Tallet har vært riktig hele tiden. Likevel har det i løpet av 2026 gått galt med nesten alt rundt det hos Faktaportalen. Enheten ble lest feil. Portalen brukte ordet «transport» om to av SSBs kategorier uten at en maskin kunne se det. Kildemerkene pekte på Miljødirektoratet. Sidene viste 2023 etter at SSB hadde publisert både 2024 og 2025. Og grensesnittet for KI-agenter oppga et 2024-tall som ikke stemte med SSB.

Hver del stiller ett av spørsmålene en maskin må kunne få svar på før den kan bruke tallet.

De fem delene

  1. Metadata er ikke pynt. Hva er tallet? Enheten, skalafaktoren og beregningsgrunnlaget sto i én tekststreng hos SSB. Om hva et tall trenger ved siden av verdien, og hvorfor det som ikke er et felt, ikke kan testes.
  2. Ontologi uten store ord. Hva betyr tallet? SSBs tabell har ingen kategori som heter transport. Om ordlister, begreper, kunnskapskartets fire koblingstyper, og prisen for å velge bort standardene.
  3. Kildehenvisningen er en påstand. Hvor kommer tallet fra? Kildemerkene ved utslippstallene var feil, og KI-verktøyet sendte en feil kilde videre som fakta. Om opphav, sporbarhet bakover og kildehenvisninger som ikke er skrevet for hånd.
  4. Et tall som endrer seg. Hva har endret seg? En fast liste med årstall holdt energisidene på 2023 mens alt var grønt. Om revisjoner, omlegginger og rettelser, og om skillet mellom «fra kilden» og «av oss».
  5. Når maskinen spør. Hvordan når maskinen tallet? Brukertesten av KI-grensesnittet fant et velformet galt svar. Om hva et grensesnitt for agenter må gjøre, og om forskjellen på maskinlesbar og tilgjengelig for maskiner.

Serien på én side

SpørsmålHva maskinen trengerHva Faktaportalen gjørHva som mangler
Hva er tallet?Enhet, skala, periode, beregningsgrunnlag og presisjon som egne felterEnhet og skala er skilt, feil stoppes ved inngangen, hvert tall har periode og datoBeregningsgrunnlag og aggregering står bare i kommentarer
Hva betyr tallet?Definerte begreper og relasjonerSmå ordlister med én kilde hver, fire koblingstyper, årsakspåstander med begrunnelseIngen standardformat, ingen datasettbeskrivelse på sidene, «kadens» betyr tre ting
Hvor kommer det fra?Kilden som faktisk leverte tallet, og hvordanÉn adressebok for lenker, kildemerke ved hver graf, opphav som feltKildemerket kontrolleres ikke mot hentingen
Hva har endret seg?Versjon, historikk og hvem som endretDatoen flyttes bare ved nye data, automatisk endringshistorikk, «fra kilden» og «av oss»Datalageret har fortsatt en fast årsliste
Hvordan når maskinen det?Et grensesnitt som bærer alt over i svaretVersjon, periode og advarsler i hvert svar, ingen gjetningEnheten står i etiketten, grensesnittet krever nøkkel, ingen nedlasting

Tre ting som går igjen

Det som bare står i tekst, kan ikke kontrolleres. «1 000 tonn» i en overskrift, «transport» i en kodekommentar, «Miljødirektoratet» i et kildemerke skrevet for hånd. Hver gang betydningen lå i en fritekst, drev den fra virkeligheten uten at noe sa fra. Hver gang den ble gjort om til et felt med kjente verdier, kunne en test vokte den.

Hvert begrep skal defineres ett sted. Portalen motsa seg selv når det samme begrepet var definert to steder: 91 datasett på forsiden mot 167 i kildeoversikten, eller en ferskhetsterskel på 60 dager for leseren og 120 for KI-agenten. Én kilde per begrep, og en test som sjekker kopiene, er den enkleste formen for ontologi.

Ærlighet om usikkerhet er også metadata. Å merke tolkning som tolkning, skille kildens revisjon fra vår egen rettelse og advare når tall fra ulike år havner i samme svar, er ikke høflighet. Det er informasjon en maskin trenger for å vekte det den får.

Hvorfor KI gjør dette viktigere

Et menneske som leser en tabell, fyller inn det som mangler. Det ser at to tall etter hverandre er rart, at 2023 er et gammelt år, og at en kilde ikke passer til temaet.

En språkmodell fyller også inn, men med det som er mest sannsynlig, og den sier ikke fra når den gjetter. Det alvorligste funnet i brukertesten av portalens KI-grensesnitt var nettopp et svar der alt så riktig ut: etikett, periode og kilde. Bare tallet var feil.

Jo mer av betydningen som ligger i dataene selv, jo mindre er det igjen å gjette på.

Slik leser du serien

Delene bygger på hverandre og er skrevet for å leses i rekkefølge, men hver del kan også leses alene. Hver del har lenker til forrige og neste del, avsluttes med det portalen fortsatt ikke gjør, og har kildene nederst.

Start med del 1: Metadata er ikke pynt →

Hva synes du?