2026-09-28

6 min lesing

Knut Ole Thoreplass

Kildehenvisningen er en påstand

Utslippstallene hentet fra SSB sto med Miljødirektoratet som kilde, og KI-verktøyet oppga en kilde portalen aldri har hentet noe fra. Del 3 av 5 i serien om data maskiner kan stole på, om kildehenvisninger og sporbarhet bakover.

Foto: Daniel Forsman / Unsplash

Del 3 av 5 i serien om data maskiner kan stole på

← Forrige del: Ontologi uten store ord

I september 2026 ble utslippssidene på Faktaportalen gjennomgått mot SSBs tabell 13931 [1]. Tallene var stort sett riktige. Kildehenvisningene var det ikke.

  • Kildemerkene ved grafene på energisidene oppga Miljødirektoratet eller Klimakur 2030 som kilde. Tallene kom fra SSB, hentet automatisk av portalens datapipeline.
  • Kortet for industrien sa at utslippene hadde gått ned 30 prosent siden 1990. Tabell 13931 viser en nedgang på over 40 prosent.
  • Luftfartssida oppga SSBs tabell over gods på norske lufthavner som kilde. Ingen tall på sida kom fra den.
  • Verktøyet som lar KI-agenter spørre portalen om kilder, listet Statens vegvesen som kilde for transporttallene. Portalen henter ingenting fra Statens vegvesen.

Den siste er den mest lærerike. En KI-agent som spurte portalen om kildene bak transportutslippene, fikk et velformet svar med en kilde som var feil. Den hadde ingen måte å oppdage det på.

Hvorfor kildehenvisninger forvitrer

Ingen av feilene over var bevisste. De har samme opphav: kildehenvisningen ble skrevet for hånd ved siden av tallet, mens tallet ble hentet av en maskin et annet sted.

Når tallet senere flyttes til en ny kilde, en ny tabell eller en ny beregning, følger ikke teksten med. Tallet er fortsatt riktig. Henvisningen er en påstand om hvor det kom fra, og ingen tester påstanden.

Tidligere revisjoner har funnet det samme. Én kontroll av økonomisidene fant fem SSB-tabellnumre som pekte på feil tabell. Toppen av boligsida oppga fire SSB-tabeller, og ingen av dem var en tabell sida faktisk leste. Grunnlagsfila for en artikkel om yrkeskjøretøy hadde fire tall som alle var feil da de ble kontrollert mot SSB: 92 000 lastebiler var 65 528.

For et menneske er en feil kildehenvisning irriterende. For en KI er den farligere, fordi kildehenvisningen er nettopp det som gjør at svaret virker til å stole på.

Hva sporbarhet bakover krever

W3C har en egen modell for dette, PROV, som beskriver opphavet til data med tre byggesteiner: entiteten (tallet eller datasettet), aktiviteten som laget det (en henting, en beregning) og agenten som er ansvarlig (en organisasjon, en person, et program) [2].

Man trenger ikke bruke PROV-formatet for å bruke ideen. En god kildehenvisning svarer på tre spørsmål:

  1. Hvilken kilde leverte tallet? Ikke hvilken organisasjon som eier temaet, men hvilken tabell tallet faktisk ble hentet fra.
  2. Hvordan kom det inn? Hentet automatisk fra et API, tatt fra et publisert datasett, eller lest ut av en rapport av et menneske eller en modell.
  3. Hvem har gjort noe med det? Er tallet kildens, eller har vi summert, regnet om eller tolket det?

Hva Faktaportalen gjør

  • Én adressebok for alle eksterne lenker. Alle lenker til kilder står i én fil, gruppert per organisasjon, med dato for når gruppen sist ble kontrollert. En lenke til en SSB-tabell skal aldri skrives direkte inn på en side.
  • Et kildemerke ved hver graf. Hver graf har et klikkbart merke med kilde og dato, for eksempel «SSB 13931 · 2026-09-11». Leseren skal aldri måtte bla til bunnen av sida for å finne ut hvor et tall kommer fra.
  • Én kildeoversikt. Kildesida lister 48 organisasjoner og 208 datasett i seks kategorier, og hver rad sier hvilken side som bruker datasettet, og om det oppdateres automatisk eller for hånd [3].
  • Opphav som felt. Manuelt vedlikeholdte rader må ha et opphav: API, datasett eller statisk, der statisk betyr at tallet er lest ut av en rapport eller en artikkel. En rad uten opphav stopper bygget. Siterer en graf en avisartikkel, krever en test at merket sier statisk, så en avissak aldri ser ut som et tall hentet fra et API.
  • Kildene per side. Fra datoen for sist oppdatering på hver side går det en lenke til en egen oversikt over kildene bak akkurat den datafila, for eksempel kildene bak energisidene [4].
  • Tolkning merkes som tolkning. Tekst der portalen tolker tallene, har et synlig merke og en fast forklaring under: «Vår tolkning av tallene. Selve tallene er hentet fra kildene som er oppgitt.» Er tallene vårt eget regneeksempel, eller et regnestykke en leser har sendt inn, sier merket det [5].

Etter kontrollen i september ble kildemerkene på utslippssidene rettet til SSB 13931, industrikortet regnes nå ut fra tabellen i stedet for å stå som fast tekst, og Statens vegvesen er fjernet fra grunnlaget KI-verktøyet leser. Rettelsen i bloggartikkelen som hadde samme feil, står åpent i endringsloggen i artikkelen om transport og energi.

Egen vurdering: Den viktigste av disse er opphavet. Et tall hentet fra et API og et tall lest ut av en PDF kan se helt like ut på en side. De er ikke like pålitelige, og en maskin som vet forskjellen, kan vekte dem ulikt.

Kildehenvisningen må være koblet til hentingen

Lærdommen fra utslippssidene er at en kildehenvisning er mest pålitelig når den ikke er skrevet for hånd, men kommer fra det samme stedet som tallet.

Portalen er halvveis der. Kildeoversikten og sidene med kilder per datafil leser fra de samme registrene, så de kan ikke motsi hverandre. Men kildemerket ved grafen skrives fortsatt for hånd, rett ved siden av grafen, og det var nettopp det merket som var feil. KI-verktøyet henter kildene sine fra et tredje sted: grunnlagsfilene som artiklene skrives fra. Det var der Statens vegvesen sto.

Det portalen fortsatt ikke gjør

  • Ingen vokter kobler merket til hentingen. At kildemerket ved en graf sier SSB 13931, sjekkes ikke mot hvilken tabell datapipelinen faktisk hentet. Feilene på utslippssidene ble funnet i en manuell gjennomgang, ikke av en vokter.
  • Vokteren sjekker filer, ikke grafer. Den automatiske sjekken ser bare om en side har kildemerker i det hele tatt, ikke om hver graf har et. Per 1. september manglet fire av 52 slike filer kildemerker helt. I dag mangler fem av 62.
  • KI-verktøyet har sin egen kildeliste. Kildene en agent får oppgitt, kommer fra grunnlagsfilene for artiklene, ikke fra kildeoversikten. Ingen test sjekker at de to sier det samme.
  • Opphavet er ikke med overalt. Opphav er påkrevd på manuelt vedlikeholdte rader, men ikke synlig i svarene KI-verktøyet gir. En agent ser kilden, men ikke om tallet er hentet fra et API eller lest ut av en rapport.

I neste del: Hva har endret seg? Tabell 13931 hadde fått to nye år, portalen viste fortsatt 2023, og ingenting var rødt.

Les del 4: Et tall som endrer seg →

Kilder

  1. SSB. Tabell 13931: Klimagasser, etter utslippskilde, energiprodukt og komponent.
  2. W3C (2013). PROV-O: The PROV Ontology.
  3. Faktaportalen. Kilder. Kildeoversikten med opphav per datasett.
  4. Faktaportalen. Kildene bak energisidene.
  5. Faktaportalen. Bakgrunn og datakilder. Om hvordan tallene kommer inn, og hvordan tolkning merkes.
Hva synes du?