2026-09-29

4 min lesing

Faktaportalen

Kan en KI-agent bevise at den siterer riktig? Vi prøvde det på NAVs statistikknotater

Stanford-mønsteret Paper2Agent gjør en forskningsartikkel til en agent som må gjenskape sine egne resultater før den får svare på nye spørsmål. Vi prøvde samme oppskrift på NAVs kvartalsnotater om AAP og uføretrygd - og fant et tall som ikke lot seg gjenskape.

Foto: Austin Distel / Unsplash

Tenk deg at en KI-agent siterer et tall fra en kilde. Hvordan vet du at den ikke bare fant tallet opp, eller leste kilden feil? Et forskerteam ved Stanford beskrev i 2025 et mønster de kaller Paper2Agent [1]: gjør en forskningsartikkel om til en agent som må gjenskape artikkelens egne resultater før den får lov til å svare på nye spørsmål artikkelen ikke stiller selv. Vi har prøvd samme oppskrift på noe helt annet enn en forskningsartikkel - NAVs kvartalsvise statistikknotater om arbeidsavklaringspenger (AAP) og uføretrygd.

Fra PDF til datafil, men ikke til agent

Faktaportalen har lenge kjørt NAVs statistikknotater gjennom en AI-ekstraksjon: PDF-ene leses, hovedfunn og nøkkeltall trekkes ut, og resultatet skrives til to datafiler portalen bruker på sidene om AAP og uføretrygd. Det løste ett problem - tallene ble tilgjengelige for grafene - men skapte et nytt. En agent som spør Faktaportalens MCP-server om AAP-tall fikk bare tallene, ikke notatet de kom fra. Ingen hovedfunn, ingen av NAVs egne vurderinger, ingen diagnosefordeling, og ingenting som sa «dette er hva NAV selv skrev, med lenke til PDF-en».

Tre nye verktøy, og ett som etterprøver

Vi la til tre verktøy i den eksisterende MCP-serveren [4] - samme server, samme nøkkelkrav som før:

  • Hent notatet selv. Ett verktøy gir hovedfunn, NAVs egen vurdering, diagnosefordeling og tallene for et gitt kvartal, alltid med lenke til NAVs PDF og hvilken periode notatet gjelder.
  • Forklar begrepene. Et annet svarer på hva notatene faktisk mener med sine egne ord - hva er forskjellen mellom «smal» og «bred» i AAP-statistikken, og hva er de tre navnene NAV har brukt på uføretrygd over tid (uføreytelser til 2010, uførepensjon til 2015, uføretrygd i dag)? - hentet fra samme tekst som forklaringsboksene på portalen, ikke skrevet på nytt.
  • Gjenskap tidsserien. Det tredje regner selv ut endringen fra ett kvartal til det neste, og setter sitt eget tall side ved side med det NAV skrev i notatet.

Det siste verktøyet er kjernen i Paper2Agent-mønsteret: gjenskap kildens egne tall fra rådataene, i stedet for å bare gjengi dem.

Ett tall som stemmer, og ett som ikke gjør det

For AAP fjerde kvartal 2022 skriver NAV [2] at antall mottakere gikk opp 1,4 prosent fra kvartalet før. Regner vi selv fra tallene i tidsserien - 139 380 mottakere mot 137 423 kvartalet før - får vi 1,42 prosent. Det stemmer, innenfor avrunding.

For AAP første kvartal 2018 [3] skriver NAV derimot at endringen var minus 7,6 prosent. Ingen av de fire måtene vi kan regne det på - år-over-år eller kvartal-over-kvartal, på den smale eller den brede definisjonen NAV bruker - kommer nærmere enn 2,7 til drøyt 6 prosentpoeng fra det tallet. Vi vet ikke om det er en skrivefeil i notatet, en feil i AI-ekstraksjonen, eller en sammenligning NAV gjorde mot et grunnlag vi ikke har. Det vi vet, er at vi ikke kan late som det stemmer.

Hvorfor vi viser avviket i stedet for å skjule det

Den enkle løsningen ville vært å bare ikke nevne 2018-tallet. Den ærlige løsningen er å vise det åpent, med en begrunnelse, og la testene passe på at begrunnelsen fortsatt er sann.

Avviket står derfor i en egen, navngitt liste i koden, med tekst om hvorfor det ikke stemmer. En automatisk test kjører hver gang koden endres, og gjør to ting: den feiler hvis et nytt, udokumentert avvik dukker opp - en fersk regresjon som ellers ville gått ubemerket forbi - og den feiler også hvis et avvik som står i listen plutselig begynner å stemme igjen, fordi det da betyr at oppføringen er foreldet og skal fjernes. Verktøyet og testen bruker nøyaktig samme utregning, så de to kan ikke drifte fra hverandre over tid.

Et prinsipp som er større enn NAV-notatene

Poenget generaliserer utover denne ene datakilden. Overalt hvor en språkmodell har trukket tall og påstander ut av et dokument - en årsrapport, en forskningsartikkel, et referat - står man med samme spørsmål: stemmer utdraget med originalen? Paper2Agent-mønsteret gir et konkret svar: bygg agenten slik at den må reprodusere kildens egne resultater fra grunnlagsdataene, og la den vise forskjellen når den ikke kan. En agent som aldri kan ta feil åpent, er ikke mer troverdig enn en som ikke er testet.

Grenser for eksperimentet

To ting dette ikke er. Det er ikke automatisk generering av en agent fra en vilkårlig PDF - det er Paper2Agents fulle ambisjon, men vi startet med data vi allerede hadde kuratert og kvalitetssikret manuelt. Og reproduksjonen dekker bare kvartalene der vi faktisk har begge tallseriene å regne fra; enkelte tidlige kvartaler i uføretrygd-arkivet har for tynt datagrunnlag til at et NAV-tall kan etterprøves i det hele tatt. Det er ikke et avvik å forklare bort - det er ærlig og si at vi ikke har nok til å prøve.

Kilder

  1. Miao, A. mfl. (2025). Paper2Agent: Reimagining Research Papers As Interactive and Reliable AI Agents. Stanford University.
  2. NAV: AAP-statistikknotat 4. kvartal 2022.
  3. NAV: Statistikknotat om nedsatt arbeidsevne og arbeidsavklaringspenger, mars 2018.
  4. Faktaportalen: AI-verktøy og MCP.
Hva synes du?