2026-09-28

6 min lesing

Knut Ole Thoreplass

Ontologi uten store ord

SSBs utslippstabell har ingen kategori som heter «transport». Portalen har en hel side om det. Del 2 av 5 i serien om data maskiner kan stole på, om begreper, relasjoner og hva et tall betyr.

Foto: Etienne Girardet / Unsplash

Del 2 av 5 i serien om data maskiner kan stole på

← Forrige del: Metadata er ikke pynt

Spør en KI-assistent hvor mye norsk transport slapp ut i 2025, og du kan få to svar som begge er riktige.

Det ene er 6,9 millioner tonn CO2-ekvivalenter. Det er kategorien «Veitrafikk» i SSBs tabell 13931 [1]. Det andre er 14,3 millioner tonn. Det er det Faktaportalen kaller transport, og det er summen av to kategorier i den samme tabellen: «Veitrafikk» og «Luftfart, sjøfart, fiske, motorredskaper m.m.».

Tabellen har ingen kategori som heter transport. Begrepet er portalens eget. Det er ikke feil, men det er et valg, og valget står i en kodekommentar i datafila. Maskinen som leser tallet, ser det ikke.

Del 1 handlet om hva et tall er: enhet, skala, periode. Denne delen handler om hva det betyr, og om hvordan betydningen kan gjøres lesbar for en maskin.

Hva en ontologi er, uten store ord

En ontologi er en felles avtale om hvilke begreper som finnes, hva de betyr, og hvordan de henger sammen. Ordet høres tungt ut, men de fleste har laget en uten å kalle den det.

  • En kontrollert ordliste er det enkleste nivået: et fast sett lovlige verdier. «Manuell», «pipeline», «daglig».
  • En klassifikasjon legger til hierarki: olje- og gassutvinning er en utslippskilde, og utslippskilder er en del av utslippsregnskapet.
  • En relasjonsmodell legger til hvordan begrepene påvirker hverandre: flere elbiler fører til lavere utslipp fra veitrafikk.

Det finnes standarder for alle tre. SKOS fra W3C beskriver begreper, synonymer og hierarkier [3]. Schema.org har en egen type for datasett, som søkemotorer leser [4]. Og i Norge beskrives offentlige datasett etter DCAT-AP-NO, som brukes i Felles datakatalog på data.norge.no [5].

Små ordlister, ett sted hver

Faktaportalen har mange små ordlister, og de viktigste er definert ett sted, med en automatisk test som vokter dem.

  • Ni seksjoner. Pensjon, Økonomi, Arbeid, Helse, Energi, Næringsliv, Bolig, Utdanning og Befolkning.
  • Tre typer opphav. Et tall kan komme fra et API, fra et publisert datasett eller være lest ut av en rapport. Det kommer vi tilbake til i del 3.
  • Sju typer endringer som meldes i dag. Nye perioder, revisjon, omlegging og så videre. Det kommer vi tilbake til i del 4.

Hvorfor det er viktig at hver ordliste bare finnes ett sted, viser en feil fra forsiden. Tallet på datasett per seksjon sto en gang som faste tall i koden. De summerte til 91, mens kildeoversikten [8] hadde 167 rader. Portalen motsa seg selv, fordi det samme begrepet, «hvilken seksjon bruker dette datasettet», var definert to steder. Nå regnes tallet ut fra kildeoversikten, og en test feiler hvis en rad ikke kan knyttes til en seksjon.

Samme ord, tre betydninger

Det motsatte problemet er like vanlig: ett ord som betyr flere ting.

«Kadens» brukes tre steder i portalen. Ett sted betyr det hvilken fast kjøring som oppdaterer datafila. Et annet sted betyr det hvor ofte kilden publiserer, og styrer når leseren får et varsel om at dataene er gamle. Et tredje sted er det en klasse i innholdsplanen. Da to av konstantene fikk samme navn, ble den ene omdøpt, og kommentaren i koden forklarer hvorfor: to konstanter med samme navn og ulik betydning var nettopp fella oppryddingen skulle fjerne.

Konsekvensen er konkret. Med standardterskelene får en manuelt vedlikeholdt datafil et varsel på sida etter 60 dager, mens verktøyet som forteller KI-agenter om ferskhet, først kaller den utdatert etter 120. Et menneske og en maskin som ser på samme datafil samme dag, kan få ulike svar.

Lange rader med hvite arkivesker på trehyller Foto: Luke Caunt / Unsplash

Kunnskapskartet: fire koblingstyper

Den mest ambisiøse delen av portalens begrepsmodell er kunnskapskartet [7]. Det bygger på semantisk romtid, en modell informatikeren Mark Burgess har foreslått [2]. Poenget er at fire koblingstyper skal være nok til å beskrive sammenhenger på et hvilket som helst område [6]:

  • Henger sammen med. To ting som hører til samme område.
  • Fører til. Én ting påvirker en annen.
  • Inneholder. Én ting er en del av en annen.
  • Uttrykker. Én ting er en egenskap ved en annen.

Kartet har tre typer noder: hendelser, ting og begreper. Det meste av kartet lages automatisk fra portalens egne registre over sider, datafiler, kilder og artikler. Bare én del skrives for hånd: årsakskjedene.

Der er det 25 påstander fordelt på sju kjeder, og hver påstand har to felt ved siden av seg: en begrunnelse og et belegg, altså en side der leseren kan se tallene selv. I kjeden «Kraft og industri» står det for eksempel at elbilandelen fører til lavere utslipp, med begrunnelsen at elbilandelen i personbilparken er den enkeltfaktoren som tydeligst trekker ned utslippene fra veitrafikk, og med klimaeffekt-sida som belegg.

Påstandene er merket som redaksjonelle, ikke som beregnede sammenhenger. Og verktøyet som lar KI-agenter følge kjedene, nekter å finne på en vei som ikke er skrevet inn. Finnes det ingen påstått sammenheng mellom to sider, svarer det med en feil i stedet for en gjetning.

Et bevisst valg bort fra standardene

I kildekoden til kunnskapskartet står det rett ut: ingen ontologi, ingen RDF. Portalen bruker ideene, men ikke standardformatene.

Egen vurdering: Det er et forsvarlig valg for et prosjekt av denne størrelsen. Fire koblingstyper er lette å forstå og lette å vedlikeholde, og hver ordliste har en test. Men prisen er at vokabularet bare kan leses gjennom portalens egne grensesnitt. En søkemotor, en datakatalog eller en KI-agent som ikke kjenner portalen, finner ingen maskinlesbar beskrivelse av hva «transport» betyr her. Standardene finnes nettopp for at noen du ikke kjenner, skal kunne forstå dataene dine uten å spørre.

Det portalen fortsatt ikke gjør

  • Strukturerte data på sidene mangler nesten helt. Portalen har markering med schema.org på én side, en ofte-stilte-spørsmål-seksjon om konkurser. Ingen av datasidene beskriver datasettene sine som Dataset.
  • Ingen beskrivelse etter DCAT-AP-NO. Det finnes ingen maskinlesbar katalog over portalens datasett i et standardformat. Kildeoversikten på /kilder er skrevet for mennesker.
  • Definisjonene er ikke publisert som data. At transport er veitrafikk pluss luftfart, sjøfart og fiske, står i en kodekommentar. Det er ikke et felt en maskin kan slå opp.
  • «Kadens» har tre betydninger. Terskelen for når en manuell datafil er gammel, er fortsatt ulik for leseren og for KI-agenten.

I neste del: Hvor kommer tallet fra? Kildehenvisningene ved utslippstallene pekte på feil kilde, og KI-verktøyet sendte feilen videre som fakta.

Les del 3: Kildehenvisningen er en påstand →

Kilder

  1. SSB. Tabell 13931: Klimagasser, etter utslippskilde, energiprodukt og komponent. Kategoriene veitrafikk og luftfart, sjøfart, fiske, motorredskaper m.m. for 2025.
  2. Burgess, M. Semantic Spacetime. Modellen kunnskapskartet bygger på.
  3. W3C (2009). SKOS Simple Knowledge Organization System Reference.
  4. Schema.org. Dataset.
  5. Digdir. DCAT-AP-NO. Norsk standard for beskrivelse av datasett og datakataloger.
  6. Faktaportalen. Relasjonsmodellen og kartet. Om de fire koblingstypene og årsakskjedene.
  7. Faktaportalen. Kunnskapskartet.
  8. Faktaportalen. Kilder. Kildeoversikten som seksjonstallene regnes ut fra.
Hva synes du?