Fag · Knut Ole Thoreplass
Arkitektur: dataplattform og AI
Lagene i en dataplattform med AI, og alternativene i hvert av dem: åpen kildekode, kommersielle produkter og det AWS, Azure og Google Cloud tilbyr.
Leverandørenes og prosjektenes egne sider - gått gjennom sist oppdatert 2026-10-06kilder
(Periodisk vedlikeholdt - sjekk dato på kildene for siste revisjon)
Last ned som PowerPoint (pptx-fil med innholdet på denne siden)
Slik er utvalget gjort
Redaksjonelt - utvalgEt personlig utvalg, ikke en rangering. Ingen har betalt for å stå her.
- Oversikten tar med produkter, prosjekter og standarder som er allment tilgjengelige. Den er et utvalg og ikke en komplett liste.
- Alfabetisk rekkefølge innen hver kolonne. Ingen rangering og ingen anbefaling av én leverandør.
- Ingen betalt plassering og ingen affiliate-lenker.
- Portalen kjører selv på Databricks, GitHub Actions og Netlify. Det som står om de andre plattformene, bygger på leverandørenes dokumentasjon og ikke på egen bruk.
- Oversikten sier ikke noe om pris, ytelse eller etterlevelse. Det må sjekkes hos leverandøren.
Lagring, tabellformat og katalog
Del 1 i serien
- Beslutningen:
- Du velger hvilket format tabellene ligger i, og hvilken katalog som holder rede på dem og styrer tilgangen.
- Portalen bruker:
- Tabellene i Databricks-delen ligger i Unity Catalog. De fleste sidene leser likevel TypeScript-filer som ligger i git.
- I bevegelse:
- Tabellformatene nærmer seg hverandre, og konkurransen har flyttet seg til katalogen.
Åpen kildekode
- Apache Hudi (åpner i ny fane) Åpen lakehouse-plattform bygget på et tabellformat som gir datasjøen databasefunksjoner og inkrementell behandling.
- Apache Iceberg (åpner i ny fane) Åpent tabellformat for store analysetabeller som flere motorer kan arbeide mot samtidig.
- Apache Polaris (åpner i ny fane) Åpen katalog for Iceberg-tabeller som følger REST-grensesnittet til Iceberg.
- Delta Lake (åpner i ny fane) Åpent lagringsrammeverk for lakehouse-arkitektur, med ACID-transaksjoner og støtte for flere motorer.
- DuckLake (åpner i ny fane) Lakehouse-format som lagrer dataene i Parquet-filer og metadataene i en SQL-database.
- Unity Catalog (åpner i ny fane) Åpen katalog for tabeller, ustrukturerte data og AI-ressurser på tvers av formater og skyer.
Andre kommersielle
- Databricks Unity Catalog (åpner i ny fane) Katalog og tilgangsstyring for data, modeller, agenter og applikasjoner på Databricks.
- Snowflake Horizon Catalog (åpner i ny fane) Katalog for å styre og finne data og AI-ressurser i Snowflake og i eksterne kataloger.
AWS
- Amazon S3 Tables (åpner i ny fane) Administrerte Iceberg-tabeller i S3 med automatisk vedlikehold.
- AWS Glue Data Catalog (åpner i ny fane) Sentralt metadatalager som analysetjenestene i AWS deler.
Microsoft Azure
- OneLake (åpner i ny fane) Felles datasjø som følger med Microsoft Fabric, med tabeller i Delta- eller Iceberg-format.
Google Cloud
- Google Cloud Lakehouse (tidligere BigLake) (åpner i ny fane) Lagringsmotor for åpne lakehouse-løsninger, med Iceberg-tabeller og administrert lagring i Google Cloud.
Motoren som regner
Del 2 i serien
- Beslutningen:
- Du velger hva som kjører spørringene, og dermed om du trenger en plattform eller klarer deg med én maskin.
- Portalen bruker:
- Python med pandas i GitHub Actions lager datafilene bak nesten alle sidene. Databricks SQL kjører dbt-modellene bak statistikknotatene.
- I bevegelse:
- Flere analyser enn før får plass på én maskin.
Åpen kildekode
- Apache Spark (åpner i ny fane) Motor for dataprosessering, datavitenskap og maskinlæring på én maskin eller i klynge.
- ClickHouse (åpner i ny fane) Kolonneorientert database med åpen kildekode for analyse i sanntid med SQL.
- DuckDB (åpner i ny fane) Analysedatabase med åpen kildekode som kjører inne i programmet som bruker den.
- Trino (åpner i ny fane) Distribuert SQL-motor for analyse av store datamengder.
Andre kommersielle
- Databricks SQL (åpner i ny fane) Datavarehus i skyen bygget på lakehouse-arkitektur, som kjører direkte på datasjøen.
- MotherDuck (åpner i ny fane) Serverløst datavarehus i skyen bygget på DuckDB.
- Snowflake (åpner i ny fane) Administrert plattform for data og AI.
AWS
- Amazon Athena (åpner i ny fane) Serverløs tjeneste for å kjøre SQL-spørringer mot data i Amazon S3.
- Amazon Redshift (åpner i ny fane) Datavarehus i skyen fra AWS.
Microsoft Azure
- Fabric Data Warehouse (åpner i ny fane) Relasjonelt datavarehus i Microsoft Fabric som lagrer dataene som Delta-tabeller og utvikles med T-SQL.
Google Cloud
- BigQuery (åpner i ny fane) Administrert og serverløs dataplattform for analyse med SQL og Python.
Ingestion, transformasjon og orkestrering
Del 3 i serien
- Beslutningen:
- Du velger hvor logikken skal bo: i lasteskriptene, i transformasjonene eller i verktøyet som setter dem i rekkefølge.
- Portalen bruker:
- I Databricks-delen lastes rådata uendret, og all logikk ligger i dbt. GitHub Actions starter de fleste jobbene etter tidsplan, mens dbt kjøres fra dbt Cloud.
- I bevegelse:
- Verktøyleverandørene slår seg sammen, og færre selskaper eier mer av kjeden.
Åpen kildekode
- Airbyte (åpner i ny fane) Plattform med åpen kildekode for å flytte data fra kilder til datavarehus, datasjøer og vektordatabaser.
- Apache Airflow (åpner i ny fane) Plattform for å skrive, planlegge og overvåke arbeidsflyter i kode.
- Dagster (åpner i ny fane) Orkestreringsrammeverk med åpen kildekode for å bygge og overvåke datapipelines.
- dbt (åpen kildekode) (åpner i ny fane) Verktøy for å transformere data med de samme arbeidsmåtene som programvareutviklere bruker.
- dlt (åpner i ny fane) Python-bibliotek med åpen kildekode for å laste data fra kilder til datavarehus.
- SQLMesh (åpner i ny fane) Rammeverk under Linux Foundation for datatransformasjoner skrevet i SQL eller Python.
Andre kommersielle
- Databricks Lakeflow (åpner i ny fane) Samlet løsning for innlasting, transformasjon og orkestrering av data på Databricks.
- dbt (skytjenesten) (åpner i ny fane) Kommersiell plattform for å bygge og drifte dbt-prosjekter.
- Fivetran (åpner i ny fane) Automatisert plattform for dataflytting med administrerte pipelines.
AWS
- Amazon MWAA (åpner i ny fane) Administrert Apache Airflow for å orkestrere arbeidsflyter og datapipelines i AWS.
- AWS Glue (åpner i ny fane) Serverløs tjeneste for dataintegrasjon som finner, klargjør og kombinerer data.
Microsoft Azure
- Azure Data Factory (åpner i ny fane) Administrert, serverløs tjeneste for dataintegrasjon med innebygde koblinger.
Google Cloud
- Dataflow (åpner i ny fane) Tjeneste for strøm- og batchprosessering av data i Google Cloud.
- Managed Service for Apache Airflow (åpner i ny fane) Administrert orkestreringstjeneste bygget på Apache Airflow, tidligere kjent som Cloud Composer.
Definisjonene og det semantiske laget
Del 4 i serien
- Beslutningen:
- Du velger hvor betydningen av et tall skal stå skrevet, slik at den følger med når verktøyet byttes.
- Portalen bruker:
- I Databricks-delen står forretningslogikken i dbt-modellene, og metric views i Unity Catalog er tatt i bruk for uføretrygd. Resten av portalen regner i Python.
- I bevegelse:
- Leverandørene arbeider med et felles format for semantiske modeller.
Åpen kildekode
- Cube Core (åpner i ny fane) Semantisk lag med åpen kildekode som definerer måltall i kode og leverer dem over SQL, REST og GraphQL.
- MetricFlow (åpner i ny fane) Semantisk lag som oversetter definisjoner av måltall i kode til SQL.
Andre kommersielle
- dbt Semantic Layer (åpner i ny fane) Tjeneste i dbt, bygget på MetricFlow, for å definere måltall ett sted og levere dem likt til ulike verktøy.
- Metric views i Unity Catalog (åpner i ny fane) Visninger som definerer måltall ett sted, atskilt fra dimensjonene de grupperes og filtreres på.
- Semantiske visninger i Snowflake (åpner i ny fane) Skjemaobjekter som lagrer forretningsbegreper, måltall og relasjoner direkte i databasen.
AWS
- Topics i Amazon Quick Sight (åpner i ny fane) Semantisk lag i Quick Sight som samler flere datasett i én datamodell og definerer relasjonene mellom dem.
Microsoft Azure
- Semantiske modeller i Power BI (åpner i ny fane) Datamodeller i Power BI som er klare for rapportering og visualisering.
Google Cloud
- Looker (LookML) (åpner i ny fane) BI-plattform der semantiske datamodeller skrives i modelleringsspråket LookML.
AI i plattformen: uttrekk og spørring
Del 5 i serien
- Beslutningen:
- Du velger om språkmodellen skal hente ut data, svare på spørsmål om dem, eller begge deler, og hva du sjekker svarene mot.
- Portalen bruker:
- En språkmodell henter tall ut av NAVs statistikknotater i Databricks, og Genie svarer på spørsmål om dem.
- I bevegelse:
- Ustrukturerte dokumenter behandles som en vanlig datakilde, i SQL.
Åpen kildekode
- LlamaIndex (åpner i ny fane) Rammeverk med åpen kildekode for å koble språkmodeller til egne dokumenter og data.
- pgvector (åpner i ny fane) Utvidelse med åpen kildekode for vektorsøk i Postgres.
Andre kommersielle
- AI-funksjoner i Databricks SQL (åpner i ny fane) Innebygde funksjoner som bruker språkmodeller på data i Databricks, blant annet fra SQL.
- Databricks Genie Agents (åpner i ny fane) Agenter i Databricks som svarer på spørsmål om data i naturlig språk.
- Snowflake Cortex AI (åpner i ny fane) AI-tjenester i Snowflake som gir tilgang til språkmodeller fra SQL og API-er, ved siden av dataene.
AWS
- Amazon Bedrock Data Automation (åpner i ny fane) Tjeneste som henter innsikt ut av dokumenter, bilder, lyd og video for AI-applikasjoner.
Microsoft Azure
- Azure Document Intelligence (åpner i ny fane) Tjeneste, nå del av Azure Content Understanding, som henter tekst, nøkkel-verdi-par og tabeller ut av dokumenter.
- Dataagenter i Fabric (åpner i ny fane) Funksjon i Microsoft Fabric for å bygge spørsmål-og-svar-løsninger over data i OneLake med generativ AI.
Google Cloud
- Document AI (åpner i ny fane) Plattform som gjør ustrukturerte data i dokumenter om til strukturerte data.
Agenter, MCP og modellaget
Del 6 i serien
- Beslutningen:
- Du velger hvordan en agent får tilgang til dataene dine, og hvordan du bytter modell uten å bygge om.
- Portalen bruker:
- Portalen har en egen MCP-server over registrene sine, og sporer samtalene i chatten med MLflow.
- I bevegelse:
- MCP er i ferd med å bli det vanlige grensesnittet mellom agenter og data.
Åpen kildekode
- Langfuse (åpner i ny fane) Plattform med åpen kildekode for sporing og evaluering av applikasjoner med språkmodeller.
- LangGraph (åpner i ny fane) Rammeverk med åpen kildekode for å orkestrere og kjøre agenter.
- LiteLLM (åpner i ny fane) Gateway med åpen kildekode som gir ett grensesnitt mot mange leverandører av språkmodeller.
- MLflow (åpner i ny fane) Plattform med åpen kildekode for utvikling av agenter, språkmodeller og maskinlæringsmodeller.
- Model Context Protocol (åpner i ny fane) Åpen standard for å koble AI-applikasjoner til eksterne systemer.
Andre kommersielle
- Agent Bricks (åpner i ny fane) Plattform i Databricks for å bygge og styre AI-agenter.
AWS
- Amazon Bedrock AgentCore (åpner i ny fane) Plattform i AWS for å bygge, kjøre og drifte AI-agenter uavhengig av rammeverk og modell.
Microsoft Azure
- Foundry Agent Service (åpner i ny fane) Tjeneste i Microsoft Foundry for å kjøre og orkestrere AI-agenter.
Google Cloud
- Gemini Enterprise Agent Platform (åpner i ny fane) Plattform i Google Cloud for AI-agenter, med administrert kjøremiljø, økter, minne og kodekjøring.
Skyvalg og suverenitet
Del 7 i serien
- Beslutningen:
- Du velger hvem som drifter plattformen, og i hvilket land og under hvilken lov dataene ligger.
- Portalen bruker:
- Portalen kjører på Databricks Free Edition, Netlify, GitHub og Supabase. Kvoten i gratisutgaven styrer hva som kan kjøres.
- I bevegelse:
- Europeiske virksomheter spør oftere om hvor dataene ligger og hvem som kan kreve dem utlevert.
Åpen kildekode
- Gaia-X (åpner i ny fane) Europeisk forening, ikke programvare, som utvikler et felles tillitsrammeverk for datadeling.
- Sovereign Cloud Stack (åpner i ny fane) Europeisk initiativ for et åpent og leverandørnøytralt skyøkosystem bygget på standarder.
Andre kommersielle
- OVHcloud (åpner i ny fane) Skyleverandør med datasentre i flere land, der kunden velger hvor dataene lagres.
- Scaleway (åpner i ny fane) Europeisk leverandør av sky- og AI-tjenester.
- STACKIT (åpner i ny fane) Europeisk skyleverandør som hører til Schwarz-gruppen.
AWS
- AWS European Sovereign Cloud (åpner i ny fane) Egen sky fra AWS som ligger i EU og driftes derfra.
Microsoft Azure
- Microsoft Sovereign Cloud (åpner i ny fane) Microsofts samlede tilbud for suverenitet i offentlig sky, private miljøer og partnerdrevne skyer.
Google Cloud
- Google Sovereign Cloud (åpner i ny fane) Googles portefølje for suverenitet, med variantene Data Boundary, Dedicated og Air-Gapped.
Artikkelserien
Serien tar ett lag om gangen og spør hva som må stå fast når verktøyet byttes. Hver del viser hva portalen selv valgte, og hva det kostet.
KI-tjenester gruppert etter bruksområde står under Leverandører og løsninger. Hvordan portalen selv er bygget, står under Slik er portalen bygget.
Nytt på portalen
Levealder: tallene for menn er rettet, og 2025 er inne →
Levealderen for menn var faste tall hos oss og ikke hentet fra SSB. Nå kommer alle seriene fra SSB 05375: menn 81,6 år og kvinner 84,9 år i 2025, og en 67 år gammel mann har 18,1 år igjen. For 2024 sto det 18,0 år igjen ved 67; SSB oppgir 18,2.
Eiendomsskatt: 2025-tallene er inne →
326 kommuner hadde eiendomsskatt i 2025, og samlet beløp var 18,0 mrd kr, opp 2,5 prosent fra året før. Tallene hentes nå fra SSB 14155 ved hver kjøring; fram til nå sto serien stille på 2024.
Bransjeøkonomi: tallene er rettet og hentes nå fra SSB →
Sida viste håndlagde anslag med SSB som oppgitt kilde. Nå kommer omsetning, foretak og sysselsatte per næring fra SSB 12817, og driftsmargin fra SSB 14792 og 08142. Samlet omsetning er 8 470 mrd kr for 2024, ikke 3 940.
Fag: arkitektur for dataplattform og AI →
Sju lag i en dataplattform med AI, og alternativene i hvert: åpen kildekode, kommersielle produkter og det AWS, Azure og Google Cloud tilbyr. Alfabetisk og uten rangering.
Datasentre: Teknologirådets tall er kontrollert mot rapporten →
Rapporten kom i oktober. 964 MW tilknyttet viser seg å være tre kilder lagt sammen, andelen av reservert nettkapasitet oppgis som over 50 prosent der NRK gjenga 47, og rapporten har ingen anbefalinger.
Mest lest siste 7 dager
- 1Datasentre og kraftforbruk103 visninger
- 2Teknologirådets datasenterrapport er ikke ute. Dette sier tallene vi har50 visninger
- 3Aktørene i norsk datasenterindustri13 visninger
- 4Alderspensjon 2025 - gjennomsnittlig utbetaling og avgangsalder12 visninger
- 5Pensjonssparing11 visninger
- 6Datasenteranlegg i Norge11 visninger
- 7Klimasektorer10 visninger
- 8Om portalen10 visninger
- 9325 konkurser på en måned - hvem slutter å drive butikk i Norge?9 visninger
- 10Datasentrenes kraftforbruk9 visninger