Hva er NorGEO-Bench?
NorGEO-Bench er m51 Labs løpende måling av hva generative AI-modeller vet, sier og siterer om norsk næringsliv. Denne siden viser runde 2 (måle-ID m-full-2026-07-30, juli 2026): 1 707 svar over 253 norske prompter i 11 bransjer, med full dekning på alle tre plattformene, dommerpanel fra tre leverandører og felles faktagrunnlag per spørsmål. v1 (april 2026) er arkivert.
Hvordan siterer jeg NorGEO-Bench?
Datasettet er publisert under Creative Commons Attribution 4.0 (CC BY 4.0) og kan brukes fritt, også kommersielt, så lenge kilden oppgis. Anbefalt sitering: «NorGEO-Bench, m51Lab (2026), https://m51.ai/lab/norgeo-bench» med måle-ID. Rådata: runde 2 på https://m51.ai/lab/norgeo-bench/data-v2.json, v1-arkivet på https://m51.ai/lab/norgeo-bench/data.json, og fullt datasett på Hugging Face under dervig/NorGEO-Bench (runde 2 i v2/-katalogen).
Hvor ofte oppdateres datasettet?
NorGEO-Bench er en løpende indeks: adressen er den samme, og nye målinger publiseres med egen måle-ID slik at tidligere siteringer forblir etterprøvbare. Siden viser alltid nyeste måling — nå runde 2 (m-full-2026-07-30). v1 (generert 22. april 2026) er arkivert og erstattet av runde 2 for nye analyser; rådataene ligger fortsatt på data.json-URL-en. Kadensen er hendelsesdrevet — ny måling når modellandskapet endrer seg vesentlig.
Hvilke modeller er testet?
I runde 2 (vist på denne siden): ChatGPT (gpt-5.6-sol), Claude (Opus 5) og Gemini (3.1 Pro Preview), alle med web-søk og full dekning. Svarene dømmes av Claude Sonnet 5 (Anthropic), Gemini 3.6 Flash (Google) og GPT-5.6 (OpenAI), med Claude Opus 5 som ankeinstans. I v1 (arkivert): GPT-5.4, Claude Opus 4.6 og Gemini 3.1 Pro Preview, dømt av Claude Opus 4.6 alene, med redusert Gemini-dekning (250 av 759 forsøk).