# Hvilken AI er best på norsk? Vi målte ChatGPT, Claude og Gemini på 1 707 svar om norske bedrifter

> ChatGPT er mest presis, og forskjellen er statistisk sikker. På hallusinasjon er ChatGPT og Claude likeverdige — Gemini er dårligst på begge mål. Rangeringen står seg under alle åtte dommervalg vi testet. Og vår forrige rapport tok feil; vi viser hvorfor.

- Publisert: August 2026 (2026-08-01)
- Forfatter: m51.ai Lab
- Lesetid: 11 min lesing
- Serie: GEO-serien, del 2
- Kanonisk HTML-utgave: https://m51.ai/lab/hvilken-ai-er-best-pa-norsk
- Alle Lab-artikler (Markdown-indeks): https://m51.ai/lab/index.md

---

## Det korte svaret

Vi stilte 253 spørsmål om norske bedrifter til ChatGPT, Claude og Gemini — spørsmål av typen norske forbrukere og innkjøpere faktisk stiller. «Hvem er de beste eiendomsmeglerne i Bergen?» «Hva koster en regnskapsfører?» Hvert svar ble faktasjekket av tre dommermodeller fra tre ulike leverandører, mot et faktagrunnlag hentet inn på forhånd. Måle-ID: m-full-2026-07-30.

**ChatGPT svarer mest presist: 2,40 av 3, mot Claudes 2,18 og Geminis 1,86. Forskjellene er statistisk sikre, og rekkefølgen står seg under alle åtte dommervalg vi testet — også når Googles egen modell dømmer alene.**

**På hallusinasjon er ChatGPT og Claude ikke til å skille fra hverandre. Gemini er dårligere enn begge.**

Vår forrige rapport sa det motsatte; den tok feil, og vi viser hvorfor nedenfor.

To funn til er store nok til egne artikler:

- Plattformene deler bare 8,3 % av kildene sine, og de har hver sin gjenkjennelige kildeprofil — myndigheter, registre, medier.
- Samme spørsmål stilt to ganger gir bare en tredjedels overlapp i hvilke selskaper som nevnes. AI-synlighet må måles som frekvens, ikke som øyeblikksbilde.

→ [Hele kildeanalysen → del 3 i GEO-serien](https://m51.ai/lab/hvilke-kilder-siterer-ai)

→ [Hvorfor enkeltsvar er en trekning → del 4](https://m51.ai/lab/ai-synlighet-er-en-trekning)

---

## Slik målte vi denne gangen

253 spørsmål fordelt på elleve bransjer: advokat, eiendomsmegler, regnskap, bank og forsikring, helseklinikk, håndverker, rekruttering, IT-konsulent, markedsføring, AI-markedsføring, nettbutikk. Tre spørsmålstyper: navngitte (88), sammenlignende (88) og informasjonelle (77).

Tre plattformer: gpt-5.6-sol, claude-opus-5 og gemini-3.1-pro-preview, alle med web-søk påslått. To kjøringer per spørsmål, pluss en tredje på et tilfeldig utvalg på 25 % som lar oss måle hvor mye samme spørsmål varierer mellom kjøringer. 569 svar per plattform, 1 707 totalt, 100 % coverage — ingen manglende celler.

Ett faktagrunnlag per spørsmål, hentet én gang. I v1 gjorde faktasjekkeren et nytt websøk for hver verifisering. Da varierer fasiten mellom plattformene, og forskjellen man måler er delvis forskjellen i hva faktasjekkeren tilfeldigvis fant. Nå bygges faktagrunnlaget først, og alle tre plattformer og alle tre dommere vurderes mot nøyaktig samme grunnlag.

Tre dommere fra tre leverandører — Sonnet 5 (Anthropic), Gemini 3.6 Flash (Google) og GPT-5.6 (OpenAI). Publisert score er medianen av de tre.

Hovedmetrikken er hallusinasjon per navngitt enhet, ikke rå alvorlighetsscore. Et langt svar som nevner tjue selskaper og bommer på ett er mer pålitelig enn et kort svar som nevner to og bommer på ett — rå score sier det motsatte.

### Hvorfor tre dommere

Fordi én dommer ikke kan skille mellom «dette svaret er dårlig» og «jeg liker ikke dette svaret».

Vi målte hjemmefavorisering direkte, ved å sammenligne hver dommers avvik fra panelmedianen når den vurderer sin egen leverandørs plattform mot når den vurderer andres:

| Dommer | Egen leverandør | Andre | Differanse |
| --- | --- | --- | --- |
| Sonnet 5 (Anthropic) | −0,72 | −0,58 | −0,14 |
| Gemini 3.6 Flash (Google) | +0,81 | +0,55 | +0,26 |
| GPT-5.6 (OpenAI) | −0,04 | −0,06 | +0,01 |

Google-dommeren gir Gemini 0,26 poeng mer enn den gir konkurrentene. Anthropic-dommeren er strengere mot Claude enn mot andre. OpenAI-dommeren er nøytral.

**Det avgjørende: Gemini kommer sist selv med Googles egen modell i panelet. Med én dommer ville vi ikke kunnet si det.**

### Når dommerne er uenige

De tre dommerne bruker skalaen svært ulikt:

| Dommer | Snitt accuracy | Andel svar med hallusinasjon = 0 |
| --- | --- | --- |
| Sonnet 5 (Anthropic) | 1,52 | 8,8 % |
| GPT-5.6 (OpenAI) | 2,10 | 51,1 % |
| Gemini 3.6 Flash (Google) | 2,79 | 82,0 % |

Google-dommeren finner ingen hallusinasjon i fire av fem svar. Anthropic-dommeren finner noe å utsette på i ni av ti. De leser de samme 1 707 svarene. Rå spredning mellom slike dommere måler derfor mest av alt hvem som dømte.

Vi standardiserer på hver dommers egen skalabruk før vi måler uenighet. Da står 27,4 % igjen som reell uenighet — 467 av 1 707 svar der tre kompetente bedømmere leser det samme svaret og lander ulikt.

Det tallet er i seg selv et funn. En firedel av vurderingene av AI-svar er skjønnsspørsmål. En benchmark med én dommer rapporterer et presist tall som skjuler at en firedel av grunnlaget er omstridt.

De 467 sakene gikk til en ankeinstans — Opus 5, som fikk se alle tre votumene sammen med faktagrunnlaget og avgjorde. Det er ikke en fjerde stemme: den har sett de andres arbeid, og å telle den som likemann ville vektet samme informasjon to ganger. (Ankeinstansen er fra samme leverandør som én av dommerne. Det er en reell innvending. Motargumentet er ikke en forsikring, men robusthetstabellen lenger ned: rangeringen er den samme også helt uten ankeinstans.)

---

## Resultater

| Plattform | Accuracy (0–3) | Hallusinasjon pr. enhet | Grounded |
| --- | --- | --- | --- |
| ChatGPT | 2,40 | 0,056 | 96,5 % |
| Claude | 2,18 | 0,047 | 98,8 % |
| Gemini | 1,86 | 0,084 | 98,9 % |

Med paret bootstrap på promptnivå, 4 000 resamplinger. Accuracy — alle tre forskjeller er sikre:

| Sammenligning | Differanse | 95 % KI |
| --- | --- | --- |
| ChatGPT − Claude | +0,240 | [+0,172, +0,308] |
| ChatGPT − Gemini | +0,535 | [+0,462, +0,607] |
| Claude − Gemini | +0,295 | [+0,224, +0,364] |

Hallusinasjon per enhet — her deler resultatet seg:

| Sammenligning | Differanse | 95 % KI |  |
| --- | --- | --- | --- |
| ChatGPT − Claude | +0,008 | [−0,001, +0,019] | ikke signifikant |
| ChatGPT − Gemini | −0,028 | [−0,039, −0,018] | signifikant |
| Claude − Gemini | −0,036 | [−0,044, −0,027] | signifikant |

**Altså: ChatGPT er mest presis. På hallusinasjon er ChatGPT og Claude likeverdige. Gemini er dårligere enn begge på begge mål.**

v1 påsto at Claude hallusinerte dobbelt så mye som ChatGPT. Normalisering fjerner mesteparten av forskjellen, og konfidensintervallet viser at det som er igjen ikke er til å skille fra null. Funnet var ikke bare feilrapportert — det finnes ikke.

### Er rangeringen en egenskap ved svarene, eller ved dommerne?

Det er den innvendingen som betyr noe, og den fortjener et tall og ikke en forsikring. Vi regnet derfor ut rangeringen på nytt under åtte forskjellige dommervalg — hver dommer alene, hvert panel med én dommer fjernet, og med og uten ankeinstans:

| Dommervalg | Rekkefølge | Spenn |
| --- | --- | --- |
| Bare Sonnet 5 (Anthropic) | ChatGPT 1,81 > Claude 1,47 > Gemini 1,32 | 0,49 |
| Bare Gemini 3.6 Flash (Google) | ChatGPT 2,87 > Claude 2,81 > Gemini 2,68 | 0,19 |
| Bare GPT-5.6 (OpenAI) | ChatGPT 2,37 > Claude 2,11 > Gemini 1,84 | 0,54 |
| Uten Anthropic-dommeren | ChatGPT 2,62 > Claude 2,46 > Gemini 2,26 | 0,36 |
| Uten Google-dommeren | ChatGPT 2,09 > Claude 1,79 > Gemini 1,58 | 0,52 |
| Uten OpenAI-dommeren | ChatGPT 2,34 > Claude 2,14 > Gemini 2,00 | 0,34 |
| Panel uten ankeinstans | ChatGPT 2,40 > Claude 2,16 > Gemini 1,86 | 0,54 |
| Panel med ankeinstans | ChatGPT 2,42 > Claude 2,18 > Gemini 1,88 | 0,53 |

**Rekkefølgen er den samme i alle åtte. Også når Googles egen modell dømmer alene — den som favoriserer Gemini med 0,26 poeng — kommer Gemini sist.**

Legg samtidig merke til hvor mye nivået flytter seg: Gemini får 1,32 av Anthropic-dommeren og 2,68 av Google-dommeren. Det er over halvparten av skalaen, på de samme svarene.

Derfor publiserer vi rangeringer og differanser, ikke absolutte karakterer. «Gemini fikk 1,86» er ikke en egenskap ved Gemini — det er en egenskap ved Gemini målt med akkurat dette panelet. At Gemini kommer sist er derimot en egenskap ved svarene, og det tåler at man bytter ut dommerne.

### Hvor det går galt

Hallusinasjon per enhet, per bransje, snitt over alle tre plattformer:

| Bransje | Hall./enhet | Accuracy |
| --- | --- | --- |
| Eiendomsmegler | 0,096 | 2,07 |
| Helseklinikk | 0,082 | 2,04 |
| Håndverker | 0,072 | 2,18 |
| Rekruttering | 0,071 | 2,21 |
| Markedsføring | 0,069 | 2,03 |
| Advokat | 0,063 | 2,26 |
| Regnskap | 0,063 | 2,19 |
| IT-konsulent | 0,049 | 2,13 |
| Bank og forsikring | 0,046 | 2,20 |
| AI-markedsføring | 0,045 | 2,20 |
| Nettbutikk | 0,033 | 2,11 |

Eiendomsmegling er nesten tre ganger så feilutsatt som netthandel. Mistanken vår er at det handler om hva slags informasjon som finnes offentlig og strukturert: en nettbutikk har priser og vilkår på nett, mens en meglers faktiske provisjonssats og salgsstatistikk sjelden er tilgjengelig — så modellen fyller inn. Det er en hypotese. Vi har ikke testet den.

---

## GEO-funnene i kortform

Denne målingen er en GEO-indeks, ikke bare en kvalitetstest — den logger hvilke kilder som siteres og hvilke selskaper som nevnes. De to store funnene har fått egne artikler; her er tallene i kortform.

Kildene: 74,7 % av siteringene går til norske domener, fordelt på 2 735 siterte kilder. Finansavisen, Finn og Proff topper — men sammenligningstjenester som Smartbyra og Bytt siteres som autoriteter på linje med riksmedia. Plattformene deler bare 8,3 % av kildegrunnlaget og har systematisk ulike profiler: ChatGPT leser myndigheter, Claude leser registre, Gemini leser aviser.

→ [Hele analysen, med sjekkliste for bedrifter → del 3](https://m51.ai/lab/hvilke-kilder-siterer-ai)

Stabiliteten: identiske spørsmål gir 34–38 % overlapp i hvilke selskaper som nevnes mellom to kjøringer. Enkeltsvar er trekninger; bare frekvens over gjentatte kjøringer er en måling. Det er grunnen til at denne benchmarken kjører hvert spørsmål flere ganger og rapporterer konfidensintervaller.

→ [Hele funnet → del 4](https://m51.ai/lab/ai-synlighet-er-en-trekning)

Konsentrasjonen: de fem mest omtalte aktørene i hver bransje tar bare 6–16 % av omtalene, målt over 611–1 164 navngitte aktører per bransje. Ingen norsk bransje er låst — eiendomsmegling er trangest, markedsføring mest åpen.

Merkevarene: i sammenlignende spørsmål nevner Claude bransjens forventede aktører i 96,6 % av svarene, Gemini i 94,6 % — ChatGPT bare i 81,2 %. Minst forutsigbar, og dermed størst åpning for utfordrere.

---

## Hva vi tok feil i forrige runde — og hvorfor vi forteller det

NorGEO-Bench v1.0 kom i april 2026. Hovedfunnet var at Claude hallusinerte dobbelt så mye som ChatGPT: 0,82 mot 0,50 i alvorlighetsgrad. Det funnet holder ikke. Vi går gjennom hvorfor, fordi metoden er poenget med denne rapporten.

- Vi målte eksponering, ikke feilrate. Claude navnga 54 % flere selskaper per svar enn ChatGPT. Flere navn gir flere sjanser til å bomme. Deler man på antall navngitte enheter, forsvinner mesteparten av forskjellen — og Gemini, som så best ut på rå score, blir dårligst.
- Halvparten av Claudes svar var kuttet av. Én felles token-grense for alle tre plattformene gjorde at 52 % av Claude-svarene traff taket, mot 21 % av ChatGPT-svarene. Alle scorer i v1 ble altså beregnet på delvis ufullstendige svar, med systematisk skjevhet mellom nettopp de to plattformene hovedfunnet handlet om.
- Gemini-kolonnen målte noe annet enn de to andre. 67 % av kallene feilet på kvotegrense. Av dem som gikk gjennom, svarte 248 av 250 uten å søke på nettet i det hele tatt, og 248 av 250 var kuttet av. Kolonnen het «Gemini», men målte en modell uten nettilgang som ble avbrutt midt i setningen.
- Claude vurderte sine egne svar. Verifikatoren var claude-opus-4-6 — samme modellfamilie som produserte kolonnen den dømte. Runde 2 erstatter én verifikator med et dommerpanel fra tre leverandører, nettopp for å gjøre slik skjevhet målbar i stedet for usynlig.
- Kildediagrammet viste feil kilder. Grafen over de mest siterte domenene viste hvilke nettsider vår egen faktasjekker hadde slått opp i — ikke hvilke plattformene siterte. De ekte siteringene lå i rådataene og ble aldri brukt.

Vi teller 13 målte defekter i v1. Hele listen, med spørringene som viser hver feil, ligger i funnloggen i det åpne datasett-repoet.

Det er ubehagelig lesning å skrive selv. Men en benchmark som ikke tåler at forfatteren finner feil i den, er ikke en benchmark — den er markedsføring.

---

## Habilitet

m51 lager denne rapporten og selger tjenester innen AI-synlighet. Det er en interessekonflikt, ikke et hypotetisk problem, og her er hva vi har gjort med den.

Vi krysssjekket hele spørsmålsuniverset mot vårt eget CRM — 799 selskaper i stadium «kunde» eller «aktiv salgsdialog», maskinelt, med lagret øyeblikksbilde og loggført resultat. Regelen dekker med vilje prospekter og ikke bare signerte kunder: et prospekt er nettopp den man kunne fristes til å påvirke med et benchmarkresultat.

Vi scoret vår egen synlighet, og oppdaget det sent. Spørsmålet «Finnes det norske AI-verktøy for markedsføring?» hadde m51 på listen over forventede aktører. Metrikken «blir merkevaren nevnt» målte altså om AI-en nevner oss. Effekten på totalen er neglisjerbar — 151 til 149 målbare svar — men det er ikke poenget. Spørsmålet er tatt ut av merkevaremetrikken. Se F44 i funnloggen.

97 spørsmål-aktør-par treffer selskaper i vårt CRM, blant dem Thommessen, DNB, Krogsveen, Volvat og Notar. Disse er ikke fjernet, og skal ikke fjernes: selskaper kan holdes utenfor spørsmålene, men ikke ut av svarene. En modell som blir spurt om private helseklinikker nevner Volvat uansett hva vi spør om. Å filtrere dem ut av omtaledataene ville forvrengt målingen mer enn det ville beskyttet den.

Lead-stadiet er bevisst utelatt fra eksklusjonsregelen. CRM-et har 13 929 selskaper, hvorav rundt 13 100 er bulk-importerte prospektlister uten kontakt — Adecco, Aker ASA og Oslo kommune ligger der. Å ekskludere dem ville gjort en norsk markedsbenchmark umulig.

---

## Begrensninger

Absolutte karakterer er ikke publisert, og det er med vilje. De samme 1 707 svarene får snitt 1,52 av Anthropic-dommeren og 2,79 av Google-dommeren. Et tall som «Gemini fikk 1,86» er derfor en egenskap ved målingen, ikke ved Gemini. Rangeringer og differanser er robuste; nivåene er det ikke.

Vi har ikke en menneskelig kalibrering som holder mål. Ti svar ble vurdert manuelt av en leser hos m51. Resultatet viste at panelet er rundt 0,9 poeng strengere enn den leseren — men fordi samtlige ti fikk toppkarakter av mennesket, har fasiten ingen varians, og da måler sammenligningen bare hvem av dommerne som er mildest. Den kan ikke si hvem som dømmer best.

Vi kunne latt være å nevne det. Men et panel er en påstand om troverdighet, og den påstanden skal ikke hvile på et forsøk vi selv vet ikke bærer. Det som faktisk bærer rangeringen, er robusthetstesten over: samme rekkefølge under åtte forskjellige dommervalg, inkludert hver dommer alene.

**Seks av ti hovedfunn avhenger ikke av dommere i det hele tatt. Kildeoverlapp, norskandel, toppdomener, grounding-rate, merkevareomtale og svarstabilitet er parset direkte fra API-svarene. De berøres verken av at panelet er strengt eller mildt. Det gjelder blant annet de to funnene vi mener er viktigst for norske bedrifter.**

Ingen kontrollprompts. Vi har ikke spurt om bedrifter som ikke finnes. Det er den hardeste hallusinasjonstesten som finnes — «i X % av tilfellene diktet modellen opp detaljer om et selskap som ikke eksisterer» — og vi har den ikke i denne målingen. Den står på planen.

Ingen nynorsk. Om språkform påvirker svarkvaliteten er et selvstendig norsk spørsmål som ingen internasjonal benchmark kommer til å svare på. Også det står på planen, ikke i tallene.

Entitetsuttrekket kommer fra dommerne. Hvem som nevnes i et svar er hentet fra dommernes lesning, ikke fra en regelbasert parser. Konsentrasjonstallene per bransje arver derfor dommernes eventuelle systematikk. Kildetallene gjør ikke det — de kommer fra plattformenes egne siteringsfelt.

Målingen er et øyeblikksbilde. 1. august 2026, med de modellversjonene som er oppgitt. Gitt at samme spørsmål gir en tredjedel overlapp fra kjøring til kjøring, bør ingen enkeltmåling — heller ikke vår — leses som en fasit på hvor en enkelt bedrift står.

Målingen kostet 490 dollar i API-bruk fordelt på 7 603 kall, hvorav 62,9 % gikk gjennom leverandørenes batch-API til halv tokenpris. Uten batching ville den ikke fått plass i budsjettet.

---

## Reproduserbarhet

Alle tall i denne artikkelen kommer fra én kommando mot den publiserte databasen:

```bash
python scripts/analyze.py m-full-2026-07-30
```

Måle-ID, modellversjoner, kodens git-SHA, kallplan og dommeroffsets er lagret som del av målingen. Publiseringen er sperret bak en gate som krever full coverage, tre leverandører i panelet, avkutting under tak og uløst dommeruenighet under terskel.

→ [Datasettet er åpent: dervig/NorGEO-Bench på Hugging Face (v2-dataene ligger i v2/-katalogen)](https://huggingface.co/datasets/dervig/NorGEO-Bench)

---

NorGEO-Bench er en løpende indeks fra m51 Lab, ikke en kvartalsrapport. Adressen er den samme hver gang; tallene er «slik er situasjonen nå», og måle-ID-en m-full-2026-07-30 peker på akkurat dette øyeblikksbildet. Spørsmål om metoden, dataene eller hva tallene betyr for din bransje: kontakt@m51.no.

→ [Søk opp din egen bedrift i den interaktive benchmark-siden](https://m51.ai/lab/norgeo-bench)

→ [Ny i GEO? Les pilarartikkelen: Hva er GEO?](https://m51.ai/lab/hva-er-geo)

## Ofte stilte spørsmål

### Hvilken AI er best på norsk?

I vår måling av 253 spørsmål om norske bedrifter (måle-ID m-full-2026-07-30) svarer ChatGPT mest presist: 2,40 av 3, mot Claudes 2,18 og Geminis 1,86. Forskjellene er statistisk sikre med paret bootstrap, og rekkefølgen er identisk under alle åtte dommervalg vi testet — også når Googles egen modell dømmer alene.

### Hvilken AI hallusinerer minst om norske bedrifter?

ChatGPT og Claude er ikke til å skille fra hverandre: 0,056 og 0,047 hallusinasjoner per navngitt enhet, en differanse som ikke er statistisk signifikant. Gemini er dårligere enn begge med 0,084. Vår forrige rapport påsto at Claude hallusinerte mest — det funnet var en måleartefakt av at Claude navnga flere selskaper per svar, og finnes ikke i riktig normaliserte tall.

### Hvordan ble målingen gjort?

253 spørsmål fordelt på elleve bransjer ble stilt til ChatGPT (gpt-5.6-sol), Claude (claude-opus-5) og Gemini (gemini-3.1-pro-preview) med web-søk påslått — 1 707 svar totalt, 100 % coverage. Hvert svar ble vurdert av tre dommermodeller fra tre leverandører mot et felles faktagrunnlag hentet inn på forhånd, med en ankeinstans for de 467 svarene der dommerne var reelt uenige.

### Kan man stole på en AI-benchmark der AI er dommer?

Bare hvis rangeringen tåler at man bytter ut dommerne — og det gjør den her: samme rekkefølge under alle åtte dommervalg. Seks av ti hovedfunn, blant dem kildeanalysen og stabilitetsfunnet, er dessuten parset rett fra API-svarene og avhenger ikke av dommere i det hele tatt. Absolutte karakterer publiserer vi derimot ikke: de samme svarene får snitt 1,52 av den strengeste dommeren og 2,79 av den mildeste.

### Hva var galt med forrige måling (v1)?

Vi teller 13 målte defekter: hovedfunnet var en eksponeringsartefakt, halvparten av Claude-svarene var avkuttet av en felles token-grense, Gemini-kolonnen målte en modell uten nettilgang, verifikatoren dømte svar fra egen modellfamilie, og kildediagrammet viste faktasjekkerens oppslag i stedet for plattformenes siteringer. v1 er arkivert, og hele funnloggen ligger åpent i datasett-repoet på Hugging Face.

---

*Dette er en maskinlesbar Markdown-utgave av HTML-artikkelen på https://m51.ai/lab/hvilken-ai-er-best-pa-norsk. Innholdet genereres fra samme kilde som nettsiden.*
