Vi bruker informasjonskapsler for analyse og markedsføring. Les mer
Tilbake til Lab
GEO-serien, del 4

Vi stilte AI-en samme spørsmål to ganger. To tredjedeler av navnene byttet seg ut

Identisk spørsmål, samme dag, samme innstillinger — og bare rundt en tredjedel av selskapene som nevnes, nevnes igjen. Det endrer hvordan AI-synlighet må måles, og gjør enhver rapport basert på ett uttrekk verdiløs. Også våre.

m51.ai Lab
August 20262 min lesing

Still ChatGPT spørsmålet «hvem er de beste regnskapsførerne i Trondheim?» og noter hvilke selskaper den nevner. Still nøyaktig samme spørsmål en gang til.

Bare rundt en tredjedel av navnene går igjen. Vi målte det på 253 spørsmål mot tre plattformer, og resultatet er det samme overalt.

Dette er den enkeltopplysningen som betyr mest for hvordan AI-synlighet skal forstås — og den undergraver en hel sjanger av rapporter.

Tallene

Vi kjørte hvert spørsmål flere ganger med identisk ordlyd, samme dag, samme innstillinger, og målte overlappet i hvilke selskaper som ble nevnt:

PlattformNavneoverlapp mellom to kjøringerVurderingen endrer seg
Claude37,8 %45,5 % av spørsmålene
ChatGPT36,3 %39,1 %
Gemini34,1 %47,8 %

Overlappet er målt som Jaccard-indeks: av alle selskaper nevnt i minst én av to kjøringer, hvor stor andel er nevnt i begge. Rundt én av tre. To tredjedeler dukker opp i den ene kjøringen og ikke i den andre.

Å bli nevnt av en AI er ikke en posisjon. Det er en trekning.

Hvorfor skjer dette?

To mekanismer, begge dokumenterte egenskaper ved verktøyene: språkmodeller samler ikke svaret sitt likt fra gang til gang, og web-søket de gjør underveis returnerer ikke identiske treff hver gang. Et AI-svar er ikke et oppslag i en database — det er én stikkprøve fra en fordeling.

Det finnes ingen innstilling som fjerner dette. Det må måles rundt, ikke skrus av.

Hva det betyr hvis du kjøper AI-synlighetsrapporter

En rapport som viser at bedriften din «blir nevnt av ChatGPT», basert på én spørring, er et skjermbilde av en spilleautomat. Neste trekning gir et annet resultat, og rapporten sier ikke noe om hvor ofte du faktisk dukker opp.

Spørsmålene å stille leverandøren er enkle:

  • Hvor mange ganger ble hvert spørsmål stilt?
  • Rapporteres frekvens («nevnt i 7 av 10 kjøringer») eller tilstedeværelse («nevnt»)?
  • Oppgis usikkerheten?

Får du ikke svar på de tre, har du ikke kjøpt en måling. Du har kjøpt en anekdote med grafikk.

Det som faktisk er stabilt

Funnet betyr ikke at ingenting kan måles — det betyr at målingen må skje på riktig nivå. Enkeltsvar er ustabile; aggregater er stabile. I samme datasett er rangeringen mellom plattformene på svarkvalitet identisk under alle åtte dommervalg vi testet, og forskjellene er statistisk sikre med konfidensintervall fra 4 000 bootstrap-resamplinger.

Det er forskjellen på å spørre «ble jeg nevnt i går?» og «hvor stor andel av trekningene er jeg med i?». Det første er støy. Det andre er et tall som betyr noe — og som kan forbedres og etterprøves.

Derfor kjører NorGEO-Bench hvert spørsmål flere ganger, rapporterer usikkerhet på alt, og publiserer rådataene åpent. Ikke fordi det er akademisk pynt, men fordi tallene ellers ikke betyr noe.


Hvilke kilder AI-ene faktisk siterer — og hva det betyr for synligheten din → del 3

Hele metoden og resultatene → hovedrapporten (del 2)

Sjekk din egen bedrift i den interaktive benchmark-siden

Tallene er fra måling m-full-2026-07-30, og hele datasettet er åpent på Hugging Face. Spørsmål: [email protected].


Ofte stilte spørsmål

Gir ChatGPT samme svar hver gang?

Nei. På identiske spørsmål om norske bedrifter, stilt samme dag, gikk bare 36 % av de nevnte selskapene igjen mellom to kjøringer. Claude og Gemini ligger på henholdsvis 38 % og 34 %.

Kan man da måle AI-synlighet i det hele tatt?

Ja, men bare som frekvens over gjentatte spørringer — «nevnt i X av N kjøringer» — ikke som ett øyeblikksbilde. Aggregater er stabile selv om enkeltsvar ikke er det.

Er en AI-synlighetsrapport basert på ett søk verdt noe?

Som beslutningsgrunnlag: nei. Med en tredjedels overlapp mellom to identiske kjøringer kan ett uttrekk hverken bekrefte eller avkrefte at du er synlig.

Hvor kommer tallene fra?

NorGEO-Bench, m51 Labs løpende måling: 253 spørsmål × 3 plattformer med gjentatte kjøringer, måle-ID m-full-2026-07-30. Datasettet er åpent på Hugging Face (dervig/NorGEO-Bench), og hvert tall kan reproduseres med ett skript.

0 %
M51
NorskutvikletGDPR-compliantClaude Opus 5
© 2026 M51 Marketing ASPersonvern