Derfor spriker GEO-verktøyene
Åtte plattformer måler AI-synlighet, og de gir ulike tall for samme merkevare. Forskjellen er sjelden feil — den er metodevalg.
Minst åtte plattformer måler AI-synlighet i 2026. Kjører du to av dem på samme merkevare, får du to ulike tall. Ingen av dem behøver å være feil.
Jeg har bygget et slikt verktøy selv, så jeg har både interessekonflikt og innsyn. La meg bruke innsynet: forskjellene mellom verktøyene handler nesten aldri om at noen regner galt. De handler om at spørsmålet «hvor synlig er du i AI-søk» ikke har ett svar før du har tatt seks metodevalg.
De seks valgene
1. Hvilke prompts
Dette er det største, og det snakkes minst om.
Et verktøy som genererer PromptEn prompt er spørsmålet eller instruksjonen en bruker gir en AI-tjeneste. AI-synlighet må måles per prompt, ikke per søkeord — det er prompten som utløser svaret du kan bli sitert i.Se i ordlisten automatisk fra bransjen din, gir andre tall enn et der du har skrevet dem selv. Automatisk genererte prompts er typisk mer generiske, mer kategoripregede og mer like konkurrentenes — og de gir derfor jevnere, kjedeligere tall.
Spør alltid: hvem skrev promptene, og kan jeg se dem?
2. Hvor mange kjøringer per prompt
Modellene svarer ikke likt hver gang. Samme spørsmål, tre kjøringer, tre litt ulike svar — noen ganger med ulike merkevarer OmtaleOmtale er når merkevaren din nevnes i et AI-svar, uavhengig av om det følger med en kildelenke. Omtale bygger kjennskap; sitering bygger trafikk.Se i ordlisten.
Et verktøy som kjører hver prompt én gang, rapporterer støy som utvikling. Kjører det tre eller fem ganger og gjennomsnitter, får du et mer stabilt tall som beveger seg tregere. Begge er forsvarlige. De er bare ikke sammenlignbare.
3. Teller «nevnt» og «sitert» likt
Dette er den vanligste kilden til at et tall virker mistenkelig høyt.
Å bli nevnt i teksten og å bli SiteringEn sitering er når en AI-tjeneste oppgir kilden bak et svar, som regel med lenke. Sitering er noe annet enn omtale: du kan bli nevnt uten å bli lenket til, og lenket til uten å bli nevnt ved navn.Se i ordlisten med lenke er to helt ulike utfall, med ulik verdi. Slår et verktøy dem sammen til én «synlighetsskår», får du et tall som ser bra ut og som ikke kan handles på.
Jeg mener de alltid bør rapporteres hver for seg. Men det er en metodemening, ikke en objektiv sannhet.
4. Hvilke modeller, og hvilke versjoner
ChatGPT, Gemini, Perplexity, Claude, Google AI Mode — og innenfor hver av dem flere versjoner og moduser. Et verktøy som måler tre modeller og et som måler fem, gir ulike snitt selv om alt annet er likt.
Verre: modellene oppdateres. En endring i tallet ditt kan komme av at leverandøren byttet modellversjon i målingen.
5. Land og språk
For norske virksomheter er dette avgjørende. Måles det på norsk eller engelsk? Fra norsk IP eller amerikansk?
Et norsk selskap kan ha god synlighet på norske spørsmål og null på engelske. Måler verktøyet på engelsk fra USA, måler det noe som ikke angår deg.
6. Personalisering og historikk
Er målingen kjørt fra en innlogget konto med samtalehistorikk, eller fra en ren økt? Historikk påvirker svarene. Verktøy håndterer dette ulikt, og noen dokumenterer det ikke i det hele tatt.
Hva jeg ville spurt en leverandør om
Fem spørsmål, og jeg ville bedt om skriftlig svar:
- Kan jeg se de eksakte promptene som kjøres?
- Hvor mange kjøringer per prompt per måling?
- Rapporteres «nevnt» og «sitert med lenke» separat?
- Hvilke modeller og versjoner, og varsles jeg når de endres?
- Hvilket land og språk måles det fra?
Et verktøy som svarer tydelig på alle fem, er til å stole på — uavhengig av om tallet det gir er høyt eller lavt. Et som er vagt på tre av dem, selger en skår framfor en måling.
Det viktigste rådet
Velg ett, og bli.
Verdien i denne typen måling ligger nesten utelukkende i utviklingen over tid, ikke i nivået. Et tall på 23 prosent betyr ingenting alene. At det var 23 og nå er 31, med samme metode, betyr noe.
Bytter du verktøy, starter tidsserien på nytt. Kjører du to parallelt, bruker du tiden på å forklare hvorfor de spriker i stedet for å jobbe med det de viser.
Og det ubehagelige
Det finnes ingen fasit å validere mot. Ingen vet den sanne andelen AI-svar der merkevaren din nevnes, fordi det ikke finnes noe fullstendig register over spørsmål folk stiller.
Alle disse verktøyene — mitt inkludert — måler et utvalg og generaliserer. Det er en helt legitim metode, og den er den eneste som finnes. Men den som presenterer resultatet som en presis måling framfor et estimat med metodeforbehold, har gått lenger enn dataene bærer.
Ofte stilte spørsmål
Hvilket verktøy er mest nøyaktig?
Spørsmålet lar seg ikke besvare, fordi det ikke finnes en fasit å måle mot. Det finnes ingen offisiell sannhet om hvor synlig en merkevare er i AI-svar. Det du kan vurdere, er om metoden er dokumentert og konsistent over tid — det er langt viktigere enn om tallet er høyt eller lavt.
Bør jeg bruke flere verktøy samtidig?
Sjelden. To verktøy med ulik metode gir to tidsserier som ikke kan sammenlignes, og da bruker du tid på å forklare avviket i stedet for å jobbe. Velg ett, forstå metoden, og hold deg til det.
Hvorfor endrer tallet seg når jeg ikke har gjort noe?
Fordi modellene ikke svarer likt hver gang. Uten flere kjøringer per prompt måler du delvis tilfeldighet. Et verktøy som kjører hver prompt én gang vil vise bevegelse som ikke er reell — spør alltid hvor mange kjøringer som ligger bak.
Ordforklaringer
Begrepene som brukes i denne artikkelen.
- Sitering
- En sitering er når en AI-tjeneste oppgir kilden bak et svar, som regel med lenke. Sitering er noe annet enn omtale: du kan bli nevnt uten å bli lenket til, og lenket til uten å bli nevnt ved navn.
- Omtale
- Omtale er når merkevaren din nevnes i et AI-svar, uavhengig av om det følger med en kildelenke. Omtale bygger kjennskap; sitering bygger trafikk.
- Prompt
- En prompt er spørsmålet eller instruksjonen en bruker gir en AI-tjeneste. AI-synlighet må måles per prompt, ikke per søkeord — det er prompten som utløser svaret du kan bli sitert i.
Takk — dette hjelper meg med å gjøre artikkelen bedre.
Få det jeg lærer om AI-søk
Egne tester og analyser av hvordan språkmodellene velger kilder. Ingen fast frekvens — jeg sender når jeg faktisk har noe å si.
