De GEO Specialist
Inhoudstafel

Fundamentals

Prompt monitoring & KPI's: hoe meet je GEO-succes?

EwoutEwout PutsDigital Marketing Strateeg
12 min leestijd
Prompt monitoring & KPI's: hoe meet je GEO-succes? — Fundamentals

Prompt monitoring is het systematisch testen van een vaste set zoekvragen in ChatGPT, Gemini, Claude en Google AI Overviews, om te meten hoe vaak en hoe positief jouw merk in de antwoorden verschijnt. Die vragen verdeel je over twee dimensies: of ze je merknaam bevatten of niet, en in welke fase van de klantreis ze thuishoren. Samen vormen ze een matrix van zes prompttypes, elk met eigen KPI's en eigen acceptatiecriteria.

Je test vandaag honderd realistische koopvragen in ChatGPT en je merk duikt in twaalf ervan op. Is dat goed nieuws? Zonder context weet je het niet. Gaat het om vragen waarin klanten je merknaam al kennen, of om vragen van mensen die nog moeten ontdekken dat je bestaat? Staat je merk op plek één in een aanbevelingslijstje, of ergens onderaan als vage bijzin? Dat onderscheid bepaalt of die twaalf vermeldingen een overwinning zijn of een waarschuwingssignaal. In dit artikel bouwen we samen de meetlat op waarmee je dat verschil voortaan zelf kan zien.

Waarom een positie in Google niet meer volstaat als meetpunt

Generatieve zoeksystemen werken niet met een ranglijst, maar knippen content op in fragmenten en kiezen daarvan de sterkste stukjes om in hun antwoord te verwerken. Een positie zegt dus niets meer over succes. Een vermelding in dat antwoord wel: het model vond je content overtuigend genoeg om ze letterlijk over te nemen. Onderzoek van Princeton University toont dat gerichte tekstuele aanpassingen die kans met tot 40% kunnen verhogen, en die winst meet je alleen als je vooraf weet waar je nulpunt ligt.

Een generiek "we scoren goed in ChatGPT" zegt daarom weinig. Scoor je bij mensen die je merk al kennen, of ook bij mensen die je nog moeten ontdekken? Om die vraag te beantwoorden, splits je je metingen op volgens twee assen.

De monitoringsmatrix: twee assen, zes categorieën

Elke zoekvraag die relevant is voor jouw merk valt onder te verdelen op basis van twee dimensies: bevat de vraag je merknaam (branded versus unbranded), en in welke fase van de klantreis hoort ze thuis (oriënterend, vergelijkend, of beslissend). Samen leveren die twee assen zes categorieën op, en elke categorie vraagt om een andere set prompts en een ander KPI-profiel.

De eerste as is vrij intuïtief: een unbranded prompt zoals "wat is CRM-software en hoe helpt het bouwbedrijven om projecten en klantcontact te beheren" test of je opduikt bij iemand die je merk nog niet kent. Een branded prompt zoals "wat voor bedrijf is [je merk] en welke CRM-oplossing bieden ze aan voor de bouwsector" test iets heel anders, namelijk of het model je correct beschrijft op het moment dat iemand er al naar vraagt.

De tweede as volgt niet de klassieke marketingtrechter, maar het bewustzijnsniveau van de zoeker, vertaald naar hoe mensen vandaag met AI-assistenten praten:

  • Problem Unaware: iemand leert over een onderwerp en zoekt algemene informatie, zonder dat er al een concrete oplossingsrichting in beeld is.
  • Problem Aware: iemand weet welk probleem er is en denkt na over hoe dat op te lossen, maar kijkt nog niet naar specifieke leveranciers of producten.
  • Solution Aware: iemand evalueert actief concrete leveranciers en staat op het punt een aankoopbeslissing te nemen.

Zet je die twee assen naast elkaar, dan krijg je zes vakjes, elk met een eigen voorbeeldprompt en een eigen KPI. Toch is de logica simpel: bij unbranded prompts meet je vooral hoe vaak je wordt aangehaald, met de Citation Rate en de Share of Voice. Bij branded prompts kent het model je merk al, dus meet je vooral of dat wat het zegt klopt en hoe het klinkt, met de Hallucination Rate en de Mention Sentiment. We lopen de zes vakjes hieronder één voor één door.

Unbranded prompts: zichtbaarheid bij wie je nog niet kent

Unbranded prompts testen of jouw merk opduikt bij mensen die je naam nog nooit hebben getypt, en dat is meteen de categorie waar de grootste zichtbaarheidswinst te behalen valt, omdat hier geen enkel vooroordeel meespeelt. Een taalmodel kiest hier volledig op basis van hoe overtuigend en goed onderbouwd je content is, niet op basis van naamsbekendheid.

Om de matrix concreet te maken, gebruiken we doorheen dit artikel telkens hetzelfde scenario: een bouwbedrijf dat op zoek is naar CRM-software. Dezelfde logica pas je toe op elk product of elke dienst.

Problem Unaware, unbranded

Hier test je puur informatieve vragen, van het type "wat is CRM-software en hoe helpt het bouwbedrijven om projecten en klantcontact te beheren". De zoeker probeert het onderwerp zelf te begrijpen, nog zonder aan een specifieke oplossing te denken. De kern-KPI hier is de Citation Rate.

Citation Rate: het percentage gemeten AI-antwoorden waarin je merk expliciet wordt genoemd.
Formule: (aantal antwoorden met vermelding ÷ totaal aantal gemeten antwoorden) × 100

Dit cijfer krijg je niet uit een enkele prompt: AI-antwoorden variëren van run tot run, dus je moet dezelfde prompt minstens twintig tot dertig keer laten herhalen en tellen in hoeveel van die antwoorden je merk effectief voorkomt. Dat volume manueel opvolgen is nauwelijks haalbaar, daarom laat je dit best lopen via een gespecialiseerde monitoringtool die de herhalingen automatisch uitvoert en bijhoudt. Een Citation Rate onder 10% betekent dat je voor die vraag quasi onzichtbaar bent, boven 30% geldt algemeen als sterke zichtbaarheid.

Problem Aware, unbranded

Hier gaat het om procesgerichte vragen zoals "hoe pak je de keuze van een CRM-systeem het best aan voor een groeiend bouwbedrijf". Er wordt nog geen leverancier genoemd of vergeleken, de zoeker denkt na over de aanpak zelf. Ook hier blijft de Citation Rate de kern-KPI, maar dan gemeten op procesgerichte prompts in plaats van pure informatieve prompts: word je genoemd als bron voor hoe je zo'n traject aanpakt, nog voor er één naam van een leverancier valt? Een lage score op deze specifieke prompts, terwijl je Citation Rate op Problem Unaware-vragen wel goed zit, wijst op een concreet gat: je wordt herkend als autoriteit over het onderwerp, maar niet over hoe je het aanpakt.

Nieuwsbrief

Blijf mee met hoe GEO evolueert

Generative Engine Optimization staat nog volop in ontwikkeling: AI-systemen passen voortdurend aan hoe ze bronnen selecteren en antwoorden opbouwen. Schrijf je in en ontvang nieuwe inzichten, praktijkcases en tools zodra ze relevant worden, zodat je zicht houdt op wat er verandert.

Solution Aware, unbranded

Dit zijn de vragen waarin de zoeker actief leveranciers naast elkaar legt of op het punt staat te kiezen, zoals "wat zijn de beste CRM-platformen voor bouwbedrijven met meerdere werven". Hier verschuift de kern-KPI naar de Share of Voice.

Share of Voice: je eigen aandeel in alle merkcitaties binnen een categorie, in verhouding tot de concurrentie.
Formule: (eigen citaties ÷ totaal aantal citaties van alle merken in die categorie) × 100

Waar de Citation Rate absoluut is, hoe vaak jij zelf voorkomt, is de Share of Voice relatief: hoe jij je verhoudt tot de concurrentie binnen exact dezelfde resultaten. Een Citation Rate van 40% oogt sterk, maar als een dominante concurrent 65% van alle citaties binnen diezelfde vergelijkingen naar zich toetrekt, ligt je Share of Voice alsnog laag, en dat is precies het moment waarop je moet bijsturen.

Stadium

Prompt

KPI

Problem Unaware, unbranded

"Wat is CRM-software en hoe helpt het bouwbedrijven om projecten en klantcontact te beheren?"

Citation Rate

Problem Aware, unbranded

"Hoe pak je de keuze van een CRM-systeem het best aan voor een groeiend bouwbedrijf?"

Citation Rate

Solution Aware, unbranded

"Wat zijn de beste CRM-platformen voor bouwbedrijven met meerdere werven?"

Share of Voice

Branded prompts: controle over je eigen verhaal

Branded prompts testen niet of je gevonden wordt, maar of het beeld dat een AI-systeem van je merk schetst nog klopt op het moment dat iemand er expliciet naar vraagt. Deze categorie werkt daardoor als een soort spiegel: ze toont je precies wat een taalmodel intussen over je heeft "geleerd", en of dat beeld nog overeenkomt met de werkelijkheid.

Problem Unaware, branded

Vragen zoals "wat voor bedrijf is [merk] en welke CRM-oplossing bieden ze aan voor de bouwsector" testen de basisfeiten. Je merk verschijnt hier sowieso in het antwoord, de naam staat al in de vraag, dus de kern-KPI draait niet om zichtbaarheid maar om correctheid: de Hallucination Rate.

Hallucination Rate: het percentage feitelijke fouten of verzonnen beweringen in een antwoord over je merk.
Formule: (aantal antwoorden met minstens één feitelijke fout ÷ totaal aantal gemeten antwoorden) × 100

Van een verkeerd beschreven productcategorie tot een niet-bestaande functionaliteit, elke afwijking van de werkelijkheid telt mee. Idealiter staat dit cijfer op nul. Ontstaat er wel ruis, dan ligt de oorzaak meestal bij inconsistente merkinformatie die her en der op het web verspreid staat, waardoor het model niet meer zeker weet wat correct is.

Problem Aware, branded

Hier vraagt iemand die je merk al kent naar je aanpak of methodologie, zonder al specifiek een concurrent te noemen: "hoe pakt [merk] de implementatie van hun CRM-systeem aan bij bouwbedrijven". Ook hier blijft de Hallucination Rate de kern-KPI, maar dan toegepast op procesinformatie in plaats van basisfeiten: beschrijft het model je implementatietraject correct, of verzint het stappen die niet bestaan? Een hoge score hier wijst vaak op onvoldoende gestructureerde procescontent op je eigen kanalen, waardoor het model bij gebrek aan beter zelf invult wat jouw aanpak zou kunnen zijn.

Solution Aware, branded

De meest beslissende branded vragen klinken zo: "wat zijn de belangrijkste verschillen tussen [merk] en [concurrent] als CRM-oplossing voor de bouwsector". Hier verschuift de kern-KPI naar de Mention Sentiment.

Mention Sentiment: de toon waarin je merk wordt beschreven wanneer het genoemd wordt, opgedeeld in positief, neutraal of negatief.
Formule: (aantal positief geframede vermeldingen ÷ totaal aantal vermeldingen) × 100

Dit meet niet of je genoemd wordt, dat gebeurt toch al, maar of die vermelding je sterker of net zwakker doet overkomen. Wordt je merk weggezet als de logische keuze, of als een optie die weliswaar bestaat maar toch net iets minder overtuigt dan de concurrent? Een AI-systeem dat je consequent als tweede keuze framet, kost je evenveel conversie als helemaal niet genoemd worden, ook al scoor je technisch perfect op zichtbaarheid.

Awareness-stadium

Voorbeeldprompt

Kern-KPI

Problem Unaware, branded

"Wat voor bedrijf is [merk] en welke CRM-oplossing bieden ze aan voor de bouwsector?"

Hallucination Rate

Problem Aware, branded

"Hoe pakt [merk] de implementatie van hun CRM-systeem aan bij bouwbedrijven?"

Hallucination Rate

Solution Aware, branded

"Wat zijn de belangrijkste verschillen tussen [merk] en [concurrent] als CRM-oplossing voor de bouwsector?"

Mention Sentiment

Waarom precies deze verdeling het verschil maakt

Eén ongewogen gemiddelde over al je prompts heen verbergt precies de informatie die je nodig hebt om gericht bij te sturen, terwijl een opsplitsing per categorie meteen toont waar het echte probleem zit. Scoor je zwak op Citation Rate bij unbranded, Problem Unaware vragen, dan wijst dat op een contentprobleem: je autoriteit binnen het onderwerp is nog niet sterk genoeg opgebouwd. Scoor je zwak op Mention Sentiment bij branded, Solution Aware vragen, dan wijst dat eerder op een structureel vertrouwensprobleem, bijvoorbeeld het ontbreken van sterke, onafhankelijke reviews die je positie in een vergelijking onderbouwen.

Dat onderscheid bepaalt ook wélk deel van je GEO-strategie je bijstuurt. Een zwakke Citation Rate los je op met sterkere, feitelijk onderbouwde content op je eigen kanalen. Een zwakke Mention Sentiment los je op met een gerichte earned-mediastrategie, omdat taalmodellen bij vergelijkende vragen systematisch teruggrijpen naar onafhankelijke, externe bevestiging in plaats van naar wat een merk over zichzelf beweert. Wie deze twee problemen door elkaar haalt, steekt tijd en budget in de verkeerde oplossing.

Zo bouw je dit praktisch op

Een werkbare monitoringsopzet start met minstens vijftien tot twintig realistische prompts per categorie, verspreid over de zes vakjes van de matrix, herhaald op een vaste cadans. Handmatig af en toe een vraag intypen in ChatGPT volstaat niet: AI-antwoorden veranderen van dag tot dag, en een eenmalige steekproef zegt niets over een trend.

Volg hiervoor drie stappen. Stel eerst je promptenlijst samen, samen met collega's uit sales en klantendienst die de echte vragen van prospects kennen, niet enkel de vragen die jij zelf zou verzinnen achter een bureau. Kies vervolgens een meetritme: wekelijks voor de snel veranderende Solution Aware categorieën, maandelijks voor de stabielere Problem Unaware categorieën volstaat doorgaans. Documenteer ten slotte elke meting in een vast sjabloon, met per prompt de datum, het gegeven antwoord, de vermelde bronnen en een score per KPI, zodat je na een kwartaal een échte trendlijn hebt in plaats van losse steekproeven.

Manueel bijhouden is hier eigenlijk geen haalbare optie, en dat is geen kwestie van gemak maar van betrouwbaarheid: handmatig test je noodgedwongen één set prompts na elkaar, terwijl gespecialiseerde tools dezelfde matrix over ChatGPT, Gemini en Claude tegelijk en herhaald afvuren. Enkel op die manier krijg je een resultaat dat je maand na maand met elkaar kan vergelijken, in plaats van losse metingen die door toeval al kunnen verschillen. Welke tool het beste past, hangt af van je schaal en budget, maar het onderliggende principe uit dit artikel blijft hetzelfde ongeacht welk hulpmiddel je kiest: zonder een vaste matrix van prompttypes, consequent gemeten, meet je toeval, geen trend.

Gerelateerde artikelen

Veelgestelde vragen

Hoeveel prompts heb ik minimaal nodig voor een betrouwbare meting?

Reken op minstens vijftien tot twintig prompts per categorie uit de matrix, dus zeker negentig in totaal voor een volledig beeld over alle zes de vakjes heen. Minder dan dat maakt losse toevalstreffers moeilijk te onderscheiden van een echte trend.

Moet ik elke categorie even vaak meten?

Nee. Solution Aware prompts, zowel branded als unbranded, veranderen sneller van antwoord omdat ze gevoelig zijn voor actuele prijzen en aanbiedingen. Meet die wekelijks. Problem Unaware prompts blijven stabieler en volstaan met een maandelijkse meting.

Wat als mijn merk nog nooit in een AI-antwoord verschijnt?

Begin dan bij de unbranded, Solution aware categorie. Daar zit het meeste intentie en valt ook de meeste commerciële winst te halen.

Telt een negatieve vermelding ook mee als citatie?

Ja, en dat is precies waarom de Mention Sentiment een aparte KPI is naast Citation Rate en Share of Voice. Een merk dat wordt genoemd in negatieve of afzwakkende context, scoort technisch op zichtbaarheid maar verliest op vertrouwen, dus lees elke meting altijd samen met de toon van het antwoord, nooit als een los cijfer.

Kan ik deze matrix ook gebruiken voor een concurrentieanalyse?

Zeker. Voer dezelfde promptenlijst uit terwijl je specifiek let op hoe vaak en hoe positief een concurrent wordt genoemd binnen dezelfde categorieën. Dat levert een directe Share of Voice-vergelijking op, zonder dat je daarvoor een aparte matrix hoeft op te zetten.