Meten aan iets dat elke keer anders antwoordt
Stel ChatGPT drie keer dezelfde vraag en je krijgt drie verschillende antwoorden. Dat maakt AI-zichtbaarheid een steekproefprobleem, en zo behandelen we het ook.
1. Elke vraag, meerdere trekkingen
Eén meting is een momentopname van een systeem dat gokt. Geony stelt elke vraag standaard drie keer per meetronde, aan elke assistent afzonderlijk, en bewaart elke trekking apart. In het scherm zie je daarom bolletjes per trekking en geen weggemiddeld getal: "2 van de 3" en "67%" zijn hetzelfde cijfer, maar het eerste laat zien hoe smal de basis is.
2. Elk percentage draagt een Wilson-interval
Bij elk aanwezigheidspercentage tonen we het 95%-betrouwbaarheidsinterval (Wilson score), dezelfde statistiek die medische studies gebruiken voor kleine steekproeven. Drie metingen met één treffer is "33% (6 – 79%)", en die bandbreedte is geen zwakte maar de waarheid. Hoe meer metingen, hoe smaller de band.
3. Het alarm zwijgt bij overlap
Een daling van 56% naar 22% klinkt alarmerend. Maar als de intervallen elkaar overlappen, is het verschil niet te onderscheiden van toeval, en dan sturen we géén alert. Dit is rechtstreeks uit onze eigen meetgeschiedenis: diezelfde daling deed zich voor op één dag, zelfde configuratie, en was ruis. Een tool die daarop alarmeert traint je om alarmen te negeren.
4. Assistenten apart, nooit alleen het gemiddelde
In onze metingen verscheen hetzelfde merk in 36% van de Claude-antwoorden, 5% bij ChatGPT en 1% bij Gemini. Het gemiddelde daarvan (14%) beschrijft geen enkele assistent. Daarom krijgt elke assistent een eigen kolom met een eigen interval, en evalueert ook de alerting per assistent: een merk kan bij één assistent volledig verdwijnen terwijl het gemiddelde niets laat zien.
5. Bronnen uit de metadata, niet uit de lopende tekst
Welke bronnen een antwoord aanhaalt lezen we uit de gestructureerde citatiedata van de assistent zelf. Een taalmodel dat in lopende tekst URL's noemt, verzint ze regelmatig; metadata niet. Elke bron in Geony is daarmee herleidbaar tot een echt antwoord op een echt moment.
6. Wat we niet doen
We tonen geen sentiment-scores zolang we die niet tegen een gevalideerde set kunnen bewijzen. We rapporteren geen trends op te weinig data; onder de drempel zwijgt het systeem liever dan dat het gokt. En we schrijven geen "AI-geoptimaliseerde content" voor je: we laten zien welke bronnen het antwoord bepalen, het werk blijft het werk.
Binnen een dag weet je of AI jouw merk noemt of negeert
De eerste meting draait op je eigen prompts, over drie assistenten, met echte cijfers. Geen demo-data, geen gesprek met sales vooraf.