Pozorio · Metodológia
Ako meriame AI viditeľnosť
Pozorio je jediný GEO tool, ktorý publikuje confidence intervaly pri každom skóre. Tu je ako fungujú a prečo to znamená spoľahlivejšie čísla než u konkurencie.
1. Ako často sledujeme AI enginy
Pre plány Optimize a Dominate spúšťame 5 vzoriek/týždeň per (query × engine) naprieč 5 enginami (ChatGPT, Gemini, Perplexity, Google AI Overviews, Google AI Mode). Sloty sa plánujú deterministicky hash-based per pondelok 00:00 UTC a postupne sa odbavujú každých 15 minút počas celého týždňa, aby boli mereania nezávislé na rovnakom dennom kontexte.
plan-week— pondelky 00:00 UTC (vytvorí týždenný rozvrh slotov)dispatch-slot— každých 15 min (vykoná due sloty)aggregate-daily— denne 01:30 UTC (Wilson CI agregácia pre dashboard)
On-demand audit cez tlačidlo „Spustiť audit“ v dashboarde spustí všetky sloty pre brand ihneď (mimo schedule).
2. Koľko vzoriek = koľko spoľahlivosti
Pri 5 vzorkách/týždeň × 5 enginov zachytíme ~108 meraní za mesiac per query (5 × 5 × 4.3 týždňov). Konkurencia (Peec AI, Profound) typicky robí 1× denne bez confidence display — výsledné čísla skáču deň po deň bez reálnej zmeny visibility.
| Tool | Meraní/mesiac/dotaz | Confidence display |
|---|---|---|
| Pozorio Optimize | ~86 | ✓ Wilson 95% CI |
| Peec AI Pro | ~30 | ✗ |
| Profound | ~30 | ✗ |
3. Wilsonov interval — čo to znamená pre teba
Wilsonov score interval (Wilson, 1927) je štatistická metóda na výpočet 95% confidence interval-u pre binomický pomer (počet úspechov / počet pokusov). Pri AI viditeľnosti:
- úspech = AI engine spomenul tvoju značku v odpovedi
- pokus = jedna AI query (z ~86 meraní/mesiac/dotaz pri Optimize tier)
- interval = rozsah, v ktorom skutočná pravdepodobnosť mention-u leží s 95% istotou
Príklad: 12 mentions z 20 vzoriek
p̂ = 12/20 = 0.60 (60%)
z = 1.96 (95% CI)
Wilson interval = [38.7%, 78.1%]
→ tvoja skutočná visibility je s 95% pravdepodobnosťou medzi 39% a 78%. Široký interval signalizuje že potrebuješ viac vzoriek alebo je značka dosiaľ málo viditeľná.
4. Prečo neukazujeme presné čísla bez intervalu
„Tvoje skóre je 64.2 %” znie presne, ale je to ilúzia presnosti. Pri n=21 vzorkách je realistický rozsah 40-77 % — čo je obrovský rozdiel pre rozhodovanie. Ostatné GEO tooly tento detail tají, my ho stavame do popredia.
Široký interval znamená: nerob radikálne rozhodnutia na základe týždenných výkyvov. Počkaj na trend.
5. Limity metódy
- Malé n.Pri menej ako 6 vzorkách (prvé 2 dni nového projektu) zobrazíme „nedostatok dát” namiesto CI.
- Engine variance. Jednotlivé enginy (ChatGPT, Gemini, Perplexity, Google AIO) majú vlastné variability. Vážený priemer cez engines podľa traffic-share zachytáva túto heterogenitu, ale CI per engine môžu byť rozdielne.
- Drift. AI modely sa občas updatujú, čo môže spôsobiť bod-zmenu v skóre. CI nezachytí náhly model upgrade — manuálne investiguj zlomy v trende.
- Zmena režimu Gemini (9/2026). Do septembra 2026 sa Gemini sám rozhodoval, či pred odpoveďou vyhľadá na webe, a robil to len v 8–21 % meraní — zvyšok boli odpovede z pamäte modelu. Od zavedenia vynúteného groundingu vyhľadáva pri každom meraní, čo je bod-zmena: hodnoty Gemini pred a po tomto dátume nie sú priamo porovnateľné a podiel citovaných zdrojov z Gemini výrazne stúpa. Od 10. 9. 2026 navyše meriame na modeli
gemini-2.5-flashnamiestogemini-3-flash-preview: Google pri Gemini 3 účtuje vyhľadávanie za každú jednotlivú vyhľadávaciu query (vynútené vyhľadávanie ich spúšťa ~5 na meranie), pri 2.5 za meranie. Vynútené vyhľadávanie platí aj tu (8/8 v overovacej vzorke), ale odpovede pochádzajú z iného modelu, takže ide o druhú bod-zmenu v tom istom mesiaci. - Statistical, not absolute. Wilsonov interval je approximatívnypre malé n. Vždy interpretuj ako „directional”, nie „absolute”.
Adaptívne sampling
Sampluje 5 vzoriek na (query, engine) každý týždeň naprieč všetkými 5 enginmi (ChatGPT, Gemini, Perplexity, Google AIO, Google AI Mode). Planner vyberá UTC sloty deterministicky hash-based, takže merania sú rozprestreté cez celý týždeň namiesto bursting v jeden moment — to zachytí prirodzenú variabilitu odpovedí AI modelov medzi rannou a večernou prevádzkou.
Cadence škálovaná podľa plánu
Sampling cadence sa líši per plan tier (PLAN_LIMITS.samplesPerWeekPerEngine):
- Monitor (€39): 2 vzorky/týždeň × 5 enginov = ~43 meraní/dotaz/mesiac
- Optimize (€99): 5 vzoriek/týždeň × 5 enginov = ~108 meraní/dotaz/mesiac
- Dominate (€299): 5 base + variance-driven escalation až 10/týždeň × 5 enginov = ~108–215 meraní/dotaz/mesiac
Pri Optimize s 50 sledovanými dotazmi (cap) máte ~5 400 nezávislých dátových bodov mesačne — dosť pre stabilný Wilson CI aj pre malé pohyby (Δpp 3–5).
Adaptívne nastavenie počtu vzoriek
Planner každý pondelok prepočíta variance (Wilson half-width nad posledným 4-týždňovým oknom) a recent change (rozdiel cross-engine center medzi týmto a minulým 7-dňovým oknom). Podľa toho rozhodne koľko vzoriek venovať na tento týždeň:
variance < 0.10 AND recentChange < 0.05→ 3 vzorky/týždeň (stabilný dotaz, šetríme náklady)variance > 0.25 OR recentChange > 0.15→ 6–10 vzoriek/týždeň (eskalácia pri vysokej variabilite)- Inak: default 5 vzoriek/týždeň
Hash-based distribúcia v rámci týždňa
Konkrétne časy slotov sú deterministické — kľúčujú sa hashom z (queryId, engineId, weekStarting). Vzorky sú rozhodené naprieč 7 dní × 18-hodinový denný interval (04:00–22:00 UTC) tak aby rovnaký dotaz na rovnaký engine bol vždy samplovaný v rovnakých časoch — eliminuje to denno-cyklickú zaujatosť z AI APIs.
Triple-gate anomaly detection
Aby sa nezachytávali šum pohyby v hraničných oblastiach, anomálie firuju len keď platia všetky tri podmienky súčasne:
|z-score| > 2.5voči 30-dňovému baselineu- Wilson intervaly tohto a predchádzajúceho 7-dňového okna sa neprekrývajú
- Absolútna zmena cross-engine centra > 5 pp
Pri samostatnej jednej podmienke (napr. samotný z-score nad prah) alert nefirne — naivné detektory typicky spamujú Slack pri malých rozsahových pohyboch, triple-gate to eliminuje.
Cost guards
Per-brand denné limity chránia rozpočet: $1.50/deň soft cap (preskočia sa budúce sloty pre dnes — sampling sa obnoví zajtra) a $3.00/deň hard cap (atomická kontrola v RPC, flagne brand ako throttled — budúce týždne dostanú polovicu vzoriek).
Aké modely používame
Presný model je súčasť metodológie — preto ho uvádzame pri každom engine. Zmeny modelov zaznamenávame v changelogu.
| Engine | Zdroj / model | Poznámka |
|---|---|---|
| ChatGPT | gpt-5.6-luna + web search | live web search, lokalizácia SK/CZ; bezplatný audit používa rovnaký model. Migrácia z gpt-4o-mini-search-preview (deprecated u OpenAI) validovaná A/B meraním na produkčných dopytoch: zhoda verdiktov 93 %, nezhody obojsmerné = šum (8/2026); predchádzajúca medzi-modelová štúdia 97,5 %, κ 0,93 |
| Gemini | gemini-2.5-flash | Google Search grounding vynútené inštrukciou v systémovom prompte; API neponúka tvrdý prepínač, preto podiel reálne vyhľadávajúcich vzoriek priebežne merame a evidujeme pri každej vzorke (od 9/2026 100 % v overovacej vzorke; predtým sa model rozhodoval sám a hľadal len v 8–21 % prípadov). Do 10. 9. 2026 gemini-3-flash-preview; prechod na 2.5 kvôli účtovaniu vyhľadávania za každú query pri Gemini 3 |
| Perplexity | sonar | Perplexity API, záložne OpenRouter |
| Google AI Overviews | reálny Google SERP (DataForSEO) | žiadny LLM — skutočne vyrenderovaný AIO panel, desktop, SK/CZ lokalizácia |
| Google AI Mode | reálny Google AI Mode SERP (DataForSEO) | jediní na SK/CZ |
| Parser odpovedí | claude-haiku-4-5 | extrakcia zmienky/pozície/sentimentu; deterministický regex fallback |
Validácia voči reálnemu UI
API merania sa môžu líšiť od toho, čo vidí reálny používateľ v prehliadači — AI odpovede sú nedeterministické aj medzi dvomi obnoveniami tej istej stránky. Živé porovnanie (august 2026, 30 nákupných dopytov, odhlásený prehliadač so SK lokalitou vs naše API merania): 90 % zhoda v tom, či sa AI Overview zobrazí, a 72 % zhoda v zmienke značky — pričom odchýlky nemali systematický smer (ani v prospech, ani v neprospech API). Presne preto meriame každý dopyt viackrát týždenne a ukazujeme mieru s intervalom spoľahlivosti namiesto jedného merania.
Popri tom pripravujeme anonymný ground-truth program: používatelia našej Chrome extension budú môcť dobrovoľne (opt-in, defaultne vypnuté) prispievať merania z reálnych Google AI Overviews — odosiela sa výhradne vyhľadávaný dopyt, sledovaný výraz a či bol spomenutý. Žiadny obsah stránky, žiadna identita, žiadne cookies. Konzistenčné čísla z tohto programu zverejníme tu, keď dataset dosiahne štatisticky zmysluplnú veľkosť. Ak sa ukáže systematický rozdiel, upravíme metodológiu — poctivé meranie je celý zmysel Pozoria.