Tek ölçüm yanıltır: AI görünürlüğü sabit bir sayı değil
10 marka, 20 soru, üç motor, 10 tekrar — 6.000 çağrılık kendi ölçümümüz, sektörün en yaygın alışkanlığının neden savunulamaz olduğunu gösterdi.
“ChatGPT’de görünürlüğünüz %38” cümlesi, tek bir taramadan üretildiğinde bilgi taşımıyor. Aynı soruyu aynı gün tekrar sorduğunuzda cevabın değişme ihtimali beşte bir. Bunu tahmin etmiyoruz — ölçtük.
Neden ölçtük
Literatür bir süredir üretken motorlarda görünürlüğün sabit bir büyüklük değil rastgele bir değişken olduğunu söylüyor. Schulte ve arkadaşları prompt başına en az yedi-sekiz tekrar öneriyor[1]; kapsamlı bir derleme, alandaki ticari denetimlerde “koşumdan koşuma yüksek değişkenlik” bulunduğunu kaydediyor[3].
Bu sayıları ithal etmek yerine kendi hattımızda ölçmeye karar verdik. 22-23 Ağustos 2026’da 10 marka × 20 soru × 10 tekrar tasarımını üç motorda ayrı ayrı koştuk: ChatGPT, Gemini ve yerel Qwen. Toplamda 6.000 motor çağrısı. Üretim veritabanına hiçbir yazma yapılmadı.
Bulgu 1 — Kararsızlık gerçek ve üç motorda da var
“Kararsız hücre” dediğimiz şey şu: aynı marka, aynı soru, aynı gün, aynı motor — ve on koşumun bir kısmında marka görünüyor, bir kısmında görünmüyor.
| Motor | Kararsız hücre | Tek koşum yayılımı |
|---|---|---|
| ChatGPT | %20,5 | 4,7 puan |
| Gemini | %18,5 | 5,0 puan |
| Qwen | %12,5 | 2,9 puan |
Yani her beş sorudan birinde “görünüyor muyuz?” sorusunun cevabı deterministik değil. Bir markanın panelinde gördüğü sayının bir bölümü, o gün zarın nasıl döndüğü.
Bulgu 2 — Beklemediğimiz sonuç: tekrar, marka skorunu düzeltmiyor
Tasarımın amacı “kaç tekrar yeterli?” sorusuna kendi cevabımızı bulmaktı. Tekrar sayısını 1’den 10’a çıkardıkça marka düzeyindeki %95 güven aralığının daralmasını bekliyorduk. Daralmadı.
| Motor | Marka CI · 1 tekrar | Marka CI · 10 tekrar |
|---|---|---|
| ChatGPT | 28,7 puan | 23,1 puan |
| Gemini | 23,0 puan | 20,9 puan |
| Qwen | 21,4 puan | 21,6 puan |
Belirsizliğin baskın kaynağı koşum gürültüsü değil, soru örneklemesi. Tekrar, bir sorunun içindeki gürültüyü azaltır; soru evreninden gelen belirsizliğe dokunmaz.
Bu, literatürdeki “prompt başına 7-8 tekrar” kuralını olduğu gibi almanın neden yanlış olacağını gösteriyor. O kural soru düzeyi kesinlik için doğru — “bu soruda görünüyor muyuz” sorusunu cevaplar. Ama bir markanın genel görünürlük skoru için yanlış kaldıraç. Bağımsız bir varyans ayrıştırması da aynı yöne işaret ediyor: tekrar, ölçüm bütçesinin en verimsiz harcandığı yer[2].
Bulgu 3 — Asıl darboğaz soru sayısı
Ölçtüğümüz standart sapmayla, marka görünürlüğünü belirli bir kesinlikte bilmek için gereken soru sayısını hesapladık:
- ±5 puan kesinlik için marka başına ~127-174 soru
- ±3 puan kesinlik için ~483 soru
Aynı bütçenin iki farklı dağıtımı, aynı motor, yaklaşık 200 çağrı:
| Bütçe dağılımı | Marka güven aralığı |
|---|---|
| 20 soru × 10 tekrar | ±17 puan |
| 174 soru × 1 tekrar | ±5 puan |
Bunun sektör için anlamı
Bugün AI görünürlük araçlarının çoğu tek koşumluk bir tarama yapıp tek bir sayı gösteriyor, ertesi gün aynı ölçümü tekrarlayıp aradaki farkı “artış” veya “düşüş” diye raporluyor. Ölçtüğümüz belirsizlik bandı ±17-19 puanken, birkaç puanlık günlük oynamaları trend olarak sunmak savunulamaz.
Bir AI görünürlük raporuna bakarken sorulacak üç soru:
- Bu sayı kaç soru üzerinden hesaplandı? (20 ile 170 arasında üç kat kesinlik farkı var.)
- Güven aralığı verilmiş mi, yoksa çıplak bir nokta tahmini mi?
- Raporlanan değişim, ölçüm gürültüsünün dışında mı?
Biz ne yapıyoruz
Bu ölçümün sonucu doğrudan ürüne giriyor. Marka görünürlüğü kartına ölçüm hassasiyeti bandı ekleniyor; bant içinde kalan değişimler “değişim yok (ölçüm gürültüsü içinde)” olarak etiketleniyor ve ok ya da yüzde gösterilmiyor. Soru evrenini büyütmek, tekrar sayısını artırmaktan önce geliyor.
Bir AI görünürlük platformunun satması gereken şey sonuç garantisi değil, ölçüm garantisi: nerede olduğunuzu güven aralığıyla bilmek ve neyin gürültü olduğunu ayırt edebilmek.
Kaynaklar
- [1]Schulte et al. — Don’t Measure Once: Measuring Visibility in AI Search (GEO), arXiv:2604.07585
- [2]Where Does the Noise Come From? A Variance-Components Decomposition of Non-Determinism in LLM Brand Answers, arXiv:2607.13304
- [3]Optimizing Visibility in Generative Engines: A Critical Survey of GEO (2023–2026), arXiv:2607.14035
Etki büyüklükleri, kaynak çalışmaların kendi deney ortamlarına aittir ve doğrudan bir sonuç vaadi değildir. Kendi ölçümlerimize ait sayılar, ilgili yazıda tasarım ve kapsam sınırlarıyla birlikte belirtilmiştir.
Diğer yazılar
Yapay zekânın verdiği kaynak gerçekten var mı?
Uydurulan kaynakların üçte ikisi gerçek bir alan adına, var olmayan bir sayfaya işaret ediyor. Ve tanınmış markalar bu riskten daha çok etkileniyor — daha az değil.
GEO taktikleri gerçekten işliyor mu? Kanıtın söylediği
45 çalışmalık bir derleme, popüler optimizasyon tavsiyelerinin çoğunu desteklemiyor. llms.txt dahil. İşe yarayan iki şey ise sıkıcı derecede temel.