Poate măsurarea sintetică AI să prezică ce văd utilizatorii reali?
Vizibilitatea în AI se măsoară, de regulă, trimițând prompturi controlate către modele. Dar un om primește răspunsul în contul lui, cu istoricul, memoria și setările lui. Protocolul de mai jos testează cât de mult diferă cele două lumi.
Când un brand apare în 30% din răspunsurile unui AI, ce înseamnă asta? Că 30% dintre oameni îl văd? Nu neapărat. Înseamnă că apare în 30% din răspunsurile generate în condițiile experimentului. Sunt două afirmații diferite, iar diferența dintre ele se spune rar într-un dashboard.
Studiul de față nu pornește de la presupunerea că măsurarea sintetică e corectă. O tratează ca pe o ipoteză și descrie experimentul care o poate confirma, limita sau respinge. Toate cele trei rezultate sunt utile.
- Benchmark-urile de vizibilitate AI eșantionează răspunsuri generate de modele în condiții controlate, nu răspunsuri primite de utilizatori. Cât de asemănătoare sunt cele două rămâne de demonstrat.
- Studiul compară, pe aceeași intenție comercială, distribuția brandurilor din interogări sintetice cu cea din răspunsurile primite de utilizatori reali în propriile conturi AI, cu metrici cantitative și intervale de încredere.
- Ipoteza privește distribuția agregată, nu răspunsul individual. Rezultatul poate fi acord puternic, acord condiționat pe categorii sau acord slab, iar toate trei se publică.

Stadiu: protocol publicat, fără date din utilizatori reali. Panelul de utilizatori reali nu a fost colectat, deci pagina nu conține niciun rezultat al comparației. Numerele din exemple sunt ilustrative.
RAVI (Reality-Adjusted Visibility Intelligence) este instrumentul nostru de măsurare a cotei de piață în răspunsurile AI, iar acest studiu a fost gândit ca stratul lui de validare. Instrumentul este oprit; întrebarea de cercetare rămâne deschisă.
30% în benchmark nu înseamnă 30% dintre oameni
„Brandul A apare în 30% din răspunsurile generate în condițiile experimentale definite de metodologie.”
„30% dintre utilizatorii reali văd brandul A.”
Un răspuns AI real depinde de mult mai mult decât de promptul curent. Un monitor sintetic controlează doar o parte din acest mediu; un utilizator real trăiește în tot restul:
- istoricul conversației
- memoria contului
- personalizarea
- locația
- setările produsului
- model routing
- instrumentele active
- momentul interogării
- variabilitatea stochastică
Aceeași întrebare, două populații
Interogări controlate, sistematice și repetate către sisteme AI.
Distribuția sintetică a recomandărilor
Ps(B | I, M, Cs)
- B
- brandul recomandat sau menționat
- I
- intenția / promptul
- M
- modelul AI
- Cs
- contextul standardizat al experimentului
Oameni reali, în propriile conturi AI, primesc o sarcină de cercetare controlată.
Distribuția reală a recomandărilor
Pr(B | I, M, U, Cr)
- B
- brandul recomandat sau menționat
- I
- intenția / promptul
- M
- modelul AI
- U
- utilizatorul: istoric, memorie, personalizare
- Cr
- contextul real al produsului și al conversației
D(Ps, Pr)
Studiul estimează această distanță. Nu presupune că e zero și nu presupune că e mare: e valoarea pe care o măsurăm.
Întrebarea centrală și ipotezele
În ce măsură distribuția recomandărilor de brand, obținută prin interogare sintetică și standardizată, reproduce distribuția primită de utilizatori reali în propriile medii AI?
Un sondaj de opinie funcționează pentru că întreabă oameni. Nu întrebi votanți simulați și nu presupui că reprezintă electoratul. Aici e situația inversă: trimiți 10.000 de prompturi către un model și eșantionezi ieșiri de model, nu utilizatori.
- H₁. Pentru un set suficient de mare și reprezentativ de intenții comerciale, Ps(B | I) ≈ Pr(B | I): distribuția sintetică poate funcționa ca proxy al celei reale.
- H₀. Distribuția sintetică nu o reproduce suficient de bine ca să poată fi folosită drept proxy al expunerii reale.
Ipoteza nu spune că răspunsul unui API seamănă cu răspunsul unui utilizator. Spune altceva, mai îngust: răspunsurile individuale pot fi foarte diferite, iar distribuția agregată a brandurilor să convergă totuși. Sunt două ipoteze diferite: literatura avertizează împotriva primei, iar a doua rămâne, din câte am găsit, netestată pentru recomandări de brand.
Trei experimente și o regulă
- 01
Prompt controlat: varianța utilizatorului
Un grup mare de participanți primește exact același prompt, în propriile conturi. Promptul rămâne constant, utilizatorii se schimbă. Dacă distribuțiile diferă mult, personalizarea și contextul produsului contează. Dacă converg, măsurarea standardizată devine mai plauzibilă.
- 02
Variație de intenție: varianța formulării
Oamenii nu formulează la fel. „Cea mai bună bancă pentru plăți B2B UK–China” și „Ce bancă să folosească firma mea pentru furnizori din China?” exprimă aceeași intenție. Participanții și sistemul sintetic primesc aceleași variante, iar varianța de formulare se compară cu cea de utilizator.
- 03
Mai multe intenții: limitele metodei
Procesul se repetă pe multe intenții, industrii (bănci, asigurări, tehnologie, auto, SaaS), tipuri de recomandare, sisteme AI și formulări. Poate ieși că merge bine pentru recomandări generice de produs și mai slab pentru decizii financiare personalizate. Asta nu invalidează metoda, îi trasează granițele.
- Notă
Căutăm cazurile în care eșuează
Un benchmark serios nu se oprește la unde funcționează. Dacă acordul variază pe categorii, fiecare piață poate primi un scor de fiabilitate propriu, în loc de aceeași certitudine pentru toate.
Șapte metrici, nu „arată cam la fel”
| Metrică | Ce întreabă |
|---|---|
| Eroarea cotei de recomandare | Cât diferă cota sintetică a fiecărui brand de cea observată la utilizatori? |
| Eroarea medie absolută | Care e eroarea medie, în puncte procentuale, pe branduri? |
| Corelația de rang | Reproduce măsurarea sintetică ordinea competitivă? |
| Acord pe locul 1 | Identifică același lider de piață? |
| Suprapunere top 3 | Identifică aceeași mulțime principală de recomandări? |
| Distanța dintre distribuții | Cât de asemănătoare sunt distribuțiile complete de probabilitate? |
| Intervale de încredere | Cât de multă incertitudine există în jurul diferențelor observate? |
Obiectivul nu e „arată aproximativ la fel”, ci „cât de asemănătoare sunt, cantitativ”.
Trei rezultate, toate publicabile
- A
Acord puternic
Distribuțiile sintetice și reale sunt constant asemănătoare. Interogarea controlată poate fi un proxy scalabil pentru expunerea agregată, iar cota de recomandare AI câștigă temei ca metrică de piață.
- B
Acord condiționat
Măsurarea sintetică prezice bine expunerea reală în unele piețe și slab în altele. Rezultă modele de fiabilitate pe categorii: știm exact unde putem avea încredere în ea și unde nu.
- C
Acord slab
Diferențele sunt mari. Ar infirma cea mai tare versiune a ipotezei „cotă de piață în AI” și ar arăta că metodologiile sintetice de vizibilitate nu reprezintă expunerea reală fără modelare contextuală suplimentară.
- Principiu
O ipoteză infirmată e tot un rezultat
Dacă datele contrazic ipoteza, schimbăm modelul, nu datele. Incertitudinea metodologică se publică, nu se transformă în precizie falsă.
Ce am putea spune, și ce nu
| Nivel | Întrebarea | Cum se obține |
|---|---|---|
| 1 · Cota de recomandare AI | Ce recomandă sistemele AI în condiții standardizate? | Direct, prin experimente sintetice. |
| 2 · Cota validată | Cât de bine reproduce măsurarea standardizată distribuția agregată de la utilizatori reali? | Prin validare repetată pe panel uman. |
| 3 · Expunerea reală | Ce recomandări se afișează efectiv întregii populații de utilizatori AI? | Ar cere telemetrie la nivel de platformă sau date observaționale reprezentative. |
Nu pretindem că avem setul de date de nivel 3, iar distincția rămâne explicită. „Cotă de piață” cere un numitor: fără validare, măsurarea sintetică ne spune doar cum stau brandurile în universul experimental pe care l-am construit.
Ce nu colectăm
Studiul nu cere participanților să-și cedeze istoricul conversațiilor private: nici luni de mesaje, nici documente, nici profilul complet al contului. Unitatea de cercetare este promptul atribuit și răspunsul primit, plus doar metadatele necesare ca să interpretezi experimentul:
- produsul AI folosit și modelul vizibil;
- țara și momentul interogării;
- conversație nouă sau existentă;
- memorie / personalizare activă sau nu.
Principiul: minimul de informație necesar ca să răspunzi la întrebare.
Ce se știe deja, și ce nu am găsit
Trei corpuri de literatură converg spre problemă. Niciunul nu răspunde exact la întrebarea noastră.
- Vizibilitatea în AI e o distribuție, nu un punct. GEO-bench măsoară vizibilitatea pornind de la seturi de interogări [1]; măsurarea o singură dată e nesigură, pentru că răspunsurile variază între rulări, prompturi și timp [3]; serviciile AI diferă între ele ca sensibilitate la formulare și ca diversitate a surselor [2].
- Personalizarea schimbă recomandările. Identitatea dezvăluită a utilizatorului influențează semnificativ (p < 0,001) recomandările mai multor chatboți de consum [4].
- Utilizatorii sintetici nu sunt cei reali. Simulatoarele favorizează itemii populari și corelează slab cu preferințele umane [5]; o rată de câștig de 87% măsurată cu utilizatori sintetici a fost de 72% cu oameni reali [6]; pe 1.000 de dialoguri reale din 16 domenii, utilizatorii simulați sunt interlocutori mai ușori: mai puțină fricțiune, mai mult feedback pozitiv [7]; iar utilizatorii reali au găsit nouă tipuri de erori de personalizare pe care judecătorii LLM nu le detectaseră [8].
Lacuna. În sursele consultate de noi nu am găsit un studiu care să compare distribuția brandurilor obținută prin interogare sintetică standardizată cu cea primită de utilizatori reali, în propriile conturi, pe aceeași intenție comercială. Nu e o revizuire sistematică și nu susținem că suntem primii. Literatura nu spune nici că sinteticul e realul, nici că nu are legătură cu el; spune că relația trebuie validată empiric și poate varia pe domenii. Dacă știi un studiu care face exact asta, scrie-ne.
Întrebări despre studiu
Ce este The AI Recommendation Reality Study?
Un protocol de cercetare care testează dacă distribuția brandurilor recomandate în interogări sintetice, controlate, reproduce distribuția primită de utilizatori reali în propriile conturi AI. Pagina publică problema, ipotezele, designul experimental și metricile. Nu conține rezultate ale comparației.
Are studiul rezultate?
Nu. Panelul de utilizatori reali nu a fost colectat, iar numerele din exemplele de pe pagină sunt ilustrative. Publicăm protocolul ca să poată fi criticat, replicat sau reluat de altcineva.
De ce nu e suficient să interoghezi un API de mii de ori?
Pentru că astfel eșantionezi ieșiri de model în condiții controlate, nu răspunsuri primite de oameni. Un utilizator real primește răspunsul într-un mediu cu istoric, memorie, personalizare, locație și instrumente active. Dacă aceste diferențe se anulează sau nu în agregat este exact ce testează studiul.
Ce ar însemna un rezultat negativ?
Că o parte din metricile de vizibilitate AI folosite azi descriu comportamentul modelelor, nu expunerea reală a utilizatorilor, și trebuie limitate, recalibrate sau reinterpretate. Ar fi un rezultat la fel de publicabil ca unul pozitiv.
Ce date ar oferi un participant?
Doar promptul atribuit, răspunsul primit și metadate minime: produsul AI, modelul vizibil, țara, momentul, dacă conversația era nouă și dacă memoria sau personalizarea erau active. Nu istoricul conversațiilor private.
Literatura citată
Titlul, autorii, anul și locul de publicare ale fiecărei lucrări au fost verificate pe pagina lucrării. Lista nu este o revizuire sistematică a literaturii.
- 1linkAggarwal et al.2024
GEO: Generative Engine Optimization
KDD 2024. Construiește GEO-bench, un benchmark de interogări variate și surse web relevante, ca să evalueze vizibilitatea conținutului în răspunsurile motoarelor generative.
- 2linkChen et al.2025
Generative Engine Optimization: How to Dominate AI Search
arXiv 2509.08919. Experimente controlate pe mai multe servicii AI: prejudecată sistematică spre media câștigată și diferențe între servicii ca diversitate de domenii, prospețime, stabilitate între limbi și sensibilitate la formulare.
- 3linkSchulte et al.2026
Don't Measure Once: Measuring Visibility in AI Search (GEO)
arXiv 2604.07585. Argumentează că vizibilitatea în căutarea AI trebuie măsurată repetat și caracterizată ca distribuție, nu ca punct fix.
- 4linkKantharuban et al.2025
Stereotype or Personalization? User Identity Biases Chatbot Recommendations
Findings of ACL 2025. Identitatea dezvăluită a utilizatorului influențează semnificativ recomandările mai multor chatboți de consum, fără să fie indicat transparent.
- 5linkYoon et al.2024
Evaluating Large Language Models as Generative User Simulators for Conversational Recommendation
NAACL 2024. Un protocol în cinci sarcini pentru utilizatori sintetici: simulatoarele favorizează itemii populari și corelează slab cu preferințele umane.
- 6linkSingh et al.2026
FSPO: Few-Shot Optimization of Synthetic Preferences Effectively Personalizes to Real Users
ICLR 2026. Până la 1.500 de utilizatori sintetici; 87% rată de câștig pe utilizatori sintetici, 72% pe oameni reali, în întrebări deschise.
- 7linkLiu et al.2026
Synthetic Users, Real Differences: an Evaluation Framework for User Simulation in Multi-Turn Conversations
arXiv 2605.02624 (realsim). 1.000 de dialoguri reale, 16 domenii, opt dimensiuni: utilizatorii simulați introduc mai puțină fricțiune și oferă mai mult feedback pozitiv și context.
- 8linkBalepur et al.2026
Language Models Don't Know What You Want: Evaluating Personalization in Deep Research Needs Real Users
ACL 2026. Nouă tipuri de erori de personalizare, nedetectabile de judecători LLM, găsite doar cu utilizatori reali.
Ai o critică sau o referință care lipsește?
Protocolul e deschis. Dacă vezi un punct slab în design, o lucrare pe care n-am găsit-o sau vrei să replici studiul pe altă piață, scrie-ne.