Sari la conținut

Poate măsurarea sintetică AI să prezică ce văd utilizatorii reali?

Vizibilitatea în AI se măsoară, de regulă, trimițând prompturi controlate către modele. Dar un om primește răspunsul în contul lui, cu istoricul, memoria și setările lui. Protocolul de mai jos testează cât de mult diferă cele două lumi.

Dan Cristian Alexandrescu8 min citire

Când un brand apare în 30% din răspunsurile unui AI, ce înseamnă asta? Că 30% dintre oameni îl văd? Nu neapărat. Înseamnă că apare în 30% din răspunsurile generate în condițiile experimentului. Sunt două afirmații diferite, iar diferența dintre ele se spune rar într-un dashboard.

Studiul de față nu pornește de la presupunerea că măsurarea sintetică e corectă. O tratează ca pe o ipoteză și descrie experimentul care o poate confirma, limita sau respinge. Toate cele trei rezultate sunt utile.

Pe scurt
03
  • Benchmark-urile de vizibilitate AI eșantionează răspunsuri generate de modele în condiții controlate, nu răspunsuri primite de utilizatori. Cât de asemănătoare sunt cele două rămâne de demonstrat.
  • Studiul compară, pe aceeași intenție comercială, distribuția brandurilor din interogări sintetice cu cea din răspunsurile primite de utilizatori reali în propriile conturi AI, cu metrici cantitative și intervale de încredere.
  • Ipoteza privește distribuția agregată, nu răspunsul individual. Rezultatul poate fi acord puternic, acord condiționat pe categorii sau acord slab, iar toate trei se publică.
RAVI — Reality-Adjusted Visibility Intelligence

Stadiu: protocol publicat, fără date din utilizatori reali. Panelul de utilizatori reali nu a fost colectat, deci pagina nu conține niciun rezultat al comparației. Numerele din exemple sunt ilustrative.

RAVI (Reality-Adjusted Visibility Intelligence) este instrumentul nostru de măsurare a cotei de piață în răspunsurile AI, iar acest studiu a fost gândit ca stratul lui de validare. Instrumentul este oprit; întrebarea de cercetare rămâne deschisă.

— Problema

30% în benchmark nu înseamnă 30% dintre oameni

Ce poți afirma

„Brandul A apare în 30% din răspunsurile generate în condițiile experimentale definite de metodologie.”

Ce nu poți afirma automat

„30% dintre utilizatorii reali văd brandul A.”

De ce nu sunt același lucru

Un răspuns AI real depinde de mult mai mult decât de promptul curent. Un monitor sintetic controlează doar o parte din acest mediu; un utilizator real trăiește în tot restul:

  • istoricul conversației
  • memoria contului
  • personalizarea
  • locația
  • setările produsului
  • model routing
  • instrumentele active
  • momentul interogării
  • variabilitatea stochastică
— Două lumi

Aceeași întrebare, două populații

Lumea A · Sintetică

Interogări controlate, sistematice și repetate către sisteme AI.

PromptAIRecomandare

Distribuția sintetică a recomandărilor

Ps(B | I, M, Cs)

B
brandul recomandat sau menționat
I
intenția / promptul
M
modelul AI
Cs
contextul standardizat al experimentului
Lumea B · Utilizator real

Oameni reali, în propriile conturi AI, primesc o sarcină de cercetare controlată.

Utilizator + prompt + contextAIRecomandare

Distribuția reală a recomandărilor

Pr(B | I, M, U, Cr)

B
brandul recomandat sau menționat
I
intenția / promptul
M
modelul AI
U
utilizatorul: istoric, memorie, personalizare
Cr
contextul real al produsului și al conversației
Distanța dintre ele

D(Ps, Pr)

Studiul estimează această distanță. Nu presupune că e zero și nu presupune că e mare: e valoarea pe care o măsurăm.

— Întrebarea

Întrebarea centrală și ipotezele

În ce măsură distribuția recomandărilor de brand, obținută prin interogare sintetică și standardizată, reproduce distribuția primită de utilizatori reali în propriile medii AI?

Un sondaj de opinie funcționează pentru că întreabă oameni. Nu întrebi votanți simulați și nu presupui că reprezintă electoratul. Aici e situația inversă: trimiți 10.000 de prompturi către un model și eșantionezi ieșiri de model, nu utilizatori.

  • H₁. Pentru un set suficient de mare și reprezentativ de intenții comerciale, Ps(B | I) ≈ Pr(B | I): distribuția sintetică poate funcționa ca proxy al celei reale.
  • H₀. Distribuția sintetică nu o reproduce suficient de bine ca să poată fi folosită drept proxy al expunerii reale.

Ipoteza nu spune că răspunsul unui API seamănă cu răspunsul unui utilizator. Spune altceva, mai îngust: răspunsurile individuale pot fi foarte diferite, iar distribuția agregată a brandurilor să convergă totuși. Sunt două ipoteze diferite: literatura avertizează împotriva primei, iar a doua rămâne, din câte am găsit, netestată pentru recomandări de brand.

— Designul

Trei experimente și o regulă

04
  1. 01

    Prompt controlat: varianța utilizatorului

    Un grup mare de participanți primește exact același prompt, în propriile conturi. Promptul rămâne constant, utilizatorii se schimbă. Dacă distribuțiile diferă mult, personalizarea și contextul produsului contează. Dacă converg, măsurarea standardizată devine mai plauzibilă.

  2. 02

    Variație de intenție: varianța formulării

    Oamenii nu formulează la fel. „Cea mai bună bancă pentru plăți B2B UK–China” și „Ce bancă să folosească firma mea pentru furnizori din China?” exprimă aceeași intenție. Participanții și sistemul sintetic primesc aceleași variante, iar varianța de formulare se compară cu cea de utilizator.

  3. 03

    Mai multe intenții: limitele metodei

    Procesul se repetă pe multe intenții, industrii (bănci, asigurări, tehnologie, auto, SaaS), tipuri de recomandare, sisteme AI și formulări. Poate ieși că merge bine pentru recomandări generice de produs și mai slab pentru decizii financiare personalizate. Asta nu invalidează metoda, îi trasează granițele.

  4. Notă

    Căutăm cazurile în care eșuează

    Un benchmark serios nu se oprește la unde funcționează. Dacă acordul variază pe categorii, fiecare piață poate primi un scor de fiabilitate propriu, în loc de aceeași certitudine pentru toate.

— Ce măsurăm

Șapte metrici, nu „arată cam la fel”

MetricăCe întreabă
Eroarea cotei de recomandareCât diferă cota sintetică a fiecărui brand de cea observată la utilizatori?
Eroarea medie absolutăCare e eroarea medie, în puncte procentuale, pe branduri?
Corelația de rangReproduce măsurarea sintetică ordinea competitivă?
Acord pe locul 1Identifică același lider de piață?
Suprapunere top 3Identifică aceeași mulțime principală de recomandări?
Distanța dintre distribuțiiCât de asemănătoare sunt distribuțiile complete de probabilitate?
Intervale de încredereCât de multă incertitudine există în jurul diferențelor observate?

Obiectivul nu e „arată aproximativ la fel”, ci „cât de asemănătoare sunt, cantitativ”.

— Rezultate posibile

Trei rezultate, toate publicabile

04
  • A

    Acord puternic

    Distribuțiile sintetice și reale sunt constant asemănătoare. Interogarea controlată poate fi un proxy scalabil pentru expunerea agregată, iar cota de recomandare AI câștigă temei ca metrică de piață.

  • B

    Acord condiționat

    Măsurarea sintetică prezice bine expunerea reală în unele piețe și slab în altele. Rezultă modele de fiabilitate pe categorii: știm exact unde putem avea încredere în ea și unde nu.

  • C

    Acord slab

    Diferențele sunt mari. Ar infirma cea mai tare versiune a ipotezei „cotă de piață în AI” și ar arăta că metodologiile sintetice de vizibilitate nu reprezintă expunerea reală fără modelare contextuală suplimentară.

  • Principiu

    O ipoteză infirmată e tot un rezultat

    Dacă datele contrazic ipoteza, schimbăm modelul, nu datele. Incertitudinea metodologică se publică, nu se transformă în precizie falsă.

— Trei niveluri

Ce am putea spune, și ce nu

NivelÎntrebareaCum se obține
1 · Cota de recomandare AICe recomandă sistemele AI în condiții standardizate?Direct, prin experimente sintetice.
2 · Cota validatăCât de bine reproduce măsurarea standardizată distribuția agregată de la utilizatori reali?Prin validare repetată pe panel uman.
3 · Expunerea realăCe recomandări se afișează efectiv întregii populații de utilizatori AI?Ar cere telemetrie la nivel de platformă sau date observaționale reprezentative.

Nu pretindem că avem setul de date de nivel 3, iar distincția rămâne explicită. „Cotă de piață” cere un numitor: fără validare, măsurarea sintetică ne spune doar cum stau brandurile în universul experimental pe care l-am construit.

— Date

Ce nu colectăm

Studiul nu cere participanților să-și cedeze istoricul conversațiilor private: nici luni de mesaje, nici documente, nici profilul complet al contului. Unitatea de cercetare este promptul atribuit și răspunsul primit, plus doar metadatele necesare ca să interpretezi experimentul:

  • produsul AI folosit și modelul vizibil;
  • țara și momentul interogării;
  • conversație nouă sau existentă;
  • memorie / personalizare activă sau nu.

Principiul: minimul de informație necesar ca să răspunzi la întrebare.

— Literatura

Ce se știe deja, și ce nu am găsit

Trei corpuri de literatură converg spre problemă. Niciunul nu răspunde exact la întrebarea noastră.

  • Vizibilitatea în AI e o distribuție, nu un punct. GEO-bench măsoară vizibilitatea pornind de la seturi de interogări [1]; măsurarea o singură dată e nesigură, pentru că răspunsurile variază între rulări, prompturi și timp [3]; serviciile AI diferă între ele ca sensibilitate la formulare și ca diversitate a surselor [2].
  • Personalizarea schimbă recomandările. Identitatea dezvăluită a utilizatorului influențează semnificativ (p < 0,001) recomandările mai multor chatboți de consum [4].
  • Utilizatorii sintetici nu sunt cei reali. Simulatoarele favorizează itemii populari și corelează slab cu preferințele umane [5]; o rată de câștig de 87% măsurată cu utilizatori sintetici a fost de 72% cu oameni reali [6]; pe 1.000 de dialoguri reale din 16 domenii, utilizatorii simulați sunt interlocutori mai ușori: mai puțină fricțiune, mai mult feedback pozitiv [7]; iar utilizatorii reali au găsit nouă tipuri de erori de personalizare pe care judecătorii LLM nu le detectaseră [8].

Lacuna. În sursele consultate de noi nu am găsit un studiu care să compare distribuția brandurilor obținută prin interogare sintetică standardizată cu cea primită de utilizatori reali, în propriile conturi, pe aceeași intenție comercială. Nu e o revizuire sistematică și nu susținem că suntem primii. Literatura nu spune nici că sinteticul e realul, nici că nu are legătură cu el; spune că relația trebuie validată empiric și poate varia pe domenii. Dacă știi un studiu care face exact asta, scrie-ne.

— FAQ

Întrebări despre studiu

05
  • Ce este The AI Recommendation Reality Study?

    Un protocol de cercetare care testează dacă distribuția brandurilor recomandate în interogări sintetice, controlate, reproduce distribuția primită de utilizatori reali în propriile conturi AI. Pagina publică problema, ipotezele, designul experimental și metricile. Nu conține rezultate ale comparației.

  • Are studiul rezultate?

    Nu. Panelul de utilizatori reali nu a fost colectat, iar numerele din exemplele de pe pagină sunt ilustrative. Publicăm protocolul ca să poată fi criticat, replicat sau reluat de altcineva.

  • De ce nu e suficient să interoghezi un API de mii de ori?

    Pentru că astfel eșantionezi ieșiri de model în condiții controlate, nu răspunsuri primite de oameni. Un utilizator real primește răspunsul într-un mediu cu istoric, memorie, personalizare, locație și instrumente active. Dacă aceste diferențe se anulează sau nu în agregat este exact ce testează studiul.

  • Ce ar însemna un rezultat negativ?

    Că o parte din metricile de vizibilitate AI folosite azi descriu comportamentul modelelor, nu expunerea reală a utilizatorilor, și trebuie limitate, recalibrate sau reinterpretate. Ar fi un rezultat la fel de publicabil ca unul pozitiv.

  • Ce date ar oferi un participant?

    Doar promptul atribuit, răspunsul primit și metadate minime: produsul AI, modelul vizibil, țara, momentul, dacă conversația era nouă și dacă memoria sau personalizarea erau active. Nu istoricul conversațiilor private.

— Surse

Literatura citată

08

Titlul, autorii, anul și locul de publicare ale fiecărei lucrări au fost verificate pe pagina lucrării. Lista nu este o revizuire sistematică a literaturii.

  1. 1link
    Aggarwal et al.2024

    GEO: Generative Engine Optimization

    KDD 2024. Construiește GEO-bench, un benchmark de interogări variate și surse web relevante, ca să evalueze vizibilitatea conținutului în răspunsurile motoarelor generative.

  2. 2link
    Chen et al.2025

    Generative Engine Optimization: How to Dominate AI Search

    arXiv 2509.08919. Experimente controlate pe mai multe servicii AI: prejudecată sistematică spre media câștigată și diferențe între servicii ca diversitate de domenii, prospețime, stabilitate între limbi și sensibilitate la formulare.

  3. 3link
    Schulte et al.2026

    Don't Measure Once: Measuring Visibility in AI Search (GEO)

    arXiv 2604.07585. Argumentează că vizibilitatea în căutarea AI trebuie măsurată repetat și caracterizată ca distribuție, nu ca punct fix.

  4. 4link
    Kantharuban et al.2025

    Stereotype or Personalization? User Identity Biases Chatbot Recommendations

    Findings of ACL 2025. Identitatea dezvăluită a utilizatorului influențează semnificativ recomandările mai multor chatboți de consum, fără să fie indicat transparent.

  5. 5link
    Yoon et al.2024

    Evaluating Large Language Models as Generative User Simulators for Conversational Recommendation

    NAACL 2024. Un protocol în cinci sarcini pentru utilizatori sintetici: simulatoarele favorizează itemii populari și corelează slab cu preferințele umane.

  6. 6link
    Singh et al.2026

    FSPO: Few-Shot Optimization of Synthetic Preferences Effectively Personalizes to Real Users

    ICLR 2026. Până la 1.500 de utilizatori sintetici; 87% rată de câștig pe utilizatori sintetici, 72% pe oameni reali, în întrebări deschise.

  7. 7link
    Liu et al.2026

    Synthetic Users, Real Differences: an Evaluation Framework for User Simulation in Multi-Turn Conversations

    arXiv 2605.02624 (realsim). 1.000 de dialoguri reale, 16 domenii, opt dimensiuni: utilizatorii simulați introduc mai puțină fricțiune și oferă mai mult feedback pozitiv și context.

  8. 8link
    Balepur et al.2026

    Language Models Don't Know What You Want: Evaluating Personalization in Deep Research Needs Real Users

    ACL 2026. Nouă tipuri de erori de personalizare, nedetectabile de judecători LLM, găsite doar cu utilizatori reali.

— Cercetare

Ai o critică sau o referință care lipsește?

Protocolul e deschis. Dacă vezi un punct slab în design, o lucrare pe care n-am găsit-o sau vrei să replici studiul pe altă piață, scrie-ne.