Sari la conținut

Data Foundation: de ce 6 din 10 proiecte AI eșuează pe date, nu pe model

Ghid de arhitectură pentru o fundație de date AI-ready: ETL versionat, warehouse central, vector stores, embeddings și stratul MCP care expune datele agenților. Cu cifre Gartner și McKinsey, plus framework-ul Websem în 4 pași.

Dan Cristian Alexandrescu12 min citire

Gartner estimează că, prin 2026, organizațiile vor abandona 60% din proiectele AI nesusținute de date AI-ready. Nu pentru că modelele nu sunt bune. Modelele din 2026 sunt extraordinare. Proiectele cad pentru că datele care ar trebui să le alimenteze sunt împrăștiate, neîngrijite, inconsistente sau pur și simplu inaccesibile programatic.

Acest articol nu este despre care model să alegi. Este despre stratul de dedesubt — fundația de date pe care orice chatbot, agent sau dashboard AI se sprijină. Îl numim Data Foundation și, din experiența Websem, este singura diferență reală dintre un pilot AI care impresionează la demo și un sistem AI care produce valoare în producție, lună de lună.

TL;DR · ce trebuie să reții
05
  • Problema nu e modelul, e fundația. Gartner: prin 2026, 60% din proiectele AI nesusținute de date AI-ready vor fi abandonate. 38% dintre liderii I&O atribuie eșecurile AI direct calității slabe a datelor.
  • Cele mai multe companii nu sunt pregătite. Doar 37% au încredere în practicile lor de management al datelor pentru AI; 63% nu le au sau nu sunt sigure (Gartner, sondaj pe 248 lideri de date).
  • O fundație AI-ready are 5 straturi: ETL versionat → warehouse central → vector stores → embeddings → strat de acces MCP. Fiecare rezolvă o problemă pe care următorul nu o poate rezolva.
  • MCP a devenit standardul de acces. Până în martie 2026: 10.000+ servere MCP publice, 97M descărcări lunare SDK, adopție OpenAI, Google DeepMind, Microsoft, AWS. „USB-C pentru AI”.
  • Fundația se construiește iterativ, nu „big bang”. Pornește de la un singur caz de utilizare cu impact direct, livrabil în 6–10 săptămâni, și extinde cu date reale. Companiile data-driven au 19× mai multe șanse să fie profitabile (McKinsey).

De ce eșuează proiectele AI pe date, nu pe model

Întrebarea pe care o pun cei mai mulți directori în 2026 nu mai este „ce model folosim?”, ci „de ce pilotul nostru AI a impresionat la demo și apoi nu a produs nimic în producție?”

Răspunsul este aproape întotdeauna același: demo-ul a rulat pe un set de date curat, ales cu grijă. Producția rulează pe realitatea companiei — date dublate în trei sisteme, fără un proprietar clar, cu definiții care diferă de la un departament la altul, fără un mod fiabil de a fi interogate în timp real. McKinsey descrie exact această stare: date care „nu au un proprietar adevărat”, stocate în medii fragmentate, în silozuri, adesea costisitoare.

Cifrele Gartner confirmă scara problemei. Într-un sondaj din Q3 2024 pe 248 de lideri de management al datelor, doar 37% au declarat că au încredere în practicile lor de date pentru AI. Restul de 63% fie nu le au, fie nu sunt siguri. Iar 38% dintre liderii de infrastructură și operațiuni au spus că o calitate slabă a datelor sau o disponibilitate limitată a fost cauza directă a eșecului unui proiect AI.

„Avem date” nu înseamnă „date AI-ready”

Aproape orice companie are date. Problema este că datele pe care le ai și datele de care are nevoie un sistem AI sunt rareori același lucru. O fundație AI-ready se distinge prin cinci proprietăți:

  1. Curate și consistente. Aceleași definiții peste tot. „Client activ” înseamnă același lucru în CRM și în raportul financiar.
  2. Versionate, cu lineage. Știi de unde vine fiecare cifră și cum s-a transformat. Fără asta, nu poți avea încredere — și nici nu poți face compliance.
  3. Conectate la context. Datele structurate (warehouse) plus cele nestructurate (documente, conversații) trăiesc în același univers interogabil.
  4. Accesibile programatic, în timp aproape real. Un agent nu poate aștepta un export manual săptămânal.
  5. Cu acces controlat. Cine vede ce, ce poate modifica un agent, ce se loghează — by design, nu ca patch.
— Arhitectura

Cele 5 straturi ale unei fundații de date AI-ready

05
  1. 01

    ETL versionat

    Stratul care aduce datele din sursele tale (ERP, CRM, ecommerce, fișiere, API-uri) într-un format consistent. „Versionat” înseamnă că fiecare transformare e urmăribilă și reproductibilă — nu un script care rulează în beci și pe care nu îndrăznește nimeni să-l atingă. Aici se naște lineage-ul.

  2. 02

    Warehouse central

    Sursa unică de adevăr pentru date structurate. Răspunde la întrebări exacte: vânzări, stocuri, conversii, KPI. Fără un warehouse central, fiecare departament își construiește propria versiune a realității — și deciziile se iau pe cifre care nu se potrivesc între ele.

  3. 03

    Vector stores

    Stratul care face datele nestructurate (documente, descrieri, conversații, tichete de suport) căutabile semantic. Aici trăiește memoria pe care un chatbot sau un sistem RAG o interoghează când răspunde. Intenția de adopție a retrieval-ului hibrid s-a triplat în Q1 2026, de la 10,3% la 33,3% (VentureBeat).

  4. 04

    Embeddings pe sursele critice

    Reprezentarea numerică a sensului. Embeddings-urile pe documentele, produsele și clienții tăi sunt ce permite întrebări de tip „găsește ce seamănă cu asta” și răspunsuri ancorate în datele tale, nu în cunoștințele generice ale modelului. Se reîmprospătează pe măsură ce datele se schimbă — altfel îmbătrânesc.

  5. 05

    Strat de acces · MCP

    Interfața standardizată prin care agenții și modelele ajung la toate straturile de mai sus, sigur și controlat. MCP (Model Context Protocol) a devenit „USB-C pentru AI”: până în martie 2026, 10.000+ servere publice și 97M descărcări lunare SDK, cu adopție de la OpenAI, Google DeepMind, Microsoft și AWS. Alternativa — conectori custom pentru fiecare unealtă — nu scalează.

De la fundație la valoare: ce alimentează o fundație bună

O fundație de date nu este un scop în sine. Valoarea apare când straturile de mai sus alimentează ceva concret. Implementările AI Websem pe care le poți vedea live — consultantul AI de pe DonaVital cu peste 1.600 de conversații pe lună, configuratorul Haier AC, consultantul Eurial Selection — funcționează pentru că în spate există exact acest tip de fundație: date despre produse, vectorizate și menținute la zi, accesibile sistemului AI în timp real.

Fără fundație, aceleași sisteme ar fi fost chatboți cu butoane. Cu ea, devin sisteme care răspund cu informația corectă despre produsele reale ale brandului. Aceasta este diferența pe care o vinde Data Foundation.

— Anti-patterns

Greșelile pe care le vedem pe proiectele de date

05
  • Cumperi tool-ul AI înainte de fundație

    Cel mai frecvent. Tool-ul ajunge, datele nu sunt pregătite, pilotul moare. Ordinea corectă este invers: întâi un caz de utilizare clar, apoi datele care îl alimentează, apoi tool-ul.

  • Un nou silo pentru fiecare proiect AI

    Fiecare echipă își exportă propriul subset de date pentru propriul pilot. La final ai cinci versiuni ale adevărului în loc de una. Fundația trebuie să fie partajată, nu duplicată.

  • Embeddings construite o singură dată

    Embeddings pe un catalog din ianuarie, neactualizate, înseamnă răspunsuri AI despre produse care nu mai există. Reîmprospătarea trebuie să fie un proces, nu un eveniment.

  • Conectori custom pentru fiecare unealtă

    Înainte de MCP, fiecare integrare era o piesă fragilă de cod. Se sparge la fiecare update. Stratul de acces standardizat (MCP) elimină acest morman de datorie tehnică.

  • ETL fără versionare și lineage

    Dacă nu poți spune de unde vine o cifră și cum s-a transformat, nu poți avea încredere în ea — și nu poți face compliance. Pentru sisteme de decizie, lineage-ul nu e opțional.

— Framework

Cum începi: framework în 4 pași

04
  1. 01

    Audit de pregătire a datelor

    Inventariază sursele, evaluează calitatea, identifică silozurile și proprietarii. Rezultatul: o hartă a ce ai și ce lipsește pentru AI.

  2. 02

    Alege un singur caz de utilizare cu impact

    Nu construi fundația „în general”. Alege un caz cu valoare directă — un consultant AI, o căutare semantică internă — și construiește exact datele de care are nevoie.

  3. 03

    Construiește straturile, în ordine

    ETL versionat → warehouse → vector store → embeddings → strat MCP. Un layer funcțional pentru cazul ales se livrează în 6–10 săptămâni.

  4. 04

    Extinde iterativ, cu refresh ca proces

    Adaugă surse și cazuri de utilizare pe fundația existentă. Stabilește reîmprospătarea embeddings-urilor și verificarea calității ca proces recurent, nu ca proiect unic.

— FAQ

Întrebări frecvente

05
  • Ce înseamnă „date AI-ready”?

    Date AI-ready sunt date care nu doar există, ci sunt curate, etichetate, versionate, conectate la context și accesibile programatic în timp aproape real. Diferența față de „date pe care le avem” este uriașă: un model AI sau un agent are nevoie de date pe care le poate interoga cu încredere, cu lineage clar (de unde vin), cu definiții consistente și cu un strat de acces controlat. Gartner estimează că prin 2026 organizațiile vor abandona 60% din proiectele AI nesusținute de date AI-ready.

  • Avem deja un data warehouse. De ce mai e nevoie de vector stores și embeddings?

    Warehouse-ul clasic răspunde la întrebări structurate („care au fost vânzările pe Q1?”). Vector stores și embeddings răspund la întrebări semantice și pe date nestructurate („ce clienți seamănă cu acesta?”, „găsește documentele relevante pentru această întrebare”). Pentru aplicații AI — chatbot pe documentația ta, recomandări, RAG — ai nevoie de ambele: warehouse-ul pentru fapte exacte, vector store-ul pentru similaritate și retrieval. Nu se înlocuiesc, se completează.

  • Ce este MCP și de ce contează pentru fundația de date?

    MCP (Model Context Protocol) este un standard deschis prin care un model sau un agent AI se poate conecta la surse de date și unelte interne fără integrări custom pentru fiecare. A fost poreclit „USB-C pentru AI”. Până în martie 2026 existau peste 10.000 de servere MCP publice active și 97 de milioane de descărcări lunare ale SDK-urilor, cu adopție de la OpenAI, Google DeepMind, Microsoft și AWS. Pentru o companie, MCP înseamnă că datele tale interne devin accesibile agenților printr-un strat sigur și standardizat, în loc de un ghem de conectori fragili.

  • Cât durează să construiești o fundație de date AI-ready?

    Depinde de starea actuală a datelor. Pentru o companie cu surse relativ ordonate, un prim layer funcțional (ETL + warehouse + un vector store pentru un caz de utilizare prioritar) se livrează în 6–10 săptămâni. Greșeala comună este să încerci „totul deodată” — abordarea Websem este să pornești de la un singur caz de utilizare cu impact direct și să extinzi fundația iterativ, cu date reale.

  • Care este primul pas concret?

    Un audit de pregătire a datelor: ce surse ai, ce calitate au, unde sunt silozurile, cine deține fiecare set și ce caz de utilizare AI ar produce cea mai mare valoare imediată. De aici derivă prioritățile. Greșeala frecventă este să cumperi un tool AI înainte să știi dacă datele îl pot alimenta. Websem oferă acest audit gratuit pentru a clarifica prioritizarea.

— Surse

Surse primare folosite în articol

05

Fiecare cifră din acest articol este atribuită unei surse primare — Gartner, McKinsey și raportări de piață. Nu sintetizăm date și nu recităm agregatori fără verificare.

  1. 01link
    Gartnerfebruarie 2025

    Lack of AI-Ready Data Puts AI Projects at Risk

    Prin 2026, organizațiile vor abandona 60% din proiectele AI nesusținute de date AI-ready. Sondaj Q3 2024 pe 248 lideri de date: doar 37% au încredere în practicile lor de date pentru AI.

  2. 02link
    Gartneraprilie 2026

    AI Projects in I&O Stall Ahead of Meaningful ROI Returns

    38% dintre liderii de infrastructură și operațiuni au indicat calitatea slabă a datelor sau disponibilitatea limitată ca o cauză directă a eșecului proiectelor AI.

  3. 03link
    VentureBeat2026

    Context architecture is replacing RAG as agentic AI pushes enterprise retrieval to its limits

    Intenția de adopție a retrieval-ului hibrid s-a triplat în Q1 2026, de la 10,3% la 33,3%. Optimizarea retrieval-ului a devenit prioritatea #1 de investiție (de la 19% la 28,9%).

  4. 04link
    Model Context Protocol · raportări de adopțiemartie 2026

    MCP — „USB-C pentru AI”

    Până în martie 2026: peste 10.000 de servere MCP publice active, 97M descărcări lunare ale SDK-urilor Python/TypeScript, adopție de la OpenAI, Google DeepMind, Microsoft și AWS.

  5. 05link
    McKinsey2025

    The data-driven enterprise of 2025

    Date fără proprietar, stocate în silozuri fragmentate, blochează decizia. Organizațiile data-driven au de 23× mai multe șanse să achiziționeze clienți, 6× să-i rețină, 19× să fie profitabile.

Concluzii

Cursa pentru AI în companii nu se câștigă la nivelul modelului — acolo toată lumea are acces la aceleași capabilități. Se câștigă la nivelul fundației de date. Compania care își pune datele în ordine — versionate, centralizate, vectorizate, accesibile prin MCP — poate construi orice deasupra. Compania care sare acest pas rămâne cu piloți care impresionează la demo și mor în producție.

Vestea bună: fundația nu se construiește „toată deodată”. Se construiește pe un caz de utilizare, în câteva săptămâni, și se extinde cu date reale. Întrebarea pentru businessul tău nu este „ce model alegem?”, ci „datele noastre pot alimenta ce vrem să construim?” Dacă răspunsul nu e un „da” clar, acolo începe treaba.

Despre autor

Dan Cristian Alexandrescu este fondatorul Websem, agenție care construiește platforme și sisteme AI pentru business serios. Sub conducerea sa, Websem a livrat în 2025–2026 sisteme AI complete — consultanți, configuratoare și fundații de date AI-ready — pentru Haier AC România, Eurial Selection, DonaVital by PlantExtrakt și alte branduri.

Pasul tău

Datele tale sunt pregătite pentru AI?

Un audit de 30 de minute al pregătirii datelor + 3 acțiuni concrete pe care le poți începe luna viitoare. Fără obligații.