Gândește-te la ultima dimineață în care telefonul firmei a sunat de trei ori la rând în timp ce erai cu un client. Nu ai răspuns la niciunul și probabil nu știi nici acum cine era. Un agent vocal AI — un program care preia apelul, poartă o conversație și notează ce trebuie notat — e exact ce ți se vinde pentru situația asta, cu promisiunea că nimeni nu-și va da seama că vorbește cu un robot. Partea care nu se vinde: din 2 august 2026, programul acela e obligat să spună apelantului, în primele secunde, că e un sistem AI.
Obligația vine din Regulamentul (UE) 2024/1689 — AI Act — și răstoarnă întrebarea cu care vin aproape toți cei care ne întreabă de agenți vocali. Ei întreabă „se aude că e robot?". Răspunsul, de la august încoace, e: se aude, pentru că așa cere legea. Întrebarea utilă e alta: care dintre apelurile tale pot fi rezolvate corect de un robot care și-a declarat din prima secundă că e robot. Nu „toate", dar nici „niciunul" — iar diferența dintre cele două liste decide dacă proiectul merită.
Apelul la care nu răspunde nimeni nu apare în nicio evidență
Un apel pierdut e singura pierdere din firmă care nu lasă urmă nicăieri: nu intră în niciun raport și nu ajunge la tine ca reclamație. Pacientul care nu a prins linia s-a programat în altă parte, clientul cu mașina stricată a sunat la următorul service din listă, iar cel care voia o masă de patru sâmbătă seara nu îți va spune niciodată că a încercat. Costul e real și invizibil în același timp — de aceea decizia se amână la nesfârșit.
Pe internet circulă cifre convenabile pe tema asta: că 62% dintre apelurile către firmele mici rămân fără răspuns, că 85% dintre cei care nu primesc răspuns nu mai sună niciodată. Le-am urmărit până la sursă și nu le folosim: apar aproape exclusiv pe site-uri care vând chiar soluții pentru apeluri pierdute, iar lanțul de citări duce la un studiu pe 85 de firme cu metodologie nepublicată. Argumentul nu are nevoie de ele: un proprietar de service auto știe deja cât de des sună telefonul când are mâinile în motor.
Ce se poate susține cu date e mai modest, dar e suficient: apelul de reamintire funcționează. Un studiu randomizat din Journal of General Internal Medicine (2016) a măsurat efectul unui apel dat cu șapte zile înainte de programare, pe pacienți cu risc mare de neprezentare — rata a scăzut de la 29,2% în grupul de control la 22,8% în grupul apelat. Precizările sunt obligatorii: apelul era dat de un om, nu de un agent AI, iar populația era de pacienți americani de medicină primară, selectați pe risc. Cifra arată că apelul contează; nu că un agent vocal produce același efect.
Alternativele pe care le încearcă oricine înainte să ajungă la un agent vocal eșuează fiecare în felul ei:
- Mesageria vocală — mută efortul pe apelant, exact când are cea mai mică răbdare. O comparație observațională publicată în Psychiatric Services (Teo și colab., 2017), pe 250 de pacienți de medicină primară cu depresie, a găsit 3% neprezentări la reamintirile preluate live, 24% când s-a lăsat mesaj și 39% când nu a răspuns nimeni. Studiu nerandomizat, pe o populație îngustă: arată o direcție, nu un raport de opt la unu.
- Robotelul cu taste („apasă 1 pentru programări") — nu pierde apelul, dar îl obligă pe apelant să navigheze un arbore pe care nu l-a văzut niciodată; mulți închid la a doua ramificație.
- Recepția care răspunde doar în program — apelurile de seară și de weekend pur și simplu nu există pentru firmă.
- Programările neconfirmate — locul rămâne blocat în agendă și gol în realitate, iar nimeni nu are timp de zece telefoane de confirmare pe zi.
Ce poate și ce nu poate un agent vocal AI
Toate demo-urile de agenți vocali au ceva în comun: interlocutorul vorbește clar, pe rând, într-o cameră liniștită. Cea mai bună dovadă publică despre ce se întâmplă când nu mai e așa vine dintr-o lucrare despre recunoașterea vorbirii în română (Pîrlogeanu, Georgescu, Cucu), depusă pe arXiv în noiembrie 2025, cu un model antrenat pe peste 2.600 de ore de română. Pe vorbire citită, rata de eroare pe cuvânt e de 3,09% pentru RoWhisper-large-v2 și 1,73% pentru modelul propus. Pe vorbire spontană, aceleași modele ajung la 25,05% și 8,12% pe un corpus, și la 61,46% și 10,75% pe altul.
Diferența dintre vorbirea citită și cea spontană e de ordin de mărime, iar un apel telefonic e, fără excepție, vorbire spontană: omul se corectează în mijlocul propoziției, vorbește peste tine, e în mașină, îți dă numărul în grupuri de două cifre. Două avertismente, fără care cifrele devin manipulare: lucrarea e un preprint și nu măsoară modelele comerciale pe care se construiesc agenții în producție. Ce rămâne valabil e forma problemei, nu procentul: calitatea depinde mai mult de cât de previzibil e ce spune apelantul decât de cât de scump e modelul.
De aici iese singurul criteriu util de selecție. Un agent vocal e fezabil când apelul e, în fond, un formular scurt citit cu voce tare — un nume, un număr, un interval orar, un serviciu dintr-o listă de cinci. Devine nesigur pe măsură ce apelul seamănă mai puțin cu un formular:
- Merge: preluarea unei programări noi, confirmarea sau mutarea uneia existente, programul și adresa, întrebări frecvente cu răspuns fix, preluarea unui mesaj cu nume și număr, filtrarea apelurilor de după ora 18.
- Merge cu grijă: estimări de preț cu condiții („depinde de piesă"), liste lungi de servicii, rezervări cu multe variabile — cer un scenariu strâns și un prag clar de renunțare.
- Nu merge: reclamația unui client nemulțumit, orice discuție medicală de fond, negocierea unui preț, problema care nu intră în nicio categorie pregătită — nu pentru că tehnologia e slabă, ci pentru că aici greșeala costă mai mult decât apelul pierdut.
Nu mai contează dacă se aude că e robot — din august 2026 trebuie să o spună el însuși. Contează doar care apeluri merită un robot.
„75 de milisecunde" nu e pauza pe care o aude apelantul
A doua limită pe care nimeni nu o explică e latența, pentru că cifrele furnizorului sună excelent. Documentația ElevenLabs declară aproximativ 75 ms (Flash v2.5), circa 100 ms median (v4 Turbo), circa 280 ms (v3 Conversational) și 150 ms pentru transcrierea în timp real cu Scribe v2 Realtime. Problema e că, în sinteza vocală, latența măsoară strict timpul până la primul octet de audio generat — nu pauza pe care o aude apelantul.
Pauza reală adună transportul telefonic, recunoașterea vorbirii, inferența modelului de limbaj, sinteza și bufferul de rețea. Nu am găsit un benchmark independent credibil de latență cap-la-cap în română, așa că nu dau o cifră — dar nici nu accept 75 ms ca răspuns la „cât durează până îmi răspunde". Verificarea o poate face oricine înainte să semneze: ceri un număr de test, suni de pe mobil, din mașină, și întrerupi agentul la jumătatea propoziției.
Româna e pe lista de limbi suportate — inclusă în modelul multilingv cu 29 de limbi, iar cele mai noi o listează explicit. Ce nu există, din câte am găsit, e vreo evaluare publicată de naturalețe a sintezei în română față de engleză. Deci nu are pe ce să se bazeze nici cine spune că sună identic, nici cine spune că sună prost. Se verifică cu urechea, acolo unde sinteza se împiedică: nume proprii, adrese, abrevieri și cifre.
Trei obligații pe care le moștenești în ziua în care pornești agentul
Partea legală nu e un avertisment de final de articol, ci o parte din specificație: două dintre cele trei obligații de mai jos se traduc în propoziții pe care agentul le rostește în primele secunde.
1. Agentul trebuie să spună că e AI
Art. 50(1) din AI Act cere furnizorilor să asigure că sistemele AI destinate să interacționeze direct cu persoane fizice sunt proiectate astfel încât acele persoane să fie informate că interacționează cu un sistem AI — excepția fiind cazul în care lucrul e evident pentru o persoană rezonabil informată, atentă și circumspectă. Pe canalul voce, cu o sinteză bună, exact asta nu mai e evident. Alin. (5) adaugă condiția decisivă pentru telefon: informarea se dă clar și distinct, cel mai târziu la prima interacțiune. Nu e o mențiune în politica de pe site — e o propoziție rostită la începutul apelului. Textul obligă furnizorul, deci pentru tine e o condiție de acceptanță: cine îți construiește agentul trebuie să-l livreze cu declarația rostită, nu să ți-o lase de configurat.
Două nuanțe utile. Obligația de a marca audio-ul generat într-un format citibil de mașină, din alin. (2), cade pe furnizorul sistemului generativ, nu pe cabinetul care îl folosește; pentru sistemele puse pe piață înainte de 2 august 2026 are grație până la 2 decembrie 2026. Iar dacă agentul face analiză de sentiment pe vocea apelantului sau îl identifică după voce, intri și sub alin. (3) — motiv bun să nu activezi funcții de care nu ai nevoie.
Cât despre consecințe: încălcarea art. 50 intră la art. 99(4) — până la 15.000.000 de euro sau 3% din cifra de afaceri mondială anuală, oricare e mai mare — dar pentru IMM-uri art. 99(6) inversează regula și aplică valoarea mai mică. Cifra de 35 de milioane de euro care circulă în presa română se referă la practicile interzise din art. 5, nu la transparență. În România, prin memorandum guvernamental din 12 martie 2026, ANCOM a fost desemnată autoritate de supraveghere a pieței și punct unic de contact pentru AI Act. La jumătatea lui august 2026, legea națională care stabilește procedura de control și regimul sancționator nu era adoptată, iar ANCOM confirma public că actul normativ e încă în elaborare; până la data publicării acestui articol nu am găsit nicio indicație că s-ar fi schimbat. Amânarea negociată în 2026 a vizat sistemele cu risc ridicat, nu transparența. Obligația e în vigoare, instrumentul național de control era în construcție — o fereastră de pregătire, nu o suspendare.
2. Un agent care răspunde e una, unul care sună e cu totul altceva
Aici e singura amendă din acest articol care s-a dat deja, în România, în 2026. ANSPDCP a finalizat în iunie 2026 o investigație la AMATO BESTSELLER S.R.L. și a sancționat operatorul, printre altele, cu 50.000 de lei pentru încălcarea art. 12 alin. (1) din Legea 506/2004: efectuase comunicări comerciale prin sisteme automate de apelare și comunicare care nu necesită intervenția unui operator uman, fără consimțământul prealabil expres al destinatarilor. În același dosar s-au adăugat 78.465 de lei pentru art. 32(4) GDPR și 104.620 de lei pentru art. 5(1)(c) și art. 9 GDPR.
Tiparul sancționat e exact cel al unui agent vocal care sună în loc să răspundă. Delimitarea practică: un agent care preia apeluri intrate nu e comunicare comercială nesolicitată, pentru că apelul l-a inițiat clientul; unul care formează numere ca să propună oferte cere consimțământ prealabil expres, documentat înainte de primul apel. Al treilea caz — apelul automat care confirmă o programare cerută de client — nu e marketing în logica obișnuită, dar nu am găsit o poziție publică explicită a autorității pe această situație, așa că nu dăm un verdict.
3. Dacă păstrezi transcrierea, informezi apelantul
Un agent vocal util vine cu transcrieri — fără ele nu poți verifica ce i-a spus clientului și nu poți corecta scenariul. Dar transcrierea și eventuala înregistrare sunt date personale, iar într-un cabinet pot fi date despre sănătate. Înseamnă informare la începutul apelului, un temei legal asumat, o durată de păstrare stabilită în scris, acces limitat și ștergere la cerere — tratate împreună cu restul obligațiilor de protecția datelor, nu improvizate într-un fișier de pe laptopul recepției.
Ordinea operațiilor, dacă vrei să funcționeze
Pașii de mai jos sunt utili și dacă îl construiești singur, și dacă nu îl construiești niciodată. Primele trei sunt decizii, nu configurări, iar greșite la început se plătesc în luna a treia.
- 1Alege un singur caz de uz măsurabil — programări sau întrebări frecvente, nu „recepție completă". Un agent care face bine un lucru e un proiect; unul care face trei lucruri prost e un demo.
- 2Scrie propoziția de deschidere înainte de orice altceva: declarația că apelantul vorbește cu un sistem AI, informarea despre înregistrare și opțiunea de a cere un om. Dacă nu încape în 10-12 secunde, rescrie-o până încape.
- 3Definește explicit punctul de predare la om: la a doua neînțelegere consecutivă, la orice cerere directă, la orice subiect medical, de plată sau de reclamație. Un sondaj Gartner pe 3.566 de clienți, din februarie-martie 2026, arată că 87% consideră esențial să poată ajunge la un operator uman când o companie folosește AI generativă în relația cu clienții. Ușa către om nu e o concesie, e condiția de acceptare.
- 4Decide dacă ai nevoie și de apeluri ieșite. Dacă da, consimțământul prealabil expres se obține și se documentează înainte de prima campanie, nu după.
- 5Alege cum intră apelul: număr nou sau integrare în telefonia existentă, cu reguli scrise pentru orele din afara programului, linia ocupată și apelurile simultane.
- 6Rulează pilotul în paralel cu procesul manual două-patru săptămâni, așa cum lucrăm la orice automatizare AI, și măsoară trei lucruri: câte apeluri a preluat, câte a escaladat, câte programări au ajuns corect în agendă.
- 7Ascultă 20 de apeluri reale în dashboard înainte să extinzi. Nu rapoartele — apelurile. Acolo se vede unde se împiedică scenariul, și acolo se repară în 20 de minute.
Cât costă și de ce se plătește pe minute
La noi, un agent pe un singur caz de uz — programări sau întrebări frecvente — se construiește în 3-4 săptămâni, cu 12.500 de lei la implementare, și se operează cu 450 de lei pe lună pentru până la 1.000 de minute. Varianta cu mai multe funcții (recepție, programări și suport) cere 5-7 săptămâni și 24.500 de lei, cu 1.250 de lei pe lună pentru până la 5.000 de minute. Livrabilele sunt aceleași: agentul cu voce personalizată, integrarea cu Twilio sau cu telefonia existentă, scenariul propriu pentru programări, FAQ și escaladare, plus dashboard-ul cu transcrieri. Abonamentul de operare se poate lua direct din pachete; implementarea se dimensionează după o discuție, pentru că scenariul diferă între un cabinet și un service auto.
Plafonul de minute nu e un artificiu comercial, și merită explicat pentru că schimbă felul în care proiectezi apelul. Costul platformelor e per minut vorbit: ElevenLabs facturează agenții la 0,08 dolari pe minut pe toate planurile, cu 0,16 dolari peste limita de apeluri concurente, iar telefonia Twilio pentru România adaugă 0,0100 dolari pe minut pentru un apel intrat pe număr local, 3 dolari pe lună pentru număr și 0,0125, respectiv 0,0320 dolari pe minut pentru apelurile ieșite către fix și mobil — prețuri afișate la data publicării. Concluzia practică: un agent care rezolvă o programare în 90 de secunde costă de câteva ori mai puțin decât unul care poartă conversații de șase minute, deci un scenariu scurt se vede în factură, nu doar în calitate.
Cheltuiala care doare nu e abonamentul, ci proiectul pornit fără un caz de uz clar. Despre de ce eșuează proiectele AI în firme am scris separat, în analiza despre ROI-ul AI pentru IMM.
Concluzie
Un agent vocal AI nu e o secretară digitală care rezolvă orice apel, și cine îți promite asta nu a ascultat niciodată 20 de apeluri reale. E o unealtă care preia bine o categorie îngustă și previzibilă de apeluri — programări, confirmări, întrebări cu răspuns fix, apelurile de după închidere — și care trebuie să spună din prima secundă ce este. Tot ce decide dacă funcționează se întâmplă înainte de implementare: ce apeluri îi dai, ce rostește la început și când predă apelul unui om. Dacă vrei să vedem împreună care dintre apelurile tale intră în categoria aceea, hai să discutăm 30 de minute, fără obligații.
Surse
- Regulamentul (UE) 2024/1689 (AI Act) — art. 50 (obligații de transparență) și art. 99 (sancțiuni), prin AI Act Service Desk, Comisia Europeană (ai-act-service-desk.ec.europa.eu)
- Analize privind pachetul Digital Omnibus pe AI și amânarea termenelor pentru sistemele cu risc ridicat, cu menținerea art. 50 la 2 august 2026 (gibsondunn.com)
- Alexandra Crăsoveanu — „AI Act se aplică în România, dar nu poate fi încă sancționat", JURIDICE.ro, 13 august 2026 (juridice.ro)
- ANSPDCP — comunicat de presă din 6 august 2026, sancțiune pentru comunicări comerciale prin sisteme automate de apelare fără consimțământ prealabil (dataprotection.ro); Legea 506/2004, art. 12 alin. (1)
- Gabriel Pîrlogeanu, Alexandru-Lucian Georgescu, Horia Cucu — „Open Source State-Of-the-Art Solution for Romanian Speech Recognition", preprint arXiv 2511.03361, noiembrie 2025 (arxiv.org)
- ElevenLabs — documentația de modele și limbi suportate, blogul despre optimizarea latenței în AI conversațional și pagina de prețuri pentru agenți (elevenlabs.io)
- Twilio — prețuri Voice pentru România (twilio.com/en-us/voice/pricing/ro)
- Gartner — comunicat de presă din 4 august 2026, sondaj pe 3.566 de clienți B2B și B2C privind accesul la un operator uman (gartner.com)
- Journal of General Internal Medicine, 2016 — studiu randomizat privind efectul apelului de reamintire asupra neprezentărilor (link.springer.com)
- Alan R. Teo, Christopher W. Forsberg, Heather E. Marsh, Somnath Saha, Steven K. Dobscha — „No-Show Rates When Phone Appointment Reminders Are Not Directly Delivered", Psychiatric Services, 68(11), 2017 — comparație observațională între tipurile de reamintire a programărilor (psychiatryonline.org)