CRYPTOITDATACRYPTOITDATA

Intelligence artificielle

Agent vocal IA au téléphone : ce qu’il peut et ne peut pas

Ce qu’un agent vocal IA peut et ne peut pas faire au téléphone d’une petite entreprise : l’obligation de se déclarer IA, les limites et le coût à la minute.

9 min de lecture

Repensez au dernier matin où le téléphone de l’entreprise a sonné trois fois de suite alors que vous étiez avec un client. Vous n’avez répondu à aucun appel et vous ne savez probablement toujours pas qui appelait. Un agent vocal IA — un programme qui prend l’appel, tient une conversation et note ce qu’il faut noter — c’est exactement ce qu’on vous vend pour cette situation, avec la promesse que personne ne se rendra compte qu’il parle à un robot. Ce qu’on ne vous vend pas : depuis le 2 août 2026, ce programme a l’obligation de dire à l’appelant, dans les premières secondes, qu’il est un système d’IA.

L’obligation vient du règlement (UE) 2024/1689 — l’AI Act — et elle renverse la question avec laquelle arrivent presque tous ceux qui nous interrogent sur les agents vocaux. Ils demandent : « est-ce qu’on entend que c’est un robot ? » Depuis août, la réponse est : oui, on l’entend, parce que la loi l’exige. La question utile est ailleurs : lesquels de vos appels peuvent être traités correctement par un robot qui s’est déclaré robot dès la première seconde. Pas « tous », mais pas « aucun » non plus — et l’écart entre ces deux listes décide si le projet en vaut la peine.

L’appel auquel personne ne répond n’apparaît dans aucun relevé

Un appel manqué est la seule perte de l’entreprise qui ne laisse de trace nulle part : il n’entre dans aucun rapport et ne vous revient pas sous forme de réclamation. Le patient qui n’a pas eu la ligne a pris rendez-vous ailleurs, le client dont la voiture est en panne a appelé le garage suivant sur sa liste, et celui qui voulait une table de quatre samedi soir ne vous dira jamais qu’il a essayé. Le coût est réel et invisible en même temps — c’est pour cela que la décision est reportée indéfiniment.

Des chiffres bien commodes circulent sur le sujet : que 62 % des appels vers les petites entreprises restent sans réponse, que 85 % de ceux qui n’obtiennent pas de réponse ne rappellent jamais. Nous les avons remontés jusqu’à la source et nous ne les utilisons pas : ils apparaissent presque exclusivement sur des sites qui vendent eux-mêmes des solutions pour les appels manqués, et la chaîne de citations aboutit à une étude sur 85 entreprises à la méthodologie non publiée. L’argument n’en a pas besoin : un patron de garage sait déjà à quelle fréquence le téléphone sonne quand il a les mains dans le moteur.

Ce qui se défend avec des données est plus modeste, mais suffit : l’appel de rappel fonctionne. Une étude randomisée du Journal of General Internal Medicine (2016) a mesuré l’effet d’un appel passé sept jours avant le rendez-vous, sur des patients à fort risque d’absence — le taux est passé de 29,2 % dans le groupe témoin à 22,8 % dans le groupe appelé. Les précisions sont obligatoires : l’appel était passé par un humain, pas par un agent IA, et la population était composée de patients américains de médecine générale, sélectionnés sur le risque. Le chiffre montre que l’appel compte ; pas qu’un agent vocal produit le même effet.

Les solutions de rechange que tout le monde essaie avant d’arriver à un agent vocal échouent chacune à sa manière :

  • La boîte vocale — elle déplace l’effort sur l’appelant, précisément au moment où il a le moins de patience. Une comparaison observationnelle publiée dans Psychiatric Services (Teo et coll., 2017), sur 250 patients de médecine générale souffrant de dépression, a trouvé 3 % d’absences quand le rappel était décroché en direct, 24 % quand un message était laissé et 39 % quand personne ne répondait. Étude non randomisée, population étroite : elle montre une direction, pas un rapport de huit à un.
  • Le serveur vocal à touches (« tapez 1 pour les rendez-vous ») — il ne perd pas l’appel, mais il oblige l’appelant à parcourir une arborescence qu’il n’a jamais vue ; beaucoup raccrochent à la deuxième bifurcation.
  • L’accueil qui ne répond qu’aux heures d’ouverture — les appels du soir et du week-end n’existent tout simplement pas pour l’entreprise.
  • Les rendez-vous non confirmés — la place reste bloquée dans l’agenda et vide dans la réalité, et personne n’a le temps de passer dix appels de confirmation par jour.

Ce qu’un agent vocal IA peut et ne peut pas faire

Toutes les démonstrations d’agents vocaux ont un point commun : l’interlocuteur parle clairement, à son tour, dans une pièce silencieuse. La meilleure preuve publique de ce qui se passe quand ce n’est plus le cas vient d’un travail sur la reconnaissance de la parole en roumain (Pîrlogeanu, Georgescu, Cucu), déposé sur arXiv en novembre 2025, avec un modèle entraîné sur plus de 2 600 heures de roumain. Sur de la parole lue, le taux d’erreur par mot est de 3,09 % pour RoWhisper-large-v2 et de 1,73 % pour le modèle proposé. Sur de la parole spontanée, les mêmes modèles atteignent 25,05 % et 8,12 % sur un corpus, et 61,46 % et 10,75 % sur un autre.

L’écart entre parole lue et parole spontanée est d’un ordre de grandeur, et un appel téléphonique est, sans exception, de la parole spontanée : la personne se corrige au milieu de sa phrase, parle en même temps que vous, est en voiture, vous donne son numéro par groupes de deux chiffres. Deux avertissements, sans lesquels les chiffres deviennent de la manipulation : le travail est une préimpression et il ne mesure pas les modèles commerciaux sur lesquels se construisent les agents en production. Ce qui reste valable, c’est la forme du problème, pas le pourcentage : la qualité dépend davantage du caractère prévisible de ce que dit l’appelant que du prix du modèle — et cela vaut pour toute langue qui n’est pas l’anglais.

De là sort le seul critère de sélection utile. Un agent vocal est faisable quand l’appel est, au fond, un formulaire court lu à voix haute — un nom, un numéro, un créneau horaire, une prestation dans une liste de cinq. Il devient incertain à mesure que l’appel ressemble moins à un formulaire :

  • Ça marche : prendre un nouveau rendez-vous, confirmer ou déplacer un rendez-vous existant, les horaires et l’adresse, les questions fréquentes à réponse fixe, prendre un message avec un nom et un numéro, filtrer les appels après 18 heures.
  • Ça marche avec prudence : les estimations de prix sous conditions (« ça dépend de la pièce »), les longues listes de prestations, les réservations à nombreuses variables — elles exigent un scénario serré et un seuil d’abandon clair.
  • Ça ne marche pas : la réclamation d’un client mécontent, toute discussion médicale de fond, la négociation d’un prix, le problème qui n’entre dans aucune catégorie préparée — non pas parce que la technologie est faible, mais parce qu’ici l’erreur coûte plus cher que l’appel manqué.
Peu importe désormais qu’on entende que c’est un robot — depuis août 2026, il doit le dire lui-même. Seul compte de savoir quels appels méritent un robot.

« 75 millisecondes » n’est pas la pause que l’appelant entend

La deuxième limite que personne n’explique est la latence, parce que les chiffres du fournisseur sonnent très bien. La documentation d’ElevenLabs annonce environ 75 ms (Flash v2.5), environ 100 ms en médiane (v4 Turbo), environ 280 ms (v3 Conversational) et 150 ms pour la transcription en temps réel avec Scribe v2 Realtime. Le problème, c’est qu’en synthèse vocale la latence mesure strictement le temps jusqu’au premier octet d’audio généré — pas la pause que l’appelant entend.

La pause réelle additionne le transport téléphonique, la reconnaissance de la parole, l’inférence du modèle de langue, la synthèse et la mémoire tampon réseau. Nous n’avons pas trouvé de test indépendant crédible de latence de bout en bout en roumain, donc nous ne donnons pas de chiffre — mais nous n’acceptons pas non plus 75 ms comme réponse à « combien de temps avant qu’il me réponde ». La vérification est à la portée de tous avant de signer : demander un numéro de test, appeler depuis un mobile, depuis la voiture, et interrompre l’agent au milieu d’une phrase.

Le roumain figure sur la liste des langues prises en charge — inclus dans le modèle multilingue à 29 langues, et les plus récents le mentionnent explicitement. Ce qui n’existe pas, d’après nos recherches, c’est une évaluation publiée du naturel de la synthèse en roumain par rapport à l’anglais. Celui qui affirme que cela sonne pareil n’a donc pas plus de base que celui qui affirme que cela sonne mal. On vérifie à l’oreille, dans sa propre langue, là où la synthèse trébuche : noms propres, adresses, abréviations et chiffres.

Trois obligations dont vous héritez le jour où vous allumez l’agent

La partie juridique n’est pas un avertissement de fin d’article, c’est une partie du cahier des charges : deux des trois obligations ci-dessous se traduisent en phrases que l’agent prononce dans les premières secondes.

1. L’agent doit dire qu’il est une IA

L’article 50, paragraphe 1, de l’AI Act impose aux fournisseurs de veiller à ce que les systèmes d’IA destinés à interagir directement avec des personnes physiques soient conçus de manière à ce que ces personnes soient informées qu’elles interagissent avec un système d’IA — sauf si cela est évident pour une personne raisonnablement informée, attentive et avisée. Sur le canal vocal, avec une bonne synthèse, c’est précisément ce qui cesse d’être évident. Le paragraphe 5 ajoute la condition décisive pour le téléphone : l’information est donnée de manière claire et distincte, au plus tard au moment de la première interaction. Ce n’est pas une mention dans la politique de confidentialité du site — c’est une phrase prononcée au début de l’appel. Le texte oblige le fournisseur, donc pour vous c’est une condition de recette : celui qui construit votre agent doit le livrer avec la déclaration prononcée, et non vous la laisser à configurer.

Deux nuances utiles. L’obligation de marquer l’audio généré dans un format lisible par machine, au paragraphe 2, pèse sur le fournisseur du système génératif, pas sur le cabinet qui l’utilise ; pour les systèmes mis sur le marché avant le 2 août 2026, elle bénéficie d’un délai jusqu’au 2 décembre 2026. Et si l’agent fait de l’analyse de sentiment sur la voix de l’appelant ou l’identifie à la voix, vous tombez aussi sous le paragraphe 3 — une bonne raison de ne pas activer des fonctions dont vous n’avez pas besoin.

Quant aux conséquences : une violation de l’article 50 relève de l’article 99, paragraphe 4 — jusqu’à 15 000 000 d’euros ou 3 % du chiffre d’affaires annuel mondial, le montant le plus élevé étant retenu — mais pour les PME l’article 99, paragraphe 6, inverse la règle et applique le montant le plus faible. Le chiffre de 35 millions d’euros qui circule dans la presse concerne les pratiques interdites de l’article 5, pas la transparence. L’application est nationale : chaque État membre désigne sa propre autorité de surveillance du marché et fixe lui-même la procédure de contrôle et les sanctions. En Roumanie, par mémorandum gouvernemental du 12 mars 2026, l’ANCOM — le régulateur national des communications — a été désignée autorité de surveillance du marché et point de contact unique pour l’AI Act. À la mi-août 2026, la loi nationale qui établit la procédure de contrôle et le régime de sanctions n’était pas adoptée, et l’ANCOM confirmait publiquement que le texte était encore en préparation ; à la date de publication de cet article, nous n’avons trouvé aucune indication que cela ait changé. Le report négocié en 2026 portait sur les systèmes à haut risque, pas sur la transparence. L’obligation est en vigueur, l’instrument national de contrôle était en construction — une fenêtre de préparation, pas une suspension.

2. Un agent qui répond est une chose, un agent qui appelle en est une tout autre

C’est ici que se trouve la seule amende de cet article déjà infligée. L’autorité roumaine de protection des données, l’ANSPDCP, a clos en juin 2026 une enquête chez AMATO BESTSELLER S.R.L. et a sanctionné le responsable de traitement, entre autres, de 50 000 RON pour violation de l’article 12, paragraphe 1, de la loi 506/2004 : il avait effectué des communications commerciales au moyen de systèmes automatisés d’appel et de communication ne nécessitant pas l’intervention d’un opérateur humain, sans le consentement préalable exprès des destinataires. Au même dossier se sont ajoutés 78 465 RON pour l’article 32, paragraphe 4, du RGPD et 104 620 RON pour les articles 5, paragraphe 1, point c), et 9 du RGPD. La règle derrière cela n’est pas roumaine : l’article 13 de la directive ePrivacy 2002/58/CE exige le consentement préalable pour les automates d’appel et il est transposé dans chaque État membre — en France par l’article L. 34-5 du code des postes et des communications électroniques.

Le schéma sanctionné est exactement celui d’un agent vocal qui appelle au lieu de répondre. La délimitation pratique : un agent qui prend les appels entrants n’est pas une communication commerciale non sollicitée, puisque l’appel a été initié par le client ; celui qui compose des numéros pour proposer des offres exige un consentement préalable exprès, documenté avant le premier appel. Le troisième cas — l’appel automatique qui confirme un rendez-vous demandé par le client — n’est pas du marketing dans la logique habituelle, mais nous n’avons pas trouvé de position publique explicite de l’autorité sur cette situation, donc nous ne rendons pas de verdict.

3. Si vous conservez la transcription, vous informez l’appelant

Un agent vocal utile vient avec des transcriptions — sans elles, vous ne pouvez pas vérifier ce qu’il a dit au client ni corriger le scénario. Mais la transcription et l’éventuel enregistrement sont des données personnelles, et dans un cabinet ce peuvent être des données de santé. Cela signifie une information au début de l’appel, une base légale assumée, une durée de conservation fixée par écrit, un accès limité et une suppression sur demande — traités avec le reste des obligations de protection des données, et non improvisés dans un fichier sur l’ordinateur de l’accueil.

L’ordre des opérations, si vous voulez que cela marche

Les étapes ci-dessous sont utiles que vous le construisiez vous-même ou que vous ne le construisiez jamais. Les trois premières sont des décisions, pas des réglages, et mal prises au départ, elles se paient au troisième mois.

  1. 1Choisissez un seul cas d’usage mesurable — les rendez-vous ou les questions fréquentes, pas « tout l’accueil ». Un agent qui fait bien une chose est un projet ; un agent qui fait mal trois choses est une démonstration.
  2. 2Écrivez la phrase d’ouverture avant tout le reste : la déclaration que l’appelant parle à un système d’IA, l’information sur l’enregistrement et la possibilité de demander un humain. Si elle ne tient pas en 10-12 secondes, réécrivez-la jusqu’à ce qu’elle tienne.
  3. 3Définissez explicitement le point de passage à l’humain : au deuxième malentendu consécutif, à toute demande directe, sur tout sujet médical, de paiement ou de réclamation. Une enquête Gartner auprès de 3 566 clients, de février-mars 2026, montre que 87 % jugent essentiel de pouvoir joindre un opérateur humain lorsqu’une entreprise utilise l’IA générative dans la relation client. La porte vers l’humain n’est pas une concession, c’est la condition d’acceptation.
  4. 4Décidez si vous avez aussi besoin d’appels sortants. Si oui, le consentement préalable exprès s’obtient et se documente avant la première campagne, pas après.
  5. 5Choisissez par où entre l’appel : nouveau numéro ou intégration dans la téléphonie existante, avec des règles écrites pour les heures de fermeture, la ligne occupée et les appels simultanés.
  6. 6Faites tourner le pilote en parallèle du processus manuel pendant deux à quatre semaines, comme nous le faisons pour toute automatisation IA, et mesurez trois choses : combien d’appels il a pris, combien il a escaladés, combien de rendez-vous sont arrivés correctement dans l’agenda.
  7. 7Écoutez 20 appels réels dans le tableau de bord avant d’étendre. Pas les rapports — les appels. C’est là qu’on voit où le scénario trébuche, et c’est là qu’on le répare en 20 minutes.

Ce que cela coûte et pourquoi la facturation est à la minute

Chez nous, un agent sur un seul cas d’usage — rendez-vous ou questions fréquentes — se construit en 3-4 semaines, avec 12 500 RON à la mise en place, et s’exploite à 450 RON par mois jusqu’à 1 000 minutes. La variante multifonction (accueil, rendez-vous et support) demande 5-7 semaines et 24 500 RON, avec 1 250 RON par mois jusqu’à 5 000 minutes. Les livrables sont les mêmes : l’agent avec une voix personnalisée, l’intégration avec Twilio ou la téléphonie existante, le scénario propre aux rendez-vous, FAQ et escalade, plus le tableau de bord avec les transcriptions. L’abonnement d’exploitation se prend directement dans les offres ; la mise en place se dimensionne après un échange, parce que le scénario diffère entre un cabinet et un garage.

Le plafond de minutes n’est pas un artifice commercial, et il mérite une explication parce qu’il change la façon de concevoir l’appel. Le coût des plateformes est à la minute parlée : ElevenLabs facture les agents 0,08 dollar la minute sur tous les forfaits, avec 0,16 dollar au-delà de la limite d’appels simultanés, et la téléphonie Twilio pour la Roumanie ajoute 0,0100 dollar la minute pour un appel entrant sur un numéro local, 3 dollars par mois pour le numéro et 0,0125 et 0,0320 dollar la minute respectivement pour les appels sortants vers le fixe et le mobile — tarifs affichés à la date de publication. La conclusion pratique : un agent qui règle un rendez-vous en 90 secondes coûte plusieurs fois moins qu’un agent qui tient des conversations de six minutes ; un scénario court se voit donc sur la facture, pas seulement dans la qualité.

La dépense qui fait mal n’est pas l’abonnement, c’est le projet lancé sans cas d’usage clair. Nous avons écrit à part sur les raisons de l’échec des projets IA en entreprise, dans l’analyse du ROI de l’IA pour les PME.

Conclusion

Un agent vocal IA n’est pas une secrétaire numérique qui règle n’importe quel appel, et celui qui vous promet cela n’a jamais écouté 20 appels réels. C’est un outil qui prend bien une catégorie étroite et prévisible d’appels — rendez-vous, confirmations, questions à réponse fixe, appels après la fermeture — et qui doit dire dès la première seconde ce qu’il est. Tout ce qui décide s’il fonctionne se passe avant la mise en œuvre : quels appels vous lui confiez, ce qu’il prononce au début et quand il passe l’appel à un humain. Si vous voulez qu’on regarde ensemble lesquels de vos appels entrent dans cette catégorie, discutons 30 minutes, sans engagement.

Sources

  • Règlement (UE) 2024/1689 (AI Act) — article 50 (obligations de transparence) et article 99 (sanctions), via l’AI Act Service Desk de la Commission européenne (ai-act-service-desk.ec.europa.eu)
  • Analyses du paquet Digital Omnibus sur l’IA et du report des échéances pour les systèmes à haut risque, l’article 50 restant fixé au 2 août 2026 (gibsondunn.com)
  • Alexandra Crăsoveanu — « L’AI Act s’applique en Roumanie, mais ne peut pas encore être sanctionné », JURIDICE.ro, 13 août 2026 (juridice.ro)
  • ANSPDCP — communiqué de presse du 6 août 2026, sanction pour communications commerciales par systèmes automatisés d’appel sans consentement préalable (dataprotection.ro) ; loi 506/2004, article 12, paragraphe 1 ; directive ePrivacy 2002/58/CE, article 13, transposé en France à l’article L. 34-5 du CPCE
  • Gabriel Pîrlogeanu, Alexandru-Lucian Georgescu, Horia Cucu — « Open Source State-Of-the-Art Solution for Romanian Speech Recognition », préimpression arXiv 2511.03361, novembre 2025 (arxiv.org)
  • ElevenLabs — documentation des modèles et des langues prises en charge, billet de blog sur l’optimisation de la latence en IA conversationnelle et page de tarifs des agents (elevenlabs.io)
  • Twilio — tarifs Voice pour la Roumanie (twilio.com/en-us/voice/pricing/ro)
  • Gartner — communiqué de presse du 4 août 2026, enquête auprès de 3 566 clients B2B et B2C sur l’accès à un opérateur humain (gartner.com)
  • Journal of General Internal Medicine, 2016 — étude randomisée sur l’effet de l’appel de rappel sur les absences (link.springer.com)
  • Alan R. Teo, Christopher W. Forsberg, Heather E. Marsh, Somnath Saha, Steven K. Dobscha — « No-Show Rates When Phone Appointment Reminders Are Not Directly Delivered », Psychiatric Services, 68(11), 2017 — comparaison observationnelle des types de rappel de rendez-vous (psychiatryonline.org)

Questions fréquentes

L’agent vocal doit-il dire qu’il est un robot ?+

Oui. L’article 50, paragraphe 1, de l’AI Act exige que les personnes soient informées qu’elles interagissent avec un système d’IA, et le paragraphe 5 exige que l’information soit claire et distincte, au plus tard au moment de la première interaction. Au téléphone, cela se traduit par une phrase prononcée au début de l’appel, pas par une mention sur le site. L’obligation s’applique depuis le 2 août 2026 et n’a pas été reportée par le paquet qui a déplacé les échéances des systèmes à haut risque.

Puis-je utiliser un agent IA pour appeler des clients avec des offres ?+

Uniquement avec le consentement préalable exprès des destinataires, obtenu et documenté avant le premier appel. L’article 13 de la directive ePrivacy — transposé en France à l’article L. 34-5 du CPCE et en Roumanie à l’article 12, paragraphe 1, de la loi 506/2004 — interdit les communications commerciales par systèmes automatisés d’appel ne nécessitant pas l’intervention d’un opérateur humain sans ce consentement, et l’autorité roumaine a sanctionné en 2026 un responsable de traitement de 50 000 RON exactement sur ce schéma. Un agent qui répond aux appels entrants est une situation complètement différente, puisque l’appel a été initié par le client.

Ai-je besoin de l’accord de l’appelant pour enregistrer la conversation ?+

L’enregistrement et la transcription sont des données personnelles, et dans un cabinet médical ce peuvent être des données de santé, donc l’appelant doit être informé au début de l’appel, avant l’enregistrement. En pratique, il vous faut une base légale assumée, une durée de conservation fixée par écrit, un accès limité et un mécanisme de suppression sur demande. Cela fait partie des obligations générales de protection des données, ce n’est pas une formalité distincte de l’agent vocal.

Dans quelle mesure un agent vocal comprend-il une autre langue que l’anglais ?+

Cela dépend de façon décisive du caractère prévisible ou libre de la parole. Un travail de novembre 2025 sur la reconnaissance de la parole en roumain mesure, sur de la parole lue, des taux d’erreur par mot de 3,09 % et 1,73 % pour deux modèles, tandis que sur de la parole spontanée les mêmes modèles montent à 25,05 % et 8,12 % sur un corpus et à 61,46 % et 10,75 % sur un autre. Un appel téléphonique est de la parole spontanée : un agent qui collecte un nom, un numéro et un créneau horaire est faisable, une conversation libre ne l’est pas. Le travail est une préimpression et ne mesure pas les modèles commerciaux de production, donc les chiffres montrent la forme du problème, pas la performance d’un fournisseur.

Une question concrète ?

30 minutes, gratuit. Nous parlons précisément de votre situation.

Réserver une consultation