Vendredi matin, 9 h 47. Un dentiste de Laval écoute la démo d'un vendeur d'agent vocal IA. L'agent prend rendez-vous parfaitement. Confirme l'heure. Propose même une alternative. Le dentiste signe le mardi suivant.
Mercredi, 11 h 03. Un vrai client appelle : « Euh oui, bonjour, j'avais un rendez-vous jeudi mais finalement ma femme a déjà pris congé pour vendredi, donc est-ce qu'on peut le bouger, mais genre pas avant 2 h parce que les enfants reviennent de l'école, et au fait est-ce que vous prenez encore la carte Zellers ? »
L'agent boucle au début. Redemande le nom. Le client raccroche. La secrétaire, qui a reçu 4 autres appels dans la même matinée avec la même frustration, appelle le dentiste. Le contrat est annulé le vendredi.
Coût de l'erreur : 1 200 $ de frais d'implantation, trois semaines à reconstruire la routine, et une confiance dans l'IA qui vient d'en prendre un coup.
La vraie question n'est pas « est-ce que l'agent fait une démo impressionnante ». C'est « est-ce qu'il survit à un vrai client ».
Pourquoi 8 démos sur 10 sont truquées (sans que ce soit de la malhonnêteté)
Ce n'est pas que les vendeurs mentent. C'est qu'ils montrent le chemin heureux : le client qui dit son nom clairement, donne une date précise, confirme, raccroche. Trente secondes. Propre.
Le problème ? Les vrais clients québécois ne parlent pas comme ça. Ils changent d'avis. Coupent la parole. Passent du français à l'anglais. Posent une question hors sujet. Laissent un silence de 4 secondes qui fait croire à l'agent qu'il doit reprendre la parole.
Une étude récente sur la QA des agents vocaux montre que la différence entre un agent qui tient la route et un qui casse se joue à quatre niveaux : infrastructure, exécution, réaction utilisateur, résultat business. La démo couvre le premier. Les quatre autres, vous les découvrez en production. Trop tard.
D'où l'idée simple : imposer les tests pendant la démo, pas après la signature.
Voici les 5 scénarios qu'un PME du Québec devrait jouer systématiquement avant de signer quoi que ce soit. Pas demander à voir — jouer lui-même. En direct. Avec le vendeur qui écoute.
Scénario 1 : Le changement d'avis à mi-course
Vous êtes en train de prendre un rendez-vous. À mi-chemin, vous changez le service demandé. Exemple concret : « J'aimerais prendre rendez-vous pour un nettoyage jeudi — en fait non, rends ça un examen complet pour le même jour, et puis finalement fais-le vendredi. »
Ce que vous testez : la récupération de conversation. L'agent doit adapter, pas recommencer.
Signal d'alarme : si l'agent redemande votre nom, votre numéro, ou reprend le script au début. Sur Reddit, c'est la plainte #1 contre les agents vocaux en 2026 — des utilisateurs qui décrivent des agents qui « rebouclent au début » dès qu'un caller modifie un détail. C'est le pain point silencieux que personne ne teste et qui coule 60 % des déploiements.
Un bon agent garde le contexte des 5-6 derniers tours et met à jour seulement la variable modifiée. Demandez au vendeur comment son agent gère l'entity tracking. Si la réponse est floue, c'est louche.
Scénario 2 : Le client qui coupe la parole
L'agent commence à lister les créneaux disponibles. Vous le coupez au milieu de la deuxième option : « Oui, jeudi 14 h parfait. »
Ce que vous testez : le barge-in. L'agent doit s'arrêter dans les 200 ms et capter votre réponse.
Signal d'alarme : l'agent continue à parler par-dessus vous, ou pire, vous oblige à attendre qu'il finisse sa phrase. ElevenLabs, dans sa mise à jour du 7 avril 2026, a justement renforcé le support des conversations multi-agents avec une analyse scopée par agent — preuve que même les fournisseurs sérieux reconnaissent que le turn-taking reste un angle mort.
Dans un salon de coiffure où le client tient son café et répond vite, un agent qui parle trop longtemps, c'est un client qui raccroche. Si la démo vous force à attendre que l'agent finisse chaque phrase avant de répondre, c'est mort.
Scénario 3 : La question totalement hors-script
Votre script théorique : prendre rendez-vous. Votre question de test : « Au fait, est-ce que vous êtes ouverts le 24 décembre ? » ou « Est-ce que vous prenez encore la carte cadeau de mon vétérinaire d'avant ? »
Ce que vous testez : la gestion gracieuse de l'inconnu. Deux comportements acceptables :
- L'agent transfère à un humain avec un contexte clair (« Je vais vous passer la réception, mentionnez-leur votre question sur les cartes cadeaux »).
- L'agent admet ne pas savoir et propose une alternative (« Je n'ai pas cette information, mais je peux vous faire rappeler dans l'heure par quelqu'un qui sait »).
Signal d'alarme rouge : l'agent invente une réponse. C'est ce qu'on appelle une hallucination, et dans une PME, ça se paye cher. Un agent vocal qui improvise un prix ou une politique inventée peut générer une facture légale bien plus salée que le contrat d'IA lui-même. On a déjà écrit sur comment éviter ces hallucinations dans un agent vocal — lecture obligatoire avant toute signature.
Scénario 4 : Le mix français-anglais à la québécoise
Vous démarrez en français, puis au milieu vous glissez une expression en anglais. « Oui je voudrais un appointment pour ma fille, preferably après l'école là. »
Ce que vous testez : la robustesse linguistique. Un tiers des PME québécoises servent une clientèle bilingue, et les appels sont rarement monolingues en pratique. Sur l'Île de Montréal, 40 % des conversations commerciales contiennent au moins un code-switch par appel.
Signal d'alarme : l'agent répond en anglais sec, ou pire, confirme mal l'heure parce qu'il a mal interprété un mot comme « pm » vs « after ». Les modèles STT (speech-to-text) récents — incluant les nouveaux modèles mentionnés dans le changelog 2026 d'ElevenLabs — gèrent mieux le code-switching, mais il faut le vérifier, pas le supposer.
Demandez au vendeur sur quel modèle STT tourne l'agent et s'il a été testé spécifiquement sur du franglais montréalais. Si la réponse est « on utilise Whisper par défaut » sans nuance, méfiez-vous.
Scénario 5 : Le silence de 4 secondes
Vous laissez tomber un silence volontaire au milieu d'une réponse. Comme si vous réfléchissiez, ou consultiez votre agenda papier. 3 secondes. 4 secondes.
Ce que vous testez : la patience de l'agent. Un bon agent attend environ 800 ms à 1,5 seconde, puis relance doucement (« Prenez votre temps », « Je suis toujours là »). Un mauvais agent parle par-dessus votre réflexion ou pire, raccroche en pensant l'appel terminé.
Signal d'alarme : l'agent enchaîne une nouvelle question pendant que vous réfléchissez. C'est ressenti par le caller comme « l'agent est pressé, il ne m'écoute pas ». Résultat : le client raccroche et rappelle pour parler à un humain — ce qui annule toute la valeur de l'IA.
La barre de latence à ne pas dépasser, qu'on a documentée en détail, c'est 800 ms pour le Time-to-First-Word (TTFW). Mais attention : un agent trop rapide à parler dans le silence, c'est aussi un défaut. La patience compte autant que la vitesse.
Les 4 chiffres à exiger noir sur blanc
Pendant que vous faites ces 5 tests, demandez au vendeur de vous donner — par écrit, dans le contrat — les 4 chiffres suivants :
TTFW < 400 ms. Temps avant le premier mot de l'agent. Au-dessus de 800 ms, votre client perçoit une « machine qui rame ».
Latence de tour P95 < 800 ms. La latence dans 95 % des cas. Un vendeur qui ne donne qu'une moyenne, c'est louche — la moyenne cache les pires appels.
Intent accuracy > 95 %. Pourcentage de fois où l'agent comprend correctement la demande. En dessous de 90 %, vous perdez plus de clients que vous n'en gagnez.
Containment rate > 70 %. Pourcentage d'appels résolus sans escalade humaine. En dessous de 50 %, votre ROI s'évapore.
Ces chiffres viennent des benchmarks industriels, mais pour une PME québécoise qui gère 200-400 appels par semaine, ce sont les seuils à ne pas descendre. OpenAI a d'ailleurs mis à jour son API Realtime avec des améliorations de latence qui permettent maintenant à des agents bien configurés de passer sous la barre des 500 ms sur le tour complet — preuve que ces chiffres sont atteignables, pas utopiques.
Le piège final : exigez l'audio, pas seulement le transcript
Dernier conseil, et c'est celui que 90 % des acheteurs oublient : demandez à recevoir l'enregistrement audio de vos 5 tests, pas juste la transcription écrite.
Pourquoi ? Parce que le transcript vous dit ce qui a été dit. L'audio vous dit comment ça a été dit. Les hésitations, le ton robotique, les pauses gênantes, les « heu » de l'agent — tout ça disparaît sur papier. Et c'est exactement ce que vos clients vont ressentir.
Si le vendeur refuse ou dit « on ne garde pas l'audio pour des raisons de confidentialité », c'est un drapeau rouge. Sous la Loi 25, vous avez le droit de recevoir vos propres enregistrements d'appel — c'est même une bonne pratique de gouvernance.
Ce qu'il faut retenir
Une démo de 3 minutes peut cacher 3 mois de production ratée. Les 5 scénarios ci-dessus prennent 12 minutes à jouer, et ils vous disent en direct si le fournisseur est sérieux ou s'il vend du rêve.
Si vous voulez pousser plus loin, on a compilé la liste complète des 10 questions à poser au fournisseur avant de signer. Les 5 scénarios de cet article sont le test live qui complète ces questions — l'un valide le discours, l'autre valide la réalité.
Et surtout : faites ces tests en présence de votre personnel qui va utiliser l'outil. Une réceptionniste qui a écouté l'agent buguer pendant le Scénario 1 aura beaucoup plus de bienveillance pour l'aider à s'améliorer ensuite — et beaucoup moins de surprise quand un client vrai casse le flow.
La différence entre un projet IA qui réussit dans une PME québécoise et un qui échoue, ce n'est pas le budget. C'est la rigueur au moment de la démo.
