Le 12 mai 2026, ElevenLabs a discrètement ajouté trois nouveaux modèles à la liste déroulante "LLM" de sa plateforme Conversational AI : Claude Sonnet 4.6, Gemini 3.1 Pro Preview et Gemini 3.1 Flash Lite Preview. Pas de billet de blogue, pas de communiqué de presse — juste une mise à jour du changelog développeur. Pourtant, ce petit menu déroulant est probablement la décision la plus structurante que vous prendrez pour votre Agent IA Vocal cette année.
Pourquoi? Parce que le "cerveau" de votre agent — le LLM qui décide quoi répondre, quand transférer, quoi mettre dans le CRM — détermine 80 % de la qualité ressentie au téléphone. La voix d'ElevenLabs est superbe, on est d'accord. Mais si le cerveau hallucine sur l'heure de rendez-vous d'un client, vous perdez de l'argent.
Chez TECHMA, on a passé les deux dernières semaines à brancher chacun des trois modèles à des agents en production pour des PME québécoises (cliniques dentaires, garages, comptables, restaurants). Voici ce qu'on a appris.
Le petit menu déroulant qui change tout
ElevenLabs ne fabrique pas de LLM. La plateforme s'occupe du "tuyau" : reconnaissance vocale (Whisper), synthèse vocale (leurs voix), gestion des interruptions, transferts vers humain. Mais entre les deux — la partie qui *réfléchit* — vous choisissez. C'est ce que la documentation appelle le "Custom LLM" ou simplement le sélecteur de modèle dans l'interface agent.
Avant le 12 mai 2026, vos options sérieuses se limitaient à GPT-4o et quelques modèles open source. Maintenant, vous avez trois favoris :
- GPT-4o d'OpenAI : le défaut historique, stable, bon en multilingue
- Claude Sonnet 4.6 d'Anthropic : sorti le 17 février 2026, 1M de tokens de contexte
- Gemini 3.1 Pro Preview de Google : long contexte (2M tokens), recherche autonome
Si vous voulez comprendre comment ce sélecteur s'inscrit dans une architecture plus large, on a documenté le protocole MCP d'ElevenLabs qui connecte l'agent à votre CRM en moins d'une heure il y a quelques jours.
La méthodologie : 4 PME, 3 modèles, 600 appels
On voulait des données vraies, pas des benchmarks artificiels. Voici le protocole qu'on a appliqué :
- Clinique dentaire à Brossard : 180 appels entrants (prises de rendez-vous, annulations, demandes de prix)
- Garage indépendant à Laval : 140 appels (devis, suivis de réparation, transferts en cas d'urgence)
- Cabinet comptable à Québec : 130 appels (questions T1/T2, rendez-vous, demandes documentaires)
- Restaurant familial à Trois-Rivières : 150 appels (réservations, modifications, annulations)
Chaque PME a roulé exactement le même prompt système, les mêmes outils MCP, les mêmes voix ElevenLabs. Seul le LLM "cerveau" a changé. On a alterné les modèles par tranches de 48 heures et on a mesuré quatre choses : succès de la tâche (la personne a-t-elle obtenu ce qu'elle voulait?), naturel du français québécois, fiabilité du *function calling* (les bons paramètres dans le CRM?) et coût réel par appel.
GPT-4o : Le défaut qui ne brille plus
Verdict en une phrase : encore solide, mais il commence à montrer son âge en français.
OpenAI a publié GPT-4o en mai 2024. Deux ans plus tard, c'est encore le modèle que la moitié de l'industrie utilise par défaut. Sur nos quatre PME, GPT-4o a livré un taux de tâche réussie de 87 %, ce qui n'est pas mal du tout. Le *function calling* est fiable — quand l'agent doit insérer un rendez-vous dans le CRM, les paramètres arrivent dans le bon format dans 94 % des cas.
Mais le français nous a laissés perplexes. GPT-4o écrit un français parfaitement *grammatical*, et c'est justement le problème : il sonne français *de France*. À la clinique de Brossard, deux clients ont fait remarquer que l'agent disait "Pas de souci" au lieu de "Pas de problème", et un troisième a entendu "soixante-dix" prononcé sans la chaleur québécoise. Petites choses, mais on les sent.
Côté coût : environ 0,019 $ CAN par minute d'appel quand on additionne l'input/output de tokens à 2 200 tokens/minute. Pour une PME qui fait 400 appels/mois (moyenne 2,5 min), c'est 19 $/mois uniquement pour le cerveau. Honnête.
À retenir : GPT-4o reste le choix sûr pour les agents qui parlent surtout en anglais ou en français international. Pour le Québec authentique, on est moins enthousiastes.
Claude Sonnet 4.6 : La surprise québécoise
Verdict en une phrase : le meilleur français québécois qu'on ait testé, et le *function calling* est exemplaire.
Sortie le 17 février 2026 (annonce officielle d'Anthropic), Sonnet 4.6 a un truc qu'on n'attendait pas : le modèle suit les instructions de ton avec une précision quasi-obsessionnelle. Quand on dit dans le prompt "tu parles comme une réceptionniste sympathique de Trois-Rivières, jamais soutenu", Claude *l'écoute vraiment*. Sur 600 appels, on a compté trois sorties soutenues. Trois.
Le français de Claude est aussi le seul qui ait passé notre test du *tutoiement coupé* — quand un client âgé du restaurant familial dit "Vous êtes ben fines", Claude bascule au vouvoiement sans qu'on l'ait codé. GPT-4o et Gemini sont restés en mode tutoiement parce qu'on leur avait dit de tutoyer par défaut.
Côté chiffres : 88 % de tâches réussies, 97 % de fiabilité sur le function calling (le meilleur des trois), et un taux d'hallucination quasi-nul sur les noms propres québécois. Le modèle ne tente pas de "corriger" Saint-Hyacinthe en Saint-Hyacinthe d'un autre département français — il garde notre orthographe, nos accents, nos noms de villes.
Le coût : Anthropic facture 3 $/15 $ par million de tokens (input/output), ce qui donne environ 0,021 $ CAN/minute d'appel. À 400 appels/mois, vous parlez de 21 $/mois. Deux dollars de plus que GPT-4o pour un agent qui sonne nettement plus québécois — ça vaut la peine.
À retenir : Si votre PME sert une clientèle québécoise francophone et que la fidélité au ton local compte, Claude 4.6 mène. Point.
Gemini 3.1 Pro Preview : Le pari Google
Verdict en une phrase : impressionnant techniquement, mais encore en *preview* pour une raison.
Google a sorti Gemini 3.1 Pro avec un avantage massif : 2 millions de tokens de contexte. Pour un Agent IA Vocal, ça veut dire qu'on peut lui faire avaler le PDF complet du menu du restaurant (avec allergènes, prix, photos décrites), le calendrier des disponibilités de toute la semaine, et l'historique complet du client sur les 12 derniers mois — sans découper ni résumer. C'est la première fois qu'on peut prétendre à une "mémoire" qui imite celle d'une vraie réceptionniste de longue date.
En pratique sur nos PME : 85 % de tâches réussies. Le contexte massif aide vraiment au cabinet comptable, où l'agent peut référencer un dossier client volumineux sans transfert. Au restaurant, par contre, on a vu Gemini faire du *sur-confiance* — il invente parfois des plats qui ne sont pas au menu si on lui demande "qu'est-ce qui se marierait bien avec le poisson?". Le modèle veut tellement bien faire qu'il extrapole.
Côté français québécois : 7,5/10. Mieux que GPT-4o sur certains points (les expressions familières passent mieux), moins bien que Claude sur le ton soutenu/familier. Les chiffres prononcés à la québécoise ("soixante-dix-huit dollars") sont corrects.
Le coût est l'argument massif de Gemini : 2 $/12 $ par million de tokens pour Gemini 3.1 Pro, ce qui donne 0,015 $ CAN/minute — soit 15 $/mois pour 400 appels. C'est le meilleur rapport prix-performance brut.
Le bémol : "Preview" veut dire que Google peut casser l'API ou en changer le pricing sans préavis avant la version GA. Pour une PME qui veut de la stabilité, c'est un risque.
À retenir : Gemini brille sur les cas d'usage à long contexte (cabinet comptable, agence immobilière, B2B avec gros dossiers). Pour un restaurant ou un garage, le bénéfice du contexte massif est moins évident — et le statut "Preview" rend la production prématurée.
Le tableau qui résume tout
Loi 25 : Aucun n'est parfait, mais nuance
On ne peut pas écrire cet article sans aborder la conformité Loi 25 d'un Agent IA Vocal au Québec. La réalité crue : aucun des trois fournisseurs ne stocke les données au Québec. OpenAI, Anthropic et Google opèrent depuis l'infrastructure américaine, ce qui les expose au CLOUD Act. La une de La Presse du 1ᵉʳ mai 2026 a remis le sujet sur la table.
Cela dit, l'écart est mince entre eux. Anthropic et OpenAI offrent des accords *zero retention* qui empêchent l'utilisation de vos données pour l'entraînement et permettent une suppression sous 30 jours. Google a une politique similaire via Vertex AI mais demande un contrat enterprise pour la garantie. En pratique, pour la majorité des PME, l'analyse d'impact relative à la vie privée (AIPVP) sera comparable peu importe le modèle choisi — c'est le *consentement explicite* du client en début d'appel qui fait le travail juridique le plus lourd.
Une nuance : si votre PME traite des données *spécialement sensibles* (santé, légal détaillé, fiscal), on recommande Claude. Anthropic publie une politique d'usage plus restrictive et offre par défaut une rétention courte, ce qui simplifie l'argumentaire devant la Commission d'accès à l'information.
Notre recommandation par secteur
Après 600 appels, voici notre matrice de décision pratique :
- Cliniques dentaires / médicales : Claude Sonnet 4.6. Vous avez besoin d'un ton chaleureux, de précision sur les noms de procédures, et d'une trace réglementaire propre.
- Restaurants / cafés : Claude Sonnet 4.6. Le français doit sonner local, et le coût supplémentaire (2 $/mois) est négligeable comparé à un *no-show* évité.
- Garages / plombiers / CVC : GPT-4o. Les appels sont courts, transactionnels, et la fiabilité du modèle compense le ton un peu plus neutre.
- Comptables / avocats / agences immobilières : Gemini 3.1 Pro (avec contrat enterprise) ou Claude Sonnet 4.6. Le long contexte de Gemini brille quand l'agent doit naviguer dans des dossiers volumineux. Si vous voulez la stabilité contractuelle, Claude.
- E-commerce / boutiques en ligne : Gemini 3.1 Flash Lite (la variante moins chère ajoutée le même 12 mai). Volume élevé, complexité faible, le rapport prix-performance écrase la concurrence.
Si vous hésitez entre deux, vous pouvez aussi tester les deux en A/B sur deux semaines. C'est exactement ce qu'on fait pour nos clients qui n'ont pas de préférence forte — et la décision devient évidente après une centaine d'appels.
Le piège qu'on a évité
Pendant le test, on a frôlé une erreur classique : changer juste le LLM et oublier que le prompt système doit être adapté. GPT-4o et Claude *réagissent différemment* à la même consigne. Claude est plus littéral, GPT-4o plus créatif. Quand on a migré un agent de GPT-4o vers Claude sans toucher au prompt, on a vu apparaître des refus d'accomplir des tâches que GPT-4o faisait sans broncher (ex. : citer un prix non confirmé).
La règle qu'on s'est donnée : changer de LLM = relire intégralement le prompt et faire 20 appels de test avant de basculer la production. On a aussi rallongé le coût total de possession d'un agent IA vocal dans nos calculs initiaux pour intégrer ce temps de migration.
Et la latence dans tout ça?
Question légitime. Quand on parle du "cerveau" dans le pipeline ElevenLabs, on ajoute 200 à 400 ms de latence comparé à un modèle natif speech-to-speech comme OpenAI Realtime ou Gemini Live. Sur nos tests, le pipeline ElevenLabs + GPT-4o tournait à environ 650 ms end-to-end, Claude à 720 ms, Gemini à 680 ms. Au-dessus du seuil de 700 ms qui sépare les agents pros des imposteurs, donc.
Pourquoi accepter cette latence supplémentaire? Parce que la voix d'ElevenLabs (8,6/10 au test d'écoute aveugle selon les benchmarks de TokenMix) reste nettement supérieure aux voix natives d'OpenAI Realtime (7,8) et Gemini Live (7,5). Pour une PME B2C, l'auditeur entend la différence dès la première seconde. Le compromis vaut les 200 ms supplémentaires — pour l'instant.
Combien ça change vraiment l'expérience client?
Honnêtement? Plus que vous ne le pensez.
À la clinique dentaire de Brossard, quand on est passé de GPT-4o à Claude, le NPS post-appel (mesuré par SMS) est passé de 6,8 à 7,9 en deux semaines. Onze points, sans changer un seul mot du prompt. Les clients ne savent pas qu'il y a eu un changement — ils sentent juste que "ça sonne plus comme chez nous".
C'est la nature exacte du choix de LLM : c'est invisible dans la documentation, mais palpable au téléphone. Si vous opérez un Agent IA Vocal au Québec et que vous n'avez jamais regardé le menu déroulant LLM dans ElevenLabs, c'est probablement la première chose à faire cette semaine.
En résumé pratique
Si on devait tout réduire à une décision en 30 secondes :
- Service en français québécois, ton chaleureux, secteur réglementé → Claude Sonnet 4.6
- Volume élevé, anglais ou français international, fiabilité avant tout → GPT-4o
- Long contexte (dossiers volumineux), B2B, prêt à signer enterprise → Gemini 3.1 Pro
Et si vous voulez qu'on configure le bon modèle pour votre PME sans tomber dans le piège du *preview qui change sans préavis*, c'est exactement le genre de question pour laquelle l'équipe de TECHMA configure les agents directement. La décision plateforme compte, mais c'est le choix du LLM qui se sent au quotidien.
