Mardi dernier, un propriétaire de garage de Laval a passé 40 minutes au téléphone avec un fournisseur d'agent IA vocal. La conversation a déraillé sur une seule question : « Quel LLM voulez-vous derrière votre agent? GPT-Realtime-2? Gemini 3.1? Claude? Le nouveau Qwen 35 qu'ElevenLabs vient d'ajouter? »
Le proprio a raccroché sans signer. Pas parce que la techno ne l'intéressait pas. Parce qu'on lui demandait de choisir un cerveau pour son agent sans lui expliquer ce que ça change concrètement pour son shop.
Et il a raison de se méfier. Le 12 mai 2026, ElevenLabs a ajouté Gemini 3.1 Pro Preview, Qwen 35-35B-A3B et Qwen 35-397B-A17B à sa liste de LLM disponibles pour les agents vocaux. C'est venu se rajouter à GPT-Realtime-2 (lancé par OpenAI le 7 mai), Claude Sonnet 4.6, Gemini 3.1 Flash, GPT-4o-mini-realtime et la famille Mistral. Résultat : un PME du Québec qui veut un agent IA vocal a maintenant huit cerveaux différents à comparer, chacun avec ses forces, sa facture, et ses pièges.
Ce que ce guide va vous éviter
On ne va pas vous noyer dans des tableaux de benchmarks MMLU-Pro ou des temps « TTFT » mesurés au millième. Les ingénieurs de Softcery ont déjà publié un comparatif de 11 LLM pour les techies anglophones qui hébergent leurs propres GPU H100. Ce guide-là est utile, mais il ne parle pas de vous.
Vous, vous êtes un propriétaire de PME au Québec. Vous gérez entre 200 et 2 000 appels par mois. Vos clients vous parlent en français, parfois en anglais. Vous êtes assujetti à la Loi 25 sur la protection des renseignements personnels. Et votre budget pour automatiser le téléphone tourne autour de 200 à 600 $ CAD par mois.
Voici donc comment choisir, en se basant sur les quatre choses qui comptent vraiment pour votre shop : la latence, la facture mensuelle, le bilinguisme français-anglais, et la conformité Loi 25.
Les huit cerveaux en circulation (et lesquels ignorer tout de suite)
Commençons par la liste complète, telle qu'elle apparaît dans la console ElevenLabs aujourd'hui :
- GPT-Realtime-2 (OpenAI, mai 2026) — raisonnement de classe GPT-5, contexte 128k tokens, supporte les préambules type « un moment, je vérifie ». 32 $/M tokens audio en entrée, 64 $/M en sortie.
- GPT-4o-mini-realtime — l'option économique d'OpenAI, latence très basse.
- Gemini 3.1 Pro Preview (Google, ajouté en mai 2026) — 2 $/M en entrée, 12 $/M en sortie, 124,9 tokens/seconde en sortie. Excellent rapport intelligence/prix.
- Gemini 3.1 Flash-Lite — version express de Google, 0,15 $/M en entrée, idéale pour le très haut volume.
- Claude Sonnet 4.6 (Anthropic) — 3 $/M en entrée, 15 $/M en sortie, latence first-token autour de 1,24 s.
- Qwen 35-35B-A3B (Alibaba, ajouté en mai 2026) — modèle mixture-of-experts, latence streaming sous les 250 ms héritée de Qwen3-Omni Flash.
- Qwen 35-397B-A17B — le grand frère du précédent, raisonnement supérieur, mais plus lent.
- Mistral Large 2 — le choix souveraineté européenne, pertinent surtout si votre clientèle est sensible à l'hébergement hors-USA.
Sur ces huit, deux peuvent être écartés tout de suite pour la grande majorité des PME au Québec : Qwen 35-397B-A17B (le grand modèle) parce que sa latence pour le voice est trop élevée pour respecter la règle des 800 ms qui détermine si vos clients raccrochent; et Mistral Large 2, qui n'apporte pas grand-chose si vos données restent au Canada (votre fournisseur peut déjà héberger Claude ou Gemini sur AWS Canada Central).
Reste six candidats sérieux. Voyons quel cerveau colle à quel type de shop.
Restaurant 80 réservations par jour : Gemini 3.1 Flash-Lite ou GPT-4o-mini-realtime
Un restaurant qui prend 80 réservations par jour, c'est environ 2 400 appels par mois. La moitié sont expédiés en moins de 90 secondes (« table pour deux, 19h, vendredi »). L'autre moitié dépasse rarement les 3 minutes (modifications, annulations, questions sur le menu).
Ce type d'appel ne demande pas de raisonnement profond. Il demande de la vitesse, de l'écoute active, et la capacité de comprendre « la table près de la fenêtre, comme la dernière fois » sans pédaler. Pour ça, Gemini 3.1 Flash-Lite à 0,15 $/M tokens entrée fait le travail pour environ 90 à 130 $ CAD/mois côté LLM. GPT-4o-mini-realtime est dans la même fourchette, avec un léger avantage sur la gestion des interruptions (le client qui coupe l'agent pour préciser « finalement, on sera quatre »).
Le piège ici : prendre Claude Sonnet 4.6 ou GPT-Realtime-2 parce qu'on vous a vendu « la meilleure qualité ». Sur 2 400 appels/mois, la différence de facture entre Flash-Lite et Sonnet 4.6 peut atteindre 400 $ CAD/mois. Pour zéro bénéfice perçu par votre clientèle, qui veut juste réserver une table.
Clinique avec triage des urgences : GPT-Realtime-2 ou Claude Sonnet 4.6
Une clinique dentaire ou médicale, c'est une autre game. Quand un patient appelle pour dire « j'ai mal depuis hier soir, ça lance jusque dans l'oreille », votre agent doit faire trois choses en moins de 800 ms : reconnaître les mots-clés d'urgence, poser deux questions de triage (depuis quand exactement? avez-vous de la fièvre?), et décider s'il transfère, s'il prend un rendez-vous d'urgence, ou s'il programme un rappel du Dr.
Cette décision-là demande du raisonnement. Pas du « générer du texte fluide », du raisonnement clinique léger. Deux LLM dominent ce cas d'usage : GPT-Realtime-2 (raisonnement classe GPT-5, supporte les préambules type « un instant, je vérifie l'horaire de Dre Tremblay ») et Claude Sonnet 4.6 (réputation établie sur la nuance et la prudence dans les contextes médicaux).
Sur 600 appels/mois avec une moyenne de 3 minutes, la facture LLM tourne autour de 180 à 280 $ CAD/mois pour GPT-Realtime-2, et 250 à 350 $ pour Claude Sonnet 4.6. C'est plus cher que le restaurant, mais c'est de l'argent bien placé : un mauvais triage d'urgence dentaire qui se transforme en visite à l'hôpital, c'est un patient perdu pour les dix prochaines années.
Garage qui fait des devis détaillés : Claude Sonnet 4.6 (sans hésiter)
Le garagiste qui veut un agent capable de demander « bruit constant ou par à-coups? quand vous accélérez ou quand vous freinez? combien de kilomètres au compteur? », puis de proposer une fourchette de coût et de réserver le lift pour mardi matin — celui-là a besoin d'un cerveau qui suit un fil de conversation long sans perdre le contexte.
Claude Sonnet 4.6 est calibré pour ça. Sa fenêtre contextuelle, sa capacité à garder le fil après plusieurs détours, et la qualité de ses paraphrases en français québécois (« vous voulez dire que ça cogne juste quand vous virez à gauche? ») en font le choix par défaut pour les conversations consultatives.
Le coût? Sur 400 appels/mois de 5 minutes en moyenne, comptez 220 à 320 $ CAD/mois. Si vous voulez creuser le calcul, on a publié la formule en 5 étapes pour calculer le ROI d'un agent IA vocal au Québec.
Salon de beauté avec rappels et bilinguisme : Gemini 3.1 Pro Preview
Salon de coiffure, esthétique, spa — clientèle souvent à 60-70 % francophone, 30-40 % anglophone à Montréal, parfois plus complexe en banlieue. L'agent doit basculer du français à l'anglais sans pédaler, gérer des rappels (« votre rendez-vous est demain à 14h, voulez-vous le confirmer ou le déplacer? »), et offrir des produits complémentaires sans paraître insistant.
Gemini 3.1 Pro Preview brille ici. 124,9 tokens/seconde en sortie, prix raisonnable (2 $ et 12 $/M), et un comportement multilingue solide grâce à son entraînement sur un corpus Google. Selon l'analyse d'Artificial Analysis, il dépasse la médiane des modèles de raisonnement de sa catégorie sur la vitesse.
Les quatre chiffres qui devraient guider votre décision (pas les benchmarks)
Avant de signer avec n'importe qui, posez ces quatre questions à votre fournisseur. Sans les bonnes réponses ici, le choix du LLM n'a plus d'importance.
1. Latence end-to-end sous 800 ms? C'est le seuil au-delà duquel 40 % des clients perçoivent que ça « rame » et raccrochent. Demandez à voir une démo enregistrée avec timestamp.
2. Le LLM est-il hébergé sur AWS Canada Central ou Azure Canada East? Si la réponse est « non, c'est aux États-Unis », la conformité à la Loi 25 devient compliquée. Le fournisseur doit pouvoir justifier le transfert de données vers un pays tiers.
3. Quelle est la facture LLM seule sur votre volume mensuel projeté? Le piège classique : un fournisseur quote « 0,15 $/minute » sans préciser ce qui est inclus. Demandez la décomposition : STT, LLM, TTS, transport SIP, hébergement, support. Le LLM représente typiquement 30 à 50 % du coût total.
4. Que se passe-t-il si OpenAI ou Anthropic change ses prix ou déprécié son modèle? En mai 2026 seulement, OpenAI a annoncé GPT-Realtime-2 et déprécié l'ancienne Realtime API Beta. Si votre agent est verrouillé sur un modèle, vous êtes vulnérable. Un bon fournisseur peut basculer entre LLM en quelques minutes sans casser votre flow.
Les trois pièges qui font perdre 6 à 12 mois à une PME du Québec
Premier piège : choisir le « meilleur » LLM au lieu du bon. Claude Opus 4.7 trône en haut des classements LMArena, mais à 15 $/M tokens en entrée, c'est financièrement absurde pour un agent qui prend des réservations de resto.
Deuxième piège : se faire vendre un agent « propulsé par GPT-5 » sans pouvoir changer de cerveau. C'est l'équivalent d'acheter un char avec le capot soudé.
Troisième piège : oublier que l'intégration n'est pas un acte technique isolé. Brancher un LLM sur votre logiciel de prise de rendez-vous, votre CRM, votre fiche client — c'est là que se cache 70 % du travail. Chez TECHMA, c'est notre équipe qui s'occupe de l'intégration complète au profit du client; jamais en libre-service. C'est ce qui fait la différence entre un agent qui « parle bien » et un agent qui « travaille bien ».
Notre recommandation par profil, en une phrase
Si vous tenez 80 % de vos appels en moins de 3 minutes et que votre volume dépasse 1 500 appels/mois : Gemini 3.1 Flash-Lite.
Si vos appels demandent du triage, du raisonnement ou de la nuance médicale/juridique : GPT-Realtime-2 ou Claude Sonnet 4.6.
Si vos appels sont longs, consultatifs, et nécessitent de garder le fil sur 5+ minutes : Claude Sonnet 4.6.
Si votre clientèle est bilingue FR/EN à parts égales : Gemini 3.1 Pro Preview.
Si vous voulez tester quelque chose de neuf et que votre fournisseur le supporte : Qwen 35-35B-A3B, avec une latence streaming impressionnante héritée de la famille Qwen3-Omni.
Et maintenant?
Le choix du LLM n'est qu'une des 12 décisions à prendre quand vous déployez un agent IA vocal. La latence cible, l'architecture FR/EN, l'intégration CRM, les heures de bascule vers un humain, les scripts de fallback, la conformité Loi 25 — chacune mérite sa propre conversation.
Chez Agent IA Vocal, on fait cette analyse avec vous sur un appel de 30 minutes. Pas pour vous vendre, pour vous donner un avis honnête sur le cerveau qui collerait à votre shop. Si on n'est pas le bon fit, on vous le dit aussi.
Parce qu'au final, le bon LLM n'est pas celui qui a le plus de paramètres ou qui domine les classements. C'est celui qui décroche au premier coup, comprend votre client du premier essai, et termine la conversation par un rendez-vous confirmé dans votre calendrier.
