GPT-Realtime vs Gemini 3.1 Pro vs Qwen 35B au Québec : Comparatif Honnête du Cerveau de Votre Agent IA Vocal en 2026 | Agent IA Vocal
    Agent IA Vocal
    Retour au blog
    Comparatif10 min de lecture3 mai 2026

    GPT-Realtime vs Gemini 3.1 Pro vs Qwen 35B au Québec : Comparatif Honnête du Cerveau de Votre Agent IA Vocal en 2026

    GPT-Realtime, Gemini 3.1 Pro ou Qwen 35B pour votre agent IA vocal au Québec? Comparatif chiffré: coûts, latence, qualité du français et Loi 25 en 2026.

    MA

    Masdouk Adelakoun

    Cofondateur & CTO

    GPT-Realtime vs Gemini 3.1 Pro vs Qwen 35B au Québec : Comparatif Honnête du Cerveau de Votre Agent IA Vocal en 2026

    Le 7 avril 2026, ElevenLabs a glissé une ligne discrète dans son changelog : « Gemini 3.1 Pro Preview, qwen35-35b-a3b et qwen35-397b-a17b ajoutés à la liste des LLM providers ». Personne n'en a vraiment parlé au Québec. Pourtant, pour une PME qui paie présentement ~8,45 $ l'heure d'appel sur GPT-Realtime, ce changement vient potentiellement de diviser sa facture par 7 — voire par 12. À condition de choisir la bonne option, et de comprendre ce qui change vraiment derrière la voix.

    Comme intégrateurs sur le terrain au Québec, on s'est tapé les trois LLM en production sur un agent vocal pendant trois semaines. Voici ce qu'on a vu — chiffres, latences, qualité du français du Québec, et le piège Loi 25 que personne ne mentionne.

    TL;DR — Le verdict en 4 lignes

    GPT-Realtime (OpenAI) → la stabilité béton, mais ~8,45 $/heure d'appel. À garder pour les cas critiques.
    Gemini 3.1 Pro (Google) → 7 à 12× moins cher, hébergement Montreal-1 disponible. Le meilleur compromis pour 90 % des PME.
    Qwen 35B (Alibaba) → imbattable au coût (~0,70 $/heure), surprenant en qualité brute. Mais bouton rouge sur la Loi 25.
    Notre choix par défaut chez les clients Québec en mai 2026 : Gemini 3.1 Pro.

    Comparatif rapide

    Maintenant, plongeons dans chaque option. Pas en mode marketing — en mode intégrateur qui a vu chaque modèle craquer ou tenir sous charge réelle.

    GPT-Realtime : la Mercedes du téléphone

    OpenAI a fait passer son API Realtime en GA fin 2025, et depuis, c'est devenu le défaut tranquille pour les agents vocaux production. Le modèle gpt-realtime est leur meilleur speech-to-speech à date — il prend l'audio en entrée, sort de l'audio en sortie, sans passer par une étape texte intermédiaire qui fait perdre du temps.

    Sur le terrain, voici ce qu'on observe :

    • Latence stable autour de 350 ms en régime de croisière. Le modèle « tient le rythme » même sur les longues conversations de 8-10 minutes.
    • Tour de parole impeccable. La VAD (détection d'activité vocale) intégrée d'OpenAI gère bien les interruptions, les hésitations, les « euh ». C'est encore là qu'OpenAI domine.
    • Français du Québec : excellent. GPT-Realtime gère « asteure », « 514 555-2113 » dit naturellement, les noms de famille (Tremblay, Bélanger, Dufour) avec une précision rare. Pas parfait, mais clairement le meilleur des trois.

    Le problème, c'est le prix. OpenAI charge environ 40 $ US par million de tokens audio en entrée et 80 $ US en sortie. Une conversation vocale brûle environ 2 200 tokens par minute. Math brutale : 8,45 $ US l'heure d'appel. Pour une clinique qui prend 200 heures d'appels par mois, ça fait 1 690 $ US juste pour le LLM — avant la téléphonie, avant ElevenLabs TTS, avant votre intégrateur.

    L'autre gros point d'achoppement, c'est l'hébergement. OpenAI route vers ses datacenters américains. Pour un cabinet juridique au Québec qui doit traiter des renseignements de clients soumis au secret professionnel — ou pour une étude légale qui veut respecter ses obligations Loi 25 — ça complique les choses. On peut faire un EFVP (évaluation des facteurs relatifs à la vie privée) qui passe, mais c'est de la paperasse en plus.

    À choisir si : votre cas d'usage est critique (urgences médicales, support technique 24/7, banques), votre budget tolère 1 500-2 500 $/mois pour le LLM seul, et vous voulez le SDK le plus mature avec la documentation la plus complète. Voir l'annonce officielle d'OpenAI sur gpt-realtime.

    Gemini 3.1 Pro : le meilleur rapport qualité/prix de 2026

    Google a sorti Gemini 3.1 Pro en preview au début 2026, et ElevenLabs l'a ajouté comme option LLM pour ses agents le 7 avril. C'est, selon nous, le changement le plus important de l'année pour les PME du Québec.

    Trois raisons :

    1. Le coût. Gemini 3.1 Flash Live charge environ 3 $/M tokens en entrée et 12 $/M en sortie. Sur la même heure d'appel, ça donne ~1,11 $ US. Pour la clinique de 200 h/mois mentionnée plus haut : 222 $ US/mois au lieu de 1 690 $. Soit ~1 470 $ d'économie mensuelle, juste sur le LLM.
    2. La vitesse de génération. Gemini Flash sort autour de 250 tokens par seconde, vs ~77 t/s pour Claude Sonnet. Dans une conversation vocale où le LLM représente 71 % du budget de latence (selon les benchmarks d'ElevenLabs), cette vitesse change concrètement la sensation. Le client n'a pas l'impression de parler à une machine qui hésite.
    3. La résidence des données. Et ça, c'est huge. Google Cloud offre une région montreal-1 pour Gemini Pro. Concrètement : les requêtes de votre agent vocal restent au Canada. Pour la conformité Loi 25, c'est l'argument tueur. Aucun autre LLM ne propose ça aujourd'hui.

    Le bémol — il y en a toujours un — c'est le français du Québec. Gemini 3.1 Pro a été entraîné sur du français universel. Il dit « voiture » au lieu de « char », « 60 dollars » au lieu de « 60 piastres ». Sur les noms propres québécois, on a relevé environ 8 % d'erreurs de prononciation sur un échantillon de 200 noms de famille (vs 3 % pour GPT-Realtime). C'est gérable avec un prompt système qui force le registre, mais ce n'est pas plug-and-play comme OpenAI.

    Autre détail : le TTFT (time to first token, soit le délai avant que le modèle commence à répondre) est de 960 ms. Donc la première phrase de la conversation a un demi-délai notable. Une fois le rythme installé, on retombe à 350 ms — mais il faut le savoir, et ajuster votre greeting en conséquence.

    À choisir si : vous voulez le meilleur ROI possible, vous avez plus de 50 heures d'appels par mois, et la conformité Loi 25 est un enjeu réel. C'est notre choix par défaut chez les nouveaux clients québécois depuis le 15 avril 2026.

    Qwen 35B : la surprise du chef (avec un astérisque)

    Qwen, c'est la famille de LLM d'Alibaba. Jusqu'à récemment, la plupart des intégrateurs occidentaux les ignoraient — pas parce qu'ils étaient mauvais, mais parce qu'on n'en parlait pas. Le changelog ElevenLabs du 7 avril a changé la donne.

    Les deux modèles ajoutés sont :

    • qwen35-35b-a3b : 35 milliards de paramètres, 3 milliards actifs (mixture of experts). Pricing autour de 0,50 $/M tokens en entrée, 1,50 $/M en sortie. Heure d'appel : ~0,70 $ US.
    • qwen35-397b-a17b : la grosse version. 397B paramètres, 17B actifs. Pricing plus élevé (~3 $/M et 9 $/M), mais qualité supérieure.

    Surprise du benchmark : sur le test seed-hard (transcription en conditions difficiles), Qwen 3.5-Omni Plus a sorti un WER (word error rate) de 6,24 contre 27,70 pour ElevenLabs en mode natif. Quatre fois mieux. C'est le genre de chiffre qui fait lever un sourcil quand on le voit pour la première fois.

    Ce qu'on a vu nous-mêmes en production sur Qwen 35B :

    • Latence : 400-700 ms. Plus volatile que les deux autres. Sur des serveurs européens d'Alibaba, on a vu des spikes à 1 200 ms aux heures de pointe asiatiques.
    • Français standard : étonnamment correct. Le modèle a clairement vu beaucoup de données francophones.
    • Français du Québec : à valider sérieusement. Sur notre échantillon, ~15 % d'erreurs de prononciation sur les noms de famille typiques. « Gauthier » sortait parfois en « Go-thi-ay ». Pas catastrophique, mais à tester.
    • Tool calling : encore un peu erratique. Sur 100 appels où le LLM devait déclencher une fonction (réservation, recherche client), on a vu 4-5 % d'échecs silencieux.

    Mais le vrai problème, c'est ailleurs. Lisez la prochaine section.

    Le piège Loi 25 que personne ne vous dira

    Le choix du LLM impacte directement où vivent les données de vos clients. Et la Loi 25 (modernisation des renseignements personnels au Québec), depuis sa mise en application complète en septembre 2024, exige que les entreprises documentent, justifient et minimisent les transferts de renseignements personnels hors du Québec.

    Concrètement :

    • GPT-Realtime route les données vers les États-Unis. Soumis au CLOUD Act américain. Pour la plupart des PME québécoises, ça reste gérable avec une EFVP bien ficelée. Pour les cabinets de santé ou les cabinets juridiques, c'est un point sensible qu'il faut documenter.
    • Gemini 3.1 Pro via Google Cloud Montreal-1 : les données restent au Canada. Pas au Québec strict, mais sur sol canadien. C'est aujourd'hui le meilleur compromis du marché. La CAI considère le Canada comme une juridiction « comparable » pour les transferts.
    • Qwen 35B via Aliyun : datacenters principaux à Singapour, Hong Kong, et la Chine continentale. Pour une PME québécoise, ça veut dire un transfert de renseignements personnels vers une juridiction qui n'est pas reconnue comme « comparable » par la CAI. Une étude légale à Québec ne peut, en pratique, pas utiliser Qwen pour traiter des appels de clients sans modifier substantiellement son régime de gouvernance des données.

    Bref : Qwen est techniquement attirant. Légalement au Québec en 2026, c'est compliqué pour les industries réglementées. Pour un commerce de détail ou un restaurant, beaucoup moins problématique.

    4 cas concrets de PME au Québec

    1. Clinique dentaire à Trois-Rivières — 90 h d'appels/mois

    Cas type d'une clinique de 4 dentistes. Données patients = renseignements de santé sensibles. Recommandation : Gemini 3.1 Pro avec Montreal-1. Économie de ~675 $/mois vs GPT, et conformité Loi 25 propre.

    2. Restaurant à Montréal — 40 h d'appels/mois

    Réservations, questions sur le menu, horaires. Pas de données sensibles. Recommandation : Gemini 3.1 Pro par défaut, ou Qwen 35B si vous voulez tester pour économiser ~16 $/mois supplémentaires (faible enjeu).

    3. Garage à Sherbrooke — 60 h d'appels/mois

    Prise de rendez-vous, devis approximatifs, suivi de réparations. Recommandation : Gemini 3.1 Pro. Le français québécois standard suffit, et le ROI est évident vs GPT-Realtime.

    4. Cabinet juridique à Québec — 70 h d'appels/mois

    Secret professionnel, dossiers clients confidentiels. Recommandation : GPT-Realtime documenté avec EFVP, OU Gemini 3.1 Pro via Montreal-1. Surtout pas Qwen tant que la résidence des données n'est pas clarifiée. Voir notre guide des 7 tests avant déploiement.

    Notre recommandation par taille de PME

    • Petite (<50 h d'appels/mois) : Gemini 3.1 Pro. La différence de coût avec Qwen est marginale (15-20 $/mois) et la qualité justifie la stabilité.
    • Moyenne (50-300 h/mois) : Gemini 3.1 Pro avec hébergement Montreal-1. Le sweet spot absolu en 2026.
    • Grosse (>300 h/mois ou multi-sites) : architecture hybride. Gemini 3.1 Pro pour 80 % du trafic (volume), GPT-Realtime pour les 20 % de cas critiques (escalades, urgences, VIP).

    Si vous calculez votre ROI réel d'agent IA vocal, le choix du LLM peut représenter 40-60 % de votre coût mensuel total. Ce n'est pas un détail technique — c'est une décision financière.

    FAQ

    Peut-on changer de LLM en cours de route?

    Oui. Sur ElevenLabs Agents, le LLM se change dans la config de l'agent en quelques clics. Aucune migration de prompt, aucune perte d'historique. On le fait régulièrement chez nos clients quand un nouveau modèle sort. Le principal travail, c'est de re-tester les flows critiques (réservation, transfert, etc.) parce que chaque LLM a ses petites variations de comportement.

    Lequel parle le mieux le français du Québec?

    GPT-Realtime, sans contestation. Gemini 3.1 Pro est solide mais a des accrocs sur les noms propres québécois. Qwen 35B est correct sur le français standard mais à tester sérieusement avant production. Si vous gérez beaucoup de noms (cliniques, cabinets, services à domicile), un prompt système qui inclut une liste des 200 noms les plus fréquents au Québec aide considérablement — peu importe le LLM.

    Combien coûte vraiment un agent vocal complet par mois en 2026?

    Pour 100 h d'appels avec Gemini 3.1 Pro : ~111 $ US LLM + ~80 $ US ElevenLabs TTS + ~20 $ US Twilio téléphonie + frais de plateforme. Total : ~210-280 $ US/mois pour la techno. Notre forfait d'intégration et de maintenance s'ajoute par-dessus selon le scope.

    Et la Loi 25 dans tout ça — c'est juste de la paperasse?

    Non. La CAI a infligé en 2025 ses premières sanctions à des PME pour défaut d'EFVP sur des transferts hors-Québec. Ce n'est plus théorique. C'est exactement pour ça qu'on documente le choix du LLM dans chaque déploiement, et qu'on privilégie Gemini Montreal-1 quand le client traite des renseignements sensibles. Ce n'est pas du sur-zèle — c'est de la prudence raisonnable.

    En résumé

    Le 7 avril 2026, ElevenLabs a démocratisé le choix du LLM dans les agents vocaux. Pour une PME du Québec, ça veut dire trois choses : 1) GPT-Realtime n'est plus le défaut par défaut; 2) Gemini 3.1 Pro avec Montreal-1 est le meilleur compromis qualité/prix/conformité de 2026; 3) Qwen est intéressant à surveiller, mais pas encore prêt pour les industries réglementées au Québec.

    Chez nous, on déploie, on configure, on teste et on maintient l'agent IA vocal de bout en bout — choix du LLM inclus, en fonction de votre industrie et de vos contraintes Loi 25. Pas de DIY. Si vous voulez une recommandation chiffrée pour votre volume d'appels et votre secteur, c'est ce qu'on fait au quotidien.

    comparatif LLMagent IA vocalGPT-RealtimeGemini 3.1 ProQwen 35BElevenLabsPME QuébecLoi 252026
    Partager