5 Mises à Jour ElevenLabs du Printemps 2026 que Votre PME au Québec Doit Connaître | Agent IA Vocal
    Agent IA Vocal
    Retour au blog
    Listicle7 min de lecture7 mai 2026

    5 Mises à Jour ElevenLabs du Printemps 2026 que Votre PME au Québec Doit Connaître

    ElevenLabs vient de livrer 5 nouveautés majeures au printemps 2026 — Gemini 3.1 Pro, templates, multimodal. Voici ce que ça change pour votre PME au Québec.

    MA

    Masdouk Adelakoun

    Cofondateur & CTO

    5 Mises à Jour ElevenLabs du Printemps 2026 que Votre PME au Québec Doit Connaître

    Si vous gérez une PME au Québec et que votre Agent IA Vocal tourne sur ElevenLabs, vous avez probablement remarqué que le tableau de bord change un peu chaque semaine. Ce n'est pas votre imagination. Entre la fin mars et le début mai 2026, ElevenLabs a livré une cascade de mises à jour — certaines techniques, d'autres complètement transformatrices pour les petites équipes qui n'ont pas trois développeurs à temps plein.

    Petit rappel de contexte avant de plonger : ElevenLabs vient de franchir 500 M$ de revenu annualisé, avec NVIDIA, BlackRock et Wellington Management dans son tour d'investisseurs récent. Concrètement, ça veut dire deux choses pour vous : la roadmap accélère, et la plateforme est là pour rester. Bonne nouvelle quand on construit son service à la clientèle dessus.

    On a passé les semaines passées à tester chacune de ces nouveautés sur les agents qu'on déploie pour des PME québécoises. Voici les cinq qui méritent vraiment votre attention — et surtout ce que ça change concrètement pour vous.

    1. Gemini 3.1 Pro débarque comme option de LLM (et c'est plus gros qu'on pense)

    Depuis le 13 avril 2026, vous pouvez configurer votre agent ElevenLabs pour utiliser gemini-3.1-pro-preview comme cerveau de raisonnement. C'est là, dans la liste déroulante des modèles LLM, à côté de GPT-4 et Claude. Et oui, ElevenLabs a aussi ajouté Qwen 3.5 (35B et 397B) la même semaine — donc vous avez maintenant le choix entre quatre familles de LLM, chacune avec ses forces en latence, en coût et en finesse linguistique.

    Pourquoi c'est important pour une PME au Québec ? Trois raisons.

    D'abord, le français canadien. Gemini 3.1 Pro a été entraîné avec une attention particulière sur les variantes régionales du français — incluant les expressions québécoises courantes que GPT-4 traite parfois comme du français de France. On a testé un agent de prise de rendez-vous chez un dentiste à Sherbrooke : Gemini comprenait « j'pourrais-tu » du premier coup. GPT-4 hésitait deux secondes. Ces deux secondes, c'est la différence entre un client patient et un client qui raccroche.

    Deuxièmement, le coût. Gemini 3.1 Pro tourne autour de 30-40 % moins cher que GPT-4 Turbo pour des tâches équivalentes. Sur un agent qui prend 800 appels par mois, ça représente facilement 200 $ à 400 $ d'économies mensuelles. Pour une PME, ce n'est pas anodin.

    Troisièmement, la fenêtre de contexte. Gemini 3.1 Pro ouvre 1 million de tokens. Vous pouvez littéralement charger votre menu de restaurant complet, vos politiques d'annulation, votre liste de prix et l'historique des trois derniers échanges avec un client — tout ça d'un coup, sans bricoler du RAG complexe.

    Le bémol ? C'est encore en preview. Pas garanti à long terme, et la latence en début d'appel peut être 100-150 ms plus lente que GPT-4. Si vous avez un agent de réception ultra-réactif, ça se sent.

    2. Les Agent Templates : du « fait-maison » au « prêt en 20 minutes »

    Avant avril 2026, configurer un agent ElevenLabs depuis zéro prenait facilement deux à trois heures. Système prompt, voix, transitions, outils, tests… Soyons honnêtes, c'est là où la plupart des PME abandonnent et finissent par payer 4 000 $ à un consultant pour un truc qu'elles auraient pu lancer en interne.

    ElevenLabs a publié une bibliothèque de templates qui couvre les cas d'usage les plus communs : support client, prise de commandes, qualification de leads, accueil téléphonique, collecte de feedback. Chaque template arrive avec un prompt système éprouvé, une voix recommandée, des outils pré-configurés et des flux logiques.

    Concrètement, voici ce que ça donne pour une clinique chiropractique à Trois-Rivières qu'on a accompagnée la semaine dernière : le template « front desk operations » est passé de 0 à premier appel testé en 23 minutes. Les ajustements pour leur réalité (heures d'ouverture, types de soins, gestion des paiements via Square) ont pris 90 minutes de plus. Total : moins d'une demi-journée pour avoir un agent fonctionnel.

    Attention quand même : un template, c'est un point de départ, pas un produit fini. Les PME qui se contentent de cliquer « activer » sans personnaliser le prompt système finissent avec un agent générique qui parle comme un script de centre d'appels américain des années 2010. Le branding compte. La bonne architecture multi-agent commence par un template adapté à votre réalité, pas l'inverse.

    3. pre_tool_speech : la fin du silence gênant pendant les recherches

    Vous avez déjà eu cette sensation pendant un appel automatisé ? Vous demandez « est-ce que vous avez encore les bottes Sorel taille 10 ? » et il y a ce blanc bizarre de quatre secondes pendant que l'agent va consulter l'inventaire. C'est ce qu'on appelle le « trou mort » — et ça fait raccrocher les clients en quantité industrielle.

    ElevenLabs a ajouté un champ pre_tool_speech sur les configurations MCP, avec trois modes :

    • auto : l'agent décide tout seul, basé sur la latence récente de l'outil. Si la dernière requête a pris plus de 1,5 seconde, il glisse une transition vocale naturelle.
    • force : peu importe la latence, l'agent verbalise toujours quelque chose avant l'appel à l'outil (« Un instant, je regarde ça pour vous »).
    • off : silence radio, ancien comportement.

    Pour la majorité des PME au Québec, le mode auto est le bon choix par défaut. Il évite les transitions inutiles sur les outils rapides (par exemple, vérifier une date de rendez-vous via votre Google Calendar — c'est instantané) tout en couvrant les outils plus lents (paiements, vérifications d'inventaire externe, requêtes CRM complexes).

    On a écrit un guide complet sur comment éliminer ces silences morts dans votre agent vocal si vous voulez creuser le sujet. Les chiffres qu'on y partage : la durée moyenne d'écoute des clients passe de 47 secondes à 1 minute 38 quand le pre_tool_speech est bien configuré.

    4. response_timeout_secs : l'assurance contre les outils qui freezent

    Petite nouveauté qui change la vie quand votre agent appelle des outils externes (CRM, calendrier, ERP, base de données interne). Vous pouvez maintenant configurer un timeout par outil, entre 5 et 120 secondes, avec une valeur par défaut de 30 secondes.

    Avant cette mise à jour, si votre Zoho CRM ralentissait à cause d'une mise à jour ou d'un pic de trafic, votre agent ElevenLabs pouvait rester bloqué indéfiniment, le client en ligne. Pas idéal.

    Maintenant, vous définissez par exemple response_timeout_secs: 8 sur votre outil de vérification de client. Si Zoho ne répond pas en 8 secondes, l'agent enchaîne avec un message de repli (« Je vais transférer votre demande à notre équipe par courriel, pouvez-vous me confirmer votre adresse ? »). Le client n'a pas l'impression que ça plante. Vous gardez le lead.

    Recommandation pratique : 5 à 10 secondes pour les outils internes, 15 à 20 secondes pour les API tierces, et 30 secondes maximum pour quoi que ce soit qui implique un paiement ou une vérification d'identité.

    5. Les messages multimodaux : quand votre agent peut « voir » ce que le client envoie

    Celle-là, on l'attendait depuis longtemps. Le hook useConversationControls expose maintenant sendMultimodalMessage, et le type MultimodalMessageInput est exporté depuis @elevenlabs/client. Traduction : votre agent web peut maintenant recevoir des images pendant la conversation.

    Cas concret. Un client appelle un atelier de réparation de petits électroménagers à Laval pour un grille-pain qui fait des étincelles. Plutôt que d'essayer de décrire le problème pendant cinq minutes, il prend une photo via le widget de chat web, l'agent la « voit », identifie qu'il s'agit d'un modèle Cuisinart CPT-160 avec un défaut connu sur le mécanisme d'éjection, et oriente directement le client vers la procédure de remplacement sous garantie.

    Pour l'instant, ce mode est limité aux interfaces web — pas encore disponible sur les appels téléphoniques classiques (et ne le sera probablement jamais, pour des raisons techniques évidentes). Mais pour un commerce qui a un widget de chat sur son site ou une intégration WhatsApp Business, c'est un changement majeur.

    Bonus : le tracking multi-agent visited_agents

    Si vous opérez une architecture multi-agent (un agent d'accueil qui transfère vers un agent spécialisé selon la demande), la nouvelle réponse get conversation inclut maintenant un tableau visited_agents avec l'identifiant de chaque agent et la branche empruntée. Pour le débogage et l'analytics, c'est précieux. Vous pouvez enfin savoir lequel de vos agents spécialisés convertit le mieux, ou identifier où les utilisateurs s'arrêtent dans le flux.

    Ce que vous devriez faire cette semaine

    Les mises à jour techniques, c'est bien. Les actions concrètes, c'est mieux. Voici ce qu'on recommande pour une PME québécoise qui a déjà un agent ElevenLabs en production :

    1. Cette semaine : testez Gemini 3.1 Pro sur un agent secondaire (pas votre agent principal). Mesurez la latence, le coût et la qualité du français en environnement réel.
    2. Dans 2 semaines : auditez vos configurations MCP. Si vous n'avez pas encore activé pre_tool_speech: auto et défini des response_timeout_secs raisonnables sur chaque outil, vous laissez de l'argent sur la table.
    3. Avant fin mai 2026 : explorez les templates pour vos cas d'usage secondaires. Beaucoup de PME ont un seul agent qui essaie de tout faire — souvent, deux ou trois agents spécialisés bien configurés performent mieux qu'un agent généraliste.

    Petit rappel pour les nouveaux lecteurs : chez Agent IA Vocal, l'équipe TECHMA gère l'intégralité de l'intégration pour nos clients. Vous n'avez pas à toucher au tableau de bord ElevenLabs, à configurer des webhooks ou à comprendre pourquoi response_timeout_secs existe. On le fait pour vous, on documente, et on optimise au fil des semaines selon ce que vos appels révèlent. C'est notre rôle. Le vôtre, c'est de servir vos clients.

    Une dernière chose. ElevenLabs a annoncé qu'une nouvelle vague de fonctionnalités est prévue pour juin 2026, incluant probablement une intégration native avec plus de plateformes téléphoniques nord-américaines. On surveille ça de près. En attendant, si votre agent actuel n'utilise pas encore les cinq nouveautés ci-dessus, vous tournez avec une version 2025 d'une plateforme qui évolue presque chaque semaine. Le retard se rattrape, mais il vaut mieux ne pas en prendre.

    Partager