Brancher RAG à Votre Agent IA Vocal : Le Tutoriel En 5 Étapes Pour PME du Québec (Mai 2026) | Agent IA Vocal
    Agent IA Vocal
    Retour au blog
    Tutoriel7 min de lecture23 mai 2026

    Brancher RAG à Votre Agent IA Vocal : Le Tutoriel En 5 Étapes Pour PME du Québec (Mai 2026)

    Le 12 mai 2026 ElevenLabs a livré l API typée RAG. Voici le tutoriel en 5 étapes pour brancher votre FAQ à votre agent IA vocal de PME au Québec.

    MA

    Masdouk Adelakoun

    Cofondateur & CTO

    Brancher RAG à Votre Agent IA Vocal : Le Tutoriel En 5 Étapes Pour PME du Québec (Mai 2026)

    Un cabinet dentaire de Laval recevait six fois par jour la même question : « Acceptez-vous l'assurance Desjardins, et le forfait Croix Bleue couvre-t-il le détartrage ? ». Une réceptionniste avait fini par taper un document Word de 47 pages : tarifs, assurances, horaires, politiques d'annulation, services offerts par chaque hygiéniste. Personne ne le lisait, sauf elle. Le 12 mai 2026, ElevenLabs a publié sa version typée de l'API RAG chunk listing et file document updates — la pièce qui manquait pour qu'un agent IA vocal lise ce document à la place de l'humain, sans qu'on ait à le réécrire en prompt.

    Ce tutoriel décrit les cinq étapes que TECHMA suit pour brancher cette base de connaissances sur un agent IA vocal qui tient déjà debout. Compte 90 minutes pour un premier déploiement propre, et un vendredi après-midi pour la boucle de mise à jour. À la fin, votre FAQ répond toute seule, en français du Québec, sans relire le prompt principal.

    Étape 1 — Préparer les documents source (PDF, .md, .docx, URL)

    La règle d'or n'est pas « plus c'est gros, mieux c'est ». Un agent IA vocal sur ElevenLabs en compte non-entreprise plafonne à 20 Mo et 300 000 caractères pour l'ensemble de sa base de connaissances. Concrètement, ça suffit largement pour une PME du Québec — c'est environ 150 pages de FAQ dense, ou trois SOPs longues plus deux grilles tarifaires.

    Ne téléversez pas un PDF scanné de votre brochure de 2019. Reprenez-le en .md ou .txt avec des titres clairs (## Tarifs, ## Assurances, ## Horaires). Le moteur de chunking d'ElevenLabs respecte les sections — un document bien titré devient deux à trois fois plus précis qu'un mur de texte. Pour le cabinet dentaire, on a découpé le Word de 47 pages en six fichiers .md thématiques.

    Et avant de cliquer « téléverser », passez chaque document au peigne fin : aucun numéro d'assurance maladie, aucun nom de patient, aucune adresse personnelle d'employé. La base de connaissances vit dans le contexte du modèle — si une donnée sensible s'y promène, vous transférez du renseignement personnel à un sous-traitant américain, et la Commission d'accès à l'information du Québec n'apprécie pas. Ce volet est traité plus en détail dans notre protocole en 9 étapes pour la conformité Loi 25.

    Étape 2 — Téléverser et indexer dans ElevenLabs

    Deux chemins. Le plus rapide : Dashboard → Agents → [votre agent] → Knowledge Base → Add Document. Vous glissez le fichier, ElevenLabs lance l'indexation, et vous voyez une barre de progression. Pour un .md de 30 ko, comptez deux à trois minutes. Pour un PDF de 8 Mo plein d'images, ça peut grimper à huit minutes. Tant que le statut affiche indexing, le contenu n'est pas requêtable.

    L'autre chemin, qu'on utilise chez TECHMA quand un client a 12 documents à pousser : l'API. Un POST /v1/convai/knowledge-base avec le fichier en multipart, puis un POST /v1/convai/knowledge-base/document/{doc_id}/rag-index pour forcer le calcul de l'index avec le modèle d'embedding choisi. La documentation de Compute RAG Index liste les paramètres exacts. Cette voie scripte ce qui serait sinon vingt minutes de glisser-déposer.

    Pour vérifier qu'un document est prêt, appelez GET /v1/convai/knowledge-base/document/{doc_id}/rag-index. Statut succeeded ? On passe à l'étape 3. Statut failed ? Neuf fois sur dix, c'est un PDF mal océrisé ou un .docx avec des objets imbriqués (graphiques Excel collés, formulaires verrouillés). Re-export en .md règle le problème.

    Étape 3 — Configurer les paramètres RAG (sans tirer dans le tas)

    Dans la configuration de l'agent, section Knowledge Base, basculez le toggle Use RAG. Trois réglages comptent vraiment ; le reste, par défaut, fonctionne pour 80 % des cas.

    Embedding model : e5_mistral_7b_instruct est le défaut. Pour une PME du Québec avec des documents en français, c'est correct, mais multilingual-e5 donne un rappel sensiblement meilleur sur les requêtes mêlant français et anglais — typique d'un cabinet de Montréal où le patient bascule de langue en milieu de phrase. Activez-le si plus de 20 % de vos appels sont bilingues.

    Max document chunks : le nombre de morceaux que le moteur injecte dans le contexte par requête. Par défaut 5. Pour une PME, descendez à 3 — l'agent répond plus vite et hallucine moins. Au-delà de 7, vous noyez le modèle dans des extraits qui se contredisent.

    Max vector distance : seuil de pertinence. 0,7 est strict (l'agent dira « je ne sais pas » plus souvent), 0,9 est large (il tentera de répondre même sur des questions tangentes). Démarrez à 0,75 et ajustez après 50 appels test. Le détail des trois paramètres est documenté dans la page RAG d'ElevenLabs.

    Étape 4 — Ajuster le prompt système pour exploiter la base

    Une base de connaissances branchée mais pas appelée dans le prompt, c'est comme une bibliothèque dont personne ne connaît l'adresse. Quatre lignes suffisent :

    « Tu as accès à une base de connaissances contenant les tarifs, les assurances acceptées, les horaires et les politiques du cabinet. Réponds en t'appuyant sur cette base. Si l'information n'y est pas, dis-le et propose un transfert vers la réceptionniste. »

    Le « si l'information n'y est pas » est la phrase qui empêche les hallucinations. Un agent IA vocal mal cadré inventera un numéro de fax, une politique d'annulation, un tarif. Avec cette instruction, il refuse poliment et bascule vers un humain — comportement qu'on a analysé en profondeur dans notre protocole en 7 étapes contre les hallucinations.

    Évitez aussi le piège inverse : ne dites pas « Réponds UNIQUEMENT depuis la base ». L'agent deviendrait incapable de saluer, de demander le nom du patient, de fixer un rendez-vous. La base couvre la FAQ ; le prompt couvre la conversation. C'est cette séparation qui fait toute la différence entre un robot rigide et un agent IA vocal utile.

    Étape 5 — Tester et brancher la boucle de mise à jour

    Lancez dix appels test en couvrant les questions les plus fréquentes — chez nos clients, on tire la liste depuis l'étiquetage des conversations, qui isole déjà les sujets récurrents. Pour chaque appel, notez : la réponse est-elle correcte, complète, en bon français ? Si non, le chunk pertinent existait-il dans le document source ?

    La mise à jour file document updates publiée par ElevenLabs le 12 mai 2026 change la boucle de maintenance. Avant, modifier un document obligeait à le supprimer puis à le re-téléverser — donc à perdre l'ID, à recâbler la référence agent, et à attendre la réindexation complète. Désormais, un PATCH /v1/convai/knowledge-base/document/{doc_id} remplace le contenu tout en conservant l'ID. L'index se recalcule en arrière-plan. Pour un cabinet dentaire qui actualise sa grille tarifaire à chaque hausse d'assurance, c'est l'équivalent de garder le même livre, juste avec des pages réimprimées.

    Branchez aussi le RAG chunk listing typé (autre nouveauté du 12 mai) à un tableau de bord interne. L'appel GET /v1/convai/knowledge-base/document/{doc_id}/chunks retourne maintenant un JSON propre, avec ID, contenu, position dans le document, et score d'embedding. Pour une PME qui a déjà branché MCP sur son CRM, c'est trivial à ingérer — et ça permet de voir, en temps réel, quels chunks l'agent récupère le plus souvent. Vous savez alors quelle section de votre FAQ est la plus consultée, et donc laquelle peaufiner en priorité.

    Et le coût, dans tout ça ?

    Question qui revient à chaque consultation : combien ça coûte ? Pour une PME du Québec en mai 2026, le calcul est plus simple qu'on le craint. La base de connaissances elle-même est incluse dans le plan ElevenLabs de l'agent — pas de surcharge à l'octet stocké. Ce qui coûte, c'est l'inférence : chaque fois que l'agent récupère des chunks et les injecte dans le contexte du modèle, vous payez quelques tokens supplémentaires par appel. Sur un cabinet dentaire qui prend 200 appels par mois, l'addition tourne autour de 18 à 25 $ par mois. À comparer aux 14 à 19 heures que la réceptionniste passait à répéter les mêmes réponses — c'est l'ordre de grandeur sur lequel TECHMA chiffre le retour sur investissement pour ses clients.

    Petit avertissement honnête : le calcul change si vous laissez la fenêtre max document chunks à 10 ou plus, ou si votre base contient des documents redondants. C'est précisément ce qu'on règle dans l'audit post-déploiement — la deuxième vague, généralement entre le 14e et le 21e jour après la mise en production.

    90 minutes, et votre FAQ répond toute seule

    Récapitulons. Un .md propre (étape 1), un téléversement (étape 2), trois réglages — modèle d'embedding, max chunks, vector distance (étape 3), quatre lignes dans le prompt (étape 4), dix appels test plus la boucle de mise à jour (étape 5). 90 minutes la première fois, 15 minutes par mise à jour ensuite.

    Le prochain palier, qu'on traite dans un tutoriel séparé, c'est le routage intelligent : quand l'agent IA vocal détecte que la base ne couvre pas la question, il bascule vers un humain — mais pas n'importe lequel. Le bon humain. Avec le bon contexte. Sans répéter l'historique de l'appel. C'est là que TECHMA passe du temps avec ses clients, parce que le passage agent → humain est la couture où 67 % des PME du Québec abandonnent leur agent IA vocal au bout de 30 jours.

    Si vous voulez qu'on regarde ensemble votre FAQ actuelle — celle dans le tiroir de la réceptionniste ou dans un Google Drive partagé — et qu'on chiffre combien de temps elle pourrait vous récupérer chaque semaine, prenez 20 minutes avec un membre de l'équipe TECHMA. On ne facture pas la discussion. On vous dit franchement si RAG est le bon outil pour votre cas, ou si c'est ailleurs qu'il faut tirer.

    Partager