Se connecte au PBX, et non pas en contournant celui-ci
L'enregistrement de Yeastar et des systèmes SIP compatibles s'effectue via un formulaire, et l'entreprise conserve son opérateur, ses numéros et son forfait d'appels.
Étude de cas sur un assistant vocal basé sur l'IA
Un agent qui répond au téléphone de l'entreprise, trouve la réponse dans les documents de cette dernière et ouvre le ticket d'assistance avant même que l'appelant n'ait raccroché — sur les numéros dont l'entreprise dispose déjà et sur son propre matériel, si elle le souhaite.

Vocale intègre un agent IA à la ligne téléphonique dont dispose déjà une entreprise. Un client compose le numéro qu'il a toujours composé ; l'agent décroche dès la première sonnerie, s'exprime dans sa langue, répond en s'appuyant sur les manuels et les politiques de l'entreprise et, lorsque la réponse est en réalité « quelqu'un doit examiner cela », il crée un ticket d'assistance avec les informations déjà recueillies.
Le système téléphonique reste inchangé. L'entreprise conserve son opérateur, ses numéros et son forfait d'appels ; une plateforme Yeastar ou SIP compatible est connectée une seule fois via un formulaire, et la ligne réseau ainsi que le routage des appels sont configurés en arrière-plan. Il suffit ensuite de télécharger les documents que l’agent doit connaître, de rédiger les quelques phrases qui définissent son ton, et de tester le tout dans un navigateur jusqu’à ce que le résultat soit satisfaisant — le tout avant qu’un seul appel réel ne lui soit acheminé.
Le choix du lieu d’exécution des modèles est déterminant pour la rentabilité ; c’est pourquoi la plateforme propose deux moteurs au sein d’un même produit. Dans l’offre hébergée, la reconnaissance vocale, le raisonnement et la synthèse vocale proviennent d’une API tierce, et chaque minute est facturée à l’unité. Sur le niveau auto-hébergé, ces trois fonctionnalités s’exécutent sur un GPU sous le contrôle direct de l’entreprise ; aucun fichier audio ni document ne quitte les locaux, et un appel ne coûte que l’électricité consommée. Le passage d’un niveau à l’autre se fait par simple configuration ; le comportement de l’agent reste identique dans les deux cas.

Un guide pas à pas de Vocale, depuis la connexion d'un système téléphonique et le téléchargement d'un manuel jusqu'à un appel en direct permettant de répondre à la question et de classer celle à laquelle le système n'a pas pu répondre.
Répond au téléphone
Il s'intègre au système Yeastar ou SIP déjà utilisé par l'entreprise, de sorte que les appels parviennent à l'agent aux numéros que les clients ont toujours composés.
En s'appuyant sur vos documents
Les manuels, les politiques et les listes de prix sont mis en ligne, indexés et consultés au moment même où la question est posée ; la réponse provient donc des ressources propres à l'entreprise plutôt que de la mémoire du modèle.
Crée des tickets en cours d'appel
Lorsqu'un appelant a besoin d'une personne, l'agent recueille les informations relatives à l'objet de la demande, aux coordonnées de la personne concernée et au degré d'urgence pendant que l'appelant est encore en ligne, puis il crée lui-même le ticket.
Sait qui appelle
La base de données clients existante est connectée en lecture seule ; ainsi, un numéro entrant est associé à un compte avant même que l'agent n'ait prononcé un mot.
Deux moteurs, un seul produit
Le même agent peut fonctionner soit sur une API hébergée, soit entièrement sur un GPU privé. L'entreprise choisit en fonction du coût et de la destination autorisée pour ses données.
Le téléphone sonne à sept heures du soir. La réponse se trouve dans un fichier PDF sur le disque partagé. Personne n'est là pour la lire.
La qualité d’un service d’assistance dépend entièrement des personnes qui y répondent, et les questions qui y sont posées se résument presque toujours aux mêmes : quels sont vos horaires, est-ce pris en charge, comment puis-je le réinitialiser ? Les réponses sont déjà consignées — dans un manuel, une charte, une grille tarifaire — mais elles ne se trouvent nulle part où un appelant puisse les consulter ni où un opérateur puisse les trouver pendant qu’un client attend. Mettre une IA en ligne résout la moitié du problème d’accessibilité. La location à la minute transforme discrètement ce problème en un problème de coût, car plus l’IA fonctionne efficacement, plus elle est utilisée, et plus la facture mensuelle est élevée.
Appels en dehors des heures de bureau
Le soir, le week-end et les jours fériés, les appels sont redirigés vers la messagerie vocale — et la plupart des messages qui y aboutissent ne sont que des demandes courantes qu’une personne aurait pu régler en une minute.
Des réponses que personne ne peut trouver
Ces informations figurent bien dans des documents, mais elles ne sont pas disponibles sous une forme permettant de les consulter pendant qu'un appelant attend en ligne.
Tarification à la minute
Les plateformes d'IA vocale gérées facturent à la minute d'appel, ce qui fait que la facture augmente à mesure que leur utilisation se généralise — ce qui constitue une mauvaise incitation à mettre en place une ligne d'assistance.
Un agent est déjà en ligne.
Vocale s'intercale entre le système téléphonique d'une entreprise et sa base de connaissances. Le PBX s'y connecte via un formulaire et le routage est configuré en arrière-plan. Les documents sont téléchargés et indexés. Le comportement de l'agent est défini en langage naturel plutôt qu'en code, et l'ensemble peut être testé dans un navigateur avant qu'un véritable appel ne lui parvienne. Une fois en production, toutes ses actions sont consignées — la transcription, les recherches effectuées, les tickets ouverts — afin que l'équipe puisse évaluer s'il remplit correctement sa mission avant de lui confier davantage de tâches.
L'enregistrement de Yeastar et des systèmes SIP compatibles s'effectue via un formulaire, et l'entreprise conserve son opérateur, ses numéros et son forfait d'appels.
Une question nécessitant une information concrète déclenche une recherche parmi les documents indexés, et la réponse est élaborée à partir des résultats obtenus — l'agent étant autorisé à répondre « aucune information trouvée » si la recherche n'a donné aucun résultat.
Les fonctionnalités liées à la parole, au langage et à la voix s'exécutent soit via une API tierce, soit sur un GPU privé. Le passage de l'une à l'autre se fait par simple configuration, sans nécessiter de recompilation.
A sandbox that runs the whole pipeline in the browser. Pick a caller, start the call, and the transcript arrives live beside it as the agent hears and answers. Every session it has ever handled — browser or phone, inbound or outbound — is one click away in the rail on the left.

Files are dropped straight onto the page, then parsed, split and indexed. Each row reports how many pages went in and how many searchable pieces came out, so it is obvious at a glance when a document is ready to be quoted on a call and when it is still being worked on.

The agent collects the subject, the customer and the urgency while the caller is still on the line and files the ticket itself, transcript attached. Support opens the queue to a list of real problems in the caller's own words instead of a column of missed calls.

An existing customer database connects read-only, with a mapping step for whichever columns hold the name and the number. From then on an inbound call is matched against it before the agent speaks — and the records stay where they are. Vocale reads them; it does not become the place they live.

Telephony is the one part a business should not have to get right alone, so provisioning is an operator job rather than a self-service form. Each number is registered, pointed at an organisation and switched on from here — which doubles as the fastest way to see which tenants are actually taking calls.

Spend is metered the way the models bill it — caller speech, agent speech and replayed history, broken out per model and per organisation. It is what turns the choice between a hosted API and a private GPU into a decision with a number attached rather than an argument.

On m'a répondu dès la première sonnerie, et les tarifs sont ceux d'un logiciel.
Ce qui compte pour un service d’assistance téléphonique, ce n’est pas la précision en soi, mais le fait que l’appel ait été pris en charge et que la réponse ait été correcte. Vocale répond à tous les appels, à toute heure, dans la langue de l’appelant, et fournit une transcription permettant de régler la deuxième question. Le coût indiqué ci-dessous correspond à ce que la plateforme a facturé sur la formule hébergée pour un mois d’appels réels ; la formule auto-hébergée transfère cette ligne vers le matériel que l’entreprise paie déjà, et le coût à la minute cesse alors d’évoluer.


Solution: Dès qu'ils ont compris la réponse, les appelants reprennent la parole, et un conseiller qui continue à parler donne l'impression de bafouiller. La détection d'activité vocale coupe le son dès que l'appelant prend la parole, puis tronque la transcription du conseiller pour ne conserver que ce qui a réellement été entendu. Ainsi, la conversation reprend là où l'appelant l'a laissée, et non là où le système l'avait prévue.
Solution: La recherche dans les documents prend suffisamment de temps pour être perçue comme une coupure de ligne. L'agent lance une petite phrase de remplissage naturelle au bout d'une demi-seconde et l'interrompt si la recherche aboutit avant, ce qui laisse le temps à la recherche de s'effectuer sans qu'il y ait de silence gênant.
Solution: Ce qui est écrit pour un écran n'est pas écrit pour être lu à voix haute : montants monétaires, dates sous forme de chiffres, acronymes. Une couche de normalisation réécrit les montants, les dates, les heures et les abréviations sous leur forme orale, selon la langue, avant même qu'ils n'atteignent le modèle vocal.
Solution: Une session vocale en temps réel stocke ses modèles dans la mémoire vidéo ; sa capacité est donc limitée par la VRAM plutôt que par la puissance de calcul brute. Les sessions sont réparties par carte et la charge de travail est explicitement répartie entre les cartes : si l’on s’en remet au regroupement par défaut, les tâches de reconnaissance vocale et de traitement du langage se retrouvent sur le même GPU et se privent mutuellement de ressources.
Vous ne recevez plus d'appels après 17 heures ?
Nous allons vous mettre en relation avec un conseiller.