
Answers the phone
Connects to the Yeastar or SIP system the business already runs, so calls reach the agent on the numbers customers have always dialled.
Caso di studio sull'agente vocale basato sull'intelligenza artificiale
Un operatore che risponde alla linea telefonica di un'azienda, trova la risposta nei documenti della stessa azienda e apre il ticket di assistenza prima ancora che il chiamante abbia riattaccato — utilizzando i numeri già in loro possesso e, se lo desiderano, sul proprio hardware.

Vocale integra un agente basato sull’intelligenza artificiale nella linea telefonica già in uso presso un’azienda. Il cliente compone il numero che ha sempre chiamato; l’agente risponde al primo squillo, parla la sua lingua, fornisce risposte basate sui manuali e sulle politiche aziendali e, quando la risposta è in realtà «qualcuno deve occuparsene», apre un ticket di assistenza con i dettagli già raccolti.
Il sistema telefonico rimane invariato. L’azienda mantiene il proprio provider, i propri numeri e il proprio piano tariffario; una piattaforma Yeastar o SIP compatibile viene collegata una sola volta tramite un modulo, e il trunk e l’instradamento delle chiamate vengono configurati a livello di piattaforma. A questo punto, il lavoro consiste nel caricare i documenti che l’operatore deve conoscere, scrivere le poche frasi che ne definiscono lo stile e testarlo in un browser finché non suona corretto — il tutto prima che gli venga inoltrata una sola chiamata reale.


Connects to the Yeastar or SIP system the business already runs, so calls reach the agent on the numbers customers have always dialled.

Manuals, policies and price lists are uploaded, indexed and searched at the moment of the question so the answer comes from the business's own material rather than the model's memory.

When a caller needs a person, the agent gathers the subject, the contact and the urgency while it still has them on the line, then files the ticket itself.

An existing customer database connects read-only, so an inbound number is matched to an account before the agent says a word.

The same agent runs on a hosted model API or entirely on a private GPU. The business picks on cost and on where its data is allowed to go.
L'efficacia di una linea di assistenza dipende esclusivamente dalle persone che rispondono, e le domande che arrivano sono quasi sempre le stesse: quali sono gli orari di apertura, questo servizio è coperto, come si fa a resettarlo? Le risposte sono già scritte — in un manuale, in una politica aziendale, in un listino prezzi — ma non si trovano in un posto accessibile a chi chiama né a un operatore mentre qualcuno è in attesa. Mettere un'intelligenza artificiale in linea risolve la metà del problema della disponibilità. Noleggiarne una al minuto sostituisce silenziosamente il problema con uno di costi, perché meglio funziona, più viene utilizzata e più aumenta il costo mensile.

La sera, nei fine settimana e nei giorni festivi le chiamate vengono deviate alla segreteria telefonica — e ciò che finisce lì sono per lo più richieste di routine che una persona avrebbe risolto in un minuto.

Le informazioni sono contenute nei documenti, ma non in un formato che possa essere consultato mentre un chiamante è in attesa in linea.

Le piattaforme di IA vocale gestite prevedono una tariffa al minuto di chiamata, quindi il costo aumenta con l’aumentare dell’utilizzo: un incentivo sbagliato per attivare una linea di assistenza.
Vocale si colloca tra il sistema telefonico di un’azienda e il suo patrimonio di conoscenze. Il PBX si collega tramite un modulo e l’instradamento viene configurato a monte. I documenti vengono caricati e indicizzati. Il comportamento dell’agente viene impostato in linguaggio semplice anziché in codice, e l’intero processo può essere simulato in un browser prima che arrivi una chiamata reale. Una volta in funzione, tutte le sue azioni vengono registrate — la trascrizione, le ricerche effettuate, i ticket aperti — in modo che il team possa valutare se sta svolgendo correttamente il proprio lavoro prima di affidargli ulteriori incarichi.

Yeastar e i sistemi SIP compatibili si registrano tramite un modulo, e l'azienda mantiene il proprio provider, i propri numeri e il proprio piano tariffario.

Una domanda che richiede un dato di fatto avvia una ricerca tra i documenti indicizzati, e la risposta viene elaborata sulla base dei risultati ottenuti — anche l’assenza di risultati costituisce una risposta che l’agente è autorizzato a fornire.

Il parlato, il linguaggio e la voce vengono eseguiti tramite un’API di terze parti o su una GPU privata. Il passaggio da una soluzione all’altra richiede solo una configurazione, non una ricompilazione.
UX researchFeb–Mar
MVPApr–Jul
OperationAug–Sep
DiscoveryFeb
ArchitectureMar
UI designApr–May
Backend and local AIMay–Jul
TestingJul–Aug
OperationAug–Sep
A sandbox that runs the whole pipeline in the browser. Pick a caller, start the call, and the transcript arrives live beside it as the agent hears and answers. Every session it has ever handled, browser or phone, inbound or outbound, is one click away in the rail on the left.

Files are dropped straight onto the page, then parsed, split and indexed. Each row reports how many pages went in and how many searchable pieces came out, so it is obvious at a glance when a document is ready to be quoted on a call and when it is still being worked on.

The agent collects the subject, the customer and the urgency while the caller is still on the line and files the ticket itself, transcript attached. Support opens the queue to a list of real problems in the caller's own words instead of a column of missed calls.

An existing customer database connects read-only, with a mapping step for whichever columns hold the name and the number. From then on an inbound call is matched against it before the agent speaks, and the records stay where they are. Vocale reads them; it does not become the place they live.

Telephony is the one part a business should not have to get right alone, so provisioning is an operator job rather than a self-service form. Each number is registered, pointed at an organisation, and switched on from here, which doubles as the fastest way to see which tenants are actually taking calls.

Spend is metered the way the models bill it: caller speech, agent speech, and replayed history, broken out per model and per organisation. It is what turns the choice between a hosted API and a private GPU into a decision with a number attached rather than an argument.

Ciò che conta in una linea di assistenza non è la precisione in astratto, ma se la chiamata ha ricevuto risposta e se la risposta era corretta. Vocale risponde a tutte le chiamate, a qualsiasi ora, nella lingua del chiamante, e lascia una trascrizione in modo che la seconda domanda possa essere chiarita. Il costo indicato di seguito corrisponde a quanto addebitato dalla piattaforma sul piano in hosting per un mese di chiamate effettive; il piano self-hosted trasferisce tale costo sull’hardware già pagato dall’azienda, e la tariffa al minuto smette del tutto di variare.
User goal
Functions the agent calls while the caller is still on the line.


Solution: I chiamanti interrompono la risposta non appena l’hanno compresa, e un operatore che continua a parlare sembra confuso. Il rilevamento dell’attività vocale interrompe l’audio in uscita non appena il chiamante parla, quindi trunca la trascrizione dell’operatore limitandola a ciò che è stato effettivamente udito — in questo modo la conversazione prosegue sulla base della chiamata vissuta dal chiamante, anziché su quella che il sistema aveva pianificato.
Solution: La ricerca nei documenti richiede un tempo tale da sembrare una chiamata interrotta. L’operatore inserisce una breve pausa naturale dopo mezzo secondo e la interrompe se la ricerca restituisce il risultato per prima, il che concede il tempo necessario al recupero dei dati senza che si crei alcun momento di silenzio imbarazzante.
Solution: Ciò che è scritto per lo schermo non è scritto per la voce: importi in valuta, date espresse in cifre, acronimi. Un livello di normalizzazione riscrive importi, date, orari e abbreviazioni nella loro forma parlata, a seconda della lingua, prima ancora che raggiungano il modello vocale.
Solution: Una sessione vocale in tempo reale mantiene i propri modelli nella memoria video, quindi la capacità è limitata dalla VRAM piuttosto che dalla potenza di calcolo pura. Le sessioni vengono assegnate per scheda e il carico di lavoro viene distribuito esplicitamente tra le schede: se si lascia il pooling predefinito, le attività relative al parlato e al linguaggio finiscono sulla stessa GPU e si ostacolano a vicenda.
Mettiamo un operatore in linea con te.