Il contesto attuale dell’IA vocale
La teoria secondo cui la voce rappresenterà la prossima grande interfaccia digitale ha guadagnato slancio, spingendo gli investitori a destinare miliardi di dollari a startup che operano in settori diversi: dalla creazione di modelli di linguaggio alla fornitura di servizi di assistenza clienti, passando per la presa di appunti durante le riunioni e la dettatura potenziata dall’IA.
Ogni settimana emergono nuovi modelli o strumenti che promettono di parlare come esseri umani e di conversare in modo fluido. Tuttavia, la realtà è spesso più complessa e i risultati non sempre corrispondono alle aspettative.
Le considerazioni di PolyAI
Shawn Wen, CTO della piattaforma enterprise PolyAI, ha osservato al HumanX conference lo scorso mese che, nonostante il rilascio di modelli full‑duplex – capaci di parlare mentre ascoltano – l’IA vocale non ha ancora vissuto il suo “momento ChatGPT”.
«Abbiamo raggiunto la pietra miliare dello sviluppo di modelli full‑duplex. La sfida successiva è rendere il ragionamento molto veloce, così che i modelli recuperino le risposte rapidamente e la conversazione appaia naturale», ha dichiarato Wen.
Lui sottolinea inoltre che gli agenti vocali nel servizio clienti non devono suonare robotici; devono trasmettere sufficiente fiducia agli interlocutori, affinché questi credano di poter risolvere i propri problemi senza l’intervento umano.
«Una volta che la voce è abbastanza buona e il cliente accetta di interagire per i primi due o tre turni, inizia a costruirsi la fiducia. Con il tempo, percepirà che non è necessario parlare con un umano se l’agente può risolvere il problema», ha aggiunto Wen.
Le prospettive di Otter
Alex Gay, CMO di Otter, azienda specializzata nella trascrizione automatica di riunioni, ha evidenziato l’importanza dell’identificazione dei relatori, della cattura delle intenzioni e dell’integrazione dei dati con la conoscenza organizzativa per abilitare l’automazione. L’azienda sta inoltre sperimentando “digital twins”, ovvero rappresentazioni vocali di persone all’interno delle riunioni.
Per Gay è fondamentale che la voce prodotta da questi avatar mantenga le stesse espressioni emotive di una conversazione umana.
«Le migliori conversazioni che abbiamo in una riunione sono quelle che includono dibattiti e discussioni strategiche, dove percepisci una relazione sottostante. Se non riesci a ricreare ciò con un avatar, rimani con un semplice chatbot di domande‑risposte», ha osservato.
Problemi di comprensione e trasparenza
Nonostante i progressi, gli assistenti vocali spesso non comprendono correttamente gli utenti, o i trascrittori di riunioni forniscono testi o riepiloghi errati. Wen ritiene che i modelli di riconoscimento automatico del parlato (ASR) perdano parole chiave cruciali, compromettendo la cattura del contesto.
Gay concorda, aggiungendo che la precisione della trascrizione è solo il punto di partenza. «Per Otter, la trascrizione non è mai il risultato finale; è lo strato su cui costruire guadagni di produttività. Se la trascrizione originale è imprecisa, tutte le azioni successive diventano difettose, si perde la fiducia nella piattaforma. È essenziale migliorare costantemente il modello ASR, perché gli impatti a valle sono significativi», ha spiegato.
La questione della trasparenza
Con l’avvento dei nuovi strumenti vocali, emerge la necessità di informare gli utenti sul fatto che stanno parlando con un’intelligenza artificiale o che la conversazione è registrata. Otter intende instaurare fiducia nei partecipanti alle riunioni, anche quando il bot non è presente, notificando, ad esempio, in chat che la sessione è in fase di registrazione.
Wen di PolyAI ribadisce l’importanza di stabilire chiaramente che le chiamate enterprise coinvolgono un agente IA, per evitare fraintendimenti e garantire la trasparenza.
Prospettive future
Il percorso verso un “momento ChatGPT” per l’IA vocale richiede quindi miglioramenti sia nella velocità di ragionamento che nella precisione del riconoscimento del parlato, nonché un’attenta gestione dell’esperienza utente e della trasparenza. Solo quando la tecnologia sarà in grado di offrire risposte rapide, accurate e percepite come naturali, gli utenti potranno affidarsi completamente a un assistente vocale, riducendo la dipendenza dall’intervento umano.