Introduzione
ElevenLabs è diventata il principale fornitore della “voce” nell’intelligenza artificiale, trasformando il testo in parlato con un realismo quasi umano. Il suo motore è ormai presente nelle chiamate di assistenza clienti, spesso senza che l’utente se ne accorga. Tra i più grandi utilizzatori troviamo Klarna, che gestisce il primo livello di supporto telefonico per 35 milioni di clienti negli Stati Uniti, nonché Deutsche Telekom, Cisco, Adobe e un numero crescente di amministrazioni pubbliche.
L’azienda vende anche a creatori indipendenti che sfruttano la piattaforma per audiolibri, doppiaggi musicali e altri contenuti multimediali. Non è l’unica a operare in questo campo: la concorrenza è aumentata, soprattutto da parte di Decagon, una piattaforma di IA conversazionale che ha addestrato il proprio prodotto vocale su ElevenLabs per poi diventare concorrente diretto.
Dimensioni e valutazione dell’impresa
Nonostante abbia solo quattro anni di vita, ElevenLabs dichiara di generare circa 600 milioni di dollari di fatturato ricorrente annuale (ARR). Gli investitori hanno già attribuito all’azienda una valutazione di 22 miliardi di dollari. La crescita rapida è sostenuta da una clientela diversificata e da un modello di business che combina entrate da grandi imprese e da segmenti più piccoli.
Composizione del mercato
Secondo Staniszewski, più della metà del fatturato proviene dal segmento enterprise, con una quota “55 % più” attribuita a clienti aziendali di grandi dimensioni. Il restante 45 % è suddiviso tra piccole e medie imprese, sviluppatori, costruttori di piattaforme e creatori di contenuti.
- Klarna – supporto a 35 milioni di consumatori negli USA.
- Deutsche Telekom – soluzioni vocali per i servizi di telecomunicazione.
- Cisco e Adobe – integrazione nelle suite di produttività e creatività.
- Governi degli Stati Uniti, Polonia, Brasile – applicazioni in sanità, pubblica amministrazione e sicurezza.
Previsioni sulla commoditizzazione dei modelli audio
Al TechCrunch Disrupt dell’anno precedente, Staniszewski aveva affermato che i modelli audio sarebbero stati “commoditizzati entro pochi anni”. Oggi ritiene che, sebbene i progressi siano continui, la differenza qualitativa tra i modelli rimanga significativa. “A lungo termine, entro tre‑cinque anni, le differenze si ridurranno, ma il vero obiettivo è superare il test di Turing per le IA conversazionali, combinando intelligenza cognitiva ed emotiva”, ha spiegato.
Scelta tra modelli frontier e open‑weight
ElevenLabs offre ai clienti una “menu di opzioni” per la cosiddetta “reasoning layer”. La decisione non è più binaria: per interazioni puramente informative è possibile utilizzare modelli open‑source, mentre per settori critici come i servizi finanziari, dove è richiesta autenticazione e precisione assoluta, si ricorre a modelli frontier più avanzati.
Le richieste dei clienti governativi influenzano la scelta dei modelli. Per esempio, in Polonia il progetto sanitario prevede l’uso di un modello ottimizzato per gestire appuntamenti medici, con un tasso di mancata presentazione del 18 %. In Brasile, le esigenze di sovranità dei dati hanno portato all’adozione di modelli con residenti locali e a politiche di data residency.
Trasparenza verso gli utenti
Staniszewski sostiene che “dovrebbe esserci una divulgazione” quando un cliente parla con un agente virtuale. Attualmente, la maggior parte delle persone non è abituata a questa pratica e potrebbe percepirla come una truffa. Tuttavia, entro cinque anni, con la diffusione di assistenti personali, la trasparenza diventerà la norma. Propone di offrire la scelta al cliente, ad esempio proponendo un’opzione “attendi un agente umano” con un tempo di attesa stimato.
Margini lordi e strategia di pricing
Quando gli è stato chiesto dei margini lordi, Staniszewski ha fornito una risposta vaga, sottolineando che l’azienda investe in ricerca per ottimizzare i modelli in modo “estremamente intelligente”. Ha affermato che, se le economie di scala possono essere trasmesse al cliente, l’azienda le sfrutta. “Non ci preoccupa un margine più basso se ciò permette di aumentare la quota di mercato e creare valore nei prossimi cinque anni”.
Formazione dei modelli e dati sintetici
ElevenLabs non si limita a raccogliere enormi volumi di chiamate. Gran parte del lavoro di addestramento consiste nell’annotare i dati: migliaia di collaboratori esterni annotano non solo il contenuto, ma anche tono, accento, emozioni e timing. Sono stati impiegati “voice coach” per garantire una corretta rilevazione degli accenti e delle sfumature emotive.
In alcuni casi, i modelli sono co‑creati con i clienti, adattandoli a esigenze specifiche. La percentuale di dati sintetici è significativa, ma l’enfasi rimane sull’annotazione qualitativa piuttosto che sulla quantità grezza di registrazioni.
Prospettive di IPO
Riguardo al futuro dell’azienda, Staniszewski ha confermato che l’obiettivo è preparare le basi per un’IPO “intorno al 2028”. Ha precisato che la decisione dipenderà dal “tempo e dal luogo”, ma l’intento è costruire una società che resista alla prova del tempo. Quando gli è stato chiesto di definire “anni”, ha risposto con una risata, lasciando intendere che la tempistica è ancora flessibile.
Competizione, regolamentazione e sicurezza
Il CEO riconosce che il settore sta diventando sempre più “confuso” tra aziende di modello, piattaforme e applicazioni. Citando Anthropic, osserva che una società di modelli può evolversi in una piattaforma e in un ecosistema di applicazioni. La risposta di ElevenLabs a questa evoluzione è una politica di “KYC” (Know Your Customer) per tutti i clienti, limitando la creazione di agenti autonomi che possano auto‑replicarsi.
Per quanto riguarda la regolamentazione