TANO — AI Voice Agent

Registro chiamate

Pensa e parla nello stesso momento. Al telefono è tutto.

Il 15 settembre Google ha presentato i suoi due modelli vocali più avanzati. Nei numeri pubblicati c'è un salto che si sente proprio nel punto in cui una telefonata di solito si rompe: il silenzio mentre la macchina pensa.

Su un compito bancario complesso — cercare le informazioni giuste in una base di conoscenza enorme e completare una pratica in più passaggi, parlando — il miglior modello vocale di Google della generazione precedente ci riusciva nell'11,3% dei casi. Il nuovo, presentato il 15 settembre 2026, ci riesce nel 35,1%. Più del triplo, in una sola generazione.

Il modello si chiama Gemini 3.8 Live Extended Thinking, e insieme al fratello più leggero Gemini 3.8 Live è quello che Google definisce il suo modello di dialogo dal vivo più avanzato di sempre. Non è una notizia per sviluppatori: è il pezzo di tecnologia che decide se un agente vocale al telefono sembra una persona attenta o un risponditore automatico.

Cosa è uscito, in due righe

Due modelli, con due mestieri diversi. Gemini 3.8 Live è pensato per le conversazioni veloci e fluide, su grandi volumi. Gemini 3.8 Live Extended Thinking è pensato per i compiti complicati: ragiona in più passaggi, e lo fa mentre continua a parlare.

Google li ha resi disponibili dal giorno stesso agli sviluppatori, alle aziende e dentro i suoi prodotti — l'app Gemini, la ricerca vocale, Gmail, Docs. È il segnale più chiaro di quanto si fidi di loro: li mette davanti a milioni di persone, non in un laboratorio.

I numeri, a confronto con la generazione precedente

Tutte le cifre che seguono vengono dal documento di valutazione pubblicato da Google DeepMind insieme al modello. Il confronto più utile è con Gemini 3.1 Flash Live, il modello vocale di punta della generazione prima.

ModelloQualità della conversazione
(Speech to Speech Index)
Compiti bancari complessi
(τ³-Banking)
Gemini 3.1 Flash Live (minimo)63,9%—
Gemini 3.1 Flash Live (alto)71,5%11,3%
Gemini 3.8 Live76,0%—
Gemini 3.8 Live Extended Thinking82,6%35,1%

Due letture. La prima: sulla qualità complessiva della conversazione vocale — l'indice di Artificial Analysis, che misura ragionamento, dinamica del dialogo e tempi di risposta — il salto è di undici punti fra il meglio della generazione precedente e il meglio di questa. La seconda: sui compiti in più passaggi, quelli dove bisogna capire, cercare e agire, il salto non è un miglioramento. È un cambio di categoria.

Per completezza, lo stesso indice mette il nuovo modello davanti anche ai migliori vocali degli altri grandi laboratori: 82,6% contro l'81,5% di GPT-Live-1 Astra di OpenAI e l'81,3% di Grok Voice Think Fast 2.0 di xAI. Tre modelli in poco più di un punto: la corsa è serratissima, ed è la notizia migliore per chi usa questa tecnologia, perché ogni pochi mesi qualcuno alza l'asticella.

Google riporta anche un 97,7% su Big Bench Audio, un test di ragionamento fatto interamente a voce, e un 68,6% su τ-Voice, un altro banco di prova per agenti che devono completare compiti parlando.

La fine del silenzio

Chi ha ascoltato qualche chiamata fatta da un agente vocale conosce il momento critico: la persona fa una domanda un po' più complicata, e dall'altra parte cala un silenzio di due o tre secondi. Al telefono due secondi sono un'eternità. È lì che chi ascolta capisce di parlare con una macchina — e spesso è lì che riattacca.

La novità più concreta di Extended Thinking sta proprio qui: ragiona e parla nello stesso momento. Invece di tacere mentre pensa, fa quello che farebbe una persona: segnala che sta controllando con una frase breve, e intanto lavora. Google lo descrive come l'uso di «segnali verbali» precoci e di una narrazione dei passaggi mentre il compito procede.

Sembra un dettaglio. Per un agente che telefona è la differenza fra una conversazione che scorre e una che si incaglia.

Fare le cose mentre parla

La seconda novità è che il modello esegue strumenti e chiamate ai sistemi in background senza interrompere la conversazione. Tradotto nel lavoro di tutti i giorni: mentre dice alla persona che sta guardando le disponibilità, sta davvero consultando l'agenda; mentre conferma l'orario, sta già registrando l'appuntamento.

Fra gli esempi mostrati da Google c'è proprio questo: prenotazioni in più passaggi coordinate mentre la conversazione continua, senza pause. È esattamente il mestiere di un agente che deve fissare un sopralluogo, una visita o un appuntamento in agenda — la cosa che alla generazione precedente riusciva, ma con qualche esitazione di troppo.

97 lingue, senza chiedere quale

Il terzo punto riguarda chi lavora con clienti che non parlano tutti la stessa lingua. Gemini 3.8 Live riconosce e cambia lingua da solo a metà conversazione, fra 97 lingue supportate. Non serve impostarla prima, e non serve che la persona la chieda: se risponde in un'altra lingua, il modello la segue.

Per un'agenzia immobiliare in una città con molti proprietari stranieri, o per uno studio che richiama pazienti di origini diverse, è una porta che prima andava aperta a mano.

Cosa i numeri non dicono

Qui serve onestà, perché è la parte che fa credere il resto. Il 35,1% sui compiti bancari complessi è un record, ma vuol dire anche che su quel tipo di prova — una base di conoscenza sterminata, pratiche in molti passaggi — il modello migliore del mondo sbaglia ancora due volte su tre. I benchmark sono fatti apposta per essere difficili, e questo lo è.

La conseguenza pratica è la stessa che vediamo lavorando: un agente vocale rende al massimo quando ha un compito chiaro e delimitato — richiamare, qualificare, fissare un appuntamento — e non quando gli si chiede di fare tutto. Il modello è il motore. Quello che lo fa andare dritto è come viene impostato il lavoro: cosa deve ottenere, dove si ferma, quando passa la palla a una persona.

E una seconda cosa: sono numeri pubblicati da chi ha fatto il modello, su test scelti da lui. Sono misurati da enti terzi — Artificial Analysis, Sierra, ServiceNow — ma la vetrina resta quella di Google. Il test che conta davvero è sentirlo parlare sul proprio caso.

Cosa puoi fare lunedì mattina

Prendi la telefonata che in azienda nessuno fa mai — i preventivi da richiamare, i clienti da ricontattare, le disdette da riempire — e scrivi su un foglio il risultato che vorresti a fine chiamata, in una riga sola. Un appuntamento fissato, un sì o un no, un orario confermato.

Se ci sta in una riga, è esattamente il tipo di lavoro in cui i modelli di questa generazione danno il meglio. E adesso lo fanno senza quei silenzi che, fino a pochi mesi fa, tradivano la macchina.

Fonti

Perché lo sappiamo

Non veniamo dal software, veniamo dalla vendita. Gli script che trovi in queste pagine non escono da un modello generico: nascono da oltre cinque anni di vendita telefonica, e vengono riscritti dopo aver riascoltato le chiamate — quelle andate bene e soprattutto quelle andate male. Dietro ogni riga di copione c'è una frase che al telefono ha funzionato, e tre che sono state buttate.

Il motore lo scegliamo e lo aggiorniamo noi. Tu senti l'agente sul tuo settore, approvi come parla, e ricevi gli appuntamenti. → Come lavoriamo, settore per settore

Parliamone

Mezz'ora sul tuo caso, non una presentazione

Guardiamo come lavori adesso, ti facciamo sentire l'agente sul tuo settore e ti diciamo se ha senso o no. Se non ha senso te lo diciamo lì. Scegli tu giorno e ora.

Se il calendario non si carica, apri direttamente la pagina di prenotazione.

Apri il calendario