Su un compito bancario complesso — cercare le informazioni giuste in una base di conoscenza enorme e completare una pratica in più passaggi, parlando — il miglior modello vocale di Google della generazione precedente ci riusciva nell'11,3% dei casi. Il nuovo, presentato il 15 settembre 2026, ci riesce nel 35,1%. Più del triplo, in una sola generazione.
Il modello si chiama Gemini 3.8 Live Extended Thinking, e insieme al fratello più leggero Gemini 3.8 Live è quello che Google definisce il suo modello di dialogo dal vivo più avanzato di sempre. Non è una notizia per sviluppatori: è il pezzo di tecnologia che decide se un agente vocale al telefono sembra una persona attenta o un risponditore automatico.
Cosa è uscito, in due righe
Due modelli, con due mestieri diversi. Gemini 3.8 Live è pensato per le conversazioni veloci e fluide, su grandi volumi. Gemini 3.8 Live Extended Thinking è pensato per i compiti complicati: ragiona in più passaggi, e lo fa mentre continua a parlare.
Google li ha resi disponibili dal giorno stesso agli sviluppatori, alle aziende e dentro i suoi prodotti — l'app Gemini, la ricerca vocale, Gmail, Docs. È il segnale più chiaro di quanto si fidi di loro: li mette davanti a milioni di persone, non in un laboratorio.
I numeri, a confronto con la generazione precedente
Tutte le cifre che seguono vengono dal documento di valutazione pubblicato da Google DeepMind insieme al modello. Il confronto più utile è con Gemini 3.1 Flash Live, il modello vocale di punta della generazione prima.
| Modello | Qualità della conversazione (Speech to Speech Index) | Compiti bancari complessi (τ³-Banking) |
|---|---|---|
| Gemini 3.1 Flash Live (minimo) | 63,9% | — |
| Gemini 3.1 Flash Live (alto) | 71,5% | 11,3% |
| Gemini 3.8 Live | 76,0% | — |
| Gemini 3.8 Live Extended Thinking | 82,6% | 35,1% |
Due letture. La prima: sulla qualità complessiva della conversazione vocale — l'indice di Artificial Analysis, che misura ragionamento, dinamica del dialogo e tempi di risposta — il salto è di undici punti fra il meglio della generazione precedente e il meglio di questa. La seconda: sui compiti in più passaggi, quelli dove bisogna capire, cercare e agire, il salto non è un miglioramento. È un cambio di categoria.
Per completezza, lo stesso indice mette il nuovo modello davanti anche ai migliori vocali degli altri grandi laboratori: 82,6% contro l'81,5% di GPT-Live-1 Astra di OpenAI e l'81,3% di Grok Voice Think Fast 2.0 di xAI. Tre modelli in poco più di un punto: la corsa è serratissima, ed è la notizia migliore per chi usa questa tecnologia, perché ogni pochi mesi qualcuno alza l'asticella.
Google riporta anche un 97,7% su Big Bench Audio, un test di ragionamento fatto interamente a voce, e un 68,6% su τ-Voice, un altro banco di prova per agenti che devono completare compiti parlando.
La fine del silenzio
Chi ha ascoltato qualche chiamata fatta da un agente vocale conosce il momento critico: la persona fa una domanda un po' più complicata, e dall'altra parte cala un silenzio di due o tre secondi. Al telefono due secondi sono un'eternità. È lì che chi ascolta capisce di parlare con una macchina — e spesso è lì che riattacca.
La novità più concreta di Extended Thinking sta proprio qui: ragiona e parla nello stesso momento. Invece di tacere mentre pensa, fa quello che farebbe una persona: segnala che sta controllando con una frase breve, e intanto lavora. Google lo descrive come l'uso di «segnali verbali» precoci e di una narrazione dei passaggi mentre il compito procede.
Sembra un dettaglio. Per un agente che telefona è la differenza fra una conversazione che scorre e una che si incaglia.
Fare le cose mentre parla
La seconda novità è che il modello esegue strumenti e chiamate ai sistemi in background senza interrompere la conversazione. Tradotto nel lavoro di tutti i giorni: mentre dice alla persona che sta guardando le disponibilità, sta davvero consultando l'agenda; mentre conferma l'orario, sta già registrando l'appuntamento.
Fra gli esempi mostrati da Google c'è proprio questo: prenotazioni in più passaggi coordinate mentre la conversazione continua, senza pause. È esattamente il mestiere di un agente che deve fissare un sopralluogo, una visita o un appuntamento in agenda — la cosa che alla generazione precedente riusciva, ma con qualche esitazione di troppo.
97 lingue, senza chiedere quale
Il terzo punto riguarda chi lavora con clienti che non parlano tutti la stessa lingua. Gemini 3.8 Live riconosce e cambia lingua da solo a metà conversazione, fra 97 lingue supportate. Non serve impostarla prima, e non serve che la persona la chieda: se risponde in un'altra lingua, il modello la segue.
Per un'agenzia immobiliare in una città con molti proprietari stranieri, o per uno studio che richiama pazienti di origini diverse, è una porta che prima andava aperta a mano.
Cosa i numeri non dicono
Qui serve onestà, perché è la parte che fa credere il resto. Il 35,1% sui compiti bancari complessi è un record, ma vuol dire anche che su quel tipo di prova — una base di conoscenza sterminata, pratiche in molti passaggi — il modello migliore del mondo sbaglia ancora due volte su tre. I benchmark sono fatti apposta per essere difficili, e questo lo è.
La conseguenza pratica è la stessa che vediamo lavorando: un agente vocale rende al massimo quando ha un compito chiaro e delimitato — richiamare, qualificare, fissare un appuntamento — e non quando gli si chiede di fare tutto. Il modello è il motore. Quello che lo fa andare dritto è come viene impostato il lavoro: cosa deve ottenere, dove si ferma, quando passa la palla a una persona.
E una seconda cosa: sono numeri pubblicati da chi ha fatto il modello, su test scelti da lui. Sono misurati da enti terzi — Artificial Analysis, Sierra, ServiceNow — ma la vetrina resta quella di Google. Il test che conta davvero è sentirlo parlare sul proprio caso.
Cosa puoi fare lunedì mattina
Prendi la telefonata che in azienda nessuno fa mai — i preventivi da richiamare, i clienti da ricontattare, le disdette da riempire — e scrivi su un foglio il risultato che vorresti a fine chiamata, in una riga sola. Un appuntamento fissato, un sì o un no, un orario confermato.
Se ci sta in una riga, è esattamente il tipo di lavoro in cui i modelli di questa generazione danno il meglio. E adesso lo fanno senza quei silenzi che, fino a pochi mesi fa, tradivano la macchina.
Fonti
- Google — Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking, 15 settembre 2026
- Google DeepMind — Gemini 3.8 Audio (Live, Live Extended Thinking): model evaluation (tutte le cifre della tabella)
- Google DeepMind — Model card di Gemini 3.8 Audio
Perché lo sappiamo
Non veniamo dal software, veniamo dalla vendita. Gli script che trovi in queste pagine non escono da un modello generico: nascono da oltre cinque anni di vendita telefonica, e vengono riscritti dopo aver riascoltato le chiamate — quelle andate bene e soprattutto quelle andate male. Dietro ogni riga di copione c'è una frase che al telefono ha funzionato, e tre che sono state buttate.
Il motore lo scegliamo e lo aggiorniamo noi. Tu senti l'agente sul tuo settore, approvi come parla, e ricevi gli appuntamenti. → Come lavoriamo, settore per settore
