TANO — AI Voice Agent

Registro chiamate

Ascolta mentre parla. Come una persona al telefono.

Il 10 settembre OpenAI ha reso disponibile agli sviluppatori il suo modello vocale full duplex. Nei numeri pubblicati il salto più grande non è su quanto sa, ma su come gestisce il momento in cui l'altro ti parla sopra.

Quando smetti di parlare, il modello vocale di OpenAI della generazione precedente impiegava in media 1,41 secondi prima di cominciare a risponderti. Il nuovo ne impiega 0,798. Poco più di mezzo secondo di differenza: al telefono è la distanza fra una pausa che sembra una riflessione e una che sembra una linea caduta.

Il modello si chiama GPT-Live-1. OpenAI lo aveva mostrato prima dentro ChatGPT, e il 10 settembre 2026 lo ha reso disponibile nell'API, cioè a chi costruisce agenti vocali. Fra le funzioni elencate nell'annuncio ce n'è una scritta senza giri di parole: supporto per la telefonia, per agenti che gestiscono chiamate «dalle prenotazioni al ristorante all'assistenza clienti».

Cosa è uscito, in due righe

Un modello che fa una cosa sola, ma la fa in modo nuovo: tiene la conversazione. Ascolta, parla, capisce quando tocca a lui e quando no. Il ragionamento più pesante e le azioni — consultare un'agenda, cercare un dato, registrare una richiesta — le può delegare a un secondo modello che lavora dietro le quinte, mentre lui continua a parlare con la persona.

È una divisione dei compiti che somiglia a quella di un buon centralino: chi risponde non smette di parlare con te mentre un collega controlla la pratica. OpenAI la descrive proprio così: la conversazione prosegue «mentre le attività vengono svolte in background».

Full duplex, in parole semplici

Quasi tutti gli agenti vocali fino a oggi funzionano a staffetta. Un primo sistema trasforma la tua voce in testo, un secondo decide cosa rispondere, un terzo trasforma la risposta in voce. Tre passaggi, uno dopo l'altro. Funziona, ma ha un difetto di fondo: mentre parla, la macchina non ti sente davvero, e ogni passaggio di consegne aggiunge un pezzetto di ritardo. È la stessa OpenAI a scriverlo nell'annuncio: ogni passaggio «aumenta la latenza e le possibilità di perdere la tempistica» della conversazione.

Full duplex vuol dire che ascolto e parola passano nello stesso momento, come in una telefonata fra due persone. GPT-Live-1 elabora insieme l'audio che entra e quello che esce, in un unico modello. Può quindi accorgersi che lo stai interrompendo mentre sta ancora parlando, fermarsi, e riprendere dal punto giusto. Può sentire un «sì, sì» detto sopra la sua frase e capire che è un segnale di assenso, non una domanda nuova.

I numeri, a confronto con la generazione precedente

Tutte le cifre vengono dai grafici pubblicati da OpenAI nell'annuncio. Il confronto è con GPT-Realtime-2.1 e GPT-Realtime-2, i due modelli vocali in tempo reale che OpenAI offriva prima.

Cosa misuraGPT-Live-1GPT-Realtime-2.1GPT-Realtime-2
Tempo per iniziare a rispondere
(Full Duplex Bench v1, più basso è meglio)
0,798 s1,41 s1,63 s
Reazione a interruzioni, rumori e voci di sottofondo
(Full Duplex Bench v1.5)
80,1%45,4%47,8%
Pause, alternanza dei turni, segnali di ascolto
(Artificial Analysis Conversational Dynamics)
97,3%95,7%95,3%
Azioni giuste da richieste con esitazioni e autocorrezioni
(Full Duplex Bench v3, uso degli strumenti)*
87,0%60,0%58,0%
Risposta che corrisponde all'intento
(Full Duplex Bench v3, qualità della risposta)*
90,0%88,0%81,0%
Compiti di assistenza clienti completati a voce
(τ³ Voice: voli, negozi, telefonia)**
86,2%45,7%42,4%
Compiti bancari con ricerca nella base di conoscenza
(τ Banking Voice Knowledge, 97 prove)**
32,0%12,4%10,3%

* GPT-Live-1 abbinato al modello di ragionamento GPT-6 Terra (livello basso). ** GPT-Live-1 abbinato a GPT-6 Astra (livello medio). Fonte: OpenAI, annuncio del 10 settembre 2026, grafici della sezione «Misurare i vantaggi del full duplex».

La lettura in una riga: dove il modello di prima era già bravo — gestire le pause in una conversazione ordinata — il miglioramento è di un paio di punti. Dove la conversazione si fa disordinata, il salto è enorme: interruzioni, rumore, frasi spezzate. Che è esattamente com'è fatta una telefonata vera.

Le interruzioni: il punto in cui la telefonata si rompeva

Al telefono le persone si parlano sopra di continuo. Dicono «un attimo», «no aspetti», «sì sì ho capito». Un agente a staffetta, in questi momenti, fa una di due cose sbagliate: o continua a parlare come se niente fosse, o si ferma di colpo ogni volta che sente un suono. In tutti e due i casi chi ascolta capisce che dall'altra parte non c'è nessuno che ascolta davvero.

Sul test che misura proprio questo, GPT-Live-1 passa dal 45,4% del modello precedente all'80,1%. OpenAI riporta anche un caso di chi lo ha provato in anteprima, un'app per imparare le lingue: il modello lasciava più tempo per pensare prima di rispondere, e le interruzioni sono calate di quasi l'80% rispetto ai sistemi a turni di prima.

Per chi usa l'AI al telefono vuol dire una cosa pratica: la persona dall'altra parte può comportarsi come si comporta sempre, senza aspettare educatamente il suo turno. È la macchina ad adattarsi alla persona, non il contrario.

Il rumore, e chi parla con un altro

Lo stesso test verifica una cosa che chiunque abbia chiamato un'azienda conosce bene: la persona che risponde dal negozio, dal cantiere, dalla macchina, e a metà frase si gira a dire qualcosa a un collega. Un agente a staffetta prende quella frase per una risposta, e ci risponde. GPT-Live-1 è valutato proprio sulle reazioni «al parlato in sottofondo, al parlato rivolto a un'altra persona», e nella demo pubblica OpenAI invita a provarlo apposta in un posto rumoroso, un bar o una strada trafficata.

Sembra un dettaglio da laboratorio. Per un agente che chiama titolari di piccole imprese — gente che risponde mentre lavora — è la differenza fra una chiamata che va avanti e una che si ingarbuglia al secondo scambio.

Capire anche le frasi storte

Nessuno parla come scrive. «Martedì… no, mercoledì, ma dopo le tre. Anzi, facciamo giovedì.» Per fissare un appuntamento, un agente deve capire che la risposta giusta è l'ultima, e registrare quella. Il test sull'uso degli strumenti misura proprio questo — richieste con pause, esitazioni e autocorrezioni — e il risultato passa dal 60% all'87% di sequenze di azioni corrette.

OpenAI segnala anche una migliore comprensione dei contenuti alfanumerici — codici, targhe, indirizzi email dettati a voce — e la possibilità di indicare al modello le parole chiave a cui dare priorità, come il nome di un prodotto o di una località. Sono le cose su cui un agente vocale inciampava più spesso, e che costringevano a farsi ripetere.

Cosa i numeri non dicono

Tre cose, perché senza queste il resto non vale.

La prima: la tabella non confronta modelli nudi. In quattro righe su sette GPT-Live-1 lavora in coppia con un modello di ragionamento dietro le quinte, e i modelli di prima no. È un confronto onesto fra due modi di costruire un agente — quello nuovo contro quello vecchio — ma non fra due motori a parità di condizioni. Gli asterischi sotto la tabella stanno lì per questo.

La seconda: sui compiti difficili sbaglia ancora spesso. Il 32% sulle pratiche bancarie è quasi il triplo di prima, ma vuol dire che due volte su tre il compito non viene chiuso. Vale quello che abbiamo scritto per gli altri modelli vocali di questa generazione: rendono al massimo su un compito chiaro e delimitato, come richiamare, qualificare, fissare un appuntamento, e non quando gli si chiede di fare tutto.

La terza: sull'italiano non c'è ancora un numero. L'annuncio parla di una scelta più ampia di accenti, dialetti e lingue, e promette di allargarla nei prossimi mesi; la documentazione tecnica non pubblica risultati lingua per lingua. I benchmark della tabella non dicono come se la cava con un titolare di Bergamo o di Lecce che risponde di fretta. Quello si scopre solo ascoltandolo, e sono sempre numeri scelti e pubblicati da chi ha fatto il modello.

Cosa puoi fare lunedì mattina

Prendi il telefono dell'ufficio e ascolta, per una mattina, le chiamate in uscita dei tuoi — o fai caso alle tue. Segna su un foglio quante volte la persona dall'altra parte vi parla sopra, e quante volte risponde con del rumore intorno. Sono i due punti in cui un agente vocale della generazione precedente si inceppava, e quelli in cui questa generazione ha fatto il passo più lungo.

Se sul tuo foglio quei segni sono tanti, la tua è proprio il tipo di telefonata che fino a pochi mesi fa un'AI reggeva male, e che adesso vale la pena riascoltare.

Fonti

Perché lo sappiamo

Non veniamo dal software, veniamo dalla vendita. Gli script che trovi in queste pagine non escono da un modello generico: nascono da oltre cinque anni di vendita telefonica, e vengono riscritti dopo aver riascoltato le chiamate — quelle andate bene e soprattutto quelle andate male. Dietro ogni riga di copione c'è una frase che al telefono ha funzionato, e tre che sono state buttate.

Il motore lo scegliamo e lo aggiorniamo noi. Tu senti l'agente sul tuo settore, approvi come parla, e ricevi gli appuntamenti. → Come lavoriamo, settore per settore

Parliamone

Mezz'ora sul tuo caso, non una presentazione

Guardiamo come lavori adesso, ti facciamo sentire l'agente sul tuo settore e ti diciamo se ha senso o no. Se non ha senso te lo diciamo lì. Scegli tu giorno e ora.

Se il calendario non si carica, apri direttamente la pagina di prenotazione.

Apri il calendario