Poco più di un decimo di secondo. È il tempo che il nuovo modello di trascrizione di Microsoft impiega, dopo aver ricevuto l'audio, per scrivere la sua prima ipotesi di quello che stai dicendo. Non aspetta che tu finisca la frase: la scrive mentre parli, e la corregge man mano che aggiungi parole.
Per chi usa l'AI al telefono è una notizia più grossa di quanto sembri. Un agente vocale che sa cosa stai dicendo mentre lo dici può cominciare a preparare la risposta prima che tu abbia chiuso bocca. E la pausa che resta, quella che dall'altra parte si sente, si accorcia.
Cosa è uscito, in due righe
Il 1° ottobre 2026 Microsoft AI — il laboratorio interno di Microsoft che sviluppa i propri modelli — ha presentato tre modelli in un colpo solo:
- MAI-Transcribe-2-Streaming, che trasforma la voce in testo in tempo reale, in 60 lingue, riconoscendo da solo quale lingua si sta parlando;
- MAI-Voice-2.1, che trasforma il testo in voce, in 23 lingue, con la cura massima sulla qualità;
- MAI-Voice-2.1-Flash, la versione rapida della stessa voce, costruita per rispondere subito e reggere grandi volumi.
Il sottotitolo dell'annuncio dice dove vogliono arrivare: modelli «per costruire i migliori agenti vocali conversazionali». Nella documentazione, fra gli usi elencati per la voce rapida, compaiono testualmente gli agenti vocali, i centralini automatici e le chiamate da call center. L'italiano c'è, in tutti e tre.
Il giro di una battuta
Per capire perché un modello di trascrizione fa notizia bisogna guardare cosa succede in un agente vocale ogni volta che parli. Microsoft lo spiega bene: un agente è un giro chiuso, deve «sentire, capire, decidere e parlare», e deve farlo tutto dentro la finestra in cui una persona continua a percepire lo scambio come una conversazione.
Ogni pezzo di quel giro consuma una parte della finestra. Se l'orecchio è lento e la bocca è lenta, al cervello resta pochissimo tempo per ragionare — e allora o risponde in fretta e male, o risponde bene ma dopo un silenzio che al telefono sembra una linea caduta. Il ragionamento dell'annuncio è semplice: orecchio e bocca più veloci restituiscono tempo al cervello, che può usarlo per controllare un'agenda, cercare un dato, verificare la risposta, senza che la conversazione rallenti.
I tre modelli, a confronto
Le cifre vengono dall'annuncio ufficiale e dalla documentazione tecnica pubblicata da Microsoft. Non ci sono numeri di nessun altro.
| MAI-Transcribe-2-Streaming | MAI-Voice-2.1-Flash | MAI-Voice-2.1 | |
|---|---|---|---|
| Cosa fa | Dalla voce al testo, mentre parli | Dal testo alla voce, in fretta | Dal testo alla voce, con la massima resa |
| Lingue | 60, con riconoscimento automatico | 23 lingue, 26 varianti | 23 lingue, 26 varianti |
| Italiano | Sì | Sì, 4 voci | Sì, 4 voci |
| Velocità dichiarata | Prima ipotesi in poco più di 100 ms; parole a schermo 2 volte più veloci del concorrente più vicino (test interni) | 150 ms di latenza complessiva | Non è il suo obiettivo: la documentazione dice che privilegia la naturalezza sulla velocità |
| Risultato dichiarato | Primo per accuratezza, sia sulle trascrizioni finali sia su quelle provvisorie, nella classifica di Artificial Analysis | Inferenza più veloce del 55% | Il modello vocale multilingue più forte fatto finora da Microsoft |
| Pensato per | Call center, assistenti vocali, sottotitoli dal vivo | Agenti vocali, centralini automatici, call center | Audiolibri, podcast, narrazioni lunghe |
Fonte: Microsoft AI, annuncio del 1° ottobre 2026; documentazione Microsoft Learn dei modelli MAI-Transcribe-2-Streaming e MAI-Voice-2.1 (aggiornata al 1° ottobre 2026). Tutti e tre i modelli sono in anteprima pubblica.
La lettura in una riga: per una telefonata contano le prime due colonne. La terza è la voce «da studio», bellissima per un audiolibro, ma che Microsoft stessa sconsiglia dove serve rispondere al volo. Il suggerimento dell'annuncio è proprio la coppia Transcribe-Streaming più Voice-Flash, che recupera tempo a tutti e due i capi del giro.
Capire prima che tu finisca
La novità vera sta nelle trascrizioni provvisorie — Microsoft le chiama «partials». Il modello non consegna il testo a frase finita: consegna subito la sua ipotesi migliore, la rivede mentre arrivano altre parole, e la conferma appena è sicuro. L'annuncio fa l'esempio che ci interessa: gli agenti vocali possono «cominciare a ragionare o a usare strumenti a metà frase».
Al telefono vuol dire questo. La persona dice «sì, guardi, giovedì pomeriggio potrei…» e, mentre sta ancora finendo, l'agente sta già guardando quali pomeriggi di giovedì sono liberi. Quando la frase si chiude, la risposta è quasi pronta. È quello che fa un buon segretario in carne e ossa: apre l'agenda mentre il cliente parla, non dopo.
Il fatto che sia primo in classifica sia sulle trascrizioni finali sia su quelle provvisorie conta per lo stesso motivo. Una trascrizione provvisoria veloce ma sbagliata farebbe partire l'agente nella direzione sbagliata. Secondo Microsoft, nel rapporto fra precisione e velocità il modello sta sulla frontiera: «una precisione più alta non deve per forza costare latenza».
Le voci in italiano
La documentazione elenca quattro voci italiane già pronte, utilizzabili sia con la versione piena sia con quella rapida:
| Voce | Genere | Stili disponibili |
|---|---|---|
| Harper | Femminile | Operatore, call center, narratore, neutro |
| Grant | Maschile | Audiolibro, didattico, neutro |
| Rosa | Femminile | 19 registri emotivi: dal sollievo alla speranza, dalla sorpresa al sussurro |
| Luca | Maschile | Gli stessi 19 registri emotivi |
Fonte: Microsoft Learn, «MAI-Voice-2.1 and MAI-Voice-2.1-Flash», tabella delle voci gestite.
Due cose saltano all'occhio. La prima: c'è una voce italiana con uno stile dichiaratamente da call center, cioè addestrata per il registro di chi risponde al telefono per lavoro. La seconda: le voci con i registri emotivi si possono guidare frase per frase, così che la stessa voce suoni distesa quando saluta e partecipe quando l'altro racconta un problema. È uno dei limiti storici della voce sintetica — il tono sempre uguale, da annuncio in stazione — e qui viene affrontato di petto.
Entrambi i modelli vocali permettono anche di creare una voce su misura a partire da pochi secondi di registrazione, con un controllo: si accede su richiesta, e serve il consenso registrato della persona a cui la voce appartiene. Per un'azienda vuol dire poter avere la propria voce, sempre la stessa, su ogni chiamata.
Una voce, più lingue
La promessa più curiosa dell'annuncio è che una sola voce possa parlare tutte le 23 lingue «con un accento davvero nativo»: inglese, poi mandarino, poi tedesco, e chi parla resta riconoscibilmente lo stesso. Unita al riconoscimento automatico della lingua dal lato dell'ascolto, significa un agente che risponde nella lingua in cui gli parli senza cambiare voce.
Per chi lavora in Italia non è un dettaglio da multinazionale. Pensa a chi affitta case ai turisti, a una clinica che riceve pazienti dall'estero, a un'agenzia immobiliare con acquirenti tedeschi sul lago: oggi o hanno qualcuno che parla la lingua, o perdono la telefonata.
Cosa l'annuncio non dice
Quattro cose, perché senza queste il resto non vale.
La prima: è un'anteprima. Tutti e tre i modelli sono in anteprima pubblica. La documentazione lo scrive in apertura: per ora niente garanzie di servizio, e uso in produzione sconsigliato. Si possono provare e misurare da subito; costruirci sopra un servizio che telefona ogni giorno è un'altra cosa, e conviene aspettare la versione definitiva.
La seconda: sull'italiano non c'è un numero. Il primo posto in classifica è su un insieme di prove generale; né l'annuncio né la documentazione pubblicano la precisione lingua per lingua. Come se la cava con un titolare di Cagliari che risponde dal furgone non lo dice nessuno: lo si scopre solo ascoltandolo.
La terza: il telefono non è un microfono. Per il collegamento in tempo reale la documentazione indica audio a 16 o 24 kHz, mentre una linea telefonica tradizionale viaggia a una qualità più bassa. Il suono va convertito, e nessuno dei numeri pubblicati è misurato su audio telefonico. È probabile che regga bene; non è dimostrato.
La quarta, quella che ci riguarda di più: la velocità non salva una telefonata sbagliata. Recuperare tempo a ogni battuta rende la conversazione più naturale, e questo conta. Ma se l'agente chiama la persona sbagliata, nel momento sbagliato, con un motivo che non le interessa, la risposta più veloce del mondo arriva soltanto prima al «no, grazie». I modelli migliorano il come si parla; il cosa dire e a chi resta lavoro di chi conosce quella telefonata.
Cosa puoi fare lunedì mattina
Apri il MAI Playground, la pagina pubblica dove Microsoft fa provare i suoi modelli (alcune funzioni chiedono di accedere con un account Microsoft). Nella sezione di trascrizione, che usa un modello della stessa famiglia, registra trenta secondi di te che parli come parli al telefono con un cliente — di corsa, con un nome proprio, un numero, una via — possibilmente con un po' di rumore intorno. Poi leggi il testo che esce.
Se il nome, il numero e la via sono giusti, hai appena visto con i tuoi occhi il pezzo su cui fino a poco tempo fa un agente vocale inciampava più spesso. E hai un'idea concreta, tua, di quanto questa generazione di modelli è pronta per il tuo telefono.
Fonti
- Microsoft AI — Our first streaming transcription model debuts at no. 1 on Artificial Analysis, 1° ottobre 2026 (velocità, lingue, classifica, usi)
- Microsoft Learn — MAI-Transcribe-2-Streaming overview (stato di anteprima, usi previsti)
- Microsoft Learn — Use MAI-Transcribe-2-Streaming with the Realtime API (lingue supportate, formato audio)
- Microsoft Learn — MAI-Voice-2.1 and MAI-Voice-2.1-Flash (voci italiane, stili, voce su misura)
Perché lo sappiamo
Non veniamo dal software, veniamo dalla vendita. Gli script che trovi in queste pagine non escono da un modello generico: nascono da oltre cinque anni di vendita telefonica, e vengono riscritti dopo aver riascoltato le chiamate — quelle andate bene e soprattutto quelle andate male. Dietro ogni riga di copione c'è una frase che al telefono ha funzionato, e tre che sono state buttate.
Il motore lo scegliamo e lo aggiorniamo noi. Tu senti l'agente sul tuo settore, approvi come parla, e ricevi gli appuntamenti. → Come lavoriamo, settore per settore
