# Gemini 3.5 Transcribe arriva su Gboard e macOS, Chrome resta indietro

URL: https://menteinformatica.it/intelligenza-artificiale/gemini-transcribe-dettatura-google/
Autore: Giorgio Perillo
Aggiornato: 2026-10-02
Categoria: Intelligenza Artificiale

---

Google ha annunciato **Gemini 3.5 Transcribe**, un modello di trascrizione vocale che non si limita a convertire audio in testo: **lo ripulisce da solo**, eliminando esitazioni, autocorrezioni e parole di riempimento come “ehm” e “ah”, e lo formatta in modo leggibile senza che l’utente debba intervenire.

È già disponibile per gli sviluppatori tramite le [API di Google AI Studio e Gemini Enterprise Agent Platform](https://www.la%20testata/news/gemini-35-transcribe-trascrizione-vocale-ai-google.html), ma arriva anche su alcune superfici che usiamo ogni giorno: Gboard su Android (nella funzione Rambler) e l’app Gemini su macOS.

## Cosa fa in concreto il modello

Oltre alla pulizia del parlato, Gemini 3.5 Transcribe riconosce automaticamente **oltre 85 lingue** con gestione degli accenti regionali e identifica fino a **tre parlanti diversi** in registrazioni pre-esistenti, con supporto sperimentale per un numero maggiore.

Si può anche fornire al modello un vocabolario personalizzato per termini tecnici o nomi propri, e il sistema gestisce meglio entità alfanumeriche come codici postali o numeri d’ordine, un punto dove i sistemi tradizionali sbagliano spesso.

70%miglioramento del tempo di trascrizione dichiarato da Google rispetto a Chirp 3

Google cita anche un tasso di errore medio del 4% in streaming e del 2,6% per l’audio pre-registrato, dati che l’azienda attribuisce a misurazioni di Artificial Analysis: numeri comunicati da Google stessa, non una verifica indipendente pubblicata per intero.

## Il salto da trascrizione a strumento agentico

Quello che cambia davvero non è la qualità del riconoscimento vocale in sé, ma il fatto che il modello si integri con altri modelli Gemini tramite **function calling**: sull’app macOS può, per esempio, passare il contenuto trascritto ad altre funzioni AI, come generare un’immagine o riassumere un file, senza che l’utente debba copiare e incollare nulla.

La differenza non è più tra parlare bene o male al microfono, ma tra un testo grezzo e uno che arriva già pronto all’uso.

È qui che sta, secondo me, il punto più interessante della mossa di Google: la dettatura vocale smette di essere un servizio isolato e diventa un ingranaggio che si aggancia al resto dell’ecosistema Gemini. Il rischio è che l’utente perda il controllo su cosa viene
