Una nuova era per l’interazione vocale
OpenAI ha introdotto sull’app mobile di ChatGPT una modalità agentica basata sulla voce, già sperimentata su desktop con la tecnologia GPT‑Live. Grazie a questa novità, gli utenti possono dare comandi come “scrivi un documento sul progetto X” o “crea una presentazione per la riunione di domani” e ricevere risultati completi, senza dover digitare nulla. La funzionalità è pensata per chi è in movimento: si può parlare al telefono mentre si cammina verso l’ufficio, si è in coda al supermercato o semplicemente ci si rilassa sul divano.
Come funziona la modalità agentica
Le conversazioni vocali non si limitano più a fornire risposte brevi; producono output di testo ricchi, come documenti, email, riassunti, presentazioni e persino pagine web. L’interfaccia consente di passare fluidamente dalla voce al testo, permettendo di rivedere, modificare o ampliare il contenuto generato. Inoltre, la sessione può iniziare su smartphone e riprendere sul desktop, garantendo una continuità che ricorda le soluzioni già offerte da Anthropic con il suo servizio Cowork.
Disponibilità e differenziazione tra piani
Gli utenti con abbonamento Plus o Pro hanno accesso immediato alla scheda “Work” direttamente dallo smartphone, dove possono sfruttare la voce per creare tutti i tipi di contenuti elencati. Gli utenti con piani Free e Go invece ottengono l’accesso a plugin e app connesse, ma non alla scheda completa “Work”. Questa distinzione è una delle principali differenze rispetto a Anthropic, che ha unificato chat e workspace in un’unica interfaccia, mentre OpenAI mantiene separati i due ambienti per una gestione più strutturata delle attività.
Esempi di comandi vocali supportati
- “Scrivi un documento sul progetto X con struttura a tre sezioni”.
- “Crea una presentazione di dieci slide per il meeting di domani”.
- “Genera una email di risposta al cliente per la proposta di prezzo”.
- “Fai un riassunto di questo articolo in cinque punti”.
- “Costruisci una pagina web di presentazione per il nuovo prodotto”.
Ogni comando viene elaborato in tempo reale, e il risultato viene visualizzato sia in forma testuale che, se richiesto, in formato scaricabile (PDF, PPTX o HTML).
Concorrenza e contesto di mercato
La voce sta rapidamente diventando l’interfaccia principale per le attività di intelligenza artificiale complesse. Apple ha lanciato Siri AI su iOS 27 con slider per velocità ed espressività; Anthropic ha integrato la modalità vocale in Claude su Opus e Sonnet, supportando nove lingue; Google ha sperimentato la voce su occhiali Android XR con Gemini. In questo scenario, la proposta di OpenAI si differenzia perché la voce è strettamente legata a capacità agentiche, cioè non solo risponde, ma esegue compiti concreti su dispositivi mobili.
Impatto sulla produttività quotidiana
L’introduzione dell’agente vocale su ChatGPT mobile promette di cambiare le abitudini di lavoro. Professionisti che spesso si trovano a gestire più contesti (riunioni, spostamenti, compiti urgenti) possono delegare la stesura di documenti e la preparazione di presentazioni a un assistente vocale, liberando tempo per attività a più alto valore aggiunto. Inoltre, la possibilità di sincronizzare la sessione tra smartphone e desktop riduce la frizione legata al passaggio da un dispositivo all’altro, un aspetto spesso criticato nelle soluzioni concorrenti.
Prospettive future
Secondo le indicazioni fornite da Business Insider e dalla giornalista Tiziana Foglio, la modalità agentica vocale è solo il primo passo di una serie di aggiornamenti che OpenAI prevede di rilasciare nei prossimi mesi. Si parla di integrazioni più profonde con gli strumenti di produttività di terze parti, di un’espansione delle lingue supportate e di una maggiore personalizzazione dell’esperienza vocale (tono, velocità, livello di formalità). Se queste previsioni si concretizzeranno, la voce potrebbe diventare il punto di ingresso principale per la maggior parte delle interazioni con l’AI, superando di gran lunga l’uso tradizionale della tastiera.
