# ChatGPT lavora da solo per giorni: cosa cambia per te

URL: https://menteinformatica.it/intelligenza-artificiale/llms-plus-evoluzione-recursive-llm-mixture-experts/
Autore: Giorgio Perillo
Aggiornato: 2026-10-01
Categoria: Intelligenza Artificiale

---

**Il futuro dell’AI non è una tecnologia completamente nuova: sono gli LLM che conosciamo già, ma riprogettati per essere più efficienti, più stabili e capaci di lavorare in autonomia per giorni interi. MIT Technology Review ha pubblicato questa settimana un’analisi dettagliata su quella che chiama la generazione “LLMs+” , e i cambiamenti in arrivo sono più concreti di quanto sembri.**

## Mixture-of-experts e diffusion model: come si taglia il costo dell’AI

Uno dei problemi più reali degli LLM oggi è il costo computazionale enorme. L’approccio **mixture-of-experts** risolve il problema in modo elegante: divide il modello in sottosistemi specializzati e ne attiva solo una parte per volta, in base al tipo di compito richiesto.

L’altra direzione è ancora più radicale: abbandonare i **transformer**, l’architettura neurale che sta sotto praticamente tutto ciò che usiamo oggi, a favore dei **diffusion model**, finora usati quasi solo per immagini e video. È un cambio di paradigma, non un aggiornamento incrementale.

📌 **Da sapere:** **DeepSeek**, l’azienda cinese già nota per aver spiazzato i competitor occidentali, ha mostrato l’anno scorso una tecnica per codificare testo in immagini, riducendo drasticamente i costi di calcolo. Non è ancora mainstream, ma è un segnale di dove si sta andando.

Vale la pena mettere in prospettiva quanto è veloce questo cambiamento: GPT-2, uscito nel 2019, aveva 1,5 miliardi di parametri e non era nemmeno disponibile al pubblico completo perché OpenAI temeva gli abusi. Sei anni dopo stiamo discutendo di architetture che sostituiscono il transformer di base. **Il ciclo di obsolescenza in questo settore è più breve di quello di uno smartphone.**

Il mixture-of-experts non è un’idea nuova in assoluto: Google lo usava già internamente con **Switch Transformer** nel 2021. La differenza oggi è che Mistral AI lo ha portato in produzione con Mixtral 8x7B a dicembre 2023, dimostrando che funziona anche fuori dal laboratorio e a costi accessibili per aziende medie. OpenAI ha confermato che anche GPT-4 usa una variante MoE, anche se non ha mai pubblicato i dettagli tecnici.

## Context window da un milione di token: opportunità e limite

Fino a due anni fa, un LLM poteva processare qualche decina di pagine in una volta. I modelli più recenti arrivano a **un milione di token**, equivalente a una pila intera di libri.

Il problema è che più è grande la finestra di contesto, più il modello tende a perdersi o a contraddirsi durante task lunghi.

La risposta più interessante arriva da un paper recente del **MIT CSAIL**: i cosiddetti [recursive LLM descritti su MIT Technology Review](https://www.technologyreview.com/2026/04/21/1135645/llm-large-language-models-ai/) spezzano l’input in blocchi e passano ciascuno a copie di sé stessi, in cascata. Il risultato pratico è che più LLM che lavorano su pezzi piccoli battono in affidabilità un singolo modello che cerca di tenere tutto in testa insieme.

Google ha un approccio diverso al problema: con **Gemini 1.5 Pro** ha scelto di allargare la finestra fino a 2 milioni di token mantenendo un singolo modello, puntando sulla qualità dell’attention mechanism piuttosto che sulla decomposizione ricorsiva. **Sono due scommesse architetturali opposte**, e non è ancora chiaro quale reggerà meglio su task di produzione reale a sei mesi dall’adozione.

Anthropic con Claude 3.5 ha invece privilegiato la coerenza narrativa su contesti lunghi rispetto alla dimensione assoluta della finestra. Nei test interni su documenti legali e codebase grandi, Claude mantiene riferimenti incrociati meglio di GPT-4o su testi sopra le 100.000 parole, anche se la finestra massima resta inferiore. **La gara non è solo chi arriva al numero più grande.**

## Cosa significa per chi usa AI nel lavoro quotidiano

💡 **L’analisi:** I recursive LLM e il mixture-of-experts non sono feature cosmétiche: se tengono le promesse, abilitano [agenti AI](https://menteinformatica.it/intelligenza-artificiale/ai-agents-cosa-sono/) capaci di portare a termine task complessi in autonomia senza sfaldarsi a metà strada. Per chi usa oggi ChatGPT o Gemini per lavoro, questo è esattamente il salto che manca.

Il punto che trovo più sottovalutato nel dibattito italiano sull’AI è questo: la barriera attuale non è la qualità delle risposte singole, ma l’**affidabilità su task lunghi e multi-step**. Chiunque abbia provato a usare un agente AI per un progetto articolato lo sa: si rompe a metà, dimentica il contesto, si contraddice.

Se le architetture LLMs+ mantengono le promesse, il 2026-2027 sarà l’anno in cui l’AI smette di essere un assistente da supervisionare frase per frase e diventa uno strumento a cui delegare lavoro vero. Io ci credo, ma con una riserva: le demo di laboratorio MIT e le implementazioni produzione hanno sempre avuto un divario enorme.

## Chi rischia di più nei prossimi 12 mesi

Se gli agenti LLMs+ diventano affidabili su task multi-giorno, il segmento più esposto non è il lavoro creativo: è il **knowledge work procedurale**, cioè analisi dati ripetitiva, produzione di report strutturati, revisione contrattuale di primo livello. Sono esattamente le attività su cui si reggono interi reparti di consulenza junior.

Sul fronte dei player, Microsoft è quella con più da guadagnare nel breve: ha già Copilot integrato in Office 365, ha accesso diretto ai modelli OpenAI e una base enterprise consolidata. **Se gli agenti autonomi funzionano, Microsoft li vende a chi ha già un abbonamento attivo senza bisogno di convincere nessuno.** Google parte avvantaggiata sul lato infrastruttura cloud ma sconta ancora una percezione di inaffidabilità sui prodotti consumer AI dopo i lanci problematici del 2023-2024.

Starò a guardare i benchmark reali, non i paper.

Stay tech 🦾
