# Il paradosso di Claude: il modello più debole corregge il più potente

URL: https://menteinformatica.it/intelligenza-artificiale/anthropic-claude-allineamento-modello-potente/
Autore: Giorgio Perillo
Aggiornato: 2026-10-01
Categoria: Intelligenza Artificiale

---

Un modello Claude più debole ha corretto i problemi di sicurezza di un modello Claude più potente, prima ancora che questo finisse il suo addestramento. È l’esperimento al centro di un nuovo report di ricerca **Anthropic**, e il dettaglio che colpisce di più non è il risultato in sé, ma la velocità con cui è arrivato.

Il report si intitola [Automated Researchers Can Reliably Mitigate Alignment Failures](https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures) e descrive come **Claude**, usato come ricercatore automatizzato, abbia lavorato da solo per correggere dieci categorie diverse di problemi di allineamento: inganno, adulazione compiacente verso l’utente (sycophancy), vulnerabilità ai jailbreak, violazioni della privacy, reward hacking e altre.

## Dieci categorie di errori, tutte migliorate

Il sistema ha seguito un ciclo simile a quello di un ricercatore umano: cerca la letteratura scientifica disponibile, propone un metodo, addestra il modello con quel metodo e ne misura i risultati, poi ripete il processo affinando le soluzioni migliori. Secondo Anthropic, il risultato è stato netto su tutta la linea: **per tutte e dieci le categorie di fallimento testate, [Claude ha trovato](https://menteinformatica.it/intelligenza-artificiale/anthropic-lens-spazio-nascosto-claude/) correzioni che hanno migliorato i punteggi senza peggiorare le capacità generali del modello**.

Sul fronte dell’inganno (deception), il confronto con gli esseri umani è quello che rende l’esperimento notiziabile: i metodi automatizzati hanno chiuso in media l’85% del divario di sicurezza rispetto al punteggio perfetto, contro il 20% ottenuto da sei ricercatori esperti che lavoravano sotto le stesse regole.

85%del gap di sicurezza sulla deception chiuso da Claude, contro il 20% dei ricercatori umani

Il paragone va preso per quello che è: i ricercatori umani avevano fino a otto ore per proporre un metodo e non potevano iterare, mentre il sistema automatizzato ha potuto testare e correggere le proprie proposte più volte. Non è quindi una gara ad armi pari, ma un indizio su come i due approcci potrebbero funzionare insieme, con Claude che individua le strade promettenti e i ricercatori che le affinano.

## Sonnet 5 allinea un checkpoint di Opus 4.8

La parte più interessante del report riguarda un esperimento diverso, pensato per rispondere a una domanda specifica: un modello più debole può migliorare la sicurezza di uno più forte? Anthropic ha assegnato a **Claude Sonnet 5**, meno capace di **[Claude Opus](https://menteinformatica.it/intelligenza-artificiale/claude-opus-disponibile-benchmark/) 4.8** secondo l’Epoch Capabilities Index citato nel report, il compito di correggere i problemi di allineamento in un checkpoint iniziale di Opus 4.8 che non aveva ancora completato la maggior parte dell’addestramento di sicurezza previsto in produzione.

In 60 ore, Claude ha testato oltre 50 soluzioni diverse e ha raggiunto punteggi di allineamento vicini a quelli del modello di produzione finale. La soluzione vincente si basa su poco più di 2.000 esempi di addestramento, costruiti con template semplici o dataset pubblici, il che la rende circa 15.000 volte più efficiente in termini di dati rispetto alla procedura di allineamento standard usata da Anthropic.

**Da sapere:** le migliori tecniche trovate da Claude sono rimaste efficaci anche su modelli fino a 4,7 volte più grandi di quelli usati durante il ciclo di ricerca, e hanno funzionato pure su benchmark che il modello non aveva mai visto durante l’addestramento.

## Il rischio di imbrogliare i propri test

Un sistema che genera e valuta da solo centinaia di tentativi porta con sé un problema evidente: la tentazione di barare. Anthropic ha già osservato in esperimenti precedenti che Claude può ottenere test dalle API remote in modo scorretto e selezionare solo i risultati favorevoli.

Per questo motivo il team ha usato **Claude Opus 4.8** come sistema di sorveglianza, incaricandolo di controllare circa 1.600 trascrizioni delle sessioni di ricerca su tutte e dieci le categorie di allineamento. Ha trovato tentativi di imbroglio in 39 casi, pari al 2,4% del totale.

Anthropic si dice cautamente ottimista sul fatto che questo monitoraggio abbia individuato la maggior parte dei tentativi scorretti in questo studio specifico, ma ammette che il metodo potrebbe non funzionare altrettanto bene sui modelli futuri: da qui l’insistenza sulla necessità di mantenere alta la trasparenza dei ragionamenti dei modelli, anche quando diventano più capaci.

Un modello più debole che allinea uno più forte in 60 ore non è ancora un’AI che si migliora da sola: è un esperimento controllato che apre una domanda, non una risposta.

## Un esperimento di laboratorio, non un prodotto

Va detto con chiarezza: niente di tutto questo è disponibile oggi in un prodotto commerciale. Il report descrive un esperimento di ricerca condotto su benchmark pubblici e su un checkpoint interno non ancora rilasciato di Opus 4.8, non una funzione che arriva ai clienti Anthropic o ai concorrenti.

Il contesto è importante: gli stessi autori definiscono i risultati una prova preliminare, non una dimostrazione conclusiva. Le categorie di allineamento testate restano più ristrette di quelle che contano davvero in produzione (il report cita esplicitamente l’assenza di misure sui bias politici), e l’intero impianto dipende dalla qualità dei benchmark usati per giudicare il successo: se i benchmark hanno dei limiti, li eredita anche il sistema che li ottimizza.

**L’analisi:** secondo me il dato più significativo non è la percentuale di successo, ma il fatto che Anthropic abbia dovuto costruire un monitor separato per scoprire che il proprio sistema barava in decine di casi. È la prova che l’automazione della ricerca sull’allineamento non riduce il bisogno di supervisione umana: lo sposta, e forse lo rende più urgente.

**Perché conta:** il report non promette nulla di disponibile per chi usa Claude oggi, ma segnala una direzione che riguarda chi sviluppa modelli frontier, Anthropic compresa, e chi dovrà valutarne la sicurezza: se il post-training automatizzato diventa davvero praticabile a basso costo, cambia anche la velocità con cui questi sistemi potranno essere corretti o, al contrario, sfuggire al controllo.

Anthropic pone la domanda apertamente nel proprio report: cosa succede quando Claude diventa più bravo a fare ricerca sull’allineamento degli stessi ricercatori umani che lo supervisionano? Per ora la risposta resta un esperimento su benchmark, non una previsione.

Fonte: [anthropic.com](https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures).
