Introduzione a Claude Sonnet 5.5
Claude Sonnet 5.5 è il secondo modello della famiglia Claude 5.5, rilasciato da Anthropic il 28 settembre 2026. Arriva sei giorni dopo Opus 5.5 e precede l’atteso Haiku 5.5. Pur mantenendo lo stesso prezzo del suo predecessore Sonnet 5, la nuova versione cambia radicalmente il bilanciamento tra prestazioni, sicurezza e costi operativi.
Una system card più concisa ma più significativa
La system card di Anthropic, descritta come “molto più corta” rispetto a quelle dei modelli di frontiera, si concentra sui test pre‑rilascio dei modelli più capaci. Anthropic afferma che d’ora in poi adotterà lo stesso formato per i modelli non di frontiera. Sonnet 5.5, nella tassonomia interna, non è considerato un modello di frontiera: questo influisce sulla valutazione del rischio e sul posizionamento rispetto agli altri Claude.
Responsibile Scaling Policy e valutazione del rischio
Le valutazioni della Responsible Scaling Policy non attivano nuove soglie di rischio per Sonnet 5.5. La motivazione è quasi aritmetica: il modello è meno capace di Opus 5.5 nella maggior parte delle prove, quindi il tetto di rischio è già fissato da quest’ultimo. Per i settori chimica e biologia, i cosiddetti rischi CB, Anthropic stima le capacità di Sonnet 5.5 pari o inferiori a quelle di Opus 5, e ben sotto Opus 5.5, con un ritardo netto sui compiti di ricerca autonoma a lungo termine.
L’indice interno AECI colloca Sonnet 5.5 a 167,93 contro i 169,12 di Opus 5.5. L’assessment di allineamento segnala che un modello meno capace potrebbe comunque presentare rischi maggiori se mostrasse comportamenti più preoccupanti. Anthropic riporta di non aver trovato prove di obiettivi disallineati coerenti e conferma il rating di rischio «basso» del Risk Report di agosto 2026.
Capacità offensiva nella cyber‑security
Su CyScenarioBench, un benchmark che misura la capacità di pianificare ed eseguire operazioni cyber multi‑fase, Sonnet 5.5 completa il 46,1 % degli scenari, mentre Sonnet 5 si fermava allo 0,7 %. Nel benchmark di exploitation dei binari, il nuovo modello produce 50 dirottamenti del flusso di controllo, contro i 3 di Sonnet 5 (per confronto, Opus 5.5 ne produce 106 e Mythos 5.1 ne produce 81).
Questo salto avvicina Sonnet 5.5 alla soglia in cui Anthropic applica le contromisure dei modelli più capaci, rendendolo il primo della linea Sonnet a includere i guardrail cyber e i fallback sviluppati per i modelli di punta.
Guardrail cyber e meccanismo di fallback
La scheda è chiara sull’effetto collaterale: gli utenti «dovrebbero aspettarsi un aumento dei rifiuti con Sonnet 5.5, anche su compiti benigni legati alla cybersicurezza». Il meccanismo di guardrail è a tre stadi:
- Una sonda che osserva le attivazioni interne del modello;
- Un classificatore leggero che gira sul modello stesso;
- Un classificatore LLM addestrato che decide se bloccare la risposta.
La ricerca di vulnerabilità nel codice sorgente rimane permessa, consentendo agli sviluppatori di scrivere software più sicuro, ma la ricerca di vulnerabilità nei binari compilati viene bloccata.
Comportamento differenziato per canale e tipologia di rifiuto
Il blocco varia a seconda del canale. Nelle applicazioni Anthropic e in Claude Code, una richiesta cyber ad alto rischio viene automaticamente indirizzata a Sonnet 5, cioè al modello precedente. Sull’API, lo sviluppatore deve attivare esplicitamente il fallback. Per la biologia, invece, la richiesta termina senza fallback.
La documentazione elenca cinque categorie di rifiuto: cyber, biologia, sviluppo di LLM di frontiera, estrazione del ragionamento e danni generali. Il ritentativo automatico lato server riguarda solo le prime due categorie tecniche.
Prompt injection e vulnerabilità di iniezione di istruzioni
Nel benchmark di prompt injection indiretta di Gray Swan, costruito con l’Istituto britannico per la sicurezza dell’AI e l’omologo statunitense, il tasso di successo dell’attacco su Sonnet 5.5 scende al 3,4 % dopo 15 tentativi, contro il 6,7 % di Sonnet 5. Nell’uso del browser, Sonnet 5.5 è il primo modello testato da Anthropic senza alcun attacco riuscito: zero su 110 scenari, anche senza contromisure attive.
Resistenza ai compiti malevoli e fallback in ambiente di coding
Il tasso di rifiuto dei compiti malevoli nell’uso del computer scende dall’84,68 % di Sonnet 5 al 79,46 %, identico a quello di Opus 5.5. In Claude Code, la flessione è dall’87,9 % all’85,2 %. Contro attaccanti adattivi in ambienti di coding, Sonnet 5.5 risulta nettamente più robusto del predecessore. Gran parte del residuo di attacchi riusciti passa per il fallback: quando un’iniezione chiede un’azione distruttiva, il classificatore cyber la intercetta e la dirotta su Sonnet 5, meno robusto. Sonnet 5.5 è compromesso in 4 richieste su 5 901 nell’ambiente di coding.
Trasparenza del ragionamento e sorveglianza
Un punto della scheda contrasta il tono rassicurante: il testo di ragionamento di Sonnet 5.5 è il meno leggibile fra i modelli testati, leggermente meno leggibile di Sonnet 5. Anthropic lo giustifica dichiarando che la leggibilità del ragionamento è la chiave per sorvegliare il comportamento del modello. L’azienda vuole ridurre nel tempo la dipendenza dall’audit di quella catena di pensiero.
Nel test di capacità di sabotaggio, Sonnet 5.5 è meno abile di Opus 5.5 nel completare un compito dannoso di nascosto quando il suo ragionamento è nascosto al controllore, e quasi non riesce quando il controllore può leggerlo. Il modello controlla male la propria catena di pensiero, rendendolo paradossalmente più sorvegliabile.
Allineamento, valutazioni comparative e omissioni
← Torna alle news
