Fable 5.1 vs Opus, GPT e altri modelli frontier
Cosa mostrano i nuovi benchmark e cosa serve ancora verificare
Entra nell'analisiRisposta breve
Fable 5.1 guida la tabella Anthropic su ricerca scientifica agentica, coding, knowledge work, computer use, ragionamento e automazioni. Il salto rispetto a Fable 5 è ampio in alcuni test, ma non prova che convenga sempre: input e output restano costosi, i setup cambiano tra benchmark e mancano ancora conferme indipendenti comparabili.
- Terminal-Bench-Science 0.1: Fable 5.1 52,6%, Opus 5 29,0%, Fable 5 24,7%, GPT-5.6 Sol 22,4%.
- Terminal-Bench 4.0: Fable 5.1 55,8%, Opus 5 52,3%, Fable 5 42,0%, GPT-5.6 Sol 37,3%.
- AutomationBench: Fable 5.1 31,4%, Opus 5 26,9%, GPT-5.6 Sol 19,6%, Fable 5 17,1%.
- CursorBench 3.2.0: Fable 5.1 73,4%, Fable 5 70,5%, Opus 5 70,0%, GPT-5.6 Sol 67,2%.
- Fable 5.1 costa $10/$50 per 1M token input/output, mentre la cache read scende a $0,25.
- Anthropic ha eseguito Fable 5.1 con safeguards di produzione; fallback e interventi possono cambiare alcuni risultati.
Evidenze
Dati e benchmark citati
Differenze
Il confronto che orienta la scelta
| Criterio | Risultato pubblicato | Lettura pratica |
|---|---|---|
| Terminal-Bench-Science 0.1 | Fable 5.1 52,6%, Fable 5 24,7%, Opus 5 29,0%, GPT-5.6 Sol 22,4%. | È il salto più netto della tabella, ma Anthropic segnala un errore standard di circa 3,5-4,5 punti e differenze di harness rispetto alla leaderboard pubblica. |
| Terminal-Bench 4.0 | Fable 5.1 55,8%, Fable 5 42,0%, Opus 5 52,3%, GPT-5.6 Sol 37,3%. | Fable guida il coding agentico, ma il margine su Opus è di 3,5 punti, molto inferiore al salto mostrato sulla ricerca scientifica. |
| GDPval-AA v2 | Fable 5.1 1853, Fable 5 1723, Opus 5 1824, GPT-5.6 Sol 1711. | Nel knowledge work Fable 5.1 è davanti, ma Opus resta vicino e costa la metà sui token nuovi e sull'output. |
| OSWorld 2.0 | Fable 5.1 77,9% partial e 41,7% strict; Opus 5 75,4% e 39,6%. | Il vantaggio nel computer use è contenuto. I task in cui i safeguards intervengono ricevono punteggio zero in alcune condizioni. |
| Humanity's Last Exam | Fable 5.1 60,9% senza tool e 65,0% con tool; Opus 5 56,6% e 63,6%. | Il vantaggio si riduce con gli strumenti: 1,4 punti invece di 4,3. Il tool use può avvicinare modelli con capacità di base diverse. |
| AutomationBench | Fable 5.1 31,4%, Fable 5 17,1%, Opus 5 26,9%, GPT-5.6 Sol 19,6%. | È un segnale utile per workflow aziendali lunghi, ma il punteggio assoluto mostra che resta molto lavoro non completato. |
| CursorBench 3.2.0 | Fable 5.1 73,4%, Fable 5 70,5%, Opus 5 70,0%, GPT-5.6 Sol 67,2%. | Il margine sul coding dentro Cursor è reale nella tabella, ma più piccolo rispetto ai titoli sul salto generazionale. |
Applicazione
I tre segnali più forti
I numeri vengono dalla tabella di lancio Anthropic verificata il 2 settembre 2026. Non sono una classifica universale e non hanno tutti lo stesso setup.
Ricerca scientifica agentica
Terminal-Bench-Science 0.1 · Accuracy
- Numero
- 52,6%
- Cosa misura
- Salto più ampio
È il dato più interessante per ricerca computazionale con terminale e strumenti, non per domande scientifiche generiche in chat.
Coding agentico
Terminal-Bench 4.0 · Accuracy
- Numero
- 55,8%
- Cosa misura
- +3,5 punti su Opus 5
Il vantaggio esiste, ma va confrontato con il costo per task completato e con la propria codebase.
Automazioni aziendali
AutomationBench · Accuracy
- Numero
- 31,4%
- Cosa misura
- +4,5 punti su Opus 5
Fable migliora, ma nessun modello supera un terzo del benchmark: la supervisione resta necessaria.
Cosa scegliere oggi
Fable 5.1 è il modello da provare quando il lavoro è lungo, agentico e costoso da rifare. Opus 5 resta il punto di partenza più equilibrato per la maggior parte dei task complessi, perché si avvicina a Fable in diversi test e costa la metà su input nuovo e output. GPT resta rilevante quando il workflow dipende da Codex o dall'ecosistema OpenAI.
- Prova Fable 5.1 per agenti lunghi, ricerca multistep e task ad alto costo di errore.
- Parti da Opus 5 se il task è verificabile e il costo si moltiplica su molte esecuzioni.
- Mantieni GPT se integrazioni, harness e strumenti OpenAI producono un risultato migliore sul tuo lavoro.
- Non scegliere un modello soltanto perché guida una media di benchmark eterogenei.
Il salto rispetto a Fable 5
I miglioramenti più grandi non compaiono ovunque. Terminal-Bench-Science più che raddoppia, AutomationBench cresce di oltre 14 punti e Terminal-Bench 4.0 guadagna quasi 14 punti. Su CursorBench, OSWorld e HLE il salto è invece più contenuto.
- Terminal-Bench-Science: 52,6% contro 24,7%.
- AutomationBench: 31,4% contro 17,1%.
- Terminal-Bench 4.0: 55,8% contro 42,0%.
- CursorBench: 73,4% contro 70,5%.
- HLE con tool: 65,0% contro 63,8%.
Dove Opus 5 resta vicino
Il confronto più utile non è sempre con il modello precedente. Opus 5 costa la metà di Fable 5.1 su input nuovo e output e resta entro pochi punti su coding, knowledge work, computer use e ragionamento con strumenti. Per molti team, questo rende Opus il baseline da battere.
- Terminal-Bench 4.0: 52,3% contro 55,8%.
- GDPval-AA v2: 1824 contro 1853.
- OSWorld partial: 75,4% contro 77,9%.
- HLE con tool: 63,6% contro 65,0%.
- CursorBench: 70,0% contro 73,4%.
Perché la classifica non basta
I benchmark misurano modelli, harness e regole diverse. Anthropic ha valutato Fable 5.1 con safeguards di produzione e segnala che alcuni interventi portano a uno zero o a un fallback verso Opus. Anche effort, strumenti e versione dei task cambiano il risultato.
- Controlla se il test usa il modello puro o un agente completo.
- Verifica effort, tool, retry, fallback e criterio di punteggio.
- Non confrontare versioni diverse dello stesso benchmark come se fossero identiche.
- Distingui il risultato di Fable da quello di Mythos 5.1, che ha safeguards differenti.
- Aspetta conferme indipendenti prima di trasformare la tabella del lancio in una regola generale.
Prezzo e cache cambiano il verdetto
Fable 5.1 mantiene $10/$50 per 1M token input/output, il doppio di Opus 5. La cache read costa però $0,25, metà di Opus e un quarto di Fable 5. Nei loop che riusano molto contesto, il costo può avvicinarsi o perfino scendere sotto Opus; nei task output-heavy resta molto più alto.
- Calcola input nuovo, cache write, cache read e output separatamente.
- Misura il costo per task accettato, includendo retry e supervisione.
- Non applicare il risparmio dichiarato del 25-45% a ogni workload.
- Confronta Fable 5.1 e Opus 5 sullo stesso prompt, con gli stessi tool e lo stesso livello di effort.
Un test che vale più della leaderboard
Scegli un campione di task reali, non una raccolta di prompt dimostrativi. Per il coding usa issue chiuse, test e review; per ricerca e knowledge work usa fonti note, calcoli controllabili e un criterio di completezza definito prima della prova.
- Esegui almeno cinque task per categoria.
- Nascondi il nome del modello a chi valuta l'output quando possibile.
- Registra completamento, errori, retry, costo e tempo umano.
- Separa qualità del modello da qualità dell'harness e degli strumenti.
- Promuovi Fable solo dove il vantaggio si ripete e copre il costo aggiuntivo.
Prima di chiudere
Domande frequenti
Fable 5.1 batte Opus 5 nei benchmark?
Sì, in tutti i confronti riportati nella tabella di lancio Anthropic. I margini variano: sono ampi su Terminal-Bench-Science e più contenuti su GDPval, OSWorld, HLE con strumenti e CursorBench. Sono dati del provider e vanno confermati sul proprio workflow.
Fable 5.1 batte GPT-5.6 Sol?
Nelle righe in cui Anthropic riporta GPT-5.6 Sol, Fable 5.1 è davanti. Il confronto non copre però tutti i prodotti, gli harness o gli scenari OpenAI e non misura il valore delle integrazioni con ChatGPT o Codex.
Qual è il benchmark più convincente per Fable 5.1?
Terminal-Bench-Science 0.1 mostra il salto più grande, 52,6% contro 24,7% di Fable 5 e 29,0% di Opus 5. È rilevante per ricerca scientifica agentica con terminale e strumenti, non per ogni uso scientifico.
I benchmark Anthropic sono indipendenti?
No. Alcuni benchmark sono di terze parti, ma configurazione, esecuzione e tabella comparativa sono pubblicate dal vendor. Sono una fonte primaria per il lancio, non una verifica indipendente della superiorità generale del modello.
Quando un benchmark giustifica pagare Fable 5.1?
Quando il test assomiglia al tuo lavoro e il vantaggio si ripete su task reali, riducendo errori, retry o supervisione abbastanza da coprire il costo. Se Opus completa lo stesso lavoro, il punteggio più alto di Fable può non avere valore economico.
Prossime letture

