Claude Haiku 5.5 o Sonnet 5.5: quando basta il modello piccolo
Per token costa un ventesimo di Sonnet: in quali lavori il risparmio regge e dove lo paghi in qualità
Entra nell'analisiRisposta breve
Usa Haiku 5.5 per lavori brevi, ripetitivi e facili da verificare: classificazione, estrazione, riassunti, subagent. Sotto i 100.000 token di prompt costa $0,10/$0,50 per milione di token, un ventesimo di Sonnet 5.5. Resta su Sonnet per coding agentico e compiti lunghi, dove Haiku è molto indietro. Con prompt più lunghi il risparmio scende da 20 a 4 volte.
- Contro GPT-6 Luna il prezzo per token è lo stesso: a parità di risultato i due modelli usano token simili, ma Haiku a effort max ne consuma circa tre volte tanti.
- Nelle app Claude i modelli Haiku sono inclusi anche nel piano Free; via API Haiku 5.5 si paga a consumo.
- Se arrivi da Haiku 4.5, ricalcola i costi: lo stesso testo conta circa il 30% di token in più.
Evidenze
Dati e benchmark citati
Differenze
Il confronto che orienta la scelta
| Criterio | Haiku 5.5 | Sonnet 5.5 |
|---|---|---|
| Prezzo API | $0,10 input, $0,50 output per 1M token con prompt fino a 100.000 token; $0,50 e $2,50 sopra. | $2 input, $10 output per 1M token, a qualunque lunghezza del prompt. |
| Cache read | $0,01 per 1M token sotto la soglia, $0,05 sopra. | $0,10 per 1M token. |
| Uso indicato da Anthropic | Classificazione, estrazione, routing, riassunti, compaction, subagent, assistenza clienti in tempo reale, browser use. | Lavoro quotidiano ben definito, coding agentico, documenti, automazioni con più passaggi. |
| Coding agentico | 39,2% su Terminal-Bench 4.0, 46,4% su FrontierCode. | 70,6% su Terminal-Bench 4.0, 52,1% su FrontierCode. |
| Knowledge work e computer use | 1620 Elo su GDPval-AA v2.1, 72,4% su OSWorld 2.1 (sottoinsieme offline). | 1840 Elo su GDPval-AA v2.1, 83,9% su OSWorld 2.1 (sottoinsieme offline). |
| Velocità ed effort | Latenza indicata come la più bassa della gamma. Effort predefinito medium, thinking adattivo. | Latenza indicata come veloce. Effort predefinito high, thinking adattivo. |
| Contesto e output | 1M token di contesto, 128K di output. | 1M token di contesto, 128K di output. |
| Dove lo trovi | App Claude web e mobile (Haiku è nei piani da Free in su), Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry. | App Claude dal piano Free in su, Claude Code, Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry. |
Applicazione
Quanto costa lo stesso lavoro
Le stime usano i listini della Claude API verificati l'8 ottobre 2026 e un solo tentativo per richiesta. Gli output includono anche i token di ragionamento, che su questi modelli si pagano come output. Non includono cache write, Batch API e maggiorazioni regionali.
Classificare 10.000 ticket di assistenza
2K input a ticket, 20M in totale · 300 output a ticket, 3M in totale
- Scenario
- Haiku 5.5: $3,50
- Cosa cambia
- Sonnet 5.5: $70
Su richieste brevi e numerose il rapporto è 1 a 20. Se Haiku classifica bene un campione verificato a mano, pagare Sonnet non ha senso.
Riassumere un contratto da 150.000 token
150K input · 5K output
- Scenario
- Haiku 5.5: $0,09
- Cosa cambia
- Sonnet 5.5: $0,35
Oltre i 100.000 token Haiku passa alla fascia alta e il vantaggio scende a 4 volte. Se le due metà si possono riassumere separatamente, due richieste da 75.000 token costano circa $0,02 in tutto.
Stesso punteggio nell'indice Artificial Analysis
Punteggio 38 su 100 · 55K output Haiku, 50K output Luna per task
- Scenario
- Haiku 5.5 a effort high: circa $0,03 di output
- Cosa cambia
- GPT-6 Luna a effort max: circa $0,03 di output
A parità di risultato i due modelli costano quasi uguale. Haiku a effort max sale a 43 punti ma usa circa 162K token di output, quasi tre volte tanto: alza l'effort solo dove ti serve davvero.
Che cos'è Claude Haiku 5.5
Haiku è la linea di modelli Claude pensata per volume e velocità. La versione 5.5 sostituisce Haiku 4.5 con un salto netto nei test Anthropic, per esempio dal 15,7% al 72,4% sul sottoinsieme offline di OSWorld 2.1, e porta per la prima volta su un Haiku il parametro effort, che regola quanto il modello ragiona prima di rispondere. Il prezzo per token scende del 90% sotto i 100.000 token di prompt e del 50% sopra.
- Model ID sulla Claude API: `claude-haiku-5-5`.
- Contesto da 1M token e fino a 128K token di output, contro 200K e 64K di Haiku 4.5.
- Effort predefinito medium, thinking adattivo attivo di default.
- Disponibile anche su Amazon Bedrock, Google Cloud, Microsoft Foundry e Claude Platform on AWS.
Quanto costa davvero: le due fasce di prezzo
A differenza di Sonnet e Opus, Haiku 5.5 ha un listino che dipende dalla lunghezza del prompt. Fino a 100.000 token paghi $0,10 input e $0,50 output per milione di token; sopra quella soglia l'intera richiesta passa a $0,50 e $2,50. Anthropic stima che, in media, far girare lo stesso lavoro costi il 75% in meno rispetto a Haiku 4.5.
- Cache read: $0,01 per milione di token sotto la soglia, $0,05 sopra.
- Batch API: sconto del 50%, quindi $0,05 input e $0,25 output nella fascia bassa.
- Il thinking adattivo produce token di output che si pagano: con effort alto una risposta breve può costare più del previsto.
- Gli abbonati Max e Team ricevono crediti API mensili: $100 su Max 5x, $200 su Max 20x, fino a $500 condivisi su Team.
Haiku 5.5 contro GPT-6 Luna
GPT-6 Luna è l'alternativa diretta di OpenAI e ha lo stesso prezzo di Haiku 5.5 sotto i 100.000 token. Nei benchmark pubblicati da Anthropic Haiku è avanti in tutti i test in cui compaiono entrambi. La misura indipendente di Artificial Analysis conferma il vantaggio, ma ne mostra il costo: Haiku 5.5 a effort max ottiene 43 punti nel suo indice contro i 38 di Luna, usando circa 162.000 token di output per task contro 50.000. A effort high Haiku scende a 38 punti con circa 55.000 token, quindi a parità di risultato i due modelli costano quasi uguale.
- Il prezzo per token è uguale, il costo per task dipende dall'effort che imposti.
- Artificial Analysis segnala che le sue stime di costo per Haiku 5.5 non includono ancora la fascia sopra i 100.000 token.
- Se usi già Luna e i risultati ti bastano, il cambio conviene solo se un test sui tuoi casi mostra meno errori.
Quando Haiku 5.5 basta
Haiku 5.5 è la scelta giusta quando ogni richiesta è piccola, il formato del risultato è chiaro e puoi controllarlo in modo economico, con uno schema, un'etichetta da confrontare o una revisione a campione. In questi casi paghi un ventesimo di Sonnet e ottieni risposte più rapide, utili anche quando un utente aspetta in tempo reale.
- Classificazione di ticket, email, recensioni o documenti.
- Estrazione di campi da testi e immagini verso uno schema fisso.
- Riassunti e compaction del contesto per agenti che lavorano a lungo.
- Chatbot di assistenza e flussi in cui la latenza conta più dell'ultimo punto di qualità.
Quando restare su Sonnet 5.5
Il distacco più ampio tra i due modelli è sul coding agentico: su Terminal-Bench 4.0 Haiku 5.5 si ferma al 39,2%, Sonnet 5.5 arriva al 70,6%. Anthropic stessa indica Sonnet come scelta migliore per il coding agentico complesso. Se un errore costa ore di revisione, o se Haiku ti costringe a rilanciare la richiesta più volte, il risparmio per token sparisce nel costo per risultato accettato.
- Bug fix, refactor e feature eseguiti da un agente in autonomia.
- Analisi in cui devi pesare fonti o requisiti in conflitto.
- Prompt stabilmente sopra i 100.000 token, dove Haiku costa solo 4 volte meno.
- Testi destinati a clienti in cui tono e precisione non si possono controllare in automatico.
Haiku come subagent di Sonnet o Opus
Tra gli usi indicati da Anthropic c'è la combinazione: Sonnet 5.5 o Opus 5.5 pianificano e decidono, Haiku 5.5 esegue i passaggi stretti, come cercare in un repository, leggere file, riassumere risultati o comprimere il contesto. Così il modello costoso lavora solo dove serve giudizio, e i passaggi ripetitivi costano una frazione. Prima di adottare lo schema, misura su 10-20 task reali il costo totale e quante volte il modello principale deve correggere il lavoro di Haiku.
- Assegna a Haiku compiti con un risultato verificabile, non decisioni.
- Parti da effort medium e alzalo solo sui passaggi in cui il test mostra errori.
- Tieni i prompt dei subagent sotto i 100.000 token per restare nella fascia bassa.
Cosa controllare se migri da Haiku 4.5
Haiku 5.5 introduce modifiche che rompono alcune integrazioni scritte per Haiku 4.5. Il cambio di model ID non basta: alcune richieste che prima funzionavano ora restituiscono errore, e il conteggio dei token cambia anche a parità di testo.
- Il thinking manuale con `budget_tokens` restituisce errore: usa il thinking adattivo con effort.
- Valori non predefiniti di temperature, top_p e top_k restituiscono errore.
- Il prefill del messaggio dell'assistente non è più supportato: chiudi la conversazione con un messaggio utente.
- Le risposte possono iniziare con blocchi di thinking, che contano anche in `max_tokens`: leggi i blocchi per tipo, non per posizione.
- Il nuovo tokenizer conta circa il 30% di token in più per lo stesso testo: ricalcola budget e soglie.
Prima di chiudere
Domande frequenti
Quanto costa Claude Haiku 5.5?
Sulla Claude API costa $0,10 per milione di token in input e $0,50 in output con prompt fino a 100.000 token. Oltre quella soglia costa $0,50 e $2,50. La cache read costa $0,01 o $0,05 e la Batch API dimezza input e output.
Posso usare Haiku 5.5 gratis?
Nelle app Claude i modelli Haiku sono inclusi anche nel piano Free, con limiti di utilizzo ridotti. Via API Haiku 5.5 si paga a consumo, salvo i crediti mensili inclusi nei piani Max e Team.
Haiku 5.5 è meglio di GPT-6 Luna?
Nei benchmark Anthropic e nell'indice di Artificial Analysis ottiene punteggi più alti a parità di prezzo per token. A effort max però consuma circa tre volte i token di output di Luna. A parità di punteggio i costi per task sono quasi uguali: decide il test sui tuoi casi.
Haiku 5.5 può sostituire Sonnet 5.5?
Solo per lavori brevi e verificabili come classificazione, estrazione e riassunti. Sul coding agentico e sui compiti lunghi resta molto indietro, per esempio 39,2% contro 70,6% su Terminal-Bench 4.0 nei dati Anthropic.
Perché Haiku 5.5 costa di più oltre i 100.000 token?
Anthropic ha scelto un listino a due fasce solo per Haiku 5.5: quando il prompt supera i 100.000 token, tutta la richiesta paga cinque volte il prezzo base. Se puoi dividere un documento lungo in parti più corte, ogni parte resta nella fascia bassa.
Prossime letture

