Qwen3.8-Max supera Claude e GPT?
Benchmark, prezzi e limiti del nuovo modello Alibaba prima di cambiare assistente o API
Entra nell'analisiRisposta breve
Qwen3.8-Max supera Claude e GPT in alcuni test, non in modo assoluto. È quarto nella WebDev Arena consultata, davanti a Fable 5 e GPT-5.6 Sol, ma il risultato è preliminare e riguarda lo sviluppo web. Nella tabella Alibaba vince su PaperBench, mentre Fable resta molto avanti su SWE-bench Pro. Va provato soprattutto per prezzo, multimodalità e task agentici lunghi.
- Nella WebDev Arena è dietro Opus 5 Max, Kimi K3 Max e Opus 5 High, ma davanti a Fable 5, GPT-5.6 Sol e GLM-5.2 Max.
- QwenCloud indica $2 per 1M token input e $6 per 1M token output.
- Il modello accetta testo, immagini e video, con contesto fino a 1M token e output fino a 131K.
- Alibaba ha annunciato i pesi aperti per la settimana successiva al lancio, ma al 5 agosto licenza e download non sono ancora disponibili.
- Il confronto utile è un pilot sugli stessi task, con costo, qualità, latenza e revisioni misurati insieme.
Evidenze
Dati e benchmark citati
Differenze
Il confronto che orienta la scelta
| Criterio | Qwen3.8-Max | Come leggerlo contro Claude, GPT e Kimi |
|---|---|---|
| WebDev Arena | Quarto posto con 1668 ±18 punti e 1.563 voti, dietro Opus 5 Max, Kimi K3 Max e Opus 5 High. | Nel campione preliminare è davanti a Fable 5 e GPT-5.6 Sol. È un segnale utile per front-end e generazione web, non per tutto il software engineering. |
| Terminal-Bench 2.1 | Alibaba riporta 86,6 per Qwen, 88,8 per GPT-5.6 Sol e 84,6 per Fable 5 e Opus 4.8. | Qwen è competitivo nei task da terminale, ma GPT resta davanti nella stessa tabella del vendor. |
| SWE-bench Pro | Alibaba riporta 67,7 per Qwen, 80,0 per Fable 5, 69,2 per Opus 4.8 e 64,6 per GPT-5.6 Sol. | Fable mantiene un vantaggio di 12,3 punti su Qwen nel benchmark software più difficile mostrato. |
| Prezzo API | $2 input e $6 output per 1M token; cache implicita a $0,25 per 1M token secondo QwenCloud. | Costa meno di GPT-5.6 Sol, Kimi K3 e Fable 5 nel listino confrontato. Il vantaggio conta se non viene annullato da più retry o output più lunghi. |
| Pesi aperti | Alibaba ha annunciato il rilascio dei pesi di Qwen3.8-Max e Qwen3.8-27B per la settimana successiva al lancio. | Al 5 agosto il rilascio non è ancora avvenuto e la licenza non è pubblicata. Il modello da 2,4T parametri non è comunque un download da laptop. |
Applicazione
Numeri che cambiano la scelta
I numeri separano tre confronti diversi: preferenza degli utenti in Arena, benchmark eseguiti da Alibaba e costo API. Nessuno dei tre, da solo, decide quale modello funzionerà meglio sul tuo lavoro.
Qwen3.8-Max input
Fonte: QwenCloud · 1M token
- Dato
- $2
- Conseguenza pratica
- Contesto fino a 1M token, con prezzi separati per la cache.
È interessante quando invii documenti, video o repository lunghi, ma selezionare il contesto resta più economico che caricare tutto.
Qwen3.8-Max output
Fonte: QwenCloud · 1M token
- Dato
- $6
- Conseguenza pratica
- Un quinto di Fable 5 e metà del prezzo output di Kimi K3 nel listino confrontato.
Il prezzo permette pilot più ampi, soprattutto su agenti che generano patch, report e artefatti lunghi.
Token Plan Lite
Fonte: QwenCloud · Piano mensile
- Dato
- $8, promo $6
- Conseguenza pratica
- 2.500 crediti ogni 7 giorni e 700 ogni 5 ore.
È pensato per uso interattivo in coding agent e tool supportati, non per backend, batch o automazioni API.
Qwen Studio
Fonte: Qwen · Accesso consumer
- Dato
- Gratis
- Conseguenza pratica
- La pagina prodotto non specifica i limiti di utilizzo.
È il modo più semplice per provare Qwen prima di configurare API, crediti o un client developer.
Che cos'è Qwen3.8-Max
Qwen3.8-Max è il modello flagship di Alibaba per coding, lavoro professionale, ricerca e task lunghi. Usa un'architettura Mixture-of-Experts da 2,4 trilioni di parametri totali, con circa 95 miliardi attivi per token. Accetta testo, immagini e video e produce testo, con una finestra di contesto fino a 1 milione di token.
- QwenCloud indica 991K token massimi in input e 131K in output.
- Supporta function calling, web search, structured output e context cache.
- È disponibile via API QwenCloud con formati compatibili OpenAI, Anthropic e DashScope.
- Qwen Studio permette di provare gratuitamente l'ecosistema Qwen senza configurare l'API.
La risposta breve: sì, ma solo in alcuni test
Il sorpasso esiste solo con una condizione chiara. Qwen3.8-Max supera Claude e GPT in alcuni benchmark, mentre perde in altri. La prova indipendente più interessante arriva dalla WebDev Arena: il modello è quarto, davanti a Fable 5 e GPT-5.6 Sol. È un segnale utile per lo sviluppo web, non una vittoria generale sul software engineering.
- Nella WebDev Arena è dietro Opus 5 Max, Kimi K3 Max e Opus 5 High.
- È davanti a Fable 5, GPT-5.6 Sol e GLM-5.2 Max nel campione consultato.
- La posizione di Qwen è ancora preliminare.
- Una posizione WebDev misura preferenza su task web, non affidabilità sul tuo repository o processo aziendale.
Dove Qwen sembra davvero forte
La tabella Alibaba mostra i risultati migliori su instruction following, ricerca riproducibile, uso del computer e task multimodali. Qwen arriva a 93,0 su PaperBench e 86,1 su OSWorld-Verified. Sono numeri forti per agenti che devono usare strumenti, leggere contenuti visuali e continuare un lavoro per molti passaggi.
- PaperBench: Alibaba riporta Qwen davanti a GPT-5.6 Sol, Fable 5 e Opus 4.8.
- OSWorld-Verified: Qwen è davanti ai modelli GPT e Gemini mostrati nella tabella multimodale.
- Terminal-Bench 2.1: Qwen supera i due Claude confrontati, ma resta sotto GPT-5.6 Sol.
- Il progetto dimostrativo di coding autonomo per più giorni è interessante, ma resta una prova costruita dal vendor.
Dove Claude resta più forte
Il limite più evidente è il software engineering difficile. Nella stessa tabella Alibaba, Fable 5 raggiunge 80,0 su SWE-bench Pro contro 67,7 di Qwen. Su FrontierSWE il divario è ancora più ampio. Chi lavora su bug complessi, patch di produzione e codebase grandi non dovrebbe leggere i risultati WebDev come un sorpasso generale su Claude.
- Fable mantiene oltre 12 punti di vantaggio su SWE-bench Pro.
- Opus 4.8 è leggermente sopra Qwen su SWE-bench Pro.
- Qwen resta sotto i rivali anche su HLE, benchmark ampio di conoscenza e ragionamento.
- I benchmark Alibaba sono eseguiti e selezionati dal produttore: servono conferme indipendenti su più harness.
Il prezzo è il vero argomento contro GPT e Claude
Qwen3.8-Max costa $2 per 1M token input e $6 per 1M token output. Questo lo mette molto sotto Fable 5 e GPT-5.6 Sol e sotto Kimi K3 nel listino confrontato. Se il modello risolve il tuo task con qualità simile, il risparmio può essere importante. Se richiede più tentativi o revisione, il vantaggio può sparire.
- Misura input, output, cache, retry e tool call dello stesso task.
- Registra quanti test passano e quanto tempo umano serve per correggere la risposta.
- Confronta il costo per task completato, non solo il prezzo per milione di token.
- Qwen Studio gratuito serve per una prima prova; QwenCloud serve per un confronto ripetibile via API.
Open weights non significa eseguirlo sul portatile
Alibaba ha annunciato che pubblicherà i pesi di Qwen3.8-Max e di una versione Qwen3.8-27B. Al 5 agosto i file e la licenza non sono ancora disponibili. Anche dopo il rilascio, il modello Max da 2,4T parametri richiederà infrastruttura multi-GPU o provider specializzati. La versione 27B sarà il candidato più realistico per deployment controllati.
- Aspetta licenza, model card e requisiti reali prima di pianificare il self-hosting.
- Per un pilot immediato usa Qwen Studio o QwenCloud.
- Non caricare dati sensibili prima di aver verificato privacy, regione e contratto applicabili.
- Il Token Plan Individual usa la regione Singapore e prevede inferenza globale e trasferimenti transfrontalieri.
Come confrontarlo senza farti guidare dalla classifica
Prepara 20 task già risolti dal tuo team: bug con test, analisi di documenti, ricerca con fonti, generazione web e uso di strumenti. Esegui Qwen e il modello attuale con gli stessi input, lo stesso limite di costo e gli stessi criteri. La classifica pubblica ti dice che Qwen merita il test; il pilot decide se merita il cambio.
- Usa almeno cinque task per la categoria che conta davvero nel tuo lavoro.
- Controlla accuratezza, fonti, test passati, latenza e formato dell'output.
- Misura il costo totale includendo retry e revisione umana.
- Se Qwen vince solo sul prezzo ma perde sull'affidabilità, usalo come modello secondario o per task a rischio ridotto.
Verdetto pratico
Qwen3.8-Max è già abbastanza forte da meritare un confronto con i modelli frontier. Provalo se usi API, coding agent, ricerca o documenti multimodali e vuoi ridurre il costo senza scendere subito di fascia. Resta su Claude o GPT se il tuo workflow è stabile, il supporto enterprise conta più del listino o non puoi ancora misurare errori e revisioni.
- Scegli Qwen per un pilot economico su task agentici e multimodali.
- Scegli Fable quando il software engineering difficile pesa più del costo per token.
- Scegli GPT quando ecosistema OpenAI, strumenti e continuità operativa sono già centrali.
- Aspetta il rilascio dei pesi se la decisione dipende da licenza, self-hosting o data residency.
Prima di chiudere
Domande frequenti
Qwen3.8-Max supera Claude Fable 5?
In alcuni test sì, ma non nel confronto più difficile sul software engineering. Qwen è davanti nella WebDev Arena preliminare e in alcuni benchmark Alibaba; Fable resta molto sopra su SWE-bench Pro e FrontierSWE.
Qwen3.8-Max supera GPT-5.6 Sol?
Dipende dal test. Qwen è davanti nella WebDev Arena consultata e su PaperBench nella tabella Alibaba. GPT-5.6 Sol resta davanti su Terminal-Bench 2.1, GPQA Diamond e altri benchmark mostrati dal vendor.
Quanto costa Qwen3.8-Max?
QwenCloud indica $2 per 1 milione di token input e $6 per 1 milione di token output. Sono previsti anche prezzi per cache implicita ed esplicita. Qwen Studio è invece descritto come gratuito, senza limiti pubblicati nella pagina prodotto consultata.
Qwen3.8-Max è open source?
Non ancora al 5 agosto 2026. Alibaba ha annunciato il rilascio dei pesi per la settimana successiva al lancio, insieme a Qwen3.8-27B. Licenza, file e requisiti definitivi vanno ricontrollati quando saranno pubblicati.
Come posso provare Qwen3.8-Max?
Parti da Qwen Studio se vuoi una prova gratuita. Usa QwenCloud se devi confrontare API, costi, cache, structured output o integrazione con client compatibili OpenAI e Anthropic. Per dati sensibili verifica prima privacy, regione e contratto.
Prossime letture

