Salta al contenuto principale
Modelli AI 8 min

Qwen3.8-Max supera Claude e GPT?

Benchmark, prezzi e limiti del nuovo modello Alibaba prima di cambiare assistente o API

Entra nell'analisi

Risposta breve

Qwen3.8-Max supera Claude e GPT in alcuni test, non in modo assoluto. È quarto nella WebDev Arena consultata, davanti a Fable 5 e GPT-5.6 Sol, ma il risultato è preliminare e riguarda lo sviluppo web. Nella tabella Alibaba vince su PaperBench, mentre Fable resta molto avanti su SWE-bench Pro. Va provato soprattutto per prezzo, multimodalità e task agentici lunghi.

  • Nella WebDev Arena è dietro Opus 5 Max, Kimi K3 Max e Opus 5 High, ma davanti a Fable 5, GPT-5.6 Sol e GLM-5.2 Max.
  • QwenCloud indica $2 per 1M token input e $6 per 1M token output.
  • Il modello accetta testo, immagini e video, con contesto fino a 1M token e output fino a 131K.
  • Alibaba ha annunciato i pesi aperti per la settimana successiva al lancio, ma al 5 agosto licenza e download non sono ancora disponibili.
  • Il confronto utile è un pilot sugli stessi task, con costo, qualità, latenza e revisioni misurati insieme.

Evidenze

Dati e benchmark citati

Classifica WebDev Arena: Qwen3.8-Max quarto, dietro Opus 5 e Kimi K3 Max ma davanti a Fable 5, GPT-5.6 Sol e GLM-5.2 Max
Qwen3.8-Max nella WebDev Arena. Qwen è dietro Opus 5 Max, Kimi K3 Max e Opus 5 High, ma davanti a Fable 5, GPT-5.6 Sol e GLM-5.2 Max. La posizione è ancora preliminare e misura task frontend e full-stack, non tutto il software engineering. Arena WebDev, dato preliminare
Grafico dei benchmark Alibaba: Qwen3.8-Max competitivo su Terminal-Bench 2.1 ma dietro Fable 5 su SWE-bench Pro
Terminal-Bench e SWE-bench Pro raccontano storie diverse. Nella tabella Alibaba, Qwen supera i due Claude su Terminal-Bench ma resta dietro GPT-5.6 Sol. Su SWE-bench Pro il quadro cambia: Fable arriva a 80,0 e Qwen si ferma a 67,7. Qwen: tabella benchmark ufficiale Qwen3.8-Max
Grafico prezzi output per 1M token: GLM-5.2 4,40 dollari, Qwen3.8-Max 6, Kimi K3 15, GPT-5.6 Sol 30 e Fable 5 50
Prezzo output API dei modelli confrontati. Qwen3.8-Max costa $6 per 1M token output. Il listino è uno dei suoi vantaggi più concreti, ma nei task agentici vanno misurati anche token generati, retry, cache e tempo umano di revisione. QwenCloud, Kimi, Z.ai, OpenAI e Anthropic pricing

Differenze

Il confronto che orienta la scelta

CriterioQwen3.8-MaxCome leggerlo contro Claude, GPT e Kimi
WebDev ArenaQuarto posto con 1668 ±18 punti e 1.563 voti, dietro Opus 5 Max, Kimi K3 Max e Opus 5 High.Nel campione preliminare è davanti a Fable 5 e GPT-5.6 Sol. È un segnale utile per front-end e generazione web, non per tutto il software engineering.
Terminal-Bench 2.1Alibaba riporta 86,6 per Qwen, 88,8 per GPT-5.6 Sol e 84,6 per Fable 5 e Opus 4.8.Qwen è competitivo nei task da terminale, ma GPT resta davanti nella stessa tabella del vendor.
SWE-bench ProAlibaba riporta 67,7 per Qwen, 80,0 per Fable 5, 69,2 per Opus 4.8 e 64,6 per GPT-5.6 Sol.Fable mantiene un vantaggio di 12,3 punti su Qwen nel benchmark software più difficile mostrato.
Prezzo API$2 input e $6 output per 1M token; cache implicita a $0,25 per 1M token secondo QwenCloud.Costa meno di GPT-5.6 Sol, Kimi K3 e Fable 5 nel listino confrontato. Il vantaggio conta se non viene annullato da più retry o output più lunghi.
Pesi apertiAlibaba ha annunciato il rilascio dei pesi di Qwen3.8-Max e Qwen3.8-27B per la settimana successiva al lancio.Al 5 agosto il rilascio non è ancora avvenuto e la licenza non è pubblicata. Il modello da 2,4T parametri non è comunque un download da laptop.

Applicazione

Numeri che cambiano la scelta

I numeri separano tre confronti diversi: preferenza degli utenti in Arena, benchmark eseguiti da Alibaba e costo API. Nessuno dei tre, da solo, decide quale modello funzionerà meglio sul tuo lavoro.

01

Qwen3.8-Max input

Fonte: QwenCloud · 1M token

Dato
$2
Conseguenza pratica
Contesto fino a 1M token, con prezzi separati per la cache.

È interessante quando invii documenti, video o repository lunghi, ma selezionare il contesto resta più economico che caricare tutto.

02

Qwen3.8-Max output

Fonte: QwenCloud · 1M token

Dato
$6
Conseguenza pratica
Un quinto di Fable 5 e metà del prezzo output di Kimi K3 nel listino confrontato.

Il prezzo permette pilot più ampi, soprattutto su agenti che generano patch, report e artefatti lunghi.

03

Token Plan Lite

Fonte: QwenCloud · Piano mensile

Dato
$8, promo $6
Conseguenza pratica
2.500 crediti ogni 7 giorni e 700 ogni 5 ore.

È pensato per uso interattivo in coding agent e tool supportati, non per backend, batch o automazioni API.

04

Qwen Studio

Fonte: Qwen · Accesso consumer

Dato
Gratis
Conseguenza pratica
La pagina prodotto non specifica i limiti di utilizzo.

È il modo più semplice per provare Qwen prima di configurare API, crediti o un client developer.

01

Che cos'è Qwen3.8-Max

Qwen3.8-Max è il modello flagship di Alibaba per coding, lavoro professionale, ricerca e task lunghi. Usa un'architettura Mixture-of-Experts da 2,4 trilioni di parametri totali, con circa 95 miliardi attivi per token. Accetta testo, immagini e video e produce testo, con una finestra di contesto fino a 1 milione di token.

  • QwenCloud indica 991K token massimi in input e 131K in output.
  • Supporta function calling, web search, structured output e context cache.
  • È disponibile via API QwenCloud con formati compatibili OpenAI, Anthropic e DashScope.
  • Qwen Studio permette di provare gratuitamente l'ecosistema Qwen senza configurare l'API.
02

La risposta breve: sì, ma solo in alcuni test

Il sorpasso esiste solo con una condizione chiara. Qwen3.8-Max supera Claude e GPT in alcuni benchmark, mentre perde in altri. La prova indipendente più interessante arriva dalla WebDev Arena: il modello è quarto, davanti a Fable 5 e GPT-5.6 Sol. È un segnale utile per lo sviluppo web, non una vittoria generale sul software engineering.

  • Nella WebDev Arena è dietro Opus 5 Max, Kimi K3 Max e Opus 5 High.
  • È davanti a Fable 5, GPT-5.6 Sol e GLM-5.2 Max nel campione consultato.
  • La posizione di Qwen è ancora preliminare.
  • Una posizione WebDev misura preferenza su task web, non affidabilità sul tuo repository o processo aziendale.
03

Dove Qwen sembra davvero forte

La tabella Alibaba mostra i risultati migliori su instruction following, ricerca riproducibile, uso del computer e task multimodali. Qwen arriva a 93,0 su PaperBench e 86,1 su OSWorld-Verified. Sono numeri forti per agenti che devono usare strumenti, leggere contenuti visuali e continuare un lavoro per molti passaggi.

  • PaperBench: Alibaba riporta Qwen davanti a GPT-5.6 Sol, Fable 5 e Opus 4.8.
  • OSWorld-Verified: Qwen è davanti ai modelli GPT e Gemini mostrati nella tabella multimodale.
  • Terminal-Bench 2.1: Qwen supera i due Claude confrontati, ma resta sotto GPT-5.6 Sol.
  • Il progetto dimostrativo di coding autonomo per più giorni è interessante, ma resta una prova costruita dal vendor.
04

Dove Claude resta più forte

Il limite più evidente è il software engineering difficile. Nella stessa tabella Alibaba, Fable 5 raggiunge 80,0 su SWE-bench Pro contro 67,7 di Qwen. Su FrontierSWE il divario è ancora più ampio. Chi lavora su bug complessi, patch di produzione e codebase grandi non dovrebbe leggere i risultati WebDev come un sorpasso generale su Claude.

  • Fable mantiene oltre 12 punti di vantaggio su SWE-bench Pro.
  • Opus 4.8 è leggermente sopra Qwen su SWE-bench Pro.
  • Qwen resta sotto i rivali anche su HLE, benchmark ampio di conoscenza e ragionamento.
  • I benchmark Alibaba sono eseguiti e selezionati dal produttore: servono conferme indipendenti su più harness.
05

Il prezzo è il vero argomento contro GPT e Claude

Qwen3.8-Max costa $2 per 1M token input e $6 per 1M token output. Questo lo mette molto sotto Fable 5 e GPT-5.6 Sol e sotto Kimi K3 nel listino confrontato. Se il modello risolve il tuo task con qualità simile, il risparmio può essere importante. Se richiede più tentativi o revisione, il vantaggio può sparire.

  • Misura input, output, cache, retry e tool call dello stesso task.
  • Registra quanti test passano e quanto tempo umano serve per correggere la risposta.
  • Confronta il costo per task completato, non solo il prezzo per milione di token.
  • Qwen Studio gratuito serve per una prima prova; QwenCloud serve per un confronto ripetibile via API.
06

Open weights non significa eseguirlo sul portatile

Alibaba ha annunciato che pubblicherà i pesi di Qwen3.8-Max e di una versione Qwen3.8-27B. Al 5 agosto i file e la licenza non sono ancora disponibili. Anche dopo il rilascio, il modello Max da 2,4T parametri richiederà infrastruttura multi-GPU o provider specializzati. La versione 27B sarà il candidato più realistico per deployment controllati.

  • Aspetta licenza, model card e requisiti reali prima di pianificare il self-hosting.
  • Per un pilot immediato usa Qwen Studio o QwenCloud.
  • Non caricare dati sensibili prima di aver verificato privacy, regione e contratto applicabili.
  • Il Token Plan Individual usa la regione Singapore e prevede inferenza globale e trasferimenti transfrontalieri.
07

Come confrontarlo senza farti guidare dalla classifica

Prepara 20 task già risolti dal tuo team: bug con test, analisi di documenti, ricerca con fonti, generazione web e uso di strumenti. Esegui Qwen e il modello attuale con gli stessi input, lo stesso limite di costo e gli stessi criteri. La classifica pubblica ti dice che Qwen merita il test; il pilot decide se merita il cambio.

  • Usa almeno cinque task per la categoria che conta davvero nel tuo lavoro.
  • Controlla accuratezza, fonti, test passati, latenza e formato dell'output.
  • Misura il costo totale includendo retry e revisione umana.
  • Se Qwen vince solo sul prezzo ma perde sull'affidabilità, usalo come modello secondario o per task a rischio ridotto.
08

Verdetto pratico

Qwen3.8-Max è già abbastanza forte da meritare un confronto con i modelli frontier. Provalo se usi API, coding agent, ricerca o documenti multimodali e vuoi ridurre il costo senza scendere subito di fascia. Resta su Claude o GPT se il tuo workflow è stabile, il supporto enterprise conta più del listino o non puoi ancora misurare errori e revisioni.

  • Scegli Qwen per un pilot economico su task agentici e multimodali.
  • Scegli Fable quando il software engineering difficile pesa più del costo per token.
  • Scegli GPT quando ecosistema OpenAI, strumenti e continuità operativa sono già centrali.
  • Aspetta il rilascio dei pesi se la decisione dipende da licenza, self-hosting o data residency.

La newsletter di QualeAI

Le novità che meritano il tuo tempo.

Aggiornamenti editoriali su tool, modelli, prezzi e workflow. Solo quando c’è qualcosa di utile da capire.

Prima di chiudere

Domande frequenti

Qwen3.8-Max supera Claude Fable 5?

In alcuni test sì, ma non nel confronto più difficile sul software engineering. Qwen è davanti nella WebDev Arena preliminare e in alcuni benchmark Alibaba; Fable resta molto sopra su SWE-bench Pro e FrontierSWE.

Qwen3.8-Max supera GPT-5.6 Sol?

Dipende dal test. Qwen è davanti nella WebDev Arena consultata e su PaperBench nella tabella Alibaba. GPT-5.6 Sol resta davanti su Terminal-Bench 2.1, GPQA Diamond e altri benchmark mostrati dal vendor.

Quanto costa Qwen3.8-Max?

QwenCloud indica $2 per 1 milione di token input e $6 per 1 milione di token output. Sono previsti anche prezzi per cache implicita ed esplicita. Qwen Studio è invece descritto come gratuito, senza limiti pubblicati nella pagina prodotto consultata.

Qwen3.8-Max è open source?

Non ancora al 5 agosto 2026. Alibaba ha annunciato il rilascio dei pesi per la settimana successiva al lancio, insieme a Qwen3.8-27B. Licenza, file e requisiti definitivi vanno ricontrollati quando saranno pubblicati.

Come posso provare Qwen3.8-Max?

Parti da Qwen Studio se vuoi una prova gratuita. Usa QwenCloud se devi confrontare API, costi, cache, structured output o integrazione con client compatibili OpenAI e Anthropic. Per dati sensibili verifica prima privacy, regione e contratto.

Prossime letture

Tre modi per continuare.

Tutti gli approfondimenti