Kimi K3 in locale: hardware, costi e quando conviene
I pesi sono disponibili, ma il deployment resta un progetto da datacenter
Kimi K3 è open-weight, ma i 2,8 trilioni di parametri e la ricetta di inferenza ufficiale lo collocano su infrastruttura da datacenter. Il self-hosting ha senso soprattutto per team con requisiti on-premise, utilizzo elevato e competenze operative. Per prove, carichi variabili e volumi ordinari, l'API Kimi evita un investimento molto più difficile da ammortizzare.
Risposta breve
Kimi K3 è open-weight, ma non è un modello da PC. La ricetta vLLM richiede almeno otto GPU GB300 oppure otto MI355X o MI350X, con più nodi per il traffico di produzione. Il self-hosting conviene a team con carichi elevati, competenze operative e vincoli on-premise; per test e volumi normali, l'API resta più semplice.
- Open-weight significa che puoi scaricare i pesi, non che il modello gira bene su hardware comune.
- La ricetta ufficiale parte da otto acceleratori da datacenter.
- Il costo reale include GPU, storage, rete, orchestrazione, monitoraggio e reperibilità.
- Prima di acquistare capacità, misura costo e qualità per task completato via API.
Confronto rapido
| Criterio | Quando ha senso | Limite decisivo |
|---|---|---|
| API Kimi | Test, carichi variabili, team senza una piattaforma GPU interna e prodotti ancora da validare. | Dipendenza dal provider, costi per token e minore controllo sull'infrastruttura. |
| Cloud GPU dedicato | Benchmark controllati, picchi pianificati e prove di deployment senza comprare hardware. | Il contatore gira anche quando il cluster è sottoutilizzato; disponibilità e rete tra nodi contano. |
| Infrastruttura propria | Dati che devono restare on-premise, utilizzo stabile e team già capace di operare cluster GPU. | Capitale, energia, raffreddamento, ricambi, aggiornamenti e reperibilità diventano responsabilità tua. |
| Modello più piccolo | Molti task non richiedono K3: estrazione, classificazione e trasformazioni controllate possono costare molto meno. | Serve una valutazione seria per capire dove la qualità più bassa diventa un problema. |
Tre ordini di grandezza da confrontare
Le cifre seguenti servono a costruire un preventivo, non a promettere prestazioni. Il listino API è per token; l'esempio GPU usa il prezzo pubblico di otto B300 su Runpod come riferimento di capacità cloud, ma non sostituisce una verifica di compatibilità con la ricetta GB300 o AMD di K3.
Prova API su un task lungo
2M token input senza cache · 200K token output
Volume di lavoro
$9 con il listino K3 verificato
Scelta iniziale
Nessun cluster da predisporre
Prima di noleggiare otto GPU, puoi misurare qualità, retry, latenza e costo su decine di task reali.
Carico API più intenso
20M token input senza cache · 2M token output
Volume di lavoro
$90 con il listino K3 verificato
Scelta iniziale
Il costo cresce solo quando usi il modello
La spesa per token può restare inferiore a poche ore di un cluster di fascia alta finché il volume non è continuo.
Otto B300 su Runpod
$7,39 per GPU/ora · $59,12 per otto GPU/ora
Volume di lavoro
$591,20 per 10 ore
Scelta iniziale
$42.566,40 per 30 giorni continui
È un riferimento di costo, non una configurazione K3 certificata: la ricetta cita GB300 o acceleratori AMD e il prezzo effettivo può differire.
Open-weight non significa AI locale da laptop
Moonshot AI ha pubblicato i pesi completi di Kimi K3 con una licenza dedicata. Puoi quindi studiare, distribuire e modificare il modello entro le condizioni previste. Il passaggio da pesi disponibili a servizio utilizzabile resta però enorme: devi scaricare e distribuire un modello da 2,8 trilioni di parametri, configurare il motore di inferenza e mantenere un sistema capace di servire richieste lunghe.
- Open-weight: i parametri del modello sono scaricabili.
- Open source: codice e licenza devono permettere gli usi che ti servono; leggi sempre il testo completo.
- Locale: l'inferenza avviene sulla tua infrastruttura, che può essere un datacenter e non un singolo computer.
- Gestito: un provider si occupa di capacità, aggiornamenti e disponibilità e ti addebita l'uso.
Perché servono GPU da datacenter
K3 usa un'architettura Mixture of Experts: attiva 16 esperti su 896 per ogni token e coinvolge 104 miliardi di parametri attivi, ma l'insieme dei pesi conta comunque 2,8 trilioni di parametri. La quantizzazione MXFP4 riduce la memoria rispetto a formati più pesanti, senza trasformare K3 in un modello consumer. La ricetta vLLM consultata il 27 luglio indica almeno otto GB300 oppure otto MI355X o MI350X.
- La memoria deve contenere pesi, cache, runtime e margine operativo.
- Il contesto massimo da 1.048.576 token aumenta il fabbisogno della cache durante richieste molto lunghe.
- La comunicazione tra GPU e tra nodi può limitare prestazioni e stabilità.
- Per traffico di produzione la ricetta segnala la necessità di più nodi.
Il confronto corretto è costo per task completato
L'API K3 costa $0,30 per 1M token input con cache hit, $3 senza cache e $15 per 1M token output, secondo il listino verificato il 27 luglio 2026. Questi numeri non includono retry, strumenti esterni e tempo umano. Il cluster, invece, costa per ora anche quando aspetta. Confronta le due opzioni sulla stessa suite di lavoro e includi qualità, latenza, fallimenti e ore operative.
- Registra token input, output, cache hit e retry per ogni task.
- Misura quanti task utili completa ogni ora il deployment self-hosted.
- Aggiungi storage, trasferimento dati, osservabilità e tempo del team.
- Calcola scenari al 25%, 50% e 80% di utilizzo, non solo a pieno carico.
Quando il self-hosting può convenire
La scelta diventa credibile quando il modello deve restare nell'infrastruttura aziendale, il carico è abbastanza stabile da tenere occupato il cluster e il team possiede già competenze su inferenza distribuita. Può servire anche per ricerca, fine-tuning o controllo profondo del runtime. Se manca uno di questi elementi, l'API o un servizio gestito riducono rischio e tempo di avvio.
- Hai un vincolo on-premise verificato, non una preferenza generica.
- Hai volumi misurati e continuativi, non una previsione ottimistica.
- Puoi gestire sicurezza, aggiornamenti, capacità e incidenti.
- Hai un fallback quando il cluster è saturo o indisponibile.
La licenza va controllata prima del business case
La licenza Kimi K3 concede diritti ampi, ma impone condizioni specifiche. Un'attività Model as a Service con ricavi aggregati superiori a 20 milioni di dollari in dodici mesi richiede un accordo separato con Moonshot AI. Prodotti commerciali oltre determinate soglie di utenti o ricavi devono mostrare Kimi K3 nell'interfaccia. Le eccezioni includono l'uso interno. Se il progetto è commerciale, fai verificare il testo applicabile al tuo caso.
Un test pratico prima di impegnare budget
Parti con l'API e prepara almeno 30 task rappresentativi. Misura costo, qualità e tempo. Poi esegui un benchmark self-hosted breve su capacità noleggiata e confronta throughput e lavoro operativo. Acquista o riserva un cluster solo se il risparmio resta credibile anche con utilizzo imperfetto, manutenzione e crescita del traffico.
- Definisci una soglia minima di qualità e affidabilità.
- Prova contesti corti, medi e realmente lunghi.
- Simula errori, saturazione, aggiornamenti e perdita di un nodo.
- Documenta il punto di pareggio e ricalcolalo quando cambiano listini o ricetta.
Domande frequenti
Kimi K3 gira su un PC?
Non esiste una ricetta ufficiale supportata per un PC comune. Il deployment vLLM indicato parte da otto acceleratori da datacenter, quindi anche eventuali esperimenti ridotti non rappresentano il percorso consigliato per usare il modello completo.
Kimi K3 è open source?
Moonshot lo definisce open-weight e pubblica pesi e codice sotto la licenza Kimi K3. La licenza concede diritti ampi ma contiene condizioni commerciali specifiche, quindi non va trattata come un'etichetta generica.
Quanto costa Kimi K3 via API?
Al 27 luglio 2026 il listino indica $0,30 per 1M token input con cache hit, $3 senza cache e $15 per 1M token output, tasse escluse.
Runpod offre una configurazione Kimi K3 pronta?
Il listino Runpod mostra GPU e cluster, ma il prezzo B300 usato nell'articolo è soltanto un riferimento economico. Prima di noleggiare capacità devi verificare disponibilità, rete, runtime e compatibilità con la ricetta K3.
La newsletter di QualeAI
Resta sempre aggiornato sul mondo AI
Ricevi aggiornamenti editoriali sui nostri approfondimenti, tool AI, modelli e workflow da conoscere.
