Modelli AI nel 2026: meno costosi, più performanti
GPT-5.6 Luna, Gemini 3.7 Flash, GLM-5.3 Flash, Qwen 3.7 Flash e DeepSeek V4-Flash: la fotografia di agosto 2026 sui modelli AI che costano meno e fanno di più, letta da chi costruisce agenti AI in produzione.

Agosto 2026 conferma una tendenza che va avanti da mesi: il costo per token continua a scendere mentre le capacità dei modelli, soprattutto nei tier economici, continuano a salire. Per chi costruisce agenti AI in produzione non è un dettaglio finanziario — cambia cosa ci si può permettere di costruire. Ecco i cinque segnali che contano di più in questo momento.

1. OpenAI taglia GPT-5.6 Luna dell'80%
Il 30 luglio 2026 OpenAI ha tagliato il prezzo di GPT-5.6 Luna dell'80% e di Terra del 20%. Il 21 agosto ha tagliato anche Sol, da 5 $/30 $ a 4 $/20 $ per milione di token. Luna oggi è il modello frontier-class più economico sul mercato: 0,20 $ di input e 1,20 $ di output per milione di token. Il tier "economico" fa oggi il lavoro che un anno fa costava cinque volte tanto.

2. Gemini 3.7 Flash: buon punteggio, prezzo a tempo
Gemini 3.7 Flash segna 56 punti sull'Artificial Analysis Intelligence Index a un prezzo di lancio di 0,75 $ / 3,75 $ per milione di token. Attenzione però: quella tariffa raddoppia dal 1° gennaio 2027. Chi lo integra oggi in un prodotto dovrebbe pianificare da subito il costo post-gennaio, non scoprirlo in fattura.

3. GLM-5.3 Flash: il nuovo arrivato open weight
Z.ai ha rilasciato GLM-5.3 Flash: 320 miliardi di parametri MoE, di cui solo 18 miliardi attivi per inferenza. Contesto da 1 milione di token, multimodale in input (testo, immagini, video), e pesi scaricabili liberamente su HuggingFace. Prezzo: 0,15 $ / 0,50 $ per milione di token. È il tipo di modello che rende sensato self-hostare invece di dipendere da un solo provider per certi workload.

4. Ancora più economici: Qwen 3.7 Flash e DeepSeek V4-Flash
Qwen 3.7 Flash scende a 0,03 $ di input e 0,13 $ di output per milione di token. DeepSeek V4-Flash è intorno a 0,06 $/milione — fino a 36-89 volte più economico dei modelli di punta. Il compromesso è reale: questi tier sono tarati su velocità e volume, non sul reasoning più difficile o sul codice più insidioso. Vanno bene per classificazione, sintesi, drafting, task ad alta frequenza — non per il passo di verifica finale.

Messi insieme, questi cinque segnali spostano il vincolo principale di chi costruisce agenti AI: non è più il budget dei token, è la latenza, l'affidabilità, e quanta verifica automatica ci si può permettere prima di spedire in produzione. Un costo per token che scende di questo passo rende sostenibili pattern prima costosi — agenti multi-step che rileggono il proprio output, RAG con retrieval più aggressivo, loop di self-correction che prima si tagliavano per contenere la spesa.
