Il 10 settembre 2026, DeepSeek ha presentato V4.1 Flash, un modello di lingua multimodale che introduce una nuova architettura e taglia bruscamente i prezzi API.
Una nuova architettura causale encoder-decoder
L’azienda chiama V4.1 Flash il modello più piccolo in una nuova famiglia. Esso utilizza un design “Causal Encoder–Decoder” con un nucleo di miscela-di-esperti di 552 miliardi di metri, di cui DeepSeek dice che solo 8 miliardi di parametri sono attivi sull’ingresso e 16 miliardi sulla produzione. Rispetto alla generazione precedente, il modello ha bisogno solo di un quarto della HBM e di un ottavo dello storage SSD per la sua cache KV.
Multimodale, pesi aperti, prezzi bassi
V4.1 Flash comprende le immagini in modo nativo ed è raggiungibile attraverso il deepseek-flash endpoint con una finestra di contesto di un milione di tonnellate. DeepSeek pubblica i pesi come modello open-weight su Hugging Face, insieme a un rapporto tecnico. I prezzi sono calati al lancio: durante le ore di punta il listino dei prezzi cita l’ingresso a $0.30 per milione di gettoni (cache miss) e l’uscita a $1.20, con tassi off-peak fissati a metà di quello.
Prestazioni vengono con caveats
DeepSeek punta a “test di più parti” che posizionano V4.1 Flash davanti al V4-Pro in uscita su prestazioni, costi, velocità e tempi di esecuzione totali – cifre del fornitore che non sono ancora state verificate in modo indipendente. Dal 14 settembre 2026, DeepSeek pianifica di indirizzare automaticamente le richieste V4-Pro al nuovo modello fino a quando non arriva una variante V4.1-Pro.
Fonti: DeepSeek – Introduzione DeepSeek-V4.1-Flash e il annuncio nel DeepSeek API Docs.



















