Le 10 septembre 2026, DeepSeek a dévoilé Flash, un modèle de langage multimodal qui introduit une nouvelle architecture et réduit fortement les prix de l’API.
Une nouvelle architecture de codeur-décodeur causal
L’entreprise appelle V4.1 Flash le plus petit modèle dans une nouvelle famille. Il utilise une conception encodeur-décodeur causal avec un noyau de mélange d’experts de 552 milliards de paramètres, dont DeepSeek dit que seulement 8 milliards de paramètres sont actifs sur l’entrée et 16 milliards sur la sortie. Par rapport à la génération précédente, le modèle n’aurait besoin que d’un quart du HBM et d’un huitième du stockage SSD pour son cache KV.
Multimodal, poids ouverts, bas prix
V4.1 Flash comprend les images nativement et est accessible à travers le deepseek-flash endpoint avec une fenêtre contextuelle d’un million de jetons. DeepSeek publie les poids en tant que modèle à poids ouvert sur Hugging Face, ainsi qu’un rapport technique. Les prix ont chuté au lancement : pendant les heures de pointe, la liste des prix indique des entrées à 0,30 $ par million de jetons (cache miss) et des sorties à 1,20 $, avec des taux hors pointe fixés à la moitié de cela.
Les demandes de prestations sont assorties de mises en garde
DeepSeek pointe sur les tests de plusieurs parties qui placent V4.1 Flash devant le V4-Pro sortant sur la performance, le coût, la vitesse et le temps d’exécution total – chiffres fournisseurs qui n’ont pas encore été vérifiés indépendamment. À partir du 14 septembre 2026, DeepSeek prévoit d’orienter automatiquement les demandes V4-Pro vers le nouveau modèle jusqu’à l’arrivée d’une variante V4.1-Pro.
Sources : DeepSeek – Présentation de DeepSeek-V4.1-Flash et les annonce dans DeepSeek API Docs.



















