DeepSeek hat am 10. September 2026 mit V4.1 Flash ein multimodales Sprachmodell vorgestellt, das eine neue Architektur einführt und die API-Preise deutlich senkt.
Neue Causal-Encoder-Decoder-Architektur
Das Unternehmen bezeichnet V4.1 Flash als das kleinste Modell einer neuen Familie. Es setzt auf eine „Causal Encoder–Decoder“-Architektur mit insgesamt 552 Milliarden Parametern im Mixture-of-Experts-Verbund, von denen laut DeepSeek nur 8 Milliarden bei der Eingabe und 16 Milliarden bei der Ausgabe aktiv sind. Gegenüber der Vorgängergeneration soll das Modell für den KV-Cache nur ein Viertel des HBM- und ein Achtel des SSD-Speichers benötigen.
Multimodal, offene Gewichte, niedrige Preise
V4.1 Flash versteht nativ Bilder und ist über den Endpunkt deepseek-flash mit einem Kontextfenster von einer Million Token erreichbar. Die Gewichte stellt DeepSeek als Open-Weight-Modell auf Hugging Face bereit, samt technischem Bericht. Zum Start sanken die API-Preise: In Spitzenzeiten kostet laut Preisliste die Eingabe 0,30 US-Dollar (Cache-Miss) und die Ausgabe 1,20 US-Dollar je Million Token, außerhalb der Stoßzeiten jeweils die Hälfte.
Leistungsangaben mit Vorbehalt
DeepSeek verweist auf „Tests mehrerer Parteien“, die V4.1 Flash bei Leistung, Kosten, Geschwindigkeit und Gesamtlaufzeit vor dem bisherigen V4-Pro sehen – unabhängig überprüft sind diese Herstellerangaben bislang nicht. Ab dem 14. September 2026 will DeepSeek V4-Pro-Anfragen automatisch auf das neue Modell umleiten, bis eine V4.1-Pro-Variante folgt.
Quellen: DeepSeek – Introducing DeepSeek-V4.1-Flash sowie die Ankündigung in den DeepSeek API Docs.



















