DeepSeek hat mit „V4-Flash-Vision-Exp“ sein erstes multimodales Modell veröffentlicht, das Bilder versteht. Über die API verfügbar, soll es bei visuellen Agenten-Aufgaben nah an Spitzenmodelle heranreichen – bei einem Kontextfenster von über einer Million Token.
Sehen statt nur lesen
Bei reinen Text-Fähigkeiten (Agenten, Reasoning, Weltwissen) liegt das Modell auf dem Niveau des bisherigen V4-Flash. Der Sprung kommt beim visuellen Verständnis: Auf Agenten-Benchmarks, die Bilderkennung erfordern, nähert sich DeepSeek nach eigenen Angaben den multimodalen Fähigkeiten von Opus 4.8 an.
Technische Eckdaten
Das Kontextfenster umfasst 1.048.576 Token, die maximale Ausgabe 384.000 Token. Der „Thinking“-Modus ist standardmäßig aktiv. Angesprochen wird das Modell über den Bezeichner „deepseek-v4-flash-vision-exp“ – wahlweise über OpenAI-kompatible oder Anthropic-formatige Endpunkte.
Einordnung
Mit einem leistungsstarken, günstigen Vision-Modell erhöht DeepSeek erneut den Druck auf die großen westlichen Anbieter. Die Freigabe erfolgte am 21. August über die DeepSeek-API; das „Exp“ im Namen weist auf den experimentellen Status hin.
Quelle: DeepSeek API Docs.



















