Abstrakte KI-Visualisierung fuer ein neues Sprachmodell

DeepSeek V4-Flash-Vision: Chinesisches KI-Modell lernt sehen

DeepSeek hat mit „V4-Flash-Vision-Exp“ sein erstes multimodales Modell veröffentlicht, das Bilder versteht. Über die API verfügbar, soll es bei visuellen Agenten-Aufgaben nah an Spitzenmodelle heranreichen – bei einem Kontextfenster von über einer Million Token.

Sehen statt nur lesen

Bei reinen Text-Fähigkeiten (Agenten, Reasoning, Weltwissen) liegt das Modell auf dem Niveau des bisherigen V4-Flash. Der Sprung kommt beim visuellen Verständnis: Auf Agenten-Benchmarks, die Bilderkennung erfordern, nähert sich DeepSeek nach eigenen Angaben den multimodalen Fähigkeiten von Opus 4.8 an.

Technische Eckdaten

Das Kontextfenster umfasst 1.048.576 Token, die maximale Ausgabe 384.000 Token. Der „Thinking“-Modus ist standardmäßig aktiv. Angesprochen wird das Modell über den Bezeichner „deepseek-v4-flash-vision-exp“ – wahlweise über OpenAI-kompatible oder Anthropic-formatige Endpunkte.

Einordnung

Mit einem leistungsstarken, günstigen Vision-Modell erhöht DeepSeek erneut den Druck auf die großen westlichen Anbieter. Die Freigabe erfolgte am 21. August über die DeepSeek-API; das „Exp“ im Namen weist auf den experimentellen Status hin.


Quelle: DeepSeek API Docs.

Mastodon
Nach oben scrollen