DeepSeek a publié « V4-Flash-Vision-Exp », son premier modèle multimodal qui comprend les images. Disponible via l’API, il serait proche des modèles les plus performants sur les tâches d’agents visuels – avec une fenêtre contextuelle de plus d’un million de jetons.
Voir, pas seulement lire
Sur les capacités de texte pur (agents, raisonnement, connaissance du monde), le modèle est au même niveau que le V4-Flash existant. Le bond en avant dans la compréhension visuelle : sur les repères d’agents qui nécessitent une reconnaissance d’image, DeepSeek dit qu’il aborde les capacités multimodales de l’Opus 4.8.
Détails techniques
La fenêtre contextuelle couvre 1 048 576 jetons, avec une sortie maximale de 384 000 jetons. Le mode « penser » est activé par défaut. Le modèle est traité par l’identificateur «deepseek-v4-flash-vision-exp» – soit par des paramètres compatibles avec OpenAI, soit par des paramètres anthropiques.
Ce que ça veut dire
Avec un modèle de vision puissant et abordable, DeepSeek augmente encore la pression sur les grands fournisseurs occidentaux. La sortie a eu lieu le 21 août via l’API DeepSeek ; le « Exp » dans le nom indique son statut expérimental.
Source: DeepSeek API Docs.



















