Abstrakte KI-Visualisierung fuer ein neues Sprachmodell

DeepSeek V4-Flash-Vision: le modèle AI chinois apprend à voir

DeepSeek a publié « V4-Flash-Vision-Exp », son premier modèle multimodal qui comprend les images. Disponible via l’API, il serait proche des modèles les plus performants sur les tâches d’agents visuels – avec une fenêtre contextuelle de plus d’un million de jetons.

Voir, pas seulement lire

Sur les capacités de texte pur (agents, raisonnement, connaissance du monde), le modèle est au même niveau que le V4-Flash existant. Le bond en avant dans la compréhension visuelle : sur les repères d’agents qui nécessitent une reconnaissance d’image, DeepSeek dit qu’il aborde les capacités multimodales de l’Opus 4.8.

Détails techniques

La fenêtre contextuelle couvre 1 048 576 jetons, avec une sortie maximale de 384 000 jetons. Le mode « penser » est activé par défaut. Le modèle est traité par l’identificateur «deepseek-v4-flash-vision-exp» – soit par des paramètres compatibles avec OpenAI, soit par des paramètres anthropiques.

Ce que ça veut dire

Avec un modèle de vision puissant et abordable, DeepSeek augmente encore la pression sur les grands fournisseurs occidentaux. La sortie a eu lieu le 21 août via l’API DeepSeek ; le « Exp » dans le nom indique son statut expérimental.


Source: DeepSeek API Docs.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *

Mastodon
Retour en haut