DeepSeek ha lanzado «V4-Flash-Vision-Exp», su primer modelo multimodal que entiende las imágenes. Disponible a través de la API, se dice que se acercan a los mejores modelos en las tareas del agente visual – con una ventana de contexto de más de un millón de fichas.
Ver, no sólo leer
Con capacidades de texto puro (agentes, razonamiento, conocimiento del mundo), el modelo está en par con el V4-Flash existente. El salto viene en la comprensión visual: en los parámetros de agente que requieren reconocimiento de imagen, DeepSeek dice que se acerca a las capacidades multimodales del Opus 4.8.
Detalles técnicos
La ventana contextual abarca 1.048.576 fichas, con una salida máxima de 384.000 fichas. El modo «Thinking» está por defecto. El modelo se aborda a través del identificador «deepseek-v4-flash-vision-exp» a través de puntos finales compatibles con OpenAI o en formato antropo.
Lo que significa
Con un modelo de visión potente y asequible, DeepSeek nuevamente aumenta la presión sobre los grandes proveedores occidentales. La versión fue en directo el 21 de agosto a través de la API de DeepSeek; el «Exp» en el nombre indica su estado experimental.
Fuente: DeepSeek API Docs.



















