DeepSeek ha rilasciato “V4-Flash-Vision-Exp”, il suo primo modello multimodale che comprende le immagini. Disponibile tramite l’API, si dice di avvicinarsi ai migliori modelli sulle attività di agente visivo – con una finestra di contesto di oltre un milione di gettoni.
Vedere, non solo leggere
Su capacità di testo puro (agenti, ragionamento, conoscenza del mondo), il modello è pari con il V4-Flash esistente. Il salto arriva nella comprensione visiva: sui benchmark dell’agente che richiedono il riconoscimento dell’immagine, DeepSeek dice che si avvicina alle capacità multimodali di Opus 4.8.
Dati tecnici
La finestra di contesto si estende su 1.08,576 token, con una potenza massima di 384.000 token. La modalità “Thinking” è attivata per impostazione predefinita. Il modello viene affrontato tramite l’identificativo “deepseek-v4-flash-vision-exp” – attraverso gli endpoint OpenAI-compatibile o Anthropic-format.
Cosa significa
Con un potente e conveniente modello di visione, DeepSeek solleva nuovamente la pressione sui grandi fornitori occidentali. Il rilascio è andato in diretta il 21 agosto tramite l’API DeepSeek; il “Exp” nel nome segnala il suo stato sperimentale.
Fonte: DeepSeek API Docs.



















