Abstrakte KI-Visualisierung fuer ein neues Sprachmodell

DeepSeek V4-Flash-Vision: Modello AI cinese impara a vedere

DeepSeek ha rilasciato “V4-Flash-Vision-Exp”, il suo primo modello multimodale che comprende le immagini. Disponibile tramite l’API, si dice di avvicinarsi ai migliori modelli sulle attività di agente visivo – con una finestra di contesto di oltre un milione di gettoni.

Vedere, non solo leggere

Su capacità di testo puro (agenti, ragionamento, conoscenza del mondo), il modello è pari con il V4-Flash esistente. Il salto arriva nella comprensione visiva: sui benchmark dell’agente che richiedono il riconoscimento dell’immagine, DeepSeek dice che si avvicina alle capacità multimodali di Opus 4.8.

Dati tecnici

La finestra di contesto si estende su 1.08,576 token, con una potenza massima di 384.000 token. La modalità “Thinking” è attivata per impostazione predefinita. Il modello viene affrontato tramite l’identificativo “deepseek-v4-flash-vision-exp” – attraverso gli endpoint OpenAI-compatibile o Anthropic-format.

Cosa significa

Con un potente e conveniente modello di visione, DeepSeek solleva nuovamente la pressione sui grandi fornitori occidentali. Il rilascio è andato in diretta il 21 agosto tramite l’API DeepSeek; il “Exp” nel nome segnala il suo stato sperimentale.


Fonte: DeepSeek API Docs.

Lascia un commento

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *

Mastodon
Torna in alto