
DeepSeek presenta un modelo multimodal experimental que supera a Opus 4.8 de Anthropic en tres pruebas de rendimiento y ofrece menor costo operativo.
El laboratorio de Inteligencia Artificial DeepSeek ha publicado un modelo multimodal experimental que, en la tabla compartida por la propia compañía, supera a Opus 4.8 de Anthropic en tres de once pruebas (benchmarks).
El modelo es DeepSeek-V4-Flash-Vision-Exp y añade capacidad de visión al modelo previo V4-Flash, lo que le permite interpretar imágenes y capturas de pantalla, ampliando sus posibilidades de uso. "Este modelo multimodal experimental iguala a DeepSeek-V4-Flash en capacidades de texto, incluyendo agentes, razonamiento y conocimiento del mundo", afirma DeepSeek.
De las once pruebas, DeepSeek supera a Opus 4.8 en tres (DeepSWE, Agents' Last Exam y ZeroBench), mientras que en el resto se queda detrás, con una diferencia de doce puntos en el benchmark de tareas complejas de repositorios (NL2Repo).
Comparado con la versión V4-Flash de solo texto, el modelo experimental lo supera en seis de las siete evaluaciones de texto, aunque ese modelo no es capaz de ver imágenes.
La compañía china ha habilitado el nuevo modelo en su plataforma de API y ha lanzado la versión 0.1.1 de su entorno para agentes con soporte para este modelo. El modelo multimodal experimental admite el envío de imágenes, de modo que una foto o captura de pantalla se traduce en unidades (tokens) que se cobran al precio del texto estándar (hasta 384 por imagen).
Se suma la API de archivos (Files API), que permite subir una imagen una sola vez para reutilizarla en todas las consultas, en vez de cargarla cada vez. El procesamiento de un millón de palabras tiene un coste de 0,87 dólares frente a los cerca de 50 dólares de Opus 4.8 de Anthropic.
Participa en la conversación con respeto. Tu comentario se publicará automáticamente, aunque podrá ser retirado por la redacción.
Comentarios (0)