DeepSeek V4 Flash, el modelo de inteligencia artificial que ha logrado las mejores puntuaciones en los principales rankings de rendimiento de modelos de lenguaje, está exhibiendo debilidades importantes en evaluaciones prácticas de tareas de agente de IA, según un nuevo estudio comparativo publicado por VentureBeat.
El modelo chino, desarrollado por el laboratorio High-Flyer, lidera actualmente las clasificaciones de referencia en matemáticas, programación y comprensión lectora. Sin embargo, cuando fue evaluado en un nuevo marco de pruebas diseñado para reflejar tareas reales de agentes de IA, el modelo cometió errores significativos en situaciones que requerían planificación a largo plazo, uso de múltiples herramientas y adaptación a instrucciones ambiguas.
La brecha entre el rendimiento en benchmarks y el rendimiento en tareas reales de agente ha sido documentada anteriormente en otros modelos, pero los investigadores señalan que en DeepSeek V4 Flash la discrepancia es particularmente pronunciada. En una prueba de tarea múltiple que simulaba un flujo de trabajo de análisis de datos, el modelo generó código funcional pero falló en conectar correctamente las salidas de una herramienta con las entradas de la siguiente.
Los investigadores teorizan que el enfoque de entrenamiento de DeepSeek, basado en una proporción muy alta de datos sintéticos generados por otros modelos, puede estar generando un sesgo hacia patrones que funcionan bien en pruebas formales pero que no generalizan a situaciones del mundo real.
El estudio también encontró que el costo por consulta de DeepSeek V4 Flash ha aumentado significativamente en los últimos meses.
El Chasqui
Comentarios (0)
Sé el primero en comentar.