Qwen 3.8 de 27.000 millones de parámetros está demostrando ser uno de los modelos de lenguaje más capaces que pueden ejecutarse en hardware local, según los análisis publicados por Simon Willison tras varias semanas de pruebas intensivas. El modelo, desarrollado por el laboratorio chino Alibaba, se ubica en el segmento de modelos pequeños de alto rendimiento, un espacio que está revolucionando el acceso a la inteligencia artificial avanzada.

En sus pruebas, Willison observó que Qwen 3.8 produce resultados excelentes en generación de código, creación de imágenes SVG y tareas de análisis de texto. En una prueba de generación de SVG de un pelícano, el modelo produjo un resultado que Willison describió como el mejor pelícano en SVG generado con un modelo que funciona en una máquina local, algo que normalmente requeriría modelos de decenas de miles de millones de parámetros.

Sin embargo, el problema recurrente que identificó fue la tendencia del modelo a sobrepensar. Incluso con límites de contexto reducidos a 8.192 tokens, Qwen 3.8 consume la totalidad del contexto disponible reflexionando sobre tareas que podrían resolverse en una fracción de ese espacio.

El fenómeno del sobrepensamiento ha sido documentado en otros modelos de la familia Qwen y en competidores como Claude y GPT. Los investigadores lo atribuyen a los procesos de refinamiento del modelo durante el entrenamiento con refuerzo sobre respuestas largas, que optimizan la calidad de las respuestas complejas pero penalizan implícitamente las respuestas breves.