Investigadores de un laboratorio de sistemas de IA han publicado Orthrus-Qwen3, una técnica de optimización que logra aumentos de velocidad de hasta 7,8 veces en la generación de tokens por segundo durante la inferencia de modelos Qwen3, uno de los familias de modelos de código abierto más utilizados del momento.
El método se basa en una combinación de destilación de conocimiento, cuantización adaptativa y una nueva arquitectura de memoria KV que reduce drásticamente el ancho de banda necesario durante el procesamiento de secuencias largas. Los investigadores demostraron que la técnica mantiene la perplejidad y las métricas de benchmark en niveles virtualmente idénticos a los del modelo original sin comprimir.
Lo más significativo del anuncio es que Orthrus-Qwen3 no requiere hardware especializado ni GPUs de última generación: las mejoras se lograron utilizando hardware comercial disponible actualmente. Esto lo hace particularmente atractivo para empresas que buscan desplegar modelos de lenguaje capaces en servidores de gama media o incluso en workstations profesionales.
Los autores han liberado tanto el código como los pesos del modelo optimizado bajo una licencia permisiva. En las pruebas realizadas por la comunidad, los resultados han sido confirmados: usuarios con tarjetas gráficas de dos años de antigüedad reportaron incrementos de throughput de entre cinco y siete veces, dependiendo de la longitud del contexto y el tamaño del lote de procesamiento.
El Chasqui
Comentarios (0)
Sé el primero en comentar.