Investigadores presentan Quantization-Aware Healing para LLMs comprimidos
Un nuevo método llamado Quantization-Aware Healing (QAH) permite que los modelos comprimidos estructuralmente de 4 bits superen a sus contrapartes de precisión completa mediante la destilación de conocimiento directamente del modelo profesor original sin comprimir.
Publicación de la fuente original: 25 de agosto de 2026
Investigadores de Multiverse Computing han introducido Quantization-Aware Healing (QAH), una técnica diseñada para recuperar el rendimiento en modelos de lenguaje grandes (LLM) que han sido sometidos tanto a compresión estructural como a cuantización de 4 bits. Los métodos tradicionales a menudo tienen dificultades para mantener la precisión después de estos procesos, ya que normalmente dependen de la destilación a partir de un punto de control recuperado de menor precisión. QAH aborda esto destilando directamente del modelo profesor original de precisión completa, independientemente de la arquitectura más pequeña del estudiante. En las pruebas, un modelo de 60B de parámetros comprimido a partir de un modelo GPT-OSS de 120B y cuantizado a MXFP4 utilizando QAH superó a su propia versión de precisión completa bfloat16 en 7 de 9 puntos de referencia. El método mostró una fortaleza particular en el razonamiento de contexto largo y tareas matemáticas. Además, QAH demostró una mayor estabilidad de entrenamiento en comparación con el Quantization-Aware Training (QAT), alcanzando el rendimiento máximo más rápido y evitando la degradación del rendimiento observada cuando el entrenamiento continúa más allá del punto óptimo. Este enfoque ofrece una forma de implementar modelos más pequeños y eficientes sin sacrificar las capacidades de la arquitectura original más grande.