Ugrás a fő tartalomra
Vissza a hírekhez
AI Research

Kutatók bemutatják a Quantization-Aware Healing-et a tömörített LLM-ekhez

A Quantization-Aware Healing (QAH) nevű új módszer lehetővé teszi, hogy a szerkezetileg tömörített, 4-bites modellek felülmúlják a teljes pontosságú társaikat azáltal, hogy a tudást közvetlenül az eredeti, tömörítetlen tanármodellből desztillálják.

Közzétéve: 2026. augusztus 25.Szerző GetAISet Editorial
Forrás: Hugging FaceEredeti cikk megtekintése

Az eredeti forrás közzétételi dátuma: 2026. augusztus 25.

A Multiverse Computing kutatói bemutatták a Quantization-Aware Healing (QAH) eljárást, amelyet arra terveztek, hogy helyreállítsa a teljesítményt azokban a nagy nyelvi modellekben (LLM), amelyek szerkezeti tömörítésen és 4-bites kvantáláson estek át. A hagyományos módszerek gyakran küzdenek a pontosság megőrzésével ezen folyamatok után, mivel általában egy helyreállított, alacsonyabb pontosságú ellenőrzőpontból történő desztillációra támaszkodnak. A QAH ezt úgy oldja meg, hogy közvetlenül az eredeti, teljes pontosságú tanármodellből desztillál, függetlenül a tanuló kisebb architektúrájától. A tesztelés során egy 120B GPT-OSS modellből tömörített és MXFP4-re kvantált 60B paraméteres modell a QAH használatával 9-ből 7 benchmarkon felülmúlta a saját teljes pontosságú bfloat16-os verzióját. A módszer különösen erősnek bizonyult a hosszú kontextusú érvelési és matematikai feladatokban. Ezenkívül a QAH jobb képzési stabilitást mutatott a Quantization-Aware Training (QAT) módszerhez képest, gyorsabban érte el a csúcsteljesítményt, és elkerülte azt a teljesítménycsökkenést, amelyet az optimális ponton túli képzés során figyeltek meg. Ez a megközelítés lehetőséget kínál kisebb, hatékonyabb modellek telepítésére anélkül, hogy feláldoznánk az eredeti, nagyobb architektúra képességeit.