Quantization-Aware Healing: técnica para modelos 4-bit más precisos que originales
Línea temporal
-
Multiverse Computing presenta técnica para modelos IA 4-bit más precisos que versiones completas
Multiverse Computing ha publicado un paper sobre Quantization-Aware Healing (QAH), una técnica de recuperación de modelos comprimidos y cuantizados a 4 bits. Al aplicarla a un modelo GPT-OSS de 120B comprimido a 60B…