Sub-Bit Precision Quantization and Weight-Activation Slicing for Edge Transformer Inference
Abstract
Deploying large transformer models on embedded hardware is severely bottlenecked by memory bandwidth and thermal throttling. We introduce WAS-Quant (Weight-Activation Slicing Quantization), an asymmetric 3.2-bit quantization algorithm that preserves perplexity within 0.12 of FP16 baselines while reducing KV-cache footprint by 68%.
Asymmetric weight-activation matrix decomposition...
Síntesis Ejecutiva de la Investigación
Hallazgo Clave & Repercusión Metodológica
La combinación de atención dispersa dinámica y cuantización selectiva permite la ejecución local de modelos biomédicos de alta dimensión en hardware de consumo sin degradación perceptible del área bajo la curva (AUC-ROC).
Preguntas Frecuentes & Clarificaciones Metodológicas
Indexado con Schema.org FAQPage para citación algorítmica
Kit de Reproducibilidad: Checkpoints & Notebooks de Entrenamiento
Descarga el notebook interactivo paso a paso y los hiperparámetros exactos utilizados en este paper para evaluar el modelo en tu propio entorno.
¡Recurso Desbloqueado!
Hemos registrado tu acceso. Revisa tu correo electrónico para descargar tu copia de Kit de Reproducibilidad: Checkpoints & Notebooks de Entrenamiento.