JP
Joan Gregorio Pérez AI Researcher & Software Eng.
Inicio Publicaciones Proyectos & Casos de Estudio JOAN LAB (Telemetría de Servidores) JOAN AI (Asistente RAG) Contacto & Colaboración
Indexación Académica

Publicaciones, Preprints & Datasets

Artículos revisados por pares en conferencias y revistas IEEE/ACM en las áreas de Inteligencia Artificial Multimodal, Neurocomputación y Accesibilidad Sensorial.

search
Neural Information Processing Systems (NeurIPS 2024 Workshop on Edge AI) · 2024

Sub-Bit Precision Quantization and Weight-Activation Slicing for Edge Transformer Inference

Joan Gregorio Pérez * iD
,
Marco Aurelio Silva iD

Deploying large transformer models on embedded hardware is severely bottlenecked by memory bandwidth and thermal throttling. We introduce WAS-Quant (Weight-Activation Slicing Quantization), an asymmetric 3.2-bit quantization algorithm that preserves perplexity within 0.12 of FP16 baselines while reducing KV-cache footprint by 68%.