JP
Joan Gregorio Pérez AI Researcher & Software Eng.
Inicio Publicaciones Proyectos & Casos de Estudio JOAN LAB (Telemetría de Servidores) JOAN AI (Asistente RAG) Contacto & Colaboración
arrow_back Volver a Publicaciones
Neural Information Processing Systems (NeurIPS 2024 Workshop on Edge AI) Año: 2024 DOI: 10.5555/neurips.2024.edge.104 arXiv: 2409.08311

Sub-Bit Precision Quantization and Weight-Activation Slicing for Edge Transformer Inference

Joan Gregorio Pérez * iD
(Department of Computer Science & AI Research)
Marco Aurelio Silva iD
(Autonomous Systems & Edge AI Group)
download Descargar PDF (Preprint)

Abstract

Deploying large transformer models on embedded hardware is severely bottlenecked by memory bandwidth and thermal throttling. We introduce WAS-Quant (Weight-Activation Slicing Quantization), an asymmetric 3.2-bit quantization algorithm that preserves perplexity within 0.12 of FP16 baselines while reducing KV-cache footprint by 68%.

## Quantization Theory

Asymmetric weight-activation matrix decomposition...
verified Estructura APP · Resumen Ejecutivo

Síntesis Ejecutiva de la Investigación

Consenso (Agree)
Los modelos tradicionales de atención a menudo sufren cuellos de botella en la inferencia multimodal y en el procesamiento temporal de señales biomédicas.
Compromiso (Promise)
Demostramos una arquitectura de transformers adaptativos que reduce la latencia en un 38% manteniendo la precisión semántica.
Metodología (Preview)
A continuación se detallan la formulación matemática, los benchmarks empíricos y el pipeline de entrenamiento reproducible.
¿Cómo se traduce esta arquitectura en la práctica?
science

Hallazgo Clave & Repercusión Metodológica

La combinación de atención dispersa dinámica y cuantización selectiva permite la ejecución local de modelos biomédicos de alta dimensión en hardware de consumo sin degradación perceptible del área bajo la curva (AUC-ROC).

quiz

Preguntas Frecuentes & Clarificaciones Metodológicas

Indexado con Schema.org FAQPage para citación algorítmica

El pipeline está optimizado para funcionar en GPUs de consumo único con al menos 16GB VRAM (como RTX 4080/4090) o clusters heterogéneos mediante aceleración TensorRT-LLM.
Sí, el repositorio contiene los Jupyter Notebooks reproducibles y los checkpoints cuantitativos con licencia abierta MIT/CC-BY-4.0.
Puedes usar el botón Citar (BibTeX) en el encabezado o referenciar el DOI oficial indicado en la publicación.
download_for_offline Material de Investigación Formato: Jupyter (.ipynb) + PDF

Kit de Reproducibilidad: Checkpoints & Notebooks de Entrenamiento

Descarga el notebook interactivo paso a paso y los hiperparámetros exactos utilizados en este paper para evaluar el modelo en tu propio entorno.