JP
Joan Gregorio Pérez AI Researcher & Software Eng.
Inicio Publicaciones Proyectos & Casos de Estudio JOAN LAB (Telemetría de Servidores) JOAN AI (Asistente RAG) Contacto & Colaboración
Laboratorio Distribuido en Vivo

JOAN LAB · Telemetría de GPUs

Monitoreo en tiempo real de nodos de cómputo para inferencia local de modelos abiertos (vLLM, Ollama, MLX).

sync Polling activo cada 5 segundos
Throughput Global speed
0 tps
VRAM Total Activa memory
304 GB GDDR6X
Latencia Media (TTFT) timer
0 ms
Nodos Operativos dns
0 / 3

monitoring Throughput & Carga en Tiempo Real — TITAN-AI-PRIMARY

Actualización en vivo (5s)

Nodos y Servidores en Producción

Modelo Cargado:
Uso GPU
VRAM
Throughput
Temp

Modelo Cargado:
Uso GPU
VRAM
Throughput
Temp

Modelo Cargado:
Uso GPU
VRAM
Throughput
Temp
calculate

Calculadora de VRAM & Hardware para LLMs Locales

Herramienta técnica interactiva para dimensionar inferencia en producción (vLLM, SGLang, Ollama)

Algoritmo vLLM Estimator 2026
2k 8k (Estándar) 32k 64k (Largo)

Diagnóstico de Recursos

VRAM Pesos
VRAM KV-Cache
VRAM Total Recomendada
memory
Hardware Sugerido:
Velocidad Estimada:
download_for_offline Herramienta de Laboratorio Formato: Script + PDF

Checklist & Script de Despliegue de Inferencia Local con vLLM

Obtén el script en Python y Docker Compose listo para producción con soporte para PagedAttention, cuantización AWQ y métricas Prometheus.