Laboratorio Distribuido en Vivo
JOAN LAB · Telemetría de GPUs
Monitoreo en tiempo real de nodos de cómputo para inferencia local de modelos abiertos (vLLM, Ollama, MLX).
sync
Polling activo cada 5 segundos
Throughput Global
speed
0
tps
VRAM Total Activa
memory
304
GB GDDR6X
Latencia Media (TTFT)
timer
0
ms
Nodos Operativos
dns
0 / 3
monitoring Throughput & Carga en Tiempo Real — TITAN-AI-PRIMARY
Actualización en vivo (5s)Nodos y Servidores en Producción
Modelo Cargado:
Uso GPU
VRAM
Throughput
Temp
Modelo Cargado:
Uso GPU
VRAM
Throughput
Temp
Modelo Cargado:
Uso GPU
VRAM
Throughput
Temp
calculate
Algoritmo vLLM Estimator 2026
Calculadora de VRAM & Hardware para LLMs Locales
Herramienta técnica interactiva para dimensionar inferencia en producción (vLLM, SGLang, Ollama)
2k
8k (Estándar)
32k
64k (Largo)
Diagnóstico de Recursos
VRAM Pesos
VRAM KV-Cache
VRAM Total Recomendada
memory
Hardware Sugerido:
Velocidad Estimada:
download_for_offline
Herramienta de Laboratorio
Formato: Script + PDF
Checklist & Script de Despliegue de Inferencia Local con vLLM
Obtén el script en Python y Docker Compose listo para producción con soporte para PagedAttention, cuantización AWQ y métricas Prometheus.
check_circle
¡Recurso Desbloqueado!
Hemos registrado tu acceso. Revisa tu correo electrónico para descargar tu copia de Checklist & Script de Despliegue de Inferencia Local con vLLM.