> ## Documentation Index
> Fetch the complete documentation index at: https://docs.zylon.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Dashboard externo de Grafana

Esta página es para equipos que usan su propia instancia de Grafana.

Zylon proporciona un dashboard de referencia para métricas de plataforma de Triton y vLLM, pero importarlo es una tarea separada en Grafana. No es necesario para activar la observabilidad en Zylon.

Úsalo cuando quieras un dashboard externo de Grafana para:

* salud del servicio
* rendimiento y errores
* análisis de latencia
* cuellos de botella del scheduler y de GPU

## Qué necesitas antes

Antes de que este dashboard sea útil, necesitas:

* métricas de plataforma activadas en Zylon
* un backend de métricas compatible con Prometheus que ya contenga métricas de Zylon
* una instancia de Grafana con un datasource de Prometheus conectado a ese backend

Consulta [Métricas de plataforma](/es/operator-manual/configuration/observability/platform-metrics) y [Destinos de métricas](/es/operator-manual/configuration/observability/destinations).

## Importar el dashboard

Descarga [grafana-dashboard.json](https://raw.githubusercontent.com/zylon-ai/zylon-docs/main/snippets/grafana-dashboard.json) e impórtalo en tu instancia de Grafana mediante **Dashboards → Nuevo → Importar**.

Para el flujo de importación en Grafana, consulta la [documentación de importación de dashboards de Grafana](https://grafana.com/docs/grafana/latest/visualizations/dashboards/build-dashboards/import-dashboards/).

## Qué muestra el dashboard

El dashboard está construido a partir de las métricas expuestas en el endpoint `/metrics` de Triton:

* métricas de **Triton Inference Server** como recuento de peticiones, latencia, profundidad de cola y salud de GPU
* métricas de **vLLM** como estado del scheduler, uso de la caché KV, rendimiento de tokens e histogramas de latencia

## Filtros del dashboard

| Variable        | Propósito                                         |
| --------------- | ------------------------------------------------- |
| **Datasource**  | Datasource de Prometheus a consultar              |
| **Environment** | Despliegue o identificador de empresa             |
| **Model**       | Modelo servido por Triton                         |
| **GPU**         | Filtro `gpu_uuid` para paneles específicos de GPU |

## Cómo leer el dashboard

Sigue este orden cuando investigues un problema:

| Sección              | Qué te ayuda a responder                                       |
| -------------------- | -------------------------------------------------------------- |
| Overview             | ¿Está sano el servicio ahora mismo?                            |
| Throughput & Errors  | ¿Cuánto tráfico está gestionando y están fallando peticiones?  |
| Latency              | ¿Dónde se está yendo el tiempo?                                |
| Capacity & Scheduler | ¿El cuello de botella es cola, presión de caché KV o batching? |
| Workload Analysis    | ¿Qué tipo de peticiones envían los clientes?                   |
| GPU Health           | ¿La GPU está saturada o limitada por memoria?                  |
| Host Resources       | ¿El nodo está bajo presión?                                    |

## Paneles por sección

### Overview

Indicadores rápidos de salud para tasa de éxito, peticiones por segundo, peticiones concurrentes y profundidad de cola.

<img src="https://mintcdn.com/zylon/1MC3EkpeIBooYZ9J/images/operator-manual/observability/overview.png?fit=max&auto=format&n=1MC3EkpeIBooYZ9J&q=85&s=ffa678e150cfba90250149365a22cff7" alt="Secciones Resumen y Rendimiento y errores" width="1587" height="291" data-path="images/operator-manual/observability/overview.png" />

### Throughput & Errors

Tasa de peticiones, tasa de fallos, motivos de fallo, comportamiento de batching y profundidad de cola a lo largo del tiempo.

<img src="https://mintcdn.com/zylon/1MC3EkpeIBooYZ9J/images/operator-manual/observability/throughput-and-errors.png?fit=max&auto=format&n=1MC3EkpeIBooYZ9J&q=85&s=719ffa5a3370212bca650fe08e285660" alt="Paneles de rendimiento y errores" width="1587" height="335" data-path="images/operator-manual/observability/throughput-and-errors.png" />

<img src="https://mintcdn.com/zylon/1MC3EkpeIBooYZ9J/images/operator-manual/observability/throughput-and-errors-2.png?fit=max&auto=format&n=1MC3EkpeIBooYZ9J&q=85&s=77e5c1bcd5ab65429d11b9a916544db3" alt="Desglose de fallos por motivo, recuento de inferencias vs. ejecuciones y profundidad de la cola de peticiones pendientes" width="1503" height="315" data-path="images/operator-manual/observability/throughput-and-errors-2.png" />

### Latency

Latencia extremo a extremo, desglose por fases, TTFT, TPOT y percentiles de latencia de petición.

<img src="https://mintcdn.com/zylon/1MC3EkpeIBooYZ9J/images/operator-manual/observability/latency.png?fit=max&auto=format&n=1MC3EkpeIBooYZ9J&q=85&s=fc2f8695e420e4b7369d79389d363a24" alt="Latencia media de extremo a extremo y cascada de latencia" width="1503" height="340" data-path="images/operator-manual/observability/latency.png" />

<img src="https://mintcdn.com/zylon/1MC3EkpeIBooYZ9J/images/operator-manual/observability/latency-2.png?fit=max&auto=format&n=1MC3EkpeIBooYZ9J&q=85&s=3c932dd61f0712a5da10b35a94a979b7" alt="Cola media, cómputo y sobrecarga de E/S; percentiles TTFT de Triton y vLLM" width="1547" height="618" data-path="images/operator-manual/observability/latency-2.png" />

<img src="https://mintcdn.com/zylon/1MC3EkpeIBooYZ9J/images/operator-manual/observability/latency-3.png?fit=max&auto=format&n=1MC3EkpeIBooYZ9J&q=85&s=bfc9cfa2639db65870f1f6a7a7dd9af2" alt="Tiempo por token de salida, latencia extremo a extremo, tiempo de prefill y decode, cuantiles de resumen de Triton" width="1509" height="558" data-path="images/operator-manual/observability/latency-3.png" />

### Capacity & Scheduler

Estado del scheduler, tiempo en cola, utilización de caché KV, preemptions y tamaño de batch.

<img src="https://mintcdn.com/zylon/1MC3EkpeIBooYZ9J/images/operator-manual/observability/capacity-and-scheduler.png?fit=max&auto=format&n=1MC3EkpeIBooYZ9J&q=85&s=0d21f88c6f71d23c0a65673a61801f42" alt="Paneles de capacidad y planificador" width="1548" height="669" data-path="images/operator-manual/observability/capacity-and-scheduler.png" />

### Workload Analysis

Rendimiento de tokens, longitud de prompts, longitud de generación y comportamiento de la caché de prefijos.

<img src="https://mintcdn.com/zylon/1MC3EkpeIBooYZ9J/images/operator-manual/observability/work-analysis.png?fit=max&auto=format&n=1MC3EkpeIBooYZ9J&q=85&s=830bbb7e486a419c6e88d93b36fa7a02" alt="Rendimiento de tokens, tokens medios por solicitud y distribuciones de longitud de prompt y generación" width="1505" height="633" data-path="images/operator-manual/observability/work-analysis.png" />

<img src="https://mintcdn.com/zylon/1MC3EkpeIBooYZ9J/images/operator-manual/observability/work-analysis-2.png?fit=max&auto=format&n=1MC3EkpeIBooYZ9J&q=85&s=c49177ca41a25f0b6313a01154d59bb8" alt="Máximo de tokens de generación, percentiles de máximo de tokens por solicitud y tasa de acierto de la caché de prefijos" width="1538" height="615" data-path="images/operator-manual/observability/work-analysis-2.png" />

### GPU Health

Utilización de GPU, presión de memoria, consumo energético y energía acumulada.

<img src="https://mintcdn.com/zylon/1MC3EkpeIBooYZ9J/images/operator-manual/observability/gpu-health.png?fit=max&auto=format&n=1MC3EkpeIBooYZ9J&q=85&s=1467cc9f8ded299875e3aa594a6e60b7" alt="Utilización de GPU, memoria, consumo energético y energía acumulada" width="1558" height="661" data-path="images/operator-manual/observability/gpu-health.png" />

### Host Resources

CPU, RAM y disponibilidad de disco desde `node_exporter`.

<img src="https://mintcdn.com/zylon/1MC3EkpeIBooYZ9J/images/operator-manual/observability/host-resources.png?fit=max&auto=format&n=1MC3EkpeIBooYZ9J&q=85&s=23895b1bd0f315a258bbb47049008199" alt="Uso de CPU, uso de RAM y disponibilidad de disco" width="1516" height="342" data-path="images/operator-manual/observability/host-resources.png" />
