Monitoring
1. Visión General
La pantalla de Monitoring da el control de salud de todas las aplicaciones corriendo en la plataforma — Flows, Apps y Add-ons — en un único lugar: ejecuciones, errores, consumo de recursos, consumo de tokens de IA, tracing detallado y alertas activas. En lugar de cazar información en varios sistemas diferentes, es posible ver rápidamente qué está corriendo, qué está fallando y por qué.
2. Filtros
En el panel lateral, los filtros recortan la vista de monitoreo:
| Filtro | Descripción |
|---|---|
| Squad | Squad dueño del recurso monitoreado. |
| Environment | Entorno monitoreado (ej: test). |
| Type | Tipo de recurso: Flows, Apps o Addons. |
| Flow | Flow específico a monitorear (cuando Type = Flows), o vista agregada de All Flows (aggregate). |
| Period | Ventana de tiempo de los datos mostrados (ej: last 15 min). |
3. Indicadores Agregados
Arriba de la pantalla, los indicadores resumen el estado general de lo que está seleccionado en el filtro:
| Indicador | Descripción |
|---|---|
| Total Executions | Total de ejecuciones en el período. |
| Error Executions | Ejecuciones que terminaron en error. |
| OOM Containers | Contenedores que sufrieron Out of Memory (desbordamiento de memoria) en el período. |
| Restart Deployments | Cantidad de reinicios (restarts) de deployments en el período. |
| Running Instances | Instancias actualmente en ejecución. |
4. Pestaña Overview
Muestra el resumen del recurso seleccionado (ej: un Flow específico), con los mismos tipos de indicador en granularidad más fina:
| Indicador | Descripción |
|---|---|
| Executions | Ejecuciones en el período. |
| Errors | Ejecuciones con error. |
| OOMs | Ocurrencias de Out of Memory. |
| Restarts | Reinicios del recurso. |
| Running Instances | Instancias en ejecución ahora. |
| CPU Now | Uso de CPU en el momento (%). |
| Memory Now | Uso de memoria en el momento (GB). |
| Deployments | Cantidad de deployments realizados. |
Justo debajo, dos gráficos complementan la vista:
- Top Executions — ranking de los servicios/flows con más ejecuciones en el período (configurable, ej: Top 5).
- Top Errored Executions — ranking de los servicios con más ejecuciones fallidas en el período ("Services with the most failed executions in the selected period"), con el propio gráfico indicando cuándo no hay errores en el período ("No errored executions in this period").
5. Pestaña Metrics
Concentra las métricas detalladas del recurso seleccionado en los filtros, dentro de la ventana de tiempo elegida en Period — la vista de serie temporal detrás de los números resumidos en la pestaña Overview.
6. Pestaña Logs
Consulta los logs de las ejecuciones de los Flows/Apps monitoreados, permitiendo investigar el comportamiento detallado de una ejecución específica sin salir de la pantalla de Monitoring.
7. Pestaña Trace
Muestra el tracing completo de la ejecución — el camino paso a paso que recorrió una ejecución (por ejemplo, entre componentes de un Flow, o entre llamadas de un Backend App), permitiendo identificar exactamente en qué etapa ocurrió un problema o una lentitud.
8. Pestaña Alerts
Muestra las alertas de error que están ocurriendo en esa instancia/recurso monitoreado — un punto único para seguir problemas activos sin tener que cruzar logs manualmente.
9. Pestaña Agent AI
Muestra el consumo de tokens de IA generado por el conector AI Agent dentro de los Flows monitoreados — útil para correlacionar el uso de IA con el costo (mira también Usage) y con el comportamiento de las ejecuciones que usan IA.
| Indicador | Descripción |
|---|---|
| Input Tokens | Total de tokens de entrada (prompt) consumidos en el período. |
| Output Tokens | Total de tokens de salida (respuesta) generados en el período. |
| Total Tokens | Suma de tokens de entrada y salida en el período. |
| Avg Input Tokens | Promedio de tokens de entrada por ejecución. |
| Avg Output Tokens | Promedio de tokens de salida por ejecución. |
| Avg Total Tokens | Promedio de tokens totales por ejecución. |
Gráficos de serie temporal (Input Tokens/s, Output Tokens/s, Total Tokens/s) muestran la tasa de consumo de tokens a lo largo del período seleccionado.
Debajo, gráficos de percentil (Input Percentiles, Output Percentiles, Total Percentiles) muestran la distribución de consumo de tokens por ejecución en P50, P75 y P99 — útil para identificar si el consumo típico es estable o si hay ejecuciones que consumen mucho más tokens que la mayoría.
Las secciones Models Breakdown (detalle por modelo de IA usado) y Performance Metrics todavía están en desarrollo (Coming Soon).
10. Preguntas frecuentes
¿Qué causa un "OOM Container"? Ocurre cuando un contenedor excede el límite de memoria asignado y es terminado por Kubernetes por desbordamiento de memoria (Out of Memory).