Saltar al contenido principal

Monitoring

1. Visión General​

La pantalla de Monitoring da el control de salud de todas las aplicaciones corriendo en la plataforma — Flows, Apps y Add-ons — en un único lugar: ejecuciones, errores, consumo de recursos, consumo de tokens de IA, tracing detallado y alertas activas. En lugar de cazar información en varios sistemas diferentes, es posible ver rápidamente qué está corriendo, qué está fallando y por qué.

2. Filtros​

En el panel lateral, los filtros recortan la vista de monitoreo:

FiltroDescripción
SquadSquad dueño del recurso monitoreado.
EnvironmentEntorno monitoreado (ej: test).
TypeTipo de recurso: Flows, Apps o Addons.
FlowFlow específico a monitorear (cuando Type = Flows), o vista agregada de All Flows (aggregate).
PeriodVentana de tiempo de los datos mostrados (ej: last 15 min).

3. Indicadores Agregados​

Arriba de la pantalla, los indicadores resumen el estado general de lo que está seleccionado en el filtro:

IndicadorDescripción
Total ExecutionsTotal de ejecuciones en el período.
Error ExecutionsEjecuciones que terminaron en error.
OOM ContainersContenedores que sufrieron Out of Memory (desbordamiento de memoria) en el período.
Restart DeploymentsCantidad de reinicios (restarts) de deployments en el período.
Running InstancesInstancias actualmente en ejecución.

4. Pestaña Overview​

Muestra el resumen del recurso seleccionado (ej: un Flow específico), con los mismos tipos de indicador en granularidad más fina:

IndicadorDescripción
ExecutionsEjecuciones en el período.
ErrorsEjecuciones con error.
OOMsOcurrencias de Out of Memory.
RestartsReinicios del recurso.
Running InstancesInstancias en ejecución ahora.
CPU NowUso de CPU en el momento (%).
Memory NowUso de memoria en el momento (GB).
DeploymentsCantidad de deployments realizados.

Justo debajo, dos gráficos complementan la vista:

  • Top Executions — ranking de los servicios/flows con más ejecuciones en el período (configurable, ej: Top 5).
  • Top Errored Executions — ranking de los servicios con más ejecuciones fallidas en el período ("Services with the most failed executions in the selected period"), con el propio gráfico indicando cuándo no hay errores en el período ("No errored executions in this period").

5. Pestaña Metrics​

Concentra las métricas detalladas del recurso seleccionado en los filtros, dentro de la ventana de tiempo elegida en Period — la vista de serie temporal detrás de los números resumidos en la pestaña Overview.

6. Pestaña Logs​

Consulta los logs de las ejecuciones de los Flows/Apps monitoreados, permitiendo investigar el comportamiento detallado de una ejecución específica sin salir de la pantalla de Monitoring.

7. Pestaña Trace​

Muestra el tracing completo de la ejecución — el camino paso a paso que recorrió una ejecución (por ejemplo, entre componentes de un Flow, o entre llamadas de un Backend App), permitiendo identificar exactamente en qué etapa ocurrió un problema o una lentitud.

8. Pestaña Alerts​

Muestra las alertas de error que están ocurriendo en esa instancia/recurso monitoreado — un punto único para seguir problemas activos sin tener que cruzar logs manualmente.

9. Pestaña Agent AI​

Muestra el consumo de tokens de IA generado por el conector AI Agent dentro de los Flows monitoreados — útil para correlacionar el uso de IA con el costo (mira también Usage) y con el comportamiento de las ejecuciones que usan IA.

IndicadorDescripción
Input TokensTotal de tokens de entrada (prompt) consumidos en el período.
Output TokensTotal de tokens de salida (respuesta) generados en el período.
Total TokensSuma de tokens de entrada y salida en el período.
Avg Input TokensPromedio de tokens de entrada por ejecución.
Avg Output TokensPromedio de tokens de salida por ejecución.
Avg Total TokensPromedio de tokens totales por ejecución.

Gráficos de serie temporal (Input Tokens/s, Output Tokens/s, Total Tokens/s) muestran la tasa de consumo de tokens a lo largo del período seleccionado.

Debajo, gráficos de percentil (Input Percentiles, Output Percentiles, Total Percentiles) muestran la distribución de consumo de tokens por ejecución en P50, P75 y P99 — útil para identificar si el consumo típico es estable o si hay ejecuciones que consumen mucho más tokens que la mayoría.

Las secciones Models Breakdown (detalle por modelo de IA usado) y Performance Metrics todavía están en desarrollo (Coming Soon).

10. Preguntas frecuentes​

¿Qué causa un "OOM Container"? Ocurre cuando un contenedor excede el límite de memoria asignado y es terminado por Kubernetes por desbordamiento de memoria (Out of Memory).