Monitoring
1. Visão Geral
A tela de Monitoring dá o controle de saúde de todas as aplicações rodando na plataforma — Flows, Apps e Add-ons — em um único lugar: execuções, erros, consumo de recursos, consumo de tokens de IA, tracing detalhado e alertas ativos. Em vez de caçar informação em vários sistemas diferentes, é possível ver rapidamente o que está rodando, o que está falhando e por quê.
2. Filtros
No painel lateral, os filtros recortam a visão de monitoramento:
| Filtro | Descrição |
|---|---|
| Squad | Squad dono do recurso monitorado. |
| Environment | Ambiente monitorado (ex: test). |
| Type | Tipo de recurso: Flows, Apps ou Addons. |
| Flow | Flow específico a monitorar (quando Type = Flows), ou visão agregada de All Flows (aggregate). |
| Period | Janela de tempo dos dados exibidos (ex: last 15 min). |
3. Indicadores Agregados
No topo da tela, indicadores resumem o estado geral do que está selecionado no filtro:
| Indicador | Descrição |
|---|---|
| Total Executions | Total de execuções no período. |
| Error Executions | Execuções que terminaram em erro. |
| OOM Containers | Containers que sofreram Out of Memory (estouro de memória) no período. |
| Restart Deployments | Quantidade de reinícios (restarts) de deployments no período. |
| Running Instances | Instâncias atualmente em execução. |
4. Aba Overview
Mostra o resumo do recurso selecionado (ex: um Flow específico), com os mesmos tipos de indicador em granularidade mais fina:
| Indicador | Descrição |
|---|---|
| Executions | Execuções no período. |
| Errors | Execuções com erro. |
| OOMs | Ocorrências de Out of Memory. |
| Restarts | Reinícios do recurso. |
| Running Instances | Instâncias em execução agora. |
| CPU Now | Uso de CPU no momento (%). |
| Memory Now | Uso de memória no momento (GB). |
| Deployments | Quantidade de deployments realizados. |
Logo abaixo, dois gráficos complementam a visão:
- Top Executions — ranking dos serviços/flows com mais execuções no período (configurável, ex: Top 5).
- Top Errored Executions — ranking dos serviços com mais execuções falhadas no período ("Services with the most failed executions in the selected period"), com o próprio gráfico indicando quando não há erros no período ("No errored executions in this period").
5. Aba Metrics
TODO: detalhar os gráficos e métricas específicas dessa aba (ainda não capturada em tela).
6. Aba Logs
Consulta os logs das execuções dos Flows/Apps monitorados, permitindo investigar o comportamento detalhado de uma execução específica sem sair da tela de Monitoring.
TODO: detalhar filtros e formato de exibição dos logs dessa aba (ainda não capturada em tela).
7. Aba Trace
Mostra o tracing completo da execução — o caminho passo a passo que uma execução percorreu (por exemplo, entre componentes de um Flow, ou entre chamadas de um Backend App), permitindo identificar exatamente em qual etapa um problema ou lentidão ocorreu.
TODO: detalhar a visualização do trace (ainda não capturada em tela).
8. Aba Alerts
Mostra os alertas de erro que estão ocorrendo naquela instância/recurso monitorado — um ponto único para acompanhar problemas ativos sem precisar cruzar logs manualmente.
TODO: detalhar tipos de alerta e configuração de regras (ainda não capturada em tela).
9. Aba Agent AI
Exibe o consumo de tokens de IA gerado pelo conector AI Agent dentro dos Flows monitorados — útil para correlacionar uso de IA com custo (veja também Usage) e com o comportamento de execuções que usam IA.
| Indicador | Descrição |
|---|---|
| Input Tokens | Total de tokens de entrada (prompt) consumidos no período. |
| Output Tokens | Total de tokens de saída (resposta) gerados no período. |
| Total Tokens | Soma de tokens de entrada e saída no período. |
| Avg Input Tokens | Média de tokens de entrada por execução. |
| Avg Output Tokens | Média de tokens de saída por execução. |
| Avg Total Tokens | Média de tokens totais por execução. |
Gráficos de série temporal (Input Tokens/s, Output Tokens/s, Total Tokens/s) mostram a taxa de consumo de tokens ao longo do período selecionado.
Abaixo, gráficos de percentil (Input Percentiles, Output Percentiles, Total Percentiles) mostram a distribuição de consumo de tokens por execução em P50, P75 e P99 — útil para identificar se o consumo típico é estável ou se há execuções que consomem muito mais tokens que a maioria.
As seções Models Breakdown (detalhamento por modelo de IA usado) e Performance Metrics ainda estão em desenvolvimento (Coming Soon).
10. Perguntas frequentes
O que causa um "OOM Container"? Ocorre quando um container excede o limite de memória alocado para ele e é encerrado pelo Kubernetes por estouro de memória (Out of Memory).
Dá para configurar alertas para ser notificado automaticamente (ex: e-mail, Slack)? TODO: confirmar se a aba Alerts suporta notificações externas ou é só um painel de visualização.
O consumo de tokens da aba Agent AI é o mesmo valor cobrado em Usage? TODO: confirmar se os números batem 1:1 com o "Tokens cost" da tela de Usage.