Pular para o conteúdo principal

Monitoring

1. Visão Geral​

A tela de Monitoring dá o controle de saúde de todas as aplicações rodando na plataforma — Flows, Apps e Add-ons — em um único lugar: execuções, erros, consumo de recursos, consumo de tokens de IA, tracing detalhado e alertas ativos. Em vez de caçar informação em vários sistemas diferentes, é possível ver rapidamente o que está rodando, o que está falhando e por quê.

2. Filtros​

No painel lateral, os filtros recortam a visão de monitoramento:

FiltroDescrição
SquadSquad dono do recurso monitorado.
EnvironmentAmbiente monitorado (ex: test).
TypeTipo de recurso: Flows, Apps ou Addons.
FlowFlow específico a monitorar (quando Type = Flows), ou visão agregada de All Flows (aggregate).
PeriodJanela de tempo dos dados exibidos (ex: last 15 min).

3. Indicadores Agregados​

No topo da tela, indicadores resumem o estado geral do que está selecionado no filtro:

IndicadorDescrição
Total ExecutionsTotal de execuções no período.
Error ExecutionsExecuções que terminaram em erro.
OOM ContainersContainers que sofreram Out of Memory (estouro de memória) no período.
Restart DeploymentsQuantidade de reinícios (restarts) de deployments no período.
Running InstancesInstâncias atualmente em execução.

4. Aba Overview​

Mostra o resumo do recurso selecionado (ex: um Flow específico), com os mesmos tipos de indicador em granularidade mais fina:

IndicadorDescrição
ExecutionsExecuções no período.
ErrorsExecuções com erro.
OOMsOcorrências de Out of Memory.
RestartsReinícios do recurso.
Running InstancesInstâncias em execução agora.
CPU NowUso de CPU no momento (%).
Memory NowUso de memória no momento (GB).
DeploymentsQuantidade de deployments realizados.

Logo abaixo, dois gráficos complementam a visão:

  • Top Executions — ranking dos serviços/flows com mais execuções no período (configurável, ex: Top 5).
  • Top Errored Executions — ranking dos serviços com mais execuções falhadas no período ("Services with the most failed executions in the selected period"), com o próprio gráfico indicando quando não há erros no período ("No errored executions in this period").

5. Aba Metrics​

Concentra as métricas detalhadas do recurso selecionado nos filtros, dentro da janela de tempo escolhida em Period — a visão de série temporal por trás dos números resumidos na aba Overview.

6. Aba Logs​

Consulta os logs das execuções dos Flows/Apps monitorados, permitindo investigar o comportamento detalhado de uma execução específica sem sair da tela de Monitoring.

7. Aba Trace​

Mostra o tracing completo da execução — o caminho passo a passo que uma execução percorreu (por exemplo, entre componentes de um Flow, ou entre chamadas de um Backend App), permitindo identificar exatamente em qual etapa um problema ou lentidão ocorreu.

8. Aba Alerts​

Mostra os alertas de erro que estão ocorrendo naquela instância/recurso monitorado — um ponto único para acompanhar problemas ativos sem precisar cruzar logs manualmente.

9. Aba Agent AI​

Exibe o consumo de tokens de IA gerado pelo conector AI Agent dentro dos Flows monitorados — útil para correlacionar uso de IA com custo (veja também Usage) e com o comportamento de execuções que usam IA.

IndicadorDescrição
Input TokensTotal de tokens de entrada (prompt) consumidos no período.
Output TokensTotal de tokens de saída (resposta) gerados no período.
Total TokensSoma de tokens de entrada e saída no período.
Avg Input TokensMédia de tokens de entrada por execução.
Avg Output TokensMédia de tokens de saída por execução.
Avg Total TokensMédia de tokens totais por execução.

Gráficos de série temporal (Input Tokens/s, Output Tokens/s, Total Tokens/s) mostram a taxa de consumo de tokens ao longo do período selecionado.

Abaixo, gráficos de percentil (Input Percentiles, Output Percentiles, Total Percentiles) mostram a distribuição de consumo de tokens por execução em P50, P75 e P99 — útil para identificar se o consumo típico é estável ou se há execuções que consomem muito mais tokens que a maioria.

As seções Models Breakdown (detalhamento por modelo de IA usado) e Performance Metrics ainda estão em desenvolvimento (Coming Soon).

10. Perguntas frequentes​

O que causa um "OOM Container"? Ocorre quando um container excede o limite de memória alocado para ele e é encerrado pelo Kubernetes por estouro de memória (Out of Memory).