Pular para o conteúdo principal

Monitoring

1. Visão Geral

A tela de Monitoring dá o controle de saúde de todas as aplicações rodando na plataforma — Flows, Apps e Add-ons — em um único lugar: execuções, erros, consumo de recursos, consumo de tokens de IA, tracing detalhado e alertas ativos. Em vez de caçar informação em vários sistemas diferentes, é possível ver rapidamente o que está rodando, o que está falhando e por quê.

2. Filtros

No painel lateral, os filtros recortam a visão de monitoramento:

FiltroDescrição
SquadSquad dono do recurso monitorado.
EnvironmentAmbiente monitorado (ex: test).
TypeTipo de recurso: Flows, Apps ou Addons.
FlowFlow específico a monitorar (quando Type = Flows), ou visão agregada de All Flows (aggregate).
PeriodJanela de tempo dos dados exibidos (ex: last 15 min).

3. Indicadores Agregados

No topo da tela, indicadores resumem o estado geral do que está selecionado no filtro:

IndicadorDescrição
Total ExecutionsTotal de execuções no período.
Error ExecutionsExecuções que terminaram em erro.
OOM ContainersContainers que sofreram Out of Memory (estouro de memória) no período.
Restart DeploymentsQuantidade de reinícios (restarts) de deployments no período.
Running InstancesInstâncias atualmente em execução.

4. Aba Overview

Mostra o resumo do recurso selecionado (ex: um Flow específico), com os mesmos tipos de indicador em granularidade mais fina:

IndicadorDescrição
ExecutionsExecuções no período.
ErrorsExecuções com erro.
OOMsOcorrências de Out of Memory.
RestartsReinícios do recurso.
Running InstancesInstâncias em execução agora.
CPU NowUso de CPU no momento (%).
Memory NowUso de memória no momento (GB).
DeploymentsQuantidade de deployments realizados.

Logo abaixo, dois gráficos complementam a visão:

  • Top Executions — ranking dos serviços/flows com mais execuções no período (configurável, ex: Top 5).
  • Top Errored Executions — ranking dos serviços com mais execuções falhadas no período ("Services with the most failed executions in the selected period"), com o próprio gráfico indicando quando não há erros no período ("No errored executions in this period").

5. Aba Metrics

TODO: detalhar os gráficos e métricas específicas dessa aba (ainda não capturada em tela).

6. Aba Logs

Consulta os logs das execuções dos Flows/Apps monitorados, permitindo investigar o comportamento detalhado de uma execução específica sem sair da tela de Monitoring.

TODO: detalhar filtros e formato de exibição dos logs dessa aba (ainda não capturada em tela).

7. Aba Trace

Mostra o tracing completo da execução — o caminho passo a passo que uma execução percorreu (por exemplo, entre componentes de um Flow, ou entre chamadas de um Backend App), permitindo identificar exatamente em qual etapa um problema ou lentidão ocorreu.

TODO: detalhar a visualização do trace (ainda não capturada em tela).

8. Aba Alerts

Mostra os alertas de erro que estão ocorrendo naquela instância/recurso monitorado — um ponto único para acompanhar problemas ativos sem precisar cruzar logs manualmente.

TODO: detalhar tipos de alerta e configuração de regras (ainda não capturada em tela).

9. Aba Agent AI

Exibe o consumo de tokens de IA gerado pelo conector AI Agent dentro dos Flows monitorados — útil para correlacionar uso de IA com custo (veja também Usage) e com o comportamento de execuções que usam IA.

IndicadorDescrição
Input TokensTotal de tokens de entrada (prompt) consumidos no período.
Output TokensTotal de tokens de saída (resposta) gerados no período.
Total TokensSoma de tokens de entrada e saída no período.
Avg Input TokensMédia de tokens de entrada por execução.
Avg Output TokensMédia de tokens de saída por execução.
Avg Total TokensMédia de tokens totais por execução.

Gráficos de série temporal (Input Tokens/s, Output Tokens/s, Total Tokens/s) mostram a taxa de consumo de tokens ao longo do período selecionado.

Abaixo, gráficos de percentil (Input Percentiles, Output Percentiles, Total Percentiles) mostram a distribuição de consumo de tokens por execução em P50, P75 e P99 — útil para identificar se o consumo típico é estável ou se há execuções que consomem muito mais tokens que a maioria.

As seções Models Breakdown (detalhamento por modelo de IA usado) e Performance Metrics ainda estão em desenvolvimento (Coming Soon).

10. Perguntas frequentes

O que causa um "OOM Container"? Ocorre quando um container excede o limite de memória alocado para ele e é encerrado pelo Kubernetes por estouro de memória (Out of Memory).

Dá para configurar alertas para ser notificado automaticamente (ex: e-mail, Slack)? TODO: confirmar se a aba Alerts suporta notificações externas ou é só um painel de visualização.

O consumo de tokens da aba Agent AI é o mesmo valor cobrado em Usage? TODO: confirmar se os números batem 1:1 com o "Tokens cost" da tela de Usage.