"erro", "exceção", "500", "falha"?
WORKFLOW 1: Depurar Erros
Observabilidade full-stack para agentes de IA — depurar erros a partir de logs, rastrear latência entre serviços, gerenciar alertas, responder a incidentes com runbooks e proteger orçamentos de erro SLO via Datadog, Grafana ou New Relic.
O que esta skill ensina
Um servidor MCP informa a um agente quais ações estão disponíveis. Uma skill adiciona o julgamento em torno dessas ações: como reconhecer o trabalho, qual sequência seguir, o que evitar e como decidir que o resultado está completo.
Orquestre observabilidade full-stack — consulte logs, pesquise traces, monitore métricas, gerencie alertas, trate incidentes, acompanhe SLOs e execute runbooks. Use ao depurar erros, investigar latência, verificar saúde do serviço, gerenciar alertas, responder a incidentes, revisar taxa de consumo de SLO ou localizar runbooks.
Arquitetura
A skill permanece legível e portátil porque contém instruções em vez de credenciais de serviço ou dados de negócio. O ADK-Rust a fornece ao agente, o agente escolhe dentro do limite de ferramentas revisado e o servidor MCP conectado executa a operação autenticada.
O agente recebe um objetivo expresso em linguagem comum.
Corresponde à intenção, fornece o guia de decisão e restringe o limite da ferramenta.
Planeja o fluxo de trabalho e transmite cada passo significativo pelo runtime.
Executa operações autenticadas contra o sistema que possui a capacidade.
As regras de conclusão da skill moldam as evidências retornadas ao usuário.
Guia de decisão
Essas rotas vêm diretamente das instruções da skill. Elas ajudam o modelo a reconhecer a intenção e selecionar uma ferramenta ou fluxo de trabalho focado em vez de improvisar por toda a superfície da capacidade.
"erro", "exceção", "500", "falha"?
WORKFLOW 1: Depurar Erros
"lento", "latência", "timeout", "p99"?
WORKFLOW 2: Rastrear Latência
"saúde", "CPU", "memória", "disco"?
WORKFLOW 3: Saúde do Sistema
"alerta", "disparado", "paginação"?
WORKFLOW 4: Gerenciamento de Alertas
"incidente", "queda", "fora do ar"?
WORKFLOW 5: Resposta a Incidentes
"SLO", "orçamento de erro", "confiabilidade"?
WORKFLOW 6: Monitoramento de SLO
"dashboard", "visão geral"?
WORKFLOW 7: Dashboards
Não está claro?
obter saúde do sistema primeiro para visão geral
Fluxos de trabalho comprovados
Um fluxo de trabalho une várias chamadas de ferramentas em uma tarefa que o usuário realmente reconhece. A skill explica a sequência e o resultado pretendido enquanto o ADK-Rust transmite o progresso do agente pelo runtime compartilhado.
Logs → rastreamentos → causa raiz
Encontrar o trecho lento
Visão geral de CPU/memória/disco
Triagem + runbook + reconhecimento
Declarar + investigar + resolver
Orçamento restante + previsão
Limite da ferramenta
Esta lista de permissões é declarada pela skill. Ela mantém o agente focado nas ações necessárias para este trabalho enquanto mcp-observability mantém a responsabilidade pela autenticação, validação e sistema conectado.
Regras de trabalho
Limites operacionais
Instalar e conectar
Instale o repositório onde seu carregador de skills ADK-Rust possa descobri-lo, conecte mcp-observability e confirme que as ferramentas declaradas estão disponíveis antes de pedir ao agente para usar o fluxo de trabalho.
git clone https://github.com/zavora-ai/skill-observability-monitoring.git \
~/.skills/skills/observability-monitoringlet skills = SkillLoader::from_dir("~/.skills/skills").await?;
let skill = skills.load("observability-monitoring").await?;
let agent = LlmAgentBuilder::new("agent")
.instruction(skill.instructions())
.tools(skill.allowed_tools(toolset)?)
.build()?;A declaração de compatibilidade do repositório: Requer servidor mcp-observability conectado (Datadog, Grafana Cloud, New Relic ou API Customizada).
Documentação oficial
O repositório permanece autoritativo para suas instruções exatas, exemplos, scripts auxiliares, recursos, requisitos MCP, licença e atualizações posteriores.
Continue explorando
Registro da fonte
Metadados do repositório para esta entrada da skill.