Registro de skills
Fluxos de desenvolvimentoSkills públicas

Observability & Monitoring

Observabilidade full-stack para agentes de IA — depurar erros a partir de logs, rastrear latência entre serviços, gerenciar alertas, responder a incidentes com runbooks e proteger orçamentos de erro SLO via Datadog, Grafana ou New Relic.

O que esta skill ensina

Um roteiro reutilizável para um tipo específico de trabalho.

Um servidor MCP informa a um agente quais ações estão disponíveis. Uma skill adiciona o julgamento em torno dessas ações: como reconhecer o trabalho, qual sequência seguir, o que evitar e como decidir que o resultado está completo.

Orquestre observabilidade full-stack — consulte logs, pesquise traces, monitore métricas, gerencie alertas, trate incidentes, acompanhe SLOs e execute runbooks. Use ao depurar erros, investigar latência, verificar saúde do serviço, gerenciar alertas, responder a incidentes, revisar taxa de consumo de SLO ou localizar runbooks.

Arquitetura

Como Observability & Monitoring orienta um agente ADK-Rust.

A skill permanece legível e portátil porque contém instruções em vez de credenciais de serviço ou dados de negócio. O ADK-Rust a fornece ao agente, o agente escolhe dentro do limite de ferramentas revisado e o servidor MCP conectado executa a operação autenticada.

01

Solicitação do usuário

O agente recebe um objetivo expresso em linguagem comum.

02

Habilidade Observability & Monitoring

Corresponde à intenção, fornece o guia de decisão e restringe o limite da ferramenta.

03

Agente ADK-Rust

Planeja o fluxo de trabalho e transmite cada passo significativo pelo runtime.

04

mcp-observability

Executa operações autenticadas contra o sistema que possui a capacidade.

05

Resultado verificado

As regras de conclusão da skill moldam as evidências retornadas ao usuário.

Instruções portáteis: SKILL.md · Limite de capacidade: mcp-observability · Ferramentas permitidas: 28

Guia de decisão

Como o agente transforma uma solicitação na ação correta.

Essas rotas vêm diretamente das instruções da skill. Elas ajudam o modelo a reconhecer a intenção e selecionar uma ferramenta ou fluxo de trabalho focado em vez de improvisar por toda a superfície da capacidade.

01

"erro", "exceção", "500", "falha"?

WORKFLOW 1: Depurar Erros

02

"lento", "latência", "timeout", "p99"?

WORKFLOW 2: Rastrear Latência

03

"saúde", "CPU", "memória", "disco"?

WORKFLOW 3: Saúde do Sistema

04

"alerta", "disparado", "paginação"?

WORKFLOW 4: Gerenciamento de Alertas

05

"incidente", "queda", "fora do ar"?

WORKFLOW 5: Resposta a Incidentes

06

"SLO", "orçamento de erro", "confiabilidade"?

WORKFLOW 6: Monitoramento de SLO

07

"dashboard", "visão geral"?

WORKFLOW 7: Dashboards

08

Não está claro?

obter saúde do sistema primeiro para visão geral

Fluxos de trabalho comprovados

Sequências repetíveis para resultados úteis.

Um fluxo de trabalho une várias chamadas de ferramentas em uma tarefa que o usuário realmente reconhece. A skill explica a sequência e o resultado pretendido enquanto o ADK-Rust transmite o progresso do agente pelo runtime compartilhado.

013-4 chamadas

Depurar Erros

Logs → rastreamentos → causa raiz

023-4 chamadas

Rastrear Latência

Encontrar o trecho lento

031-2 chamadas

Saúde do Sistema

Visão geral de CPU/memória/disco

042-3 chamadas

Gerenciamento de Alertas

Triagem + runbook + reconhecimento

053-4 chamadas

Resposta a Incidentes

Declarar + investigar + resolver

062-3 chamadas

Acompanhamento de SLO

Orçamento restante + previsão

Limite da ferramenta

A skill pode usar 28 ferramentas documentadas.

Esta lista de permissões é declarada pela skill. Ela mantém o agente focado nas ações necessárias para este trabalho enquanto mcp-observability mantém a responsabilidade pela autenticação, validação e sistema conectado.

query_logs
get_log_stats
get_errors
tail_logs
query_metric
list_metrics
get_system_health
compare_metrics
search_traces
get_trace
get_service_map
get_latency_breakdown
list_alerts
get_alert
create_alert
acknowledge_alert
list_incidents
get_incident
create_incident
update_incident
list_slos
get_slo
forecast_slo
list_dashboards
get_dashboard
get_runbook
list_services
get_service

Regras de trabalho

O que o agente deve fazer.

  • Siga o guia de decisão, use o limite de ferramenta declarado e verifique o resultado antes de responder.

Limites operacionais

O que o agente deve evitar.

  • Revise o SKILL.md completo antes de habilitar esta skill para trabalho em produção.

Instalar e conectar

Adicione a skill ao lado da capacidade que ela espera.

Instale o repositório onde seu carregador de skills ADK-Rust possa descobri-lo, conecte mcp-observability e confirme que as ferramentas declaradas estão disponíveis antes de pedir ao agente para usar o fluxo de trabalho.

Instalar a skill
git clone https://github.com/zavora-ai/skill-observability-monitoring.git \
  ~/.skills/skills/observability-monitoring
Formato de carregamento ADK-Rust
let skills = SkillLoader::from_dir("~/.skills/skills").await?;
let skill = skills.load("observability-monitoring").await?;

let agent = LlmAgentBuilder::new("agent")
    .instruction(skill.instructions())
    .tools(skill.allowed_tools(toolset)?)
    .build()?;

A declaração de compatibilidade do repositório: Requer servidor mcp-observability conectado (Datadog, Grafana Cloud, New Relic ou API Customizada).

Documentação oficial

Leia o pacote completo da skill.

O repositório permanece autoritativo para suas instruções exatas, exemplos, scripts auxiliares, recursos, requisitos MCP, licença e atualizações posteriores.

Registro da fonte

Metadados do repositório para esta entrada da skill.

Ver repositório público ↗
Licença
Apache-2.0
Ferramentas permitidas
28
Referências
3
Revisão
c7be5def736b
Atualizado
31 de mai. de 2026