Registro de skills
Flujos de desarrolloSkills públicas

Observability & Monitoring

Observabilidad full-stack para agentes de IA — depurar errores desde logs, rastrear latencia entre servicios, gestionar alertas, responder a incidentes con runbooks y proteger presupuestos de error SLO vía Datadog, Grafana o New Relic.

Qué enseña esta habilidad

Un manual reutilizable para un tipo específico de trabajo.

Un servidor MCP indica a un agente qué acciones están disponibles. Una habilidad añade el juicio alrededor de esas acciones: cómo reconocer el trabajo, qué secuencia seguir, qué evitar y cómo decidir que el resultado está completo.

Orquesta observabilidad full-stack: consulta logs, busca trazas, monitorea métricas, gestiona alertas, maneja incidentes, rastrea SLOs y ejecuta runbooks. Úsalo para depurar errores, investigar latencia, verificar salud del servicio, gestionar alertas, responder a incidentes, revisar tasa de consumo de SLO o encontrar runbooks.

Arquitectura

Cómo Observability & Monitoring guía a un agente ADK-Rust.

La habilidad se mantiene legible y portátil porque contiene instrucciones en lugar de credenciales de servicio o datos de negocio. ADK-Rust la suministra al agente, el agente elige dentro de su límite de herramientas revisado y el servidor MCP conectado realiza la operación autenticada.

01

Solicitud del usuario

El agente recibe un objetivo expresado en lenguaje común.

02

Habilidad Observability & Monitoring

Coincide con la intención, suministra la guía de decisiones y limita el límite de herramientas.

03

Agente ADK-Rust

Planifica el flujo de trabajo y transmite cada paso significativo a través del entorno de ejecución.

04

mcp-observability

Ejecuta operaciones autenticadas contra el sistema que posee la capacidad.

05

Resultado verificado

Las reglas de finalización de la habilidad moldean la evidencia devuelta al usuario.

Instrucciones portátiles: SKILL.md · Límite de capacidad: mcp-observability · Herramientas permitidas: 28

Guía de decisiones

Cómo el agente convierte una solicitud en la acción correcta.

Estas rutas provienen directamente de las instrucciones de la habilidad. Ayudan al modelo a reconocer la intención y seleccionar una herramienta o flujo de trabajo enfocado en lugar de improvisar en toda la superficie de capacidad.

01

"error", "excepción", "500", "fallando"?

WORKFLOW 1: Depurar Errores

02

"lento", "latencia", "timeout", "p99"?

WORKFLOW 2: Rastrear Latencia

03

"salud", "CPU", "memoria", "disco"?

WORKFLOW 3: Salud del Sistema

04

"alerta", "activada", "paginación"?

WORKFLOW 4: Gestión de Alertas

05

"incidente", "caída", "fuera de servicio"?

WORKFLOW 5: Respuesta a Incidentes

06

"SLO", "presupuesto de error", "confiabilidad"?

WORKFLOW 6: Seguimiento de SLO

07

"panel", "visión general"?

WORKFLOW 7: Paneles

08

¿No está claro?

obtener salud del sistema primero para panorama general

Flujos de trabajo probados

Secuencias repetibles para resultados útiles.

Un flujo de trabajo une varias llamadas a herramientas en una tarea que el usuario realmente reconoce. La habilidad explica la secuencia y el resultado esperado mientras ADK-Rust transmite el progreso del agente a través del entorno de ejecución compartido.

013-4 llamadas

Depurar Errores

Logs → trazas → causa raíz

023-4 llamadas

Rastrear Latencia

Encontrar el tramo lento

031-2 llamadas

Salud del Sistema

Resumen CPU/memoria/disco

042-3 llamadas

Gestión de Alertas

Triaje + runbook + reconocimiento

053-4 llamadas

Respuesta a Incidentes

Declarar + investigar + resolver

062-3 llamadas

Rastreo de SLO

Presupuesto restante + pronóstico

Límite de herramienta

La habilidad puede usar 28 herramientas documentadas.

Esta lista blanca es declarada por la habilidad. Mantiene al agente enfocado en las acciones necesarias para este trabajo mientras mcp-observability retiene la responsabilidad de autenticación, validación y el sistema conectado.

query_logs
get_log_stats
get_errors
tail_logs
query_metric
list_metrics
get_system_health
compare_metrics
search_traces
get_trace
get_service_map
get_latency_breakdown
list_alerts
get_alert
create_alert
acknowledge_alert
list_incidents
get_incident
create_incident
update_incident
list_slos
get_slo
forecast_slo
list_dashboards
get_dashboard
get_runbook
list_services
get_service

Reglas de trabajo

Qué debe hacer el agente.

  • Sigue la guía de decisiones, usa el límite de herramienta declarado y verifica el resultado antes de responder.

Límites operativos

Qué debe evitar el agente.

  • Revisa el SKILL.md completo antes de habilitar esta habilidad para trabajo en producción.

Instalar y conectar

Agrega la habilidad junto a la capacidad que espera.

Instala el repositorio donde tu cargador de habilidades ADK-Rust pueda descubrirlo, conecta mcp-observability y confirma que las herramientas declaradas están disponibles antes de pedir al agente que use el flujo de trabajo.

Instalar la habilidad
git clone https://github.com/zavora-ai/skill-observability-monitoring.git \
  ~/.skills/skills/observability-monitoring
Forma de carga ADK-Rust
let skills = SkillLoader::from_dir("~/.skills/skills").await?;
let skill = skills.load("observability-monitoring").await?;

let agent = LlmAgentBuilder::new("agent")
    .instruction(skill.instructions())
    .tools(skill.allowed_tools(toolset)?)
    .build()?;

La declaración de compatibilidad del repositorio: Requiere servidor mcp-observability conectado (Datadog, Grafana Cloud, New Relic o API personalizada).

Documentación oficial

Lee el paquete completo de la habilidad.

El repositorio sigue siendo la autoridad para sus instrucciones exactas, ejemplos, scripts auxiliares, recursos, requisitos MCP, licencia y actualizaciones posteriores.

Registro de origen

Metadatos del repositorio para esta entrada de habilidad.

Ver repositorio público ↗
Licencia
Apache-2.0
Herramientas permitidas
28
Referencias
3
Revisión
c7be5def736b
Actualizado
31 may 2026