Registre des compétences
Flux de développementCompétences publiques

Observability & Monitoring

Observabilité complète pour agents IA — déboguer les erreurs à partir des logs, tracer la latence entre services, gérer les alertes, répondre aux incidents avec des runbooks, et protéger les budgets d'erreur SLO via Datadog, Grafana ou New Relic.

Ce que cette compétence enseigne

Un guide réutilisable pour un type de travail spécifique.

Un serveur MCP indique à un agent quelles actions sont disponibles. Une compétence ajoute le jugement autour de ces actions : comment reconnaître la tâche, quelle séquence suivre, quoi éviter, et comment décider que le résultat est complet.

Orchestrez l'observabilité full-stack — interrogez les logs, recherchez les traces, surveillez les métriques, gérez les alertes, traitez les incidents, suivez les SLO et exécutez les runbooks. Utilisez-le pour déboguer des erreurs, enquêter sur la latence, vérifier la santé des services, gérer les alertes, répondre aux incidents, examiner le taux de consommation des SLO ou trouver des runbooks.

Architecture

Comment Observability & Monitoring guide un agent ADK-Rust.

La compétence reste lisible et portable car elle contient des instructions plutôt que des identifiants de service ou des données métier. ADK-Rust la fournit à l'agent, l'agent choisit dans sa limite d'outil examinée, et le serveur MCP connecté exécute l'opération authentifiée.

01

Requête utilisateur

L'agent reçoit un objectif exprimé en langage courant.

02

Compétence Observability & Monitoring

Correspond à l'intention, fournit le guide de décision, et restreint la limite d'outil.

03

Agent ADK-Rust

Planifie le flux de travail et diffuse chaque étape significative via le runtime.

04

mcp-observability

Exécute des opérations authentifiées contre le système propriétaire de la capacité.

05

Résultat vérifié

Les règles de complétion de la compétence façonnent les preuves retournées à l'utilisateur.

Instructions portables : SKILL.md · Limite de capacité : mcp-observability · Outils autorisés : 28

Guide de décision

Comment l'agent transforme une requête en action appropriée.

Ces routes proviennent directement des instructions de la compétence. Elles aident le modèle à reconnaître l'intention et à sélectionner un outil ou un flux de travail ciblé au lieu d'improviser sur toute la surface de capacité.

01

"erreur", "exception", "500", "échec" ?

WORKFLOW 1 : Déboguer les erreurs

02

"lent", "latence", "timeout", "p99" ?

WORKFLOW 2 : Tracer la latence

03

"santé", "CPU", "mémoire", "disque" ?

WORKFLOW 3 : Santé système

04

"alerte", "déclenchée", "pager" ?

WORKFLOW 4 : Gestion des alertes

05

"incident", "panne", "hors service" ?

WORKFLOW 5 : Réponse aux incidents

06

"SLO", "budget d'erreur", "fiabilité" ?

WORKFLOW 6 : Suivi des SLO

07

"tableau de bord", "aperçu" ?

WORKFLOW 7 : Tableaux de bord

08

Pas clair ?

commencer par get_system_health pour une vue d'ensemble

Flux de travail éprouvés

Séquences répétables pour des résultats utiles.

Un flux de travail regroupe plusieurs appels d'outils en une tâche que l'utilisateur reconnaît réellement. La compétence explique la séquence et le résultat attendu tandis qu'ADK-Rust diffuse la progression de l'agent via le runtime partagé.

013-4 appels

Déboguer les erreurs

Logs → traces → cause racine

023-4 appels

Tracer la latence

Identifier le segment lent

031-2 appels

Santé du système

Vue d'ensemble CPU/mémoire/disque

042-3 appels

Gestion des alertes

Tri + runbook + accusé de réception

053-4 appels

Réponse aux incidents

Déclarer + enquêter + résoudre

062-3 appels

Suivi des SLO

Budget restant + prévision

Limite d'outil

La compétence peut utiliser 28 outils documentés.

Cette liste blanche est déclarée par la compétence. Elle maintient l'agent concentré sur les actions nécessaires pour ce travail tandis que mcp-observability conserve la responsabilité de l'authentification, de la validation et du système connecté.

query_logs
get_log_stats
get_errors
tail_logs
query_metric
list_metrics
get_system_health
compare_metrics
search_traces
get_trace
get_service_map
get_latency_breakdown
list_alerts
get_alert
create_alert
acknowledge_alert
list_incidents
get_incident
create_incident
update_incident
list_slos
get_slo
forecast_slo
list_dashboards
get_dashboard
get_runbook
list_services
get_service

Règles de travail

Ce que l'agent doit faire.

  • Suivez le guide de décision, utilisez la limite d'outil déclarée, et vérifiez le résultat avant de répondre.

Limites opérationnelles

Ce que l'agent doit éviter.

  • Examinez le SKILL.md complet avant d'activer cette compétence pour un travail en production.

Installer et connecter

Ajoutez la compétence à côté de la capacité qu'elle attend.

Installez le dépôt où votre chargeur de compétences ADK-Rust peut le découvrir, connectez mcp-observability, et confirmez que les outils déclarés sont disponibles avant de demander à l'agent d'utiliser le flux de travail.

Installer la compétence
git clone https://github.com/zavora-ai/skill-observability-monitoring.git \
  ~/.skills/skills/observability-monitoring
Forme de chargement ADK-Rust
let skills = SkillLoader::from_dir("~/.skills/skills").await?;
let skill = skills.load("observability-monitoring").await?;

let agent = LlmAgentBuilder::new("agent")
    .instruction(skill.instructions())
    .tools(skill.allowed_tools(toolset)?)
    .build()?;

La déclaration de compatibilité du dépôt : Nécessite un serveur mcp-observability connecté (Datadog, Grafana Cloud, New Relic ou API personnalisée).

Documentation officielle

Lisez le package complet de la compétence.

Le dépôt reste la référence pour ses instructions exactes, exemples, scripts d'aide, ressources, exigences MCP, licence et mises à jour ultérieures.

Enregistrement source

Métadonnées du dépôt pour cette entrée de compétence.

Voir le dépôt public ↗
Licence
Apache-2.0
Outils autorisés
28
Références
3
Révision
c7be5def736b
Mis à jour
31 mai 2026