Skill-Register
EntwicklungsabläufeÖffentliche Skills

Observability & Monitoring

Full-Stack-Observability für KI-Agenten — Fehler aus Logs debuggen, Latenz über Dienste verfolgen, Alarme verwalten, mit Runbooks auf Vorfälle reagieren und SLO-Fehlerbudgets über Datadog, Grafana oder New Relic schützen.

Was diese Skill lehrt

Ein wiederverwendbares Playbook für eine bestimmte Art von Arbeit.

Ein MCP-Server teilt einem Agenten mit, welche Aktionen verfügbar sind. Eine Skill fügt die Bewertung dieser Aktionen hinzu: wie man den Auftrag erkennt, welche Reihenfolge zu befolgen ist, was zu vermeiden ist und wie entschieden wird, dass das Ergebnis abgeschlossen ist.

Orchestrieren Sie Full-Stack-Observability — Abfragen von Logs, Suchen von Traces, Überwachen von Metriken, Verwalten von Alerts, Bearbeiten von Vorfällen, Verfolgen von SLOs und Ausführen von Runbooks. Verwenden Sie dies beim Debuggen von Fehlern, Untersuchen von Latenzen, Überprüfen des Servicezustands, Verwalten von Alerts, Reagieren auf Vorfälle, Überprüfen der SLO-Verbrauchsrate oder Finden von Runbooks.

Architektur

Wie Observability & Monitoring einen ADK-Rust-Agenten anleitet.

Die Skill bleibt lesbar und portabel, weil sie Anweisungen enthält und keine Dienstanmeldeinformationen oder Geschäftsdaten. ADK-Rust stellt sie dem Agenten bereit, der Agent wählt aus seiner geprüften Werkzeuggrenze und der verbundene MCP-Server führt die authentifizierte Operation aus.

01

Benutzeranfrage

Der Agent erhält ein Ziel, das in Alltagssprache ausgedrückt wird.

02

Observability & Monitoring Fähigkeit

Passt die Absicht an, liefert den Entscheidungsleitfaden und schränkt die Werkzeuggrenze ein.

03

ADK-Rust Agent

Plant den Workflow und streamt jeden sinnvollen Schritt durch die Laufzeit.

04

mcp-observability

Führt authentifizierte Operationen gegen das System aus, das die Fähigkeit besitzt.

05

Verifiziertes Ergebnis

Die Abschlussregeln der Skill bestimmen die Beweise, die dem Benutzer zurückgegeben werden.

Tragbare Anweisungen: SKILL.md · Fähigkeitsgrenze: mcp-observability · Erlaubte Werkzeuge: 28

Entscheidungsleitfaden

Wie der Agent eine Anfrage in die richtige Aktion umsetzt.

Diese Routen stammen direkt aus den Skill-Anweisungen. Sie helfen dem Modell, die Absicht zu erkennen und ein fokussiertes Werkzeug oder einen Workflow auszuwählen, anstatt über die gesamte Fähigkeitsoberfläche zu improvisieren.

01

"Fehler", "Ausnahme", "500", "fehlerhaft"?

WORKFLOW 1: Fehler debuggen

02

"langsam", "Latenz", "Timeout", "p99"?

WORKFLOW 2: Latenz verfolgen

03

"Gesundheit", "CPU", "Speicher", "Festplatte"?

WORKFLOW 3: Systemgesundheit

04

"Alarm", "ausgelöst", "Paging"?

WORKFLOW 4: Alarmverwaltung

05

"Vorfall", "Ausfall", "offline"?

WORKFLOW 5: Vorfallreaktion

06

"SLO", "Fehlerbudget", "Zuverlässigkeit"?

WORKFLOW 6: SLO-Tracking

07

"Dashboard", "Übersicht"?

WORKFLOW 7: Dashboards

08

Unklar?

Zuerst get_system_health für Gesamtübersicht

Bewährte Workflows

Wiederholbare Abläufe für nützliche Ergebnisse.

Ein Workflow verbindet mehrere Werkzeugaufrufe zu einer Aufgabe, die der Benutzer tatsächlich erkennt. Die Skill erklärt die Abfolge und das beabsichtigte Ergebnis, während ADK-Rust den Fortschritt des Agenten durch die gemeinsame Laufzeit streamt.

013-4 Aufrufe

Fehler debuggen

Logs → Traces → Grundursache

023-4 Aufrufe

Latenz verfolgen

Langsame Spanne finden

031-2 Aufrufe

Systemgesundheit

CPU/Speicher/Festplatten-Übersicht

042-3 Aufrufe

Alert-Verwaltung

Triage + Runbook + Bestätigung

053-4 Aufrufe

Vorfallreaktion

Deklarieren + untersuchen + lösen

062-3 Aufrufe

SLO-Tracking

Verbleibendes Budget + Prognose

Werkzeuggrenze

Die Skill kann 28 dokumentierte Werkzeuge verwenden.

Diese Whitelist wird von der Skill deklariert. Sie hält den Agenten auf die für diesen Auftrag benötigten Aktionen fokussiert, während mcp-observability die Verantwortung für Authentifizierung, Validierung und das verbundene System behält.

query_logs
get_log_stats
get_errors
tail_logs
query_metric
list_metrics
get_system_health
compare_metrics
search_traces
get_trace
get_service_map
get_latency_breakdown
list_alerts
get_alert
create_alert
acknowledge_alert
list_incidents
get_incident
create_incident
update_incident
list_slos
get_slo
forecast_slo
list_dashboards
get_dashboard
get_runbook
list_services
get_service

Arbeitsregeln

Was der Agent tun sollte.

  • Folgen Sie dem Entscheidungsleitfaden, verwenden Sie die deklarierte Werkzeuggrenze und überprüfen Sie das Ergebnis, bevor Sie antworten.

Betriebsgrenzen

Was der Agent vermeiden sollte.

  • Überprüfen Sie das vollständige SKILL.md, bevor Sie diese Skill für die Produktion aktivieren.

Installieren und verbinden

Fügen Sie die Skill neben der Fähigkeit hinzu, die sie erwartet.

Installieren Sie das Repository dort, wo Ihr ADK-Rust-Skill-Loader es entdecken kann, verbinden Sie mcp-observability und bestätigen Sie, dass die deklarierten Werkzeuge verfügbar sind, bevor Sie den Agenten den Workflow verwenden lassen.

Skill installieren
git clone https://github.com/zavora-ai/skill-observability-monitoring.git \
  ~/.skills/skills/observability-monitoring
ADK-Rust Ladeform
let skills = SkillLoader::from_dir("~/.skills/skills").await?;
let skill = skills.load("observability-monitoring").await?;

let agent = LlmAgentBuilder::new("agent")
    .instruction(skill.instructions())
    .tools(skill.allowed_tools(toolset)?)
    .build()?;

Die Kompatibilitätserklärung des Repositories: Erfordert Verbindung zum mcp-observability Server (Datadog, Grafana Cloud, New Relic oder Custom API).

Offizielle Dokumentation

Lesen Sie das vollständige Skill-Paket.

Das Repository bleibt autoritativ für seine genauen Anweisungen, Beispiele, Hilfsskripte, Assets, MCP-Anforderungen, Lizenz und spätere Updates.

Quelleneintrag

Repository-Metadaten für diesen Skill-Eintrag.

Öffentliches Repository ansehen ↗
Lizenz
Apache-2.0
Erlaubte Werkzeuge
28
Referenzen
3
Revision
c7be5def736b
Aktualisiert
31. Mai 2026