스킬 레지스트리
개발 워크플로공개 스킬

Observability & Monitoring

AI 에이전트를 위한 풀스택 관측성 — 로그 오류 디버그, 서비스 간 지연 추적, 알림 관리, 런북 대응, Datadog, Grafana, New Relic을 통한 SLO 오류 예산 보호.

이 스킬이 가르치는 것

특정 작업 유형을 위한 재사용 가능한 플레이북입니다.

MCP 서버는 에이전트에게 어떤 작업이 가능한지 알려줍니다. 스킬은 그 작업들에 대한 판단을 추가합니다: 작업을 인식하는 방법, 따라야 할 순서, 피해야 할 것, 그리고 결과가 완료되었는지 결정하는 방법.

풀스택 관측성을 조율하세요 — 로그 쿼리, 트레이스 검색, 메트릭 모니터링, 알림 관리, 인시던트 처리, SLO 추적, 런북 실행을 수행합니다. 오류 디버깅, 지연 조사, 서비스 상태 확인, 알림 관리, 인시던트 대응, SLO 소진율 검토 또는 런북 찾기 시 사용하세요.

아키텍처

Observability & Monitoring이(가) ADK-Rust 에이전트를 어떻게 안내하는지.

스킬은 서비스 자격 증명이나 비즈니스 데이터를 포함하지 않고 지침만 포함하므로 읽기 쉽고 휴대 가능합니다. ADK-Rust가 에이전트에 제공하고, 에이전트는 검토된 도구 경계에서 선택하며, 연결된 MCP 서버가 인증된 작업을 수행합니다.

01

사용자 요청

에이전트는 일반 언어로 표현된 목표를 받습니다.

02

Observability & Monitoring 스킬

의도를 일치시키고 결정 가이드를 제공하며 도구 경계를 좁힙니다.

03

ADK-Rust 에이전트

워크플로우를 계획하고 각 의미 있는 단계를 런타임을 통해 스트리밍합니다.

04

mcp-observability

기능을 소유한 시스템에 대해 인증된 작업을 실행합니다.

05

검증된 결과

스킬의 완료 규칙은 사용자에게 반환되는 증거를 형성합니다.

휴대 가능한 지침: SKILL.md · 기능 경계: mcp-observability · 허용된 도구: 28

결정 가이드

에이전트가 요청을 올바른 작업으로 전환하는 방법입니다.

이 경로들은 스킬 지침에서 직접 가져온 것입니다. 모델이 의도를 인식하고 전체 기능 범위 대신 집중된 도구나 워크플로우를 선택하도록 돕습니다.

01

"오류", "예외", "500", "실패"?

WORKFLOW 1: 오류 디버그

02

"느림", "지연", "타임아웃", "p99"?

WORKFLOW 2: 지연 추적

03

"상태", "CPU", "메모리", "디스크"?

WORKFLOW 3: 시스템 상태

04

"알림", "발동", "호출"?

WORKFLOW 4: 알림 관리

05

"사고", "중단", "다운"?

WORKFLOW 5: 사고 대응

06

"SLO", "오류 예산", "신뢰성"?

WORKFLOW 6: SLO 추적

07

"대시보드", "개요"?

WORKFLOW 7: 대시보드

08

불명확?

전체 상황 파악을 위해 먼저 get_system_health 실행

검증된 워크플로우

유용한 결과를 위한 반복 가능한 시퀀스입니다.

워크플로우는 여러 도구 호출을 사용자가 실제로 인식하는 작업으로 결합합니다. 스킬은 순서와 의도된 결과를 설명하며 ADK-Rust는 공유 런타임을 통해 에이전트의 진행 상황을 스트리밍합니다.

013-4개의 호출

오류 디버깅

로그 → 추적 → 근본 원인

023-4개의 호출

지연 추적

느린 구간 찾기

031-2개의 호출

시스템 상태

CPU/메모리/디스크 개요

042-3개의 호출

알림 관리

분류 + 런북 + 승인

053-4개의 호출

인시던트 대응

선언 + 조사 + 해결

062-3개의 호출

SLO 추적

잔여 예산 + 예측

도구 경계

스킬은 28개의 문서화된 도구를 사용할 수 있습니다.

이 허용 목록은 스킬에서 선언합니다. 에이전트가 이 작업에 필요한 행동에 집중하도록 유지하며, mcp-observability는 인증, 검증, 연결된 시스템에 대한 책임을 집니다.

query_logs
get_log_stats
get_errors
tail_logs
query_metric
list_metrics
get_system_health
compare_metrics
search_traces
get_trace
get_service_map
get_latency_breakdown
list_alerts
get_alert
create_alert
acknowledge_alert
list_incidents
get_incident
create_incident
update_incident
list_slos
get_slo
forecast_slo
list_dashboards
get_dashboard
get_runbook
list_services
get_service

작동 규칙

에이전트가 해야 할 것

  • 결정 가이드를 따르고, 선언된 도구 경계를 사용하며, 응답 전에 결과를 검증하세요.

운영 경계

에이전트가 피해야 할 것

  • 이 스킬을 프로덕션 작업에 사용하기 전에 완전한 SKILL.md를 검토하세요.

설치 및 연결

기능이 기대하는 스킬을 그 옆에 추가하세요.

ADK-Rust 스킬 로더가 발견할 수 있는 저장소에 설치하고, mcp-observability에 연결하며, 선언된 도구가 사용 가능한지 확인한 후 에이전트에게 워크플로우 사용을 요청하세요.

스킬 설치
git clone https://github.com/zavora-ai/skill-observability-monitoring.git \
  ~/.skills/skills/observability-monitoring
ADK-Rust 로딩 형태
let skills = SkillLoader::from_dir("~/.skills/skills").await?;
let skill = skills.load("observability-monitoring").await?;

let agent = LlmAgentBuilder::new("agent")
    .instruction(skill.instructions())
    .tools(skill.allowed_tools(toolset)?)
    .build()?;

저장소의 호환성 선언: mcp-observability 서버 연결 필요 (Datadog, Grafana Cloud, New Relic 또는 커스텀 API).

공식 문서

완전한 스킬 패키지를 읽어보세요.

저장소는 정확한 지침, 예제, 헬퍼 스크립트, 자산, MCP 요구사항, 라이선스, 이후 업데이트에 대해 권위 있는 출처로 남아 있습니다.

소스 기록

이 스킬 항목의 저장소 메타데이터입니다.

공개 저장소 보기 ↗
라이선스
Apache-2.0
허용된 도구
28
참조
3
수정
c7be5def736b
업데이트됨
2026년 5월 31일