スキルレジストリに戻る
開発ワークフロー公開スキル

Browser Automation

AIエージェント向けウェブ操作 — ページ読み取り、データ抽出、スクリーンショット取得、フォーム操作、ヘッドレスChromiumによる構造化コンテンツのスクレイピング。

このスキルが教えること

特定の作業に再利用できるプレイブックです。

MCPサーバーはエージェントに利用可能なアクションを伝えます。スキルはそれらのアクションに関する判断を追加します:仕事の認識方法、従うべき順序、避けるべきこと、結果が完了したと判断する方法。

ブラウザ操作をオーケストレーションします — ウェブページの取得、コンテンツ抽出、スクリーンショット撮影、要素との対話、構造化データのスクレイピングを行います。ウェブページの閲覧、ウェブサイトからのデータ抽出、スクリーンショット撮影、URLの稼働確認、ウェブフォームとの対話時に使用してください。

アーキテクチャ

Browser AutomationがADK-Rustエージェントをどのように導くか。

スキルはサービス認証情報やビジネスデータではなく指示を含むため読みやすくポータブルです。ADK-Rustがエージェントに提供し、エージェントはレビュー済みのツール境界から選択し、接続されたMCPサーバーが認証された操作を実行します。

01

ユーザーリクエスト

エージェントは通常の言語で表現された目標を受け取ります。

02

Browser Automation スキル

意図に合致し、意思決定ガイドを提供し、ツールの境界を絞り込みます。

03

ADK-Rustエージェント

ワークフローを計画し、各重要なステップをランタイムにストリームします。

04

mcp-browser

機能を所有するシステムに対して認証された操作を実行します。

05

検証済みの結果

スキルの完了ルールはユーザーに返される証拠を形作ります。

ポータブルな指示: SKILL.md · 機能の境界: mcp-browser · 許可されたツール: 17

意思決定ガイド

エージェントがリクエストを適切なアクションに変換する方法。

これらのルートはスキルの指示から直接来ています。モデルが意図を認識し、全機能の即興ではなく特定のツールやワークフローを選択するのに役立ちます。

01

「読む」「ページ取得」「URLの内容」?

read_page(JSレンダリング)または fetch_light(静的)

02

「スクリーンショット」「キャプチャ」「ビジュアル」?

screenshot / screenshot_element

03

「リンク」「リンク抽出」?

extract_links

04

「クリック」「フォーム入力」「操作」?

click / type_text / wait_for

05

「稼働確認」「ステータス」「URLチェック」?

check_status

06

「PDF」「ページ保存」?

save_pdf

07

「構造化データ」「フィールド抽出」?

extract_structured / query_selector

実証済みのワークフロー

有用な結果のための繰り返し可能なシーケンス。

ワークフローは複数のツール呼び出しをユーザーが実際に認識するタスクに結びつけます。スキルはその順序と意図された結果を説明し、ADK-Rustは共有ランタイムを通じてエージェントの進行状況をストリームします。

011-2の呼び出し

ページ読み取り

任意のURLからクリーンなテキスト取得

022の呼び出し

データ抽出

ページから構造化フィールド抽出

031の呼び出し

スクリーンショット

ビジュアルキャプチャ(全ページまたは要素)

043-4の呼び出し

対話

フォーム入力、ボタンクリック

051の呼び出し

ステータスチェック

URLの到達可能性確認

ツールの境界

スキルは17の文書化されたツールを使用する場合があります。

この許可リストはスキルによって宣言されます。エージェントがこの仕事に必要なアクションに集中し、mcp-browserが認証、検証、接続されたシステムの責任を保持します。

read_page
get_html
extract_links
extract_metadata
query_selector
get_accessibility_tree
extract_structured
screenshot
screenshot_element
save_pdf
click
type_text
evaluate_js
wait_for
navigate
check_status
fetch_light

作業ルール

エージェントがすべきこと。

  • 重い操作の前にcheck_statusを使う(死んだURLで時間を無駄にしない)
  • 静的ページにはfetch_lightを使う(フルブラウザの10倍高速)
  • トークン効率の良い抽出にはget_accessibility_treeを使う(HTMLより77%トークン削減)

運用の境界

エージェントが避けるべきこと。

  • 単純な静的ページにread_pageを使わない(fetch_lightを使う)
  • ボットを明示的にブロックするサイトはスクレイピングしない(robots.txtを尊重)
  • type_textで入力した認証情報を保存しない

インストールと接続

期待される機能の隣にスキルを追加してください。

ADK-Rustスキルローダーが検出できるリポジトリをインストールし、mcp-browserに接続し、宣言されたツールが利用可能であることを確認してからエージェントにワークフローを使用させてください。

スキルをインストール
git clone https://github.com/zavora-ai/skill-browser-automation.git ~/.skills/skills/browser-automation
ADK-Rust読み込みの形状
let skills = SkillLoader::from_dir("~/.skills/skills").await?;
let skill = skills.load("browser-automation").await?;

let agent = LlmAgentBuilder::new("agent")
    .instruction(skill.instructions())
    .tools(skill.allowed_tools(toolset)?)
    .build()?;

リポジトリの互換性声明: mcp-browserサーバーの接続が必要です(Chromiumベース、ヘッドレス)。

公式ドキュメント

完全なスキルパッケージを読む。

リポジトリは正確な指示、例、ヘルパースクリプト、アセット、MCP要件、ライセンス、後の更新に関して権威を保持します。

ソース記録

このスキルエントリのリポジトリメタデータ。

公開リポジトリを見る ↗
ライセンス
Apache-2.0
許可されたツール
17
参照
3
リビジョン
38297870a375
更新済み
2026年5月31日