Registre des compétences
Flux de développementCompétences publiques

Browser Automation

Opérations web pour agents IA — lire des pages, extraire des données, prendre des captures d'écran, interagir avec des formulaires et scraper du contenu structuré via Chromium sans interface.

Ce que cette compétence enseigne

Un guide réutilisable pour un type de travail spécifique.

Un serveur MCP indique à un agent quelles actions sont disponibles. Une compétence ajoute le jugement autour de ces actions : comment reconnaître la tâche, quelle séquence suivre, quoi éviter, et comment décider que le résultat est complet.

Orchestrez les opérations de navigateur — récupérez des pages web, extrayez du contenu, capturez des captures d’écran, interagissez avec des éléments et scrapez des données structurées. Utilisez-le pour lire des pages web, extraire des données de sites, prendre des captures d’écran, vérifier la disponibilité d’URLs ou interagir avec des formulaires web.

Architecture

Comment Browser Automation guide un agent ADK-Rust.

La compétence reste lisible et portable car elle contient des instructions plutôt que des identifiants de service ou des données métier. ADK-Rust la fournit à l'agent, l'agent choisit dans sa limite d'outil examinée, et le serveur MCP connecté exécute l'opération authentifiée.

01

Requête utilisateur

L'agent reçoit un objectif exprimé en langage courant.

02

Compétence Browser Automation

Correspond à l'intention, fournit le guide de décision, et restreint la limite d'outil.

03

Agent ADK-Rust

Planifie le flux de travail et diffuse chaque étape significative via le runtime.

04

mcp-browser

Exécute des opérations authentifiées contre le système propriétaire de la capacité.

05

Résultat vérifié

Les règles de complétion de la compétence façonnent les preuves retournées à l'utilisateur.

Instructions portables : SKILL.md · Limite de capacité : mcp-browser · Outils autorisés : 17

Guide de décision

Comment l'agent transforme une requête en action appropriée.

Ces routes proviennent directement des instructions de la compétence. Elles aident le modèle à reconnaître l'intention et à sélectionner un outil ou un flux de travail ciblé au lieu d'improviser sur toute la surface de capacité.

01

"lire", "obtenir la page", "contenu de l'URL" ?

read_page (rendu JS) ou fetch_light (statique)

02

"capture d'écran", "prendre", "visuel" ?

screenshot / screenshot_element

03

"liens", "extraire les liens" ?

extract_links

04

"cliquer", "remplir formulaire", "interagir" ?

click / type_text / wait_for

05

"est-ce accessible", "statut", "vérifier URL" ?

check_status

06

"PDF", "enregistrer la page" ?

save_pdf

07

"données structurées", "scraper champs" ?

extract_structured / query_selector

Flux de travail éprouvés

Séquences répétables pour des résultats utiles.

Un flux de travail regroupe plusieurs appels d'outils en une tâche que l'utilisateur reconnaît réellement. La compétence explique la séquence et le résultat attendu tandis qu'ADK-Rust diffuse la progression de l'agent via le runtime partagé.

011-2 appels

Lire la Page

Texte propre de n'importe quelle URL

022 appels

Extraire les Données

Champs structurés depuis les pages

031 appels

Capture d’Écran

Capture visuelle (page complète ou élément)

043-4 appels

Interagir

Remplir formulaires, cliquer sur boutons

051 appels

Vérification de Statut

Vérifier que l'URL est accessible

Limite d'outil

La compétence peut utiliser 17 outils documentés.

Cette liste blanche est déclarée par la compétence. Elle maintient l'agent concentré sur les actions nécessaires pour ce travail tandis que mcp-browser conserve la responsabilité de l'authentification, de la validation et du système connecté.

read_page
get_html
extract_links
extract_metadata
query_selector
get_accessibility_tree
extract_structured
screenshot
screenshot_element
save_pdf
click
type_text
evaluate_js
wait_for
navigate
check_status
fetch_light

Règles de travail

Ce que l'agent doit faire.

  • Utiliser check_status avant les opérations lourdes (éviter de perdre du temps sur des URLs mortes)
  • Utiliser fetch_light pour les pages statiques (10x plus rapide qu’un navigateur complet)
  • Utiliser get_accessibility_tree pour une extraction économe en tokens (77% de tokens en moins que le HTML)

Limites opérationnelles

Ce que l'agent doit éviter.

  • Ne pas utiliser read_page pour des pages statiques simples (préférer fetch_light)
  • Ne pas scraper les sites qui bloquent explicitement les bots (respecter robots.txt)
  • Ne pas stocker les identifiants saisis via type_text

Installer et connecter

Ajoutez la compétence à côté de la capacité qu'elle attend.

Installez le dépôt où votre chargeur de compétences ADK-Rust peut le découvrir, connectez mcp-browser, et confirmez que les outils déclarés sont disponibles avant de demander à l'agent d'utiliser le flux de travail.

Installer la compétence
git clone https://github.com/zavora-ai/skill-browser-automation.git ~/.skills/skills/browser-automation
Forme de chargement ADK-Rust
let skills = SkillLoader::from_dir("~/.skills/skills").await?;
let skill = skills.load("browser-automation").await?;

let agent = LlmAgentBuilder::new("agent")
    .instruction(skill.instructions())
    .tools(skill.allowed_tools(toolset)?)
    .build()?;

La déclaration de compatibilité du dépôt : Nécessite un serveur mcp-browser connecté (basé sur Chromium, headless).

Documentation officielle

Lisez le package complet de la compétence.

Le dépôt reste la référence pour ses instructions exactes, exemples, scripts d'aide, ressources, exigences MCP, licence et mises à jour ultérieures.

Enregistrement source

Métadonnées du dépôt pour cette entrée de compétence.

Voir le dépôt public ↗
Licence
Apache-2.0
Outils autorisés
17
Références
3
Révision
38297870a375
Mis à jour
31 mai 2026