Web Scraping & Crawling
Extraction de donnees web : crawlers, RSS, Apify, indexation.
| # | Skill | Source | Description | Maj | |
|---|---|---|---|---|---|
| 1 | wayback-cdx-wildcard-pagination | divinevideo/divine-mobile | Paginer l'API CDX Wayback Machine avec des requêtes wildcard via showResumeKey. | 262 | 4j |
| 2 | wayback-indirect-asset-recovery | divinevideo/divine-mobile | Récupérer des assets introuvables via l'extraction indirecte depuis Wayback Machine. | 262 | 4j |
| 3 | wayback-machine-raw-content-id-modifier | divinevideo/divine-mobile | Récupérer le contenu brut d'archives Wayback Machine via le modificateur id_. | 262 | 4j |
| 4 | browser-automation | elophanto/elophanto | Automatiser la navigation web, les formulaires et l'extraction de données via 47 outils. | 116 | 5j |
| 5 | apify-sdk-integration | apify/agent-skills | Intégrer des Actors Apify dans une application via SDK JS, Python ou REST API. | 2 334 | 7j |
| 6 | firecrawl-search | firecrawl/cli | Rechercher sur le web et récupérer le contenu complet des pages résultantes. | 583 | 11j |
| 7 | x-twitter-scraper | github/awesome-copilot | Intégrer l'API Xquik pour scraper, monitorer et automatiser des tâches X/Twitter. | 37 709 | 13j |
| 8 | browser-use | browser-use/browser-use | Contrôler un navigateur Chrome via CDP pour automatiser des tâches web. | 108 853 | 17j |
| 9 | browser | browserbase/skills | Automatiser les interactions navigateur en local ou via Browserbase avec une CLI dédiée. | 3 687 | 1mo |
| 10 | firecrawl-monitor | firecrawl/cli | Surveiller des pages web et recevoir des alertes automatiques lors de changements détectés. | 583 | 1mo |
| 11 | firecrawl | firecrawl/cli | Scraper, rechercher et interagir avec le web via Firecrawl CLI en markdown optimisé. | 583 | 1mo |
| 12 | apify-actor-development | apify/agent-skills | Développer et déployer des Actors serverless sur la plateforme Apify. | 2 334 | 1mo |
| 13 | apify-ultimate-scraper | apify/agent-skills | Extraire des données web depuis plus de 100 sources via l'API Apify. | 2 334 | 1mo |
| 14 | google-maps-scraper | gosom/google-maps-scraper | Extraire des données de Google Maps via Docker avec configuration automatique. | 5 497 | 1mo |
| 15 | deep-research-agent | shobcoder/shob | Mener une recherche autonome multi-sources pour produire des rapports structurés et vérifiés. | 581 | 1mo |
| 16 | web-scraper | shobcoder/shob | Extraire et structurer automatiquement des données depuis n'importe quel site web. | 581 | 1mo |
| 17 | fetch | browserbase/skills | Récupérer le contenu, les en-têtes et métadonnées d'une page web sans navigateur. | 3 687 | 1mo |
| 18 | search | browserbase/skills | Rechercher sur le web et retourner des résultats structurés via l'API Browserbase. | 3 687 | 1mo |
| 19 | deep-research | shobcoder/shob | Conduire une recherche approfondie multi-sources pour produire un rapport structuré et vérifié. | 581 | 2mo |
| 20 | literature-search-arxiv | mkurman/zorai | Rechercher, télécharger et extraire des métadonnées de publications arXiv. | 321 | 2mo |
| 21 | literature-search-biorxiv | mkurman/zorai | Rechercher des prépublications bioRxiv et medRxiv par date, catégorie ou DOI. | 321 | 2mo |
| 22 | literature-search-europepmc | mkurman/zorai | Rechercher et télécharger des articles scientifiques en libre accès depuis Europe PMC. | 321 | 2mo |
| 23 | pubchem-database | mkurman/zorai | Interroger la base PubChem pour obtenir données chimiques, propriétés et interactions biologiques. | 321 | 2mo |
| 24 | firecrawl-scrape | firecrawl/cli | Extraire le contenu de pages web en markdown optimisé pour les LLMs. | 583 | 2mo |
| 25 | aeon-last30 | bankrbot/skills | Cartographier les narratifs dominants et dissidents d'un sujet sur 30 jours. | 1 176 | 3mo |
| 26 | paper-lookup | mkurman/zorai | Rechercher des articles scientifiques dans 10 bases de données académiques via leurs APIs. | 321 | 3mo |
| 27 | parallel-web | mkurman/zorai | Effectuer des recherches web rapides ou approfondies et sauvegarder les résultats. | 321 | 3mo |
| 28 | research-lookup | mkurman/zorai | Effectuer des recherches multi-sources avec citations académiques classées par qualité. | 321 | 3mo |
| 29 | wayback-api-archive-recovery | divinevideo/divine-mobile | Récupérer des données archivées d'APIs défuntes via la Wayback Machine. | 262 | 3mo |
| 30 | wayback-cdx-cloud-ip-workaround | divinevideo/divine-mobile | Contourner le blocage IP cloud de l'API Wayback CDX via GCS comme intermédiaire. | 262 | 3mo |
| 31 | wayback-cdx-wildcard-pagination | divinevideo/divine-mobile | Paginer l'API CDX Wayback Machine avec des requêtes wildcard via showResumeKey. | 262 | 3mo |
| 32 | wayback-indirect-asset-recovery | divinevideo/divine-mobile | Récupérer des assets introuvables via l'extraction indirecte depuis Wayback Machine. | 262 | 3mo |
| 33 | wayback-machine-raw-content-id-modifier | divinevideo/divine-mobile | Récupérer le contenu brut d'archives Wayback Machine via le modificateur id_. | 262 | 3mo |
| 34 | tavily | mkurman/zorai | Effectuer des recherches web, extractions et crawls via l'API REST Tavily. | 321 | 3mo |
| 35 | perplexity-search | mkurman/zorai | Effectuer des recherches web en temps réel avec citations via les modèles Perplexity. | 321 | 3mo |
| 36 | replay-ux-research | getsentry/skills | Analyser des replays de sessions utilisateurs réels pour identifier les patterns UX et points de friction. | 911 | 3mo |
| 37 | mapbox-location-grounding | mapbox/mapbox-agent-skills | Ancrer les réponses géolocalisées dans des données Mapbox en temps réel. | 71 | 3mo |
| 38 | tavily-dynamic-search | tavily-ai/skills | Filtrer et extraire des résultats web sans polluer la fenêtre de contexte. | 448 | 4mo |
| 39 | firecrawl-interact | firecrawl/cli | Interagir avec des pages web en session navigateur live via prompts ou code. | 583 | 4mo |
| 40 | firecrawl-agent | firecrawl/cli | Extraire automatiquement des données structurées depuis des sites web complexes multi-pages. | 583 | 4mo |
| 41 | bx | brave/brave-search-skills | Rechercher sur le web via Brave Search CLI avec extraction de contenu optimisée pour les agents IA. | 164 | 4mo |
| 42 | bx-search | brave/brave-search-skills | Effectuer des recherches web optimisées via CLI pour alimenter des agents IA en contexte. | 164 | 4mo |
| 43 | defuddle | kepano/obsidian-skills | Extraire le contenu lisible et épuré de pages web via Defuddle CLI. | 44 943 | 4mo |
| 44 | firecrawl-crawl | firecrawl/cli | Extraire en masse le contenu de multiples pages d'un site web via crawl. | 583 | 4mo |
| 45 | firecrawl-map | firecrawl/cli | Cartographier toutes les URLs d'un site web avec filtrage par recherche. | 583 | 4mo |
| 46 | tavily-crawl | tavily-ai/skills | Explorer et extraire le contenu de plusieurs pages web via l'outil Tavily CLI. | 448 | 4mo |
| 47 | tavily-extract | tavily-ai/skills | Extraire le contenu textuel ou Markdown propre depuis une ou plusieurs URLs. | 448 | 4mo |
| 48 | tavily-map | tavily-ai/skills | Cartographier rapidement toutes les URLs d'un site sans en extraire le contenu. | 448 | 4mo |
| 49 | tavily-research | tavily-ai/skills | Générer un rapport cité et approfondi à partir de multiples sources web analysées. | 448 | 4mo |
| 50 | tavily-search | tavily-ai/skills | Effectuer des recherches web optimisées pour LLM avec scores de pertinence via Tavily. | 448 | 4mo |
À propos de cette sélection
L'outillage de scraping web a longtemps ressemblé à un chantier artisanal : un script Playwright bricolé, un cron qui tombe en silence, des sélecteurs CSS qui rendent l'âme dès qu'un front-end se restructure. Les agents IA changent la donne. Ils ont besoin d'accéder au web de façon fiable, autonome et reproductible, et c'est précisément ce que couvrent les skills web scraping & crawling rassemblés ici. De quoi piloter un navigateur headless pour extraire des données structurées depuis des pages dynamiques, ou brancher un agent sur un moteur de recherche comme Tavily et Brave sans écrire une ligne de parsing. Ces skills s'adressent aux développeurs Python ou TypeScript qui alimentent des pipelines de données, construisent des agents de veille ou enrichissent des datasets pour du fine-tuning. L'écosystème couvre déjà une bonne partie des cas d'usage courants.