Web Scraping & Crawling

Extraction de donnees web : crawlers, RSS, Apify, indexation.

57 skills

# Skill Source Description Maj
1 wayback-cdx-wildcard-pagination divinevideo/divine-mobile Paginer l'API CDX Wayback Machine avec des requêtes wildcard via showResumeKey. 262 4j
2 wayback-indirect-asset-recovery divinevideo/divine-mobile Récupérer des assets introuvables via l'extraction indirecte depuis Wayback Machine. 262 4j
3 wayback-machine-raw-content-id-modifier divinevideo/divine-mobile Récupérer le contenu brut d'archives Wayback Machine via le modificateur id_. 262 4j
4 browser-automation elophanto/elophanto Automatiser la navigation web, les formulaires et l'extraction de données via 47 outils. 116 5j
5 apify-sdk-integration apify/agent-skills Intégrer des Actors Apify dans une application via SDK JS, Python ou REST API. 2 334 7j
6 firecrawl-search firecrawl/cli Rechercher sur le web et récupérer le contenu complet des pages résultantes. 583 11j
7 x-twitter-scraper github/awesome-copilot Intégrer l'API Xquik pour scraper, monitorer et automatiser des tâches X/Twitter. 37 709 13j
8 browser-use browser-use/browser-use Contrôler un navigateur Chrome via CDP pour automatiser des tâches web. 108 853 17j
9 browser browserbase/skills Automatiser les interactions navigateur en local ou via Browserbase avec une CLI dédiée. 3 687 1mo
10 firecrawl-monitor firecrawl/cli Surveiller des pages web et recevoir des alertes automatiques lors de changements détectés. 583 1mo
11 firecrawl firecrawl/cli Scraper, rechercher et interagir avec le web via Firecrawl CLI en markdown optimisé. 583 1mo
12 apify-actor-development apify/agent-skills Développer et déployer des Actors serverless sur la plateforme Apify. 2 334 1mo
13 apify-ultimate-scraper apify/agent-skills Extraire des données web depuis plus de 100 sources via l'API Apify. 2 334 1mo
14 google-maps-scraper gosom/google-maps-scraper Extraire des données de Google Maps via Docker avec configuration automatique. 5 497 1mo
15 deep-research-agent shobcoder/shob Mener une recherche autonome multi-sources pour produire des rapports structurés et vérifiés. 581 1mo
16 web-scraper shobcoder/shob Extraire et structurer automatiquement des données depuis n'importe quel site web. 581 1mo
17 fetch browserbase/skills Récupérer le contenu, les en-têtes et métadonnées d'une page web sans navigateur. 3 687 1mo
18 search browserbase/skills Rechercher sur le web et retourner des résultats structurés via l'API Browserbase. 3 687 1mo
19 deep-research shobcoder/shob Conduire une recherche approfondie multi-sources pour produire un rapport structuré et vérifié. 581 2mo
20 literature-search-arxiv mkurman/zorai Rechercher, télécharger et extraire des métadonnées de publications arXiv. 321 2mo
21 literature-search-biorxiv mkurman/zorai Rechercher des prépublications bioRxiv et medRxiv par date, catégorie ou DOI. 321 2mo
22 literature-search-europepmc mkurman/zorai Rechercher et télécharger des articles scientifiques en libre accès depuis Europe PMC. 321 2mo
23 pubchem-database mkurman/zorai Interroger la base PubChem pour obtenir données chimiques, propriétés et interactions biologiques. 321 2mo
24 firecrawl-scrape firecrawl/cli Extraire le contenu de pages web en markdown optimisé pour les LLMs. 583 2mo
25 aeon-last30 bankrbot/skills Cartographier les narratifs dominants et dissidents d'un sujet sur 30 jours. 1 176 3mo
26 paper-lookup mkurman/zorai Rechercher des articles scientifiques dans 10 bases de données académiques via leurs APIs. 321 3mo
27 parallel-web mkurman/zorai Effectuer des recherches web rapides ou approfondies et sauvegarder les résultats. 321 3mo
28 research-lookup mkurman/zorai Effectuer des recherches multi-sources avec citations académiques classées par qualité. 321 3mo
29 wayback-api-archive-recovery divinevideo/divine-mobile Récupérer des données archivées d'APIs défuntes via la Wayback Machine. 262 3mo
30 wayback-cdx-cloud-ip-workaround divinevideo/divine-mobile Contourner le blocage IP cloud de l'API Wayback CDX via GCS comme intermédiaire. 262 3mo
31 wayback-cdx-wildcard-pagination divinevideo/divine-mobile Paginer l'API CDX Wayback Machine avec des requêtes wildcard via showResumeKey. 262 3mo
32 wayback-indirect-asset-recovery divinevideo/divine-mobile Récupérer des assets introuvables via l'extraction indirecte depuis Wayback Machine. 262 3mo
33 wayback-machine-raw-content-id-modifier divinevideo/divine-mobile Récupérer le contenu brut d'archives Wayback Machine via le modificateur id_. 262 3mo
34 tavily mkurman/zorai Effectuer des recherches web, extractions et crawls via l'API REST Tavily. 321 3mo
35 perplexity-search mkurman/zorai Effectuer des recherches web en temps réel avec citations via les modèles Perplexity. 321 3mo
36 replay-ux-research getsentry/skills Analyser des replays de sessions utilisateurs réels pour identifier les patterns UX et points de friction. 911 3mo
37 mapbox-location-grounding mapbox/mapbox-agent-skills Ancrer les réponses géolocalisées dans des données Mapbox en temps réel. 71 3mo
38 tavily-dynamic-search tavily-ai/skills Filtrer et extraire des résultats web sans polluer la fenêtre de contexte. 448 4mo
39 firecrawl-interact firecrawl/cli Interagir avec des pages web en session navigateur live via prompts ou code. 583 4mo
40 firecrawl-agent firecrawl/cli Extraire automatiquement des données structurées depuis des sites web complexes multi-pages. 583 4mo
41 bx brave/brave-search-skills Rechercher sur le web via Brave Search CLI avec extraction de contenu optimisée pour les agents IA. 164 4mo
42 bx-search brave/brave-search-skills Effectuer des recherches web optimisées via CLI pour alimenter des agents IA en contexte. 164 4mo
43 defuddle kepano/obsidian-skills Extraire le contenu lisible et épuré de pages web via Defuddle CLI. 44 943 4mo
44 firecrawl-crawl firecrawl/cli Extraire en masse le contenu de multiples pages d'un site web via crawl. 583 4mo
45 firecrawl-map firecrawl/cli Cartographier toutes les URLs d'un site web avec filtrage par recherche. 583 4mo
46 tavily-crawl tavily-ai/skills Explorer et extraire le contenu de plusieurs pages web via l'outil Tavily CLI. 448 4mo
47 tavily-extract tavily-ai/skills Extraire le contenu textuel ou Markdown propre depuis une ou plusieurs URLs. 448 4mo
48 tavily-map tavily-ai/skills Cartographier rapidement toutes les URLs d'un site sans en extraire le contenu. 448 4mo
49 tavily-research tavily-ai/skills Générer un rapport cité et approfondi à partir de multiples sources web analysées. 448 4mo
50 tavily-search tavily-ai/skills Effectuer des recherches web optimisées pour LLM avec scores de pertinence via Tavily. 448 4mo

À propos de cette sélection

L'outillage de scraping web a longtemps ressemblé à un chantier artisanal : un script Playwright bricolé, un cron qui tombe en silence, des sélecteurs CSS qui rendent l'âme dès qu'un front-end se restructure. Les agents IA changent la donne. Ils ont besoin d'accéder au web de façon fiable, autonome et reproductible, et c'est précisément ce que couvrent les skills web scraping & crawling rassemblés ici. De quoi piloter un navigateur headless pour extraire des données structurées depuis des pages dynamiques, ou brancher un agent sur un moteur de recherche comme Tavily et Brave sans écrire une ligne de parsing. Ces skills s'adressent aux développeurs Python ou TypeScript qui alimentent des pipelines de données, construisent des agents de veille ou enrichissent des datasets pour du fine-tuning. L'écosystème couvre déjà une bonne partie des cas d'usage courants.