Web Scraping & Crawling

Extraction de donnees web : crawlers, RSS, Apify, indexation.

59 skills

# Skill Source Description Δ
1 browser-use browser-use/browser-use Contrôler un navigateur Chrome via CDP pour automatiser des tâches web. 116 350 1035
2 defuddle kepano/obsidian-skills Extraire le contenu lisible et épuré de pages web via Defuddle CLI. 48 892 289
3 x-twitter-scraper github/awesome-copilot Intégrer l'API Xquik pour scraper, monitorer et automatiser des tâches X/Twitter. 39 408 246
4 google-maps-scraper gosom/google-maps-scraper Extraire des données de Google Maps via Docker avec configuration automatique. 6 127 192
5 apify-actor-development apify/agent-skills Développer et déployer des Actors serverless sur la plateforme Apify. 2 398 10
6 apify-ultimate-scraper apify/agent-skills Extraire des données web depuis plus de 100 sources via l'API Apify. 2 398 10
7 browser browserbase/skills Automatiser les interactions navigateur en local ou via Browserbase avec une CLI dédiée. 3 733 10
8 fetch browserbase/skills Récupérer le contenu, les en-têtes et métadonnées d'une page web sans navigateur. 3 733 10
9 search browserbase/skills Rechercher sur le web et retourner des résultats structurés via l'API Browserbase. 3 733 10
10 aeon-last30 bankrbot/skills Cartographier les narratifs dominants et dissidents d'un sujet sur 30 jours. 1 203 4
11 bx-search brave/brave-search-skills Effectuer des recherches web optimisées via CLI pour alimenter des agents IA en contexte. 180 3
12 bx brave/brave-search-skills Rechercher sur le web via Brave Search CLI avec extraction de contenu optimisée pour les agents IA. 180 3
13 local-descriptions brave/brave-search-skills Récupérer des descriptions IA de lieux d'intérêt via l'API Brave Search. 180 3
14 news-search brave/brave-search-skills Rechercher des actualités récentes via l'API Brave avec filtres temporels et géographiques. 180 3
15 videos-search brave/brave-search-skills Rechercher des vidéos sur le web via l'API Brave Search. 180 3
16 web-search brave/brave-search-skills Effectuer des recherches web structurées via l'API Brave Search avec filtres avancés. 180 3
17 firecrawl-crawl firecrawl/cli Extraire en masse le contenu de multiples pages d'un site web via crawl. 638 3
18 firecrawl-agent firecrawl/cli Extraire automatiquement des données structurées depuis des sites web complexes multi-pages. 638 3
19 firecrawl-download firecrawl/cli Télécharger un site entier en fichiers locaux organisés via map et scrape. 638 3
20 firecrawl-interact firecrawl/cli Interagir avec des pages web en session navigateur live via prompts ou code. 638 3
21 firecrawl-map firecrawl/cli Cartographier toutes les URLs d'un site web avec filtrage par recherche. 638 3
22 firecrawl-scrape firecrawl/cli Extraire le contenu de pages web en markdown optimisé pour les LLMs. 638 3
23 firecrawl-search firecrawl/cli Rechercher sur le web et récupérer le contenu complet des pages résultantes. 638 3
24 firecrawl-monitor firecrawl/cli Surveiller des pages web et recevoir des alertes automatiques lors de changements détectés. 638 3
25 firecrawl firecrawl/cli Rechercher, scraper et interagir avec le web en retournant du markdown propre. 638 3
26 firecrawl-developer-index firecrawl/cli Interroger l'index Firecrawl pour répondre à des questions techniques depuis issues, PRs et docs. 638 3
27 local-place-search brave/brave-search-skills Rechercher des lieux et points d'intérêt à proximité via coordonnées ou texte libre. 180 3
28 firecrawl-research-index firecrawl/cli Rechercher et retrouver des articles scientifiques pertinents via requête textuelle ou identifiant. 638 3
29 firecrawl-alexandria firecrawl/cli Accéder à des données structurées via des workflows, API et index spécialisés intégrés à Firecrawl. 638 3
30 wayback-api-archive-recovery divinevideo/divine-mobile Récupérer des données archivées d'APIs défuntes via la Wayback Machine. 265 1
31 wayback-cdx-cloud-ip-workaround divinevideo/divine-mobile Contourner le blocage IP cloud de l'API Wayback CDX via GCS comme intermédiaire. 265 1
32 wayback-cdx-wildcard-pagination divinevideo/divine-mobile Paginer l'API CDX Wayback Machine avec des requêtes wildcard via showResumeKey. 265 1
33 wayback-indirect-asset-recovery divinevideo/divine-mobile Récupérer des assets introuvables via l'extraction indirecte depuis Wayback Machine. 265 1
34 wayback-machine-raw-content-id-modifier divinevideo/divine-mobile Récupérer le contenu brut d'archives Wayback Machine via le modificateur id_. 265 1
35 wayback-cdx-wildcard-pagination divinevideo/divine-mobile Paginer l'API CDX Wayback Machine avec des requêtes wildcard via showResumeKey. 265 1
36 wayback-indirect-asset-recovery divinevideo/divine-mobile Récupérer des assets introuvables via l'extraction indirecte depuis Wayback Machine. 265 1
37 wayback-machine-raw-content-id-modifier divinevideo/divine-mobile Récupérer le contenu brut d'archives Wayback Machine via le modificateur id_. 265 1
38 mapbox-location-grounding mapbox/mapbox-agent-skills Ancrer les réponses géolocalisées dans des données Mapbox en temps réel. 78 0
39 tavily-best-practices tavily-ai/skills Accéder à des données web en temps réel via une API de recherche optimisée pour les LLMs. 485 0
40 tavily-cli tavily-ai/skills Rechercher, extraire, crawler et analyser le web via Tavily CLI. 485 0
41 tavily-crawl tavily-ai/skills Explorer et extraire le contenu de plusieurs pages web via l'outil Tavily CLI. 485 0
42 tavily-dynamic-search tavily-ai/skills Filtrer et extraire des résultats web sans polluer la fenêtre de contexte. 485 0
43 tavily-extract tavily-ai/skills Extraire le contenu textuel ou Markdown propre depuis une ou plusieurs URLs. 485 0
44 tavily-map tavily-ai/skills Cartographier rapidement toutes les URLs d'un site sans en extraire le contenu. 485 0
45 tavily mkurman/zorai Effectuer des recherches web, extractions et crawls via l'API REST Tavily. 324 0
46 paper-lookup mkurman/zorai Rechercher des articles scientifiques dans 10 bases de données académiques via leurs APIs. 324 0
47 parallel-web mkurman/zorai Effectuer des recherches web rapides ou approfondies et sauvegarder les résultats. 324 0
48 research-lookup mkurman/zorai Effectuer des recherches multi-sources avec citations académiques classées par qualité. 324 0
49 literature-search-arxiv mkurman/zorai Rechercher, télécharger et extraire des métadonnées de publications arXiv. 324 0
50 tavily-research tavily-ai/skills Générer un rapport cité et approfondi à partir de multiples sources web analysées. 485 0

À propos de cette sélection

L'outillage de scraping web a longtemps ressemblé à un chantier artisanal : un script Playwright bricolé, un cron qui tombe en silence, des sélecteurs CSS qui rendent l'âme dès qu'un front-end se restructure. Les agents IA changent la donne. Ils ont besoin d'accéder au web de façon fiable, autonome et reproductible, et c'est précisément ce que couvrent les skills web scraping & crawling rassemblés ici. De quoi piloter un navigateur headless pour extraire des données structurées depuis des pages dynamiques, ou brancher un agent sur un moteur de recherche comme Tavily et Brave sans écrire une ligne de parsing. Ces skills s'adressent aux développeurs Python ou TypeScript qui alimentent des pipelines de données, construisent des agents de veille ou enrichissent des datasets pour du fine-tuning. L'écosystème couvre déjà une bonne partie des cas d'usage courants.