Web Scraping & Crawling

Extraction de donnees web : crawlers, RSS, Apify, indexation.

17 skills

# Skill Source Description Maj
1 browser-use browser-use/browser-use Contrôler un navigateur Chrome via CDP pour automatiser des tâches web. 114 627 10j
2 tavily-cli tavily-ai/skills Rechercher, extraire, crawler et analyser le web via Tavily CLI. 480 11j
3 tavily-dynamic-search tavily-ai/skills Filtrer et extraire des résultats web sans polluer la fenêtre de contexte. 480 11j
4 wayback-cdx-wildcard-pagination divinevideo/divine-mobile Paginer l'API CDX Wayback Machine avec des requêtes wildcard via showResumeKey. 264 1mo
5 wayback-indirect-asset-recovery divinevideo/divine-mobile Récupérer des assets introuvables via l'extraction indirecte depuis Wayback Machine. 264 1mo
6 wayback-machine-raw-content-id-modifier divinevideo/divine-mobile Récupérer le contenu brut d'archives Wayback Machine via le modificateur id_. 264 1mo
7 literature-search-arxiv mkurman/zorai Rechercher, télécharger et extraire des métadonnées de publications arXiv. 325 3mo
8 literature-search-biorxiv mkurman/zorai Rechercher des prépublications bioRxiv et medRxiv par date, catégorie ou DOI. 325 3mo
9 literature-search-europepmc mkurman/zorai Rechercher et télécharger des articles scientifiques en libre accès depuis Europe PMC. 325 3mo
10 pubchem-database mkurman/zorai Interroger la base PubChem pour obtenir données chimiques, propriétés et interactions biologiques. 325 3mo
11 parallel-web mkurman/zorai Effectuer des recherches web rapides ou approfondies et sauvegarder les résultats. 325 4mo
12 wayback-cdx-cloud-ip-workaround divinevideo/divine-mobile Contourner le blocage IP cloud de l'API Wayback CDX via GCS comme intermédiaire. 264 4mo
13 wayback-cdx-wildcard-pagination divinevideo/divine-mobile Paginer l'API CDX Wayback Machine avec des requêtes wildcard via showResumeKey. 264 4mo
14 wayback-indirect-asset-recovery divinevideo/divine-mobile Récupérer des assets introuvables via l'extraction indirecte depuis Wayback Machine. 264 4mo
15 wayback-machine-raw-content-id-modifier divinevideo/divine-mobile Récupérer le contenu brut d'archives Wayback Machine via le modificateur id_. 264 4mo
16 perplexity-search mkurman/zorai Effectuer des recherches web en temps réel avec citations via les modèles Perplexity. 325 4mo
17 tavily-best-practices tavily-ai/skills Accéder à des données web en temps réel via une API de recherche optimisée pour les LLMs. 480 6mo

À propos de cette sélection

L'outillage de scraping web a longtemps ressemblé à un chantier artisanal : un script Playwright bricolé, un cron qui tombe en silence, des sélecteurs CSS qui rendent l'âme dès qu'un front-end se restructure. Les agents IA changent la donne. Ils ont besoin d'accéder au web de façon fiable, autonome et reproductible, et c'est précisément ce que couvrent les skills web scraping & crawling rassemblés ici. De quoi piloter un navigateur headless pour extraire des données structurées depuis des pages dynamiques, ou brancher un agent sur un moteur de recherche comme Tavily et Brave sans écrire une ligne de parsing. Ces skills s'adressent aux développeurs Python ou TypeScript qui alimentent des pipelines de données, construisent des agents de veille ou enrichissent des datasets pour du fine-tuning. L'écosystème couvre déjà une bonne partie des cas d'usage courants.