Pipelines de données
Orchestration et transformation de donnees : Airflow, dbt, Astronomer, ETL et ELT.
| # | Skill | Source | Description | ||
|---|---|---|---|---|---|
| 1 | airflow-dag-patterns | wshobson/agents | Orchestrer des pipelines de données Apache Airflow avec patterns, opérateurs et déploiement. | 39 975 | |
| 2 | data-quality-frameworks | wshobson/agents | Implémenter des frameworks de qualité de données avec Great Expectations, dbt et contrats. | 39 975 | |
| 3 | risk-metrics-calculation | wshobson/agents | Calculer la VaR, CVaR et métriques de risque pour la gestion de portefeuille. | 39 975 | |
| 4 | spark-optimization | wshobson/agents | Optimiser les jobs Apache Spark avec partitionnement, mémoire et gestion des shuffles. | 39 975 | |
| 5 | bigquery-pipeline-audit | github/awesome-copilot | Auditer un pipeline BigQuery pour coûts, sécurité et fiabilité en production. | 39 398 | |
| 6 | mini-context-graph | github/awesome-copilot | Construire et interroger un graphe de connaissances persistant combinant wiki, entités et sources brutes. | 39 398 | |
| 7 | create-viz | anthropics/knowledge-work-plugins | Générer des visualisations de données professionnelles avec Python selon les meilleures pratiques. | 25 630 | |
| 8 | instrument-data-to-allotrope | anthropics/knowledge-work-plugins | Convertir des fichiers instruments au format standardisé Allotrope Simple Model pour LIMS. | 25 630 | |
| 9 | nextflow-development | anthropics/knowledge-work-plugins | Déployer et exécuter des pipelines bioinformatiques nf-core sur données locales ou publiques. | 25 630 | |
| 10 | single-cell-rna-qc | anthropics/knowledge-work-plugins | Automatiser le contrôle qualité de données single-cell RNA-seq selon les bonnes pratiques scverse. | 25 630 | |
| 11 | upload-parity-experiments | harbor-framework/harbor | Publier des résultats d'expériences de parité Harbor sur Hugging Face via Git sparse checkout. | 5 609 | |
| 12 | accelerated-computing-cudf | nvidia/skills | Accélérer des DataFrames pandas sur GPU avec cuDF et dask-cuDF. | 3 437 | |
| 13 | aiq-research | nvidia/skills | Interroger un serveur NVIDIA AI-Q Blueprint pour effectuer des recherches approfondies. | 3 437 | |
| 14 | amc-run-video-calibration | nvidia/skills | Calibrer des vidéos MP4 pré-enregistrées via l'API REST AMC sans scripts CLI. | 3 437 | |
| 15 | cuopt-multi-objective-exploration | nvidia/skills | Tracer une frontière de Pareto multi-objectifs via des solves cuOpt successifs. | 3 437 | |
| 16 | cuopt-routing-api-python | nvidia/skills | Résoudre des problèmes de routage VRP/TSP/PDP avec l'API Python cuOpt. | 3 437 | |
| 17 | dali-dynamic-mode | nvidia/skills | Exécuter des pipelines de données DALI en mode impératif Python sans graphe statique. | 3 437 | |
| 18 | data-designer | nvidia/skills | Construire des datasets synthétiques personnalisés via une interface interactive ou automatique. | 3 437 | |
| 19 | deepstream-dev | nvidia/skills | Développer des pipelines DeepStream SDK avec les bonnes pratiques et règles d'architecture NVIDIA. | 3 437 | |
| 20 | dicom-metadata-extract | nvidia/skills | Extraire les métadonnées d'un fichier DICOM et détecter la présence de PHI. | 3 437 | |
| 21 | dicom-series-preflight | nvidia/skills | Analyser les en-têtes d'une série DICOM et émettre un verdict de conformité JSON. | 3 437 | |
| 22 | dicom-series-to-volume | nvidia/skills | Convertir une série DICOM CT en volume NIfTI HU avec affine et résumé JSON. | 3 437 | |
| 23 | earth2studio-create-datasource | nvidia/skills | Implémenter de bout en bout un wrapper de source de données pour Earth2Studio. | 3 437 | |
| 24 | earth2studio-data-fetch | nvidia/skills | Télécharger des données météo/climat via les APIs Earth2Studio avec vérification lexicale. | 3 437 | |
| 25 | i4h-workflow-dataset-convert | nvidia/skills | Convertir un enregistrement HDF5 agentic en dataset LeRobot prêt à l'entraînement. | 3 437 | |
| 26 | i4h-workflow-dataset-mimic | nvidia/skills | Augmenter un dataset HDF5 en répliquant des trajectoires avec bruit d'action et d'état. | 3 437 | |
| 27 | medtech-model-evidence-export | nvidia/skills | Exporter des résultats d'inférence médicale vers MLflow via un pack d'évidence post-hoc. | 3 437 | |
| 28 | nemotron-retrieval-recipes | nvidia/skills | Orchestrer les recettes Nemotron d'embedding et de reranking pour optimiser la récupération d'information. | 3 437 | |
| 29 | nvflare-fed-stats | nvidia/skills | Calculer des statistiques fédérées sur des données tabulaires ou images via NVFLARE. | 3 437 | |
| 30 | omniverse-cad-to-simready | nvidia/skills | Convertir un asset CAD en package SimReady via un pipeline bout-en-bout orchestré. | 3 437 | |
| 31 | paidf-augmentation | nvidia/skills | Orchestrer un pipeline d'augmentation de données visuelles via des modèles génératifs NVIDIA distants. | 3 437 | |
| 32 | tao-analyze-gaps-visual-changenet | nvidia/skills | Identifier les échantillons les plus faibles d'un modèle VCN TAO pour cibler l'augmentation. | 3 437 | |
| 33 | tao-convert-dataset-format | nvidia/skills | Convertir des datasets DAFT entre formats supportés via la CLI tao-daft. | 3 437 | |
| 34 | tao-data-io | nvidia/skills | Gérer le transfert de données vers et depuis un conteneur de calcul IA selon la stratégie de… | 3 437 | |
| 35 | tao-generate-video-reasoning-annotations | nvidia/skills | Générer des datasets d'entraînement vidéo avec raisonnement CoT et paires QA annotées. | 3 437 | |
| 36 | tao-mine-nearest-neighbors | nvidia/skills | Exécuter un minage de voisins les plus proches sur des embeddings parquet via TAO Data Services. | 3 437 | |
| 37 | tao-mine-od-images | nvidia/skills | Lancer le minage TAO pour sélectionner des images uniques via correspondance de voisins. | 3 437 | |
| 38 | tao-route-visual-changenet-samples | nvidia/skills | Router les labels de gaps VCN vers les modules k-NN Mining et AnomalyGen de façon auditable. | 3 437 | |
| 39 | tao-validate-dataset-format | nvidia/skills | Valider un dataset DAFT avec tao-daft validate et interpréter les résultats. | 3 437 | |
| 40 | azure-ai-contentunderstanding-py | microsoft/skills | Extraire du contenu sémantique multimodal depuis documents, vidéos, audios et images. | 3 052 | |
| 41 | vss-search-archive | nvidia-ai-blueprints/video-search-and-summarization | Rechercher dans des archives vidéo via CLI VSS en respectant les sources exactes. | 1 875 | |
| 42 | creating-mermaid-dbt-dag | dbt-labs/dbt-agent-skills | Générer un diagramme Mermaid visuel du DAG dbt d'un modèle donné. | 726 | |
| 43 | migrating-dbt-project-across-platforms | dbt-labs/dbt-agent-skills | Migrer un projet dbt entre plateformes de données avec validation automatisée. | 726 | |
| 44 | running-dbt-commands | dbt-labs/dbt-agent-skills | Exécuter des commandes dbt efficacement avec sélecteurs, prévisualisation et variables. | 726 | |
| 45 | upgrading-dbt | dbt-labs/dbt-agent-skills | Migrer un projet dbt v1 vers la version 1.12 en appliquant les correctifs adaptés. | 726 | |
| 46 | using-dbt-for-analytics-engineering | dbt-labs/dbt-agent-skills | Construire, modifier et tester des modèles dbt avec rigueur et bonnes pratiques. | 726 | |
| 47 | chdb-datastore | clickhouse/agent-skills | Remplacer pandas par une alternative ClickHouse-backed, plus rapide et sans changer son code. | 541 | |
| 48 | chdb-sql | clickhouse/agent-skills | Exécuter des requêtes SQL ClickHouse en Python sans serveur sur fichiers, bases et cloud. | 541 | |
| 49 | airflow | astronomer/agents | Gérer, diagnostiquer et opérer des workflows Airflow via des commandes CLI dédiées. | 445 | |
| 50 | airflow-adapter | astronomer/agents | Assurer la compatibilité automatique entre les API Airflow 2.x et 3.x. | 445 |
À propos de cette sélection
L'orchestration de données a longtemps reposé sur des scripts fragiles qu'on ne touchait plus par peur de tout casser. Des acteurs comme Astronomer et dbt Labs ont depuis industrialisé la discipline : DAGs versionnés, transformations testables, lignage de bout en bout. Les skills pipelines de données rassemblés ici couvrent des cas concrets, auditer un pipeline BigQuery pour détecter des dérives de coût ou de fraîcheur, modéliser un dataset pour l'exposer proprement à une couche BI sans multiplier les joins à la main. L'outillage disponible est solide, majoritairement Python, et couvre le spectre du prototypage local au déploiement en production supervisé. Ça parle autant aux data engineers qu'aux ML engineers qui branchent des flux en amont de leurs modèles.