Pipelines de données

Orchestration et transformation de donnees : Airflow, dbt, Astronomer, ETL et ELT.

161 skills

# Skill Source Description
1 airflow-dag-patterns wshobson/agents Orchestrer des pipelines de données Apache Airflow avec patterns, opérateurs et déploiement. 38 718
2 data-quality-frameworks wshobson/agents Implémenter des frameworks de qualité de données avec Great Expectations, dbt et contrats. 38 718
3 risk-metrics-calculation wshobson/agents Calculer la VaR, CVaR et métriques de risque pour la gestion de portefeuille. 38 718
4 spark-optimization wshobson/agents Optimiser les jobs Apache Spark avec partitionnement, mémoire et gestion des shuffles. 38 718
5 bigquery-pipeline-audit github/awesome-copilot Auditer un pipeline BigQuery pour coûts, sécurité et fiabilité en production. 37 703
6 mini-context-graph github/awesome-copilot Construire et interroger un graphe de connaissances persistant combinant wiki, entités et sources brutes. 37 703
7 create-viz anthropics/knowledge-work-plugins Générer des visualisations de données professionnelles avec Python selon les meilleures pratiques. 23 435
8 instrument-data-to-allotrope anthropics/knowledge-work-plugins Convertir des fichiers instruments au format standardisé Allotrope Simple Model pour LIMS. 23 435
9 nextflow-development anthropics/knowledge-work-plugins Déployer et exécuter des pipelines bioinformatiques nf-core sur données locales ou publiques. 23 435
10 single-cell-rna-qc anthropics/knowledge-work-plugins Automatiser le contrôle qualité de données single-cell RNA-seq selon les bonnes pratiques scverse. 23 435
11 upload-parity-experiments harbor-framework/harbor Publier des résultats d'expériences de parité Harbor sur Hugging Face via Git sparse checkout. 4 121
12 azure-ai-contentunderstanding-py microsoft/skills Extraire du contenu sémantique multimodal depuis documents, vidéos, audios et images. 2 878
13 accelerated-computing-cudf nvidia/skills Accélérer des DataFrames pandas sur GPU avec cuDF et dask-cuDF. 2 858
14 aiq-research nvidia/skills Interroger un serveur NVIDIA AI-Q Blueprint pour effectuer des recherches approfondies. 2 858
15 amc-run-video-calibration nvidia/skills Calibrer des vidéos MP4 pré-enregistrées via l'API REST AMC sans scripts CLI. 2 858
16 cuopt-multi-objective-exploration nvidia/skills Tracer une frontière de Pareto multi-objectifs via des solves cuOpt successifs. 2 858
17 cuopt-routing-api-python nvidia/skills Résoudre des problèmes de routage VRP/TSP/PDP avec l'API Python cuOpt. 2 858
18 cupynumeric-hdf5 nvidia/skills Lire et écrire des tableaux cuPyNumeric en fichiers HDF5 en parallèle. 2 858
19 cupynumeric-parallel-data-load nvidia/skills Charger en parallèle des données multi-fichiers fragmentées dans un tableau cupynumeric distribué. 2 858
20 dali-dynamic-mode nvidia/skills Exécuter des pipelines de données DALI en mode impératif Python sans graphe statique. 2 858
21 data-designer nvidia/skills Construire des datasets synthétiques personnalisés via une interface interactive ou automatique. 2 858
22 deepstream-dev nvidia/skills Développer des pipelines DeepStream SDK avec les bonnes pratiques et règles d'architecture NVIDIA. 2 858
23 dicom-metadata-extract nvidia/skills Extraire les métadonnées d'un fichier DICOM et détecter la présence de PHI. 2 858
24 dicom-series-preflight nvidia/skills Analyser les en-têtes d'une série DICOM et émettre un verdict de conformité JSON. 2 858
25 dicom-series-to-volume nvidia/skills Convertir une série DICOM CT en volume NIfTI HU avec affine et résumé JSON. 2 858
26 earth2studio-create-datasource nvidia/skills Implémenter de bout en bout un wrapper de source de données pour Earth2Studio. 2 858
27 earth2studio-data-fetch nvidia/skills Télécharger des données météo/climat via les APIs Earth2Studio avec vérification lexicale. 2 858
28 i4h-catheter-navigation-digital-twin nvidia/skills Construire un jumeau numérique vasculaire à partir d'un volume CT segmenté. 2 858
29 i4h-workflow-dataset-convert nvidia/skills Convertir un enregistrement HDF5 agentic en dataset LeRobot prêt à l'entraînement. 2 858
30 i4h-workflow-dataset-mimic nvidia/skills Augmenter un dataset HDF5 en répliquant des trajectoires avec bruit d'action et d'état. 2 858
31 nemo-data-designer-plugin nvidia/skills Générer un dataset synthétique personnalisé via la bibliothèque Data Designer. 2 858
32 nemotron-retrieval-recipes nvidia/skills Orchestrer les recettes Nemotron d'embedding et de reranking pour optimiser la récupération d'information. 2 858
33 omniverse-cad-to-simready nvidia/skills Convertir un asset CAD en package SimReady via un pipeline bout-en-bout orchestré. 2 858
34 tao-analyze-gaps-visual-changenet nvidia/skills Identifier les échantillons les plus faibles d'un modèle VCN TAO pour cibler l'augmentation. 2 858
35 tao-convert-dataset-format nvidia/skills Convertir des datasets DAFT entre formats supportés via la CLI tao-daft. 2 858
36 tao-generate-video-reasoning-annotations nvidia/skills Générer des datasets d'entraînement vidéo avec raisonnement CoT et paires QA annotées. 2 858
37 tao-route-visual-changenet-samples nvidia/skills Router les labels de gaps VCN vers les modules k-NN Mining et AnomalyGen de façon auditable. 2 858
38 tao-validate-dataset-format nvidia/skills Valider un dataset DAFT avec tao-daft validate et interpréter les résultats. 2 858
39 creating-mermaid-dbt-dag dbt-labs/dbt-agent-skills Générer un diagramme Mermaid visuel du DAG dbt d'un modèle donné. 656
40 migrating-dbt-core-to-fusion dbt-labs/dbt-agent-skills Trier et classer les erreurs de migration dbt pour guider leur résolution. 656
41 migrating-dbt-project-across-platforms dbt-labs/dbt-agent-skills Migrer un projet dbt entre plateformes de données avec validation automatisée. 656
42 running-dbt-commands dbt-labs/dbt-agent-skills Exécuter des commandes dbt efficacement avec sélecteurs, prévisualisation et variables. 656
43 upgrading-dbt-core dbt-labs/dbt-agent-skills Migrer un projet dbt-core v1 vers la version 1.12 en appliquant automatiquement les correctifs adaptés. 656
44 using-dbt-for-analytics-engineering dbt-labs/dbt-agent-skills Construire, modifier et tester des modèles dbt avec rigueur et bonnes pratiques. 656
45 chdb-datastore clickhouse/agent-skills Remplacer pandas par une alternative ClickHouse-backed, plus rapide et sans changer son code. 516
46 chdb-sql clickhouse/agent-skills Exécuter des requêtes SQL ClickHouse en Python sans serveur sur fichiers, bases et cloud. 516
47 airflow astronomer/agents Gérer, diagnostiquer et opérer des workflows Airflow via des commandes CLI dédiées. 419
48 airflow-adapter astronomer/agents Assurer la compatibilité automatique entre les API Airflow 2.x et 3.x. 419
49 airflow-hitl astronomer/agents Intégrer des points de validation humaine dans un DAG Airflow via des opérateurs déférables. 419
50 airflow-state-store astronomer/agents Gérer l'état des tâches Airflow 3.3 avec des stores clé/valeur crash-safe. 419

À propos de cette sélection

L'orchestration de données a longtemps reposé sur des scripts fragiles qu'on ne touchait plus par peur de tout casser. Des acteurs comme Astronomer et dbt Labs ont depuis industrialisé la discipline : DAGs versionnés, transformations testables, lignage de bout en bout. Les skills pipelines de données rassemblés ici couvrent des cas concrets, auditer un pipeline BigQuery pour détecter des dérives de coût ou de fraîcheur, modéliser un dataset pour l'exposer proprement à une couche BI sans multiplier les joins à la main. L'outillage disponible est solide, majoritairement Python, et couvre le spectre du prototypage local au déploiement en production supervisé. Ça parle autant aux data engineers qu'aux ML engineers qui branchent des flux en amont de leurs modèles.