Pipelines de données

Orchestration et transformation de donnees : Airflow, dbt, Astronomer, ETL et ELT.

167 skills

# Skill Source Description Δ
1 instrument-data-to-allotrope anthropics/knowledge-work-plugins Convertir des fichiers instruments au format standardisé Allotrope Simple Model pour LIMS. 25 631 551
2 nextflow-development anthropics/knowledge-work-plugins Déployer et exécuter des pipelines bioinformatiques nf-core sur données locales ou publiques. 25 631 551
3 single-cell-rna-qc anthropics/knowledge-work-plugins Automatiser le contrôle qualité de données single-cell RNA-seq selon les bonnes pratiques scverse. 25 631 551
4 create-viz anthropics/knowledge-work-plugins Générer des visualisations de données professionnelles avec Python selon les meilleures pratiques. 25 631 551
5 bigquery-pipeline-audit github/awesome-copilot Auditer un pipeline BigQuery pour coûts, sécurité et fiabilité en production. 39 398 236
6 mini-context-graph github/awesome-copilot Construire et interroger un graphe de connaissances persistant combinant wiki, entités et sources brutes. 39 398 236
7 upload-parity-experiments harbor-framework/harbor Publier des résultats d'expériences de parité Harbor sur Hugging Face via Git sparse checkout. 5 610 198
8 airflow-dag-patterns wshobson/agents Orchestrer des pipelines de données Apache Airflow avec patterns, opérateurs et déploiement. 39 977 168
9 data-quality-frameworks wshobson/agents Implémenter des frameworks de qualité de données avec Great Expectations, dbt et contrats. 39 977 168
10 spark-optimization wshobson/agents Optimiser les jobs Apache Spark avec partitionnement, mémoire et gestion des shuffles. 39 977 168
11 risk-metrics-calculation wshobson/agents Calculer la VaR, CVaR et métriques de risque pour la gestion de portefeuille. 39 977 168
12 cuopt-routing-api-python nvidia/skills Résoudre des problèmes de routage VRP/TSP/PDP avec l'API Python cuOpt. 3 438 84
13 deepstream-dev nvidia/skills Développer des pipelines DeepStream SDK avec les bonnes pratiques et règles d'architecture NVIDIA. 3 438 84
14 dali-dynamic-mode nvidia/skills Exécuter des pipelines de données DALI en mode impératif Python sans graphe statique. 3 438 84
15 aiq-research nvidia/skills Interroger un serveur NVIDIA AI-Q Blueprint pour effectuer des recherches approfondies. 3 438 84
16 omniverse-cad-to-simready nvidia/skills Convertir un asset CAD en package SimReady via un pipeline bout-en-bout orchestré. 3 438 84
17 earth2studio-data-fetch nvidia/skills Télécharger des données météo/climat via les APIs Earth2Studio avec vérification lexicale. 3 438 84
18 accelerated-computing-cudf nvidia/skills Accélérer des DataFrames pandas sur GPU avec cuDF et dask-cuDF. 3 438 84
19 nemotron-retrieval-recipes nvidia/skills Orchestrer les recettes Nemotron d'embedding et de reranking pour optimiser la récupération d'information. 3 438 84
20 dicom-metadata-extract nvidia/skills Extraire les métadonnées d'un fichier DICOM et détecter la présence de PHI. 3 438 84
21 dicom-series-preflight nvidia/skills Analyser les en-têtes d'une série DICOM et émettre un verdict de conformité JSON. 3 438 84
22 dicom-series-to-volume nvidia/skills Convertir une série DICOM CT en volume NIfTI HU avec affine et résumé JSON. 3 438 84
23 data-designer nvidia/skills Construire des datasets synthétiques personnalisés via une interface interactive ou automatique. 3 438 84
24 tao-analyze-gaps-visual-changenet nvidia/skills Identifier les échantillons les plus faibles d'un modèle VCN TAO pour cibler l'augmentation. 3 438 84
25 tao-convert-dataset-format nvidia/skills Convertir des datasets DAFT entre formats supportés via la CLI tao-daft. 3 438 84
26 tao-generate-video-reasoning-annotations nvidia/skills Générer des datasets d'entraînement vidéo avec raisonnement CoT et paires QA annotées. 3 438 84
27 tao-route-visual-changenet-samples nvidia/skills Router les labels de gaps VCN vers les modules k-NN Mining et AnomalyGen de façon auditable. 3 438 84
28 tao-validate-dataset-format nvidia/skills Valider un dataset DAFT avec tao-daft validate et interpréter les résultats. 3 438 84
29 cuopt-multi-objective-exploration nvidia/skills Tracer une frontière de Pareto multi-objectifs via des solves cuOpt successifs. 3 438 84
30 amc-run-video-calibration nvidia/skills Calibrer des vidéos MP4 pré-enregistrées via l'API REST AMC sans scripts CLI. 3 438 84
31 earth2studio-create-datasource nvidia/skills Implémenter de bout en bout un wrapper de source de données pour Earth2Studio. 3 438 84
32 i4h-workflow-dataset-convert nvidia/skills Convertir un enregistrement HDF5 agentic en dataset LeRobot prêt à l'entraînement. 3 438 84
33 i4h-workflow-dataset-mimic nvidia/skills Augmenter un dataset HDF5 en répliquant des trajectoires avec bruit d'action et d'état. 3 438 84
34 medtech-model-evidence-export nvidia/skills Exporter des résultats d'inférence médicale vers MLflow via un pack d'évidence post-hoc. 3 438 84
35 paidf-augmentation nvidia/skills Orchestrer un pipeline d'augmentation de données visuelles via des modèles génératifs NVIDIA distants. 3 438 84
36 tao-mine-nearest-neighbors nvidia/skills Exécuter un minage de voisins les plus proches sur des embeddings parquet via TAO Data Services. 3 438 84
37 tao-mine-od-images nvidia/skills Lancer le minage TAO pour sélectionner des images uniques via correspondance de voisins. 3 438 84
38 nvflare-fed-stats nvidia/skills Calculer des statistiques fédérées sur des données tabulaires ou images via NVFLARE. 3 438 84
39 tao-data-io nvidia/skills Gérer le transfert de données vers et depuis un conteneur de calcul IA selon la stratégie de… 3 438 84
40 azure-ai-contentunderstanding-py microsoft/skills Extraire du contenu sémantique multimodal depuis documents, vidéos, audios et images. 3 052 18
41 creating-mermaid-dbt-dag dbt-labs/dbt-agent-skills Générer un diagramme Mermaid visuel du DAG dbt d'un modèle donné. 726 7
42 migrating-dbt-project-across-platforms dbt-labs/dbt-agent-skills Migrer un projet dbt entre plateformes de données avec validation automatisée. 726 7
43 running-dbt-commands dbt-labs/dbt-agent-skills Exécuter des commandes dbt efficacement avec sélecteurs, prévisualisation et variables. 726 7
44 using-dbt-for-analytics-engineering dbt-labs/dbt-agent-skills Construire, modifier et tester des modèles dbt avec rigueur et bonnes pratiques. 726 7
45 upgrading-dbt dbt-labs/dbt-agent-skills Migrer un projet dbt v1 vers la version 1.12 en appliquant les correctifs adaptés. 726 7
46 chdb-datastore clickhouse/agent-skills Remplacer pandas par une alternative ClickHouse-backed, plus rapide et sans changer son code. 541 5
47 chdb-sql clickhouse/agent-skills Exécuter des requêtes SQL ClickHouse en Python sans serveur sur fichiers, bases et cloud. 541 5
48 vss-search-archive nvidia-ai-blueprints/video-search-and-summarization Rechercher dans des archives vidéo via CLI VSS en respectant les sources exactes. 1 875 5
49 dagster-expert dagster-io/skills Rediriger l'utilisateur vers le plugin Dagster officiel en remplacement d'un plugin déprécié. 208 3
50 dagster-expert dagster-io/skills Configurer et piloter des pipelines Dagster via CLI, MCP et intégrations externes. 208 3

À propos de cette sélection

L'orchestration de données a longtemps reposé sur des scripts fragiles qu'on ne touchait plus par peur de tout casser. Des acteurs comme Astronomer et dbt Labs ont depuis industrialisé la discipline : DAGs versionnés, transformations testables, lignage de bout en bout. Les skills pipelines de données rassemblés ici couvrent des cas concrets, auditer un pipeline BigQuery pour détecter des dérives de coût ou de fraîcheur, modéliser un dataset pour l'exposer proprement à une couche BI sans multiplier les joins à la main. L'outillage disponible est solide, majoritairement Python, et couvre le spectre du prototypage local au déploiement en production supervisé. Ça parle autant aux data engineers qu'aux ML engineers qui branchent des flux en amont de leurs modèles.