Pipelines de données
Orchestration et transformation de donnees : Airflow, dbt, Astronomer, ETL et ELT.
| # | Skill | Source | Description | Maj | |
|---|---|---|---|---|---|
| 1 | omni-to-databricks-metric-view | exploreomni/omni-agent-skills | Convertir un topic Omni en Databricks Metric View via CLI et YAML. | 30 | 1j |
| 2 | cuopt-multi-objective-exploration | nvidia/skills | Tracer une frontière de Pareto multi-objectifs via des solves cuOpt successifs. | 2 858 | 4j |
| 3 | montecarlo-subgroup-prediction | divinevideo/divine-mobile | Modéliser des sous-groupes de projet avec des simulations Monte Carlo précises et différenciées. | 262 | 4j |
| 4 | mini-context-graph | github/awesome-copilot | Construire et interroger un graphe de connaissances persistant combinant wiki, entités et sources brutes. | 37 703 | 5j |
| 5 | upgrading-dbt-core | dbt-labs/dbt-agent-skills | Migrer un projet dbt-core v1 vers la version 1.12 en appliquant automatiquement les correctifs adaptés. | 656 | 6j |
| 6 | airflow-state-store | astronomer/agents | Gérer l'état des tâches Airflow 3.3 avec des stores clé/valeur crash-safe. | 419 | 6j |
| 7 | cupynumeric-parallel-data-load | nvidia/skills | Charger en parallèle des données multi-fichiers fragmentées dans un tableau cupynumeric distribué. | 2 858 | 11j |
| 8 | i4h-catheter-navigation-digital-twin | nvidia/skills | Construire un jumeau numérique vasculaire à partir d'un volume CT segmenté. | 2 858 | 21j |
| 9 | i4h-workflow-dataset-convert | nvidia/skills | Convertir un enregistrement HDF5 agentic en dataset LeRobot prêt à l'entraînement. | 2 858 | 21j |
| 10 | i4h-workflow-dataset-mimic | nvidia/skills | Augmenter un dataset HDF5 en répliquant des trajectoires avec bruit d'action et d'état. | 2 858 | 21j |
| 11 | nemo-data-designer-plugin | nvidia/skills | Générer un dataset synthétique personnalisé via la bibliothèque Data Designer. | 2 858 | 25j |
| 12 | nemotron-retrieval-recipes | nvidia/skills | Orchestrer les recettes Nemotron d'embedding et de reranking pour optimiser la récupération d'information. | 2 858 | 26j |
| 13 | authoring-language-sdk-tasks | astronomer/agents | Implémenter des tâches Airflow en langages non-Python via des stubs et coordinateurs natifs. | 419 | 26j |
| 14 | configuring-airflow-language-sdks | astronomer/agents | Configurer Airflow pour router les tâches SDK natifs vers le bon coordinateur. | 419 | 26j |
| 15 | deepstream-dev | nvidia/skills | Développer des pipelines DeepStream SDK avec les bonnes pratiques et règles d'architecture NVIDIA. | 2 858 | 28j |
| 16 | amc-run-video-calibration | nvidia/skills | Calibrer des vidéos MP4 pré-enregistrées via l'API REST AMC sans scripts CLI. | 2 858 | 28j |
| 17 | migrating-dagster-to-airflow | astronomer/agents | Migrer un projet Dagster vers Airflow 3 sur Astro Runtime, domaine par domaine. | 419 | 29j |
| 18 | aiq-research | nvidia/skills | Interroger un serveur NVIDIA AI-Q Blueprint pour effectuer des recherches approfondies. | 2 858 | 1mo |
| 19 | airflow | astronomer/agents | Gérer, diagnostiquer et opérer des workflows Airflow via des commandes CLI dédiées. | 419 | 1mo |
| 20 | metrics-chart | axiomhq/skills | Transformer une réponse de requête métriques en graphique temporel multi-séries. | 15 | 1mo |
| 21 | earth2studio-create-datasource | nvidia/skills | Implémenter de bout en bout un wrapper de source de données pour Earth2Studio. | 2 858 | 1mo |
| 22 | airflow-hitl | astronomer/agents | Intégrer des points de validation humaine dans un DAG Airflow via des opérateurs déférables. | 419 | 1mo |
| 23 | analyzing-data | astronomer/agents | Interroger un entrepôt de données pour répondre à des questions métier. | 419 | 1mo |
| 24 | authoring-dags | astronomer/agents | Créer et valider des DAGs Airflow via le CLI af en suivant les bonnes pratiques. | 419 | 1mo |
| 25 | cosmos-dbt-core | astronomer/agents | Intégrer dbt Core dans Airflow via Cosmos avec la configuration optimale. | 419 | 1mo |
| 26 | cosmos-dbt-fusion | astronomer/agents | Intégrer dbt Fusion avec Cosmos dans Airflow en suivant une checklist d'implémentation structurée. | 419 | 1mo |
| 27 | dag-factory | astronomer/agents | Générer des DAGs Apache Airflow déclarativement depuis des fichiers YAML avec dag-factory. | 419 | 1mo |
| 28 | debugging-dags | astronomer/agents | Diagnostiquer et résoudre les échecs de DAGs Airflow avec des actions correctives ciblées. | 419 | 1mo |
| 29 | migrating-ai-sdk-to-common-ai | astronomer/agents | Migrer un projet Airflow de airflow-ai-sdk vers apache-airflow-providers-common-ai. | 419 | 1mo |
| 30 | cuopt-routing-api-python | nvidia/skills | Résoudre des problèmes de routage VRP/TSP/PDP avec l'API Python cuOpt. | 2 858 | 1mo |
| 31 | tao-analyze-gaps-visual-changenet | nvidia/skills | Identifier les échantillons les plus faibles d'un modèle VCN TAO pour cibler l'augmentation. | 2 858 | 1mo |
| 32 | tao-convert-dataset-format | nvidia/skills | Convertir des datasets DAFT entre formats supportés via la CLI tao-daft. | 2 858 | 1mo |
| 33 | tao-route-visual-changenet-samples | nvidia/skills | Router les labels de gaps VCN vers les modules k-NN Mining et AnomalyGen de façon auditable. | 2 858 | 1mo |
| 34 | tao-validate-dataset-format | nvidia/skills | Valider un dataset DAFT avec tao-daft validate et interpréter les résultats. | 2 858 | 1mo |
| 35 | using-dbt-for-analytics-engineering | dbt-labs/dbt-agent-skills | Construire, modifier et tester des modèles dbt avec rigueur et bonnes pratiques. | 656 | 1mo |
| 36 | dali-dynamic-mode | nvidia/skills | Exécuter des pipelines de données DALI en mode impératif Python sans graphe statique. | 2 858 | 1mo |
| 37 | blueprint | astronomer/agents | Composer des DAGs Airflow en YAML via des templates Python réutilisables et validés. | 419 | 1mo |
| 38 | tao-generate-video-reasoning-annotations | nvidia/skills | Générer des datasets d'entraînement vidéo avec raisonnement CoT et paires QA annotées. | 2 858 | 2mo |
| 39 | data-designer | nvidia/skills | Construire des datasets synthétiques personnalisés via une interface interactive ou automatique. | 2 858 | 2mo |
| 40 | ucsc-conservation-and-tfbs | mkurman/zorai | Récupérer les scores de conservation évolutive et sites TFBS via UCSC. | 321 | 2mo |
| 41 | unibind-database | mkurman/zorai | Interroger la base de données UniBind pour explorer les interactions TF–ADN multi-espèces. | 321 | 2mo |
| 42 | uniprot-database | mkurman/zorai | Interroger la base UniProt pour découvrir, récupérer et cartographier des données protéiques. | 321 | 2mo |
| 43 | chembl-database | mkurman/zorai | Interroger la base ChEMBL pour récupérer données moléculaires, cibles et bioactivités. | 321 | 2mo |
| 44 | clinical-trials-database | mkurman/zorai | Interroger la base ClinicalTrials.gov pour rechercher et filtrer des essais cliniques mondiaux. | 321 | 2mo |
| 45 | clinvar-database | mkurman/zorai | Interroger la base ClinVar pour obtenir classifications cliniques et données de variants génomiques. | 321 | 2mo |
| 46 | dbsnp-database | mkurman/zorai | Interroger la base dbSNP pour mapper, résoudre et récupérer des variants génomiques. | 321 | 2mo |
| 47 | embl-ebi-ols | mkurman/zorai | Interroger et explorer des ontologies biologiques via l'API EBI OLS. | 321 | 2mo |
| 48 | encode-ccres-database | mkurman/zorai | Interroger la base ENCODE pour identifier des éléments régulateurs non-codants via l'API SCREEN. | 321 | 2mo |
| 49 | ensembl-database | mkurman/zorai | Interroger l'API Ensembl pour mapper, résoudre et récupérer des données génomiques. | 321 | 2mo |
| 50 | gnomad-database | mkurman/zorai | Interroger la base gnomAD pour obtenir fréquences alléliques et contraintes géniques. | 321 | 2mo |
À propos de cette sélection
L'orchestration de données a longtemps reposé sur des scripts fragiles qu'on ne touchait plus par peur de tout casser. Des acteurs comme Astronomer et dbt Labs ont depuis industrialisé la discipline : DAGs versionnés, transformations testables, lignage de bout en bout. Les skills pipelines de données rassemblés ici couvrent des cas concrets, auditer un pipeline BigQuery pour détecter des dérives de coût ou de fraîcheur, modéliser un dataset pour l'exposer proprement à une couche BI sans multiplier les joins à la main. L'outillage disponible est solide, majoritairement Python, et couvre le spectre du prototypage local au déploiement en production supervisé. Ça parle autant aux data engineers qu'aux ML engineers qui branchent des flux en amont de leurs modèles.