Pipelines de données

Orchestration et transformation de donnees : Airflow, dbt, Astronomer, ETL et ELT.

161 skills

# Skill Source Description Maj
1 omni-to-databricks-metric-view exploreomni/omni-agent-skills Convertir un topic Omni en Databricks Metric View via CLI et YAML. 30 1j
2 cuopt-multi-objective-exploration nvidia/skills Tracer une frontière de Pareto multi-objectifs via des solves cuOpt successifs. 2 858 4j
3 montecarlo-subgroup-prediction divinevideo/divine-mobile Modéliser des sous-groupes de projet avec des simulations Monte Carlo précises et différenciées. 262 4j
4 mini-context-graph github/awesome-copilot Construire et interroger un graphe de connaissances persistant combinant wiki, entités et sources brutes. 37 703 5j
5 upgrading-dbt-core dbt-labs/dbt-agent-skills Migrer un projet dbt-core v1 vers la version 1.12 en appliquant automatiquement les correctifs adaptés. 656 6j
6 airflow-state-store astronomer/agents Gérer l'état des tâches Airflow 3.3 avec des stores clé/valeur crash-safe. 419 6j
7 cupynumeric-parallel-data-load nvidia/skills Charger en parallèle des données multi-fichiers fragmentées dans un tableau cupynumeric distribué. 2 858 11j
8 i4h-catheter-navigation-digital-twin nvidia/skills Construire un jumeau numérique vasculaire à partir d'un volume CT segmenté. 2 858 21j
9 i4h-workflow-dataset-convert nvidia/skills Convertir un enregistrement HDF5 agentic en dataset LeRobot prêt à l'entraînement. 2 858 21j
10 i4h-workflow-dataset-mimic nvidia/skills Augmenter un dataset HDF5 en répliquant des trajectoires avec bruit d'action et d'état. 2 858 21j
11 nemo-data-designer-plugin nvidia/skills Générer un dataset synthétique personnalisé via la bibliothèque Data Designer. 2 858 25j
12 nemotron-retrieval-recipes nvidia/skills Orchestrer les recettes Nemotron d'embedding et de reranking pour optimiser la récupération d'information. 2 858 26j
13 authoring-language-sdk-tasks astronomer/agents Implémenter des tâches Airflow en langages non-Python via des stubs et coordinateurs natifs. 419 26j
14 configuring-airflow-language-sdks astronomer/agents Configurer Airflow pour router les tâches SDK natifs vers le bon coordinateur. 419 26j
15 deepstream-dev nvidia/skills Développer des pipelines DeepStream SDK avec les bonnes pratiques et règles d'architecture NVIDIA. 2 858 28j
16 amc-run-video-calibration nvidia/skills Calibrer des vidéos MP4 pré-enregistrées via l'API REST AMC sans scripts CLI. 2 858 28j
17 migrating-dagster-to-airflow astronomer/agents Migrer un projet Dagster vers Airflow 3 sur Astro Runtime, domaine par domaine. 419 29j
18 aiq-research nvidia/skills Interroger un serveur NVIDIA AI-Q Blueprint pour effectuer des recherches approfondies. 2 858 1mo
19 airflow astronomer/agents Gérer, diagnostiquer et opérer des workflows Airflow via des commandes CLI dédiées. 419 1mo
20 metrics-chart axiomhq/skills Transformer une réponse de requête métriques en graphique temporel multi-séries. 15 1mo
21 earth2studio-create-datasource nvidia/skills Implémenter de bout en bout un wrapper de source de données pour Earth2Studio. 2 858 1mo
22 airflow-hitl astronomer/agents Intégrer des points de validation humaine dans un DAG Airflow via des opérateurs déférables. 419 1mo
23 analyzing-data astronomer/agents Interroger un entrepôt de données pour répondre à des questions métier. 419 1mo
24 authoring-dags astronomer/agents Créer et valider des DAGs Airflow via le CLI af en suivant les bonnes pratiques. 419 1mo
25 cosmos-dbt-core astronomer/agents Intégrer dbt Core dans Airflow via Cosmos avec la configuration optimale. 419 1mo
26 cosmos-dbt-fusion astronomer/agents Intégrer dbt Fusion avec Cosmos dans Airflow en suivant une checklist d'implémentation structurée. 419 1mo
27 dag-factory astronomer/agents Générer des DAGs Apache Airflow déclarativement depuis des fichiers YAML avec dag-factory. 419 1mo
28 debugging-dags astronomer/agents Diagnostiquer et résoudre les échecs de DAGs Airflow avec des actions correctives ciblées. 419 1mo
29 migrating-ai-sdk-to-common-ai astronomer/agents Migrer un projet Airflow de airflow-ai-sdk vers apache-airflow-providers-common-ai. 419 1mo
30 cuopt-routing-api-python nvidia/skills Résoudre des problèmes de routage VRP/TSP/PDP avec l'API Python cuOpt. 2 858 1mo
31 tao-analyze-gaps-visual-changenet nvidia/skills Identifier les échantillons les plus faibles d'un modèle VCN TAO pour cibler l'augmentation. 2 858 1mo
32 tao-convert-dataset-format nvidia/skills Convertir des datasets DAFT entre formats supportés via la CLI tao-daft. 2 858 1mo
33 tao-route-visual-changenet-samples nvidia/skills Router les labels de gaps VCN vers les modules k-NN Mining et AnomalyGen de façon auditable. 2 858 1mo
34 tao-validate-dataset-format nvidia/skills Valider un dataset DAFT avec tao-daft validate et interpréter les résultats. 2 858 1mo
35 using-dbt-for-analytics-engineering dbt-labs/dbt-agent-skills Construire, modifier et tester des modèles dbt avec rigueur et bonnes pratiques. 656 1mo
36 dali-dynamic-mode nvidia/skills Exécuter des pipelines de données DALI en mode impératif Python sans graphe statique. 2 858 1mo
37 blueprint astronomer/agents Composer des DAGs Airflow en YAML via des templates Python réutilisables et validés. 419 1mo
38 tao-generate-video-reasoning-annotations nvidia/skills Générer des datasets d'entraînement vidéo avec raisonnement CoT et paires QA annotées. 2 858 2mo
39 data-designer nvidia/skills Construire des datasets synthétiques personnalisés via une interface interactive ou automatique. 2 858 2mo
40 ucsc-conservation-and-tfbs mkurman/zorai Récupérer les scores de conservation évolutive et sites TFBS via UCSC. 321 2mo
41 unibind-database mkurman/zorai Interroger la base de données UniBind pour explorer les interactions TF–ADN multi-espèces. 321 2mo
42 uniprot-database mkurman/zorai Interroger la base UniProt pour découvrir, récupérer et cartographier des données protéiques. 321 2mo
43 chembl-database mkurman/zorai Interroger la base ChEMBL pour récupérer données moléculaires, cibles et bioactivités. 321 2mo
44 clinical-trials-database mkurman/zorai Interroger la base ClinicalTrials.gov pour rechercher et filtrer des essais cliniques mondiaux. 321 2mo
45 clinvar-database mkurman/zorai Interroger la base ClinVar pour obtenir classifications cliniques et données de variants génomiques. 321 2mo
46 dbsnp-database mkurman/zorai Interroger la base dbSNP pour mapper, résoudre et récupérer des variants génomiques. 321 2mo
47 embl-ebi-ols mkurman/zorai Interroger et explorer des ontologies biologiques via l'API EBI OLS. 321 2mo
48 encode-ccres-database mkurman/zorai Interroger la base ENCODE pour identifier des éléments régulateurs non-codants via l'API SCREEN. 321 2mo
49 ensembl-database mkurman/zorai Interroger l'API Ensembl pour mapper, résoudre et récupérer des données génomiques. 321 2mo
50 gnomad-database mkurman/zorai Interroger la base gnomAD pour obtenir fréquences alléliques et contraintes géniques. 321 2mo

À propos de cette sélection

L'orchestration de données a longtemps reposé sur des scripts fragiles qu'on ne touchait plus par peur de tout casser. Des acteurs comme Astronomer et dbt Labs ont depuis industrialisé la discipline : DAGs versionnés, transformations testables, lignage de bout en bout. Les skills pipelines de données rassemblés ici couvrent des cas concrets, auditer un pipeline BigQuery pour détecter des dérives de coût ou de fraîcheur, modéliser un dataset pour l'exposer proprement à une couche BI sans multiplier les joins à la main. L'outillage disponible est solide, majoritairement Python, et couvre le spectre du prototypage local au déploiement en production supervisé. Ça parle autant aux data engineers qu'aux ML engineers qui branchent des flux en amont de leurs modèles.