Pipelines de données
Orchestration et transformation de donnees : Airflow, dbt, Astronomer, ETL et ELT.
| # | Skill | Source | Description | Maj | |
|---|---|---|---|---|---|
| 1 | vss-search-archive | nvidia-ai-blueprints/video-search-and-summarization | Rechercher dans des archives vidéo via CLI VSS en respectant les sources exactes. | 1 875 | 2j |
| 2 | upgrading-dbt | dbt-labs/dbt-agent-skills | Migrer un projet dbt v1 vers la version 1.12 en appliquant les correctifs adaptés. | 726 | 2j |
| 3 | paidf-augmentation | nvidia/skills | Orchestrer un pipeline d'augmentation de données visuelles via des modèles génératifs NVIDIA distants. | 3 438 | 2j |
| 4 | tao-data-io | nvidia/skills | Gérer le transfert de données vers et depuis un conteneur de calcul IA selon la stratégie de… | 3 438 | 3j |
| 5 | tao-mine-nearest-neighbors | nvidia/skills | Exécuter un minage de voisins les plus proches sur des embeddings parquet via TAO Data Services. | 3 438 | 3j |
| 6 | tao-mine-od-images | nvidia/skills | Lancer le minage TAO pour sélectionner des images uniques via correspondance de voisins. | 3 438 | 3j |
| 7 | tao-analyze-gaps-visual-changenet | nvidia/skills | Identifier les échantillons les plus faibles d'un modèle VCN TAO pour cibler l'augmentation. | 3 438 | 3j |
| 8 | tao-convert-dataset-format | nvidia/skills | Convertir des datasets DAFT entre formats supportés via la CLI tao-daft. | 3 438 | 3j |
| 9 | tao-generate-video-reasoning-annotations | nvidia/skills | Générer des datasets d'entraînement vidéo avec raisonnement CoT et paires QA annotées. | 3 438 | 3j |
| 10 | tao-route-visual-changenet-samples | nvidia/skills | Router les labels de gaps VCN vers les modules k-NN Mining et AnomalyGen de façon auditable. | 3 438 | 3j |
| 11 | tao-validate-dataset-format | nvidia/skills | Valider un dataset DAFT avec tao-daft validate et interpréter les résultats. | 3 438 | 3j |
| 12 | omni-to-dbt-metricflow | exploreomni/omni-agent-skills | Exporter la logique d'un modèle Omni vers des fichiers YAML dbt MetricFlow. | 39 | 7j |
| 13 | airflow-state-store | astronomer/agents | Gérer l'état des tâches Airflow 3.3 avec des stores clé/valeur crash-safe. | 445 | 8j |
| 14 | accelerated-computing-cudf | nvidia/skills | Accélérer des DataFrames pandas sur GPU avec cuDF et dask-cuDF. | 3 438 | 10j |
| 15 | dicom-metadata-extract | nvidia/skills | Extraire les métadonnées d'un fichier DICOM et détecter la présence de PHI. | 3 438 | 10j |
| 16 | dicom-series-preflight | nvidia/skills | Analyser les en-têtes d'une série DICOM et émettre un verdict de conformité JSON. | 3 438 | 10j |
| 17 | dicom-series-to-volume | nvidia/skills | Convertir une série DICOM CT en volume NIfTI HU avec affine et résumé JSON. | 3 438 | 10j |
| 18 | medtech-model-evidence-export | nvidia/skills | Exporter des résultats d'inférence médicale vers MLflow via un pack d'évidence post-hoc. | 3 438 | 10j |
| 19 | nvflare-fed-stats | nvidia/skills | Calculer des statistiques fédérées sur des données tabulaires ou images via NVFLARE. | 3 438 | 12j |
| 20 | blueprint | astronomer/agents | Composer des DAGs Airflow en YAML via des templates Python réutilisables et validés. | 445 | 14j |
| 21 | exploring-mcp-tool-original-user-motive | posthog/skills | Reconstruire les intentions utilisateur initiales derrière les sessions d'appels MCP et les publier en notebook. | 63 | 14j |
| 22 | dagster-expert | dagster-io/skills | Rediriger l'utilisateur vers le plugin Dagster officiel en remplacement d'un plugin déprécié. | 208 | 15j |
| 23 | dagster-expert | dagster-io/skills | Configurer et piloter des pipelines Dagster via CLI, MCP et intégrations externes. | 208 | 15j |
| 24 | managing-streamlit-apps | posthog/skills | Créer, déployer et gérer des apps Streamlit Python dans PostHog via des outils MCP. | 63 | 16j |
| 25 | i4h-workflow-dataset-convert | nvidia/skills | Convertir un enregistrement HDF5 agentic en dataset LeRobot prêt à l'entraînement. | 3 438 | 21j |
| 26 | i4h-workflow-dataset-mimic | nvidia/skills | Augmenter un dataset HDF5 en répliquant des trajectoires avec bruit d'action et d'état. | 3 438 | 21j |
| 27 | deepstream-dev | nvidia/skills | Développer des pipelines DeepStream SDK avec les bonnes pratiques et règles d'architecture NVIDIA. | 3 438 | 21j |
| 28 | amc-run-video-calibration | nvidia/skills | Calibrer des vidéos MP4 pré-enregistrées via l'API REST AMC sans scripts CLI. | 3 438 | 21j |
| 29 | migrating-dbt-project-across-platforms | dbt-labs/dbt-agent-skills | Migrer un projet dbt entre plateformes de données avec validation automatisée. | 726 | 22j |
| 30 | omni-to-databricks-metric-view | exploreomni/omni-agent-skills | Convertir un topic Omni en Databricks Metric View via CLI et YAML. | 39 | 23j |
| 31 | omniverse-cad-to-simready | nvidia/skills | Convertir un asset CAD en package SimReady via un pipeline bout-en-bout orchestré. | 3 438 | 24j |
| 32 | cuopt-routing-api-python | nvidia/skills | Résoudre des problèmes de routage VRP/TSP/PDP avec l'API Python cuOpt. | 3 438 | 1mo |
| 33 | cuopt-multi-objective-exploration | nvidia/skills | Tracer une frontière de Pareto multi-objectifs via des solves cuOpt successifs. | 3 438 | 1mo |
| 34 | montecarlo-subgroup-prediction | divinevideo/divine-mobile | Modéliser des sous-groupes de projet avec des simulations Monte Carlo précises et différenciées. | 265 | 1mo |
| 35 | mini-context-graph | github/awesome-copilot | Construire et interroger un graphe de connaissances persistant combinant wiki, entités et sources brutes. | 39 398 | 1mo |
| 36 | nemotron-retrieval-recipes | nvidia/skills | Orchestrer les recettes Nemotron d'embedding et de reranking pour optimiser la récupération d'information. | 3 438 | 2mo |
| 37 | authoring-language-sdk-tasks | astronomer/agents | Implémenter des tâches Airflow en langages non-Python via des stubs et coordinateurs natifs. | 445 | 2mo |
| 38 | configuring-airflow-language-sdks | astronomer/agents | Configurer Airflow pour router les tâches SDK natifs vers le bon coordinateur. | 445 | 2mo |
| 39 | migrating-dagster-to-airflow | astronomer/agents | Migrer un projet Dagster vers Airflow 3 sur Astro Runtime, domaine par domaine. | 445 | 2mo |
| 40 | aiq-research | nvidia/skills | Interroger un serveur NVIDIA AI-Q Blueprint pour effectuer des recherches approfondies. | 3 438 | 2mo |
| 41 | airflow | astronomer/agents | Gérer, diagnostiquer et opérer des workflows Airflow via des commandes CLI dédiées. | 445 | 2mo |
| 42 | metrics-chart | axiomhq/skills | Transformer une réponse de requête métriques en graphique temporel multi-séries. | 16 | 2mo |
| 43 | earth2studio-create-datasource | nvidia/skills | Implémenter de bout en bout un wrapper de source de données pour Earth2Studio. | 3 438 | 2mo |
| 44 | airflow-hitl | astronomer/agents | Intégrer des points de validation humaine dans un DAG Airflow via des opérateurs déférables. | 445 | 2mo |
| 45 | analyzing-data | astronomer/agents | Interroger un entrepôt de données pour répondre à des questions métier. | 445 | 2mo |
| 46 | authoring-dags | astronomer/agents | Créer et valider des DAGs Airflow via le CLI af en suivant les bonnes pratiques. | 445 | 2mo |
| 47 | cosmos-dbt-core | astronomer/agents | Intégrer dbt Core dans Airflow via Cosmos avec la configuration optimale. | 445 | 2mo |
| 48 | cosmos-dbt-fusion | astronomer/agents | Intégrer dbt Fusion avec Cosmos dans Airflow en suivant une checklist d'implémentation structurée. | 445 | 2mo |
| 49 | dag-factory | astronomer/agents | Générer des DAGs Apache Airflow déclarativement depuis des fichiers YAML avec dag-factory. | 445 | 2mo |
| 50 | debugging-dags | astronomer/agents | Diagnostiquer et résoudre les échecs de DAGs Airflow avec des actions correctives ciblées. | 445 | 2mo |
À propos de cette sélection
L'orchestration de données a longtemps reposé sur des scripts fragiles qu'on ne touchait plus par peur de tout casser. Des acteurs comme Astronomer et dbt Labs ont depuis industrialisé la discipline : DAGs versionnés, transformations testables, lignage de bout en bout. Les skills pipelines de données rassemblés ici couvrent des cas concrets, auditer un pipeline BigQuery pour détecter des dérives de coût ou de fraîcheur, modéliser un dataset pour l'exposer proprement à une couche BI sans multiplier les joins à la main. L'outillage disponible est solide, majoritairement Python, et couvre le spectre du prototypage local au déploiement en production supervisé. Ça parle autant aux data engineers qu'aux ML engineers qui branchent des flux en amont de leurs modèles.