Training & Fine-tuning
Entrainement et fine-tuning de modeles, MLOps, recherche scientifique.
| # | Skill | Source | Description | Δ | |
|---|---|---|---|---|---|
| 1 | arize-annotation | github/awesome-copilot | Créer et gérer des configs d'annotation pour labelliser des spans IA via Arize. | 37 703 | 221 |
| 2 | arize-experiment | github/awesome-copilot | Gérer et exporter des expériences d'évaluation de modèles IA via Arize. | 37 703 | 221 |
| 3 | datanalysis-credit-risk | github/awesome-copilot | Nettoyer et sélectionner des variables pour modélisation de risque crédit. | 37 703 | 221 |
| 4 | ml-pipeline-workflow | wshobson/agents | Orchestrer un pipeline MLOps complet de l'ingestion des données au déploiement en production. | 38 718 | 202 |
| 5 | backtesting-frameworks | wshobson/agents | Construire des systèmes de backtesting robustes pour évaluer fiablement des stratégies de trading. | 38 718 | 202 |
| 6 | spark-environment-setup | wshobson/agents | Configurer et déboguer un environnement ML sur DGX Spark avec CUDA 13. | 38 718 | 202 |
| 7 | spark-memory-thermal-ops | wshobson/agents | Gérer la mémoire unifiée et les thermiques du DGX Spark GB10 efficacement. | 38 718 | 202 |
| 8 | spark-training-gotchas | wshobson/agents | Diagnostiquer et corriger les dix pannes récurrentes d'entraînement sur DGX Spark GB10. | 38 718 | 202 |
| 9 | grpo-rlvr-training | wshobson/agents | Configurer et lancer un entraînement GRPO/RLVR avec récompenses vérifiables. | 38 718 | 202 |
| 10 | lora-qlora-recipes | wshobson/agents | Configurer des adaptateurs LoRA et QLoRA optimaux pour le fine-tuning SFT supervisé. | 38 718 | 202 |
| 11 | preference-optimization | wshobson/agents | Sélectionner et configurer la méthode optimale d'alignement par préférences (DPO, ORPO, KTO, SimPO). | 38 718 | 202 |
| 12 | quantized-export | wshobson/agents | Exporter un checkpoint promu au bon format quantifié selon la cible matérielle. | 38 718 | 202 |
| 13 | vision-sft | wshobson/agents | Configurer et affiner un modèle vision-langage avec LoRA/QLoRA de façon optimale. | 38 718 | 202 |
| 14 | scvi-tools | anthropics/knowledge-work-plugins | Analyser des données single-cell multi-modales avec les modèles probabilistes scvi-tools. | 23 436 | 113 |
| 15 | statistical-analysis | anthropics/knowledge-work-plugins | Analyser des données statistiques avec tendances, distributions et tests d'hypothèses. | 23 436 | 113 |
| 16 | aoti-debug | pytorch/pytorch | Diagnostiquer et corriger les erreurs courantes d'AOTInductor avec méthode. | 102 323 | 110 |
| 17 | pt2-bug-basher | pytorch/pytorch | Déboguer les erreurs de compilation PyTorch 2 via Dynamo, Inductor et AOTAutograd. | 102 323 | 110 |
| 18 | cudaq-guide | nvidia/skills | Guider l'utilisateur dans CUDA-Q : installation, simulation GPU et accès QPU. | 2 858 | 60 |
| 19 | cuopt-install | nvidia/skills | Installer cuOpt via pip, conda ou Docker pour Python, C ou REST. | 2 858 | 60 |
| 20 | deepstream-import-vision-model | nvidia/skills | Importer et benchmarker des modèles de détection d'objets dans DeepStream via TensorRT. | 2 858 | 60 |
| 21 | nemo-automodel-distributed-training | nvidia/skills | Configurer l'entraînement distribué PyTorch avec stratégies FSDP2, MegatronFSDP ou DDP. | 2 858 | 60 |
| 22 | nemo-automodel-model-onboarding | nvidia/skills | Intégrer de nouvelles architectures de modèles IA dans NeMo AutoModel. | 2 858 | 60 |
| 23 | nemo-automodel-recipe-development | nvidia/skills | Configurer et exécuter des recettes de fine-tuning NeMo AutoModel via YAML et CLI. | 2 858 | 60 |
| 24 | cupynumeric-install | nvidia/skills | Installer et vérifier cuPyNumeric via conda ou pip sur GPU ou CPU. | 2 858 | 60 |
| 25 | nemotron-customize | nvidia/skills | Configurer et orchestrer des pipelines d'entraînement Nemotron via des configs YAML. | 2 858 | 60 |
| 26 | rag-eval | nvidia/skills | Évaluer la qualité d'un pipeline RAG NVIDIA via filesystem benchmarks et RAGAS. | 2 858 | 60 |
| 27 | nemo-mbridge-mlm-bridge-training | nvidia/skills | Comparer et valider les pertes entre Megatron-LM et Bridge sur GPU. | 2 858 | 60 |
| 28 | nemo-mbridge-multi-node-slurm | nvidia/skills | Convertir des commandes distribuées PyTorch en scripts Slurm multi-nœuds avec conteneurs Enroot. | 2 858 | 60 |
| 29 | nemo-mbridge-perf-activation-recompute | nvidia/skills | Réduire la mémoire GPU en recompilant les activations selon différentes granularités configurables. | 2 858 | 60 |
| 30 | nemo-mbridge-perf-cpu-offloading | nvidia/skills | Configurer le déchargement CPU des activations ou états optimiseur pour libérer la mémoire GPU. | 2 858 | 60 |
| 31 | nemo-mbridge-perf-cuda-graphs | nvidia/skills | Configurer et optimiser les CUDA graphs pour accélérer l'entraînement de modèles GPU. | 2 858 | 60 |
| 32 | nemo-mbridge-perf-expert-parallel-overlap | nvidia/skills | Masquer la latence de communication all-to-all dans les modèles MoE via le chevauchement calcul/dispatch. | 2 858 | 60 |
| 33 | nemo-mbridge-perf-hierarchical-context-parallel | nvidia/skills | Configurer le parallélisme de contexte hiérarchique imbriqué pour l'entraînement distribué. | 2 858 | 60 |
| 34 | nemo-mbridge-perf-megatron-fsdp | nvidia/skills | Configurer et activer Megatron FSDP pour l'entraînement distribué efficace de LLMs. | 2 858 | 60 |
| 35 | nemo-mbridge-perf-memory-tuning | nvidia/skills | Diagnostiquer et corriger les erreurs OOM GPU lors de l'entraînement de modèles. | 2 858 | 60 |
| 36 | nemo-mbridge-perf-moe-comm-overlap | nvidia/skills | Activer le chevauchement des communications MoE pour optimiser le débit en entraînement distribué. | 2 858 | 60 |
| 37 | nemo-mbridge-perf-moe-dispatcher-selection | nvidia/skills | Sélectionner le dispatcher MoE optimal selon le matériel, le degré EP et le modèle. | 2 858 | 60 |
| 38 | nemo-mbridge-perf-moe-long-context | nvidia/skills | Optimiser l'entraînement MoE longue séquence via parallélisme et recompute sélectif. | 2 858 | 60 |
| 39 | nemo-mbridge-perf-moe-optimization-workflow | nvidia/skills | Optimiser l'entraînement de modèles MoE en gérant mémoire, communication et calcul. | 2 858 | 60 |
| 40 | nemo-mbridge-perf-moe-vlm-training | nvidia/skills | Optimiser l'entraînement de VLMs MoE avec FSDP ou parallélisme 3D sur GPU. | 2 858 | 60 |
| 41 | nemo-mbridge-perf-sequence-packing | nvidia/skills | Configurer le packing de séquences pour le fine-tuning LLM et VLM avec Megatron. | 2 858 | 60 |
| 42 | nemo-mbridge-perf-tp-dp-comm-overlap | nvidia/skills | Configurer le chevauchement des communications TP/DP/PP pour optimiser l'entraînement distribué. | 2 858 | 60 |
| 43 | nemo-mbridge-recipe-recommender | nvidia/skills | Indexer les recettes d'entraînement et recommander la configuration optimale pour LLM. | 2 858 | 60 |
| 44 | nemo-mbridge-resiliency | nvidia/skills | Configurer la tolérance aux pannes, détection de stragglers et préemption pour l'entraînement distribué. | 2 858 | 60 |
| 45 | digital-health-clinical-asr-build | nvidia/skills | Construire un benchmark ASR clinique avec termes médicaux, audio synthétisé et manifest NeMo. | 2 858 | 60 |
| 46 | digital-health-clinical-asr-eval | nvidia/skills | Évaluer et router des transcriptions ASR cliniques selon quatre métriques de qualité. | 2 858 | 60 |
| 47 | digital-health-clinical-asr-finetune | nvidia/skills | Affiner un modèle ASR clinique avec NeMo SFT pour réduire les erreurs médicales. | 2 858 | 60 |
| 48 | digital-health-clinical-asr-setup | nvidia/skills | Configurer et valider l'accès à la pile ASR clinique hébergée par NVIDIA. | 2 858 | 60 |
| 49 | earth2studio-deterministic-forecast | nvidia/skills | Générer des scripts de prévision météo déterministe avec Earth2Studio. | 2 858 | 60 |
| 50 | earth2studio-discover | nvidia/skills | Identifier les modèles, sources de données et exemples Earth2Studio adaptés à une tâche météo. | 2 858 | 60 |
À propos de cette sélection
Quand un modèle de base commence à produire des réponses trop génériques pour rester crédibles en production, le travail sérieux commence. Cette section s'adresse aux ingénieurs ML et aux équipes qui adaptent, évaluent et débogent des modèles en conditions réelles : affiner un LLM sur un corpus métier avec Hugging Face, tracer des expériences d'entraînement bout en bout, ou remonter un bug de compilation dans le runtime PyTorch avant qu'il bloque un pipeline entier.
Les skills training & fine-tuning couvrent un spectre plus large que le seul fine-tuning supervisé. On y trouve des outils d'annotation, de benchmarking, de kernels custom côté NVIDIA, et quelques skills orientés recherche reproductible. L'outillage reste majoritairement Python, avec une densité forte autour des frameworks majeurs. Certains cas avancés demandent encore de composer plusieurs skills ensemble, mais la base est solide.