Training & Fine-tuning

Entrainement et fine-tuning de modeles, MLOps, recherche scientifique.

312 skills

# Skill Source Description Δ
1 accessing-mlflow nvidia/model-optimizer Interroger et comparer des runs MLflow via langage naturel et MCP. 4 489 660
2 eagle3-new-model nvidia/model-optimizer Configurer un pipeline EAGLE3 en 4 tâches pour un nouveau modèle HF. 4 489 660
3 eagle3-review-logs nvidia/model-optimizer Analyser les logs d'un pipeline EAGLE3 et produire un rapport de diagnostic structuré. 4 489 660
4 eagle3-triage nvidia/model-optimizer Diagnostiquer et corriger les échecs du pipeline offline EAGLE3 en quatre étapes. 4 489 660
5 compare-results nvidia/model-optimizer Comparer baseline et candidat quantisé pour évaluer la dégradation de précision. 4 489 660
6 day0-release nvidia/model-optimizer Orchestrer le cycle complet de release d'un checkpoint quantisé jusqu'à la recommandation de publication. 4 489 660
7 eagle3-validate nvidia/model-optimizer Valider un pipeline EAGLE3 et produire un rapport de qualité complet. 4 489 660
8 evaluation nvidia/model-optimizer Configurer, lancer et superviser des évaluations de modèles via NeMo Evaluator Launcher. 4 489 660
9 ptq nvidia/model-optimizer Quantifier un modèle pré-entraîné en checkpoint optimisé via ModelOpt PTQ. 4 489 660
10 quant-recipe-search nvidia/model-optimizer Orchestrer une recherche itérative de recettes de quantisation optimales pour modèles IA. 4 489 660
11 scvi-tools anthropics/knowledge-work-plugins Analyser des données single-cell multi-modales avec les modèles probabilistes scvi-tools. 25 631 551
12 statistical-analysis anthropics/knowledge-work-plugins Analyser des données statistiques avec tendances, distributions et tests d'hypothèses. 25 631 551
13 arize-annotation github/awesome-copilot Créer et gérer des configs d'annotation pour labelliser des spans IA via Arize. 39 398 236
14 arize-experiment github/awesome-copilot Gérer et exporter des expériences d'évaluation de modèles IA via Arize. 39 398 236
15 datanalysis-credit-risk github/awesome-copilot Nettoyer et sélectionner des variables pour modélisation de risque crédit. 39 398 236
16 aoti-debug pytorch/pytorch Diagnostiquer et corriger les erreurs courantes d'AOTInductor avec méthode. 103 329 222
17 pt2-bug-basher pytorch/pytorch Déboguer les erreurs de compilation PyTorch 2 via Dynamo, Inductor et AOTAutograd. 103 329 222
18 ml-pipeline-workflow wshobson/agents Orchestrer un pipeline MLOps complet de l'ingestion des données au déploiement en production. 39 977 168
19 backtesting-frameworks wshobson/agents Construire des systèmes de backtesting robustes pour évaluer fiablement des stratégies de trading. 39 977 168
20 spark-environment-setup wshobson/agents Configurer et déboguer un environnement ML sur DGX Spark avec CUDA 13. 39 977 168
21 spark-memory-thermal-ops wshobson/agents Gérer la mémoire unifiée et les thermiques du DGX Spark GB10 efficacement. 39 977 168
22 spark-training-gotchas wshobson/agents Diagnostiquer et corriger les dix pannes récurrentes d'entraînement sur DGX Spark GB10. 39 977 168
23 grpo-rlvr-training wshobson/agents Configurer et lancer un entraînement GRPO/RLVR avec récompenses vérifiables. 39 977 168
24 lora-qlora-recipes wshobson/agents Configurer des adaptateurs LoRA et QLoRA optimaux pour le fine-tuning SFT supervisé. 39 977 168
25 preference-optimization wshobson/agents Sélectionner et configurer la méthode optimale d'alignement par préférences (DPO, ORPO, KTO, SimPO). 39 977 168
26 quantized-export wshobson/agents Exporter un checkpoint promu au bon format quantifié selon la cible matérielle. 39 977 168
27 vision-sft wshobson/agents Configurer et affiner un modèle vision-langage avec LoRA/QLoRA de façon optimale. 39 977 168
28 cudaq-guide nvidia/skills Guider l'utilisateur dans CUDA-Q : installation, simulation GPU et accès QPU. 3 438 84
29 cuopt-install nvidia/skills Installer cuOpt via pip, conda ou Docker pour Python, C ou REST. 3 438 84
30 deepstream-import-vision-model nvidia/skills Importer et benchmarker des modèles de détection d'objets dans DeepStream via TensorRT. 3 438 84
31 nemo-automodel-distributed-training nvidia/skills Configurer l'entraînement distribué PyTorch avec stratégies FSDP2, MegatronFSDP ou DDP. 3 438 84
32 nemo-automodel-model-onboarding nvidia/skills Intégrer de nouvelles architectures de modèles IA dans NeMo AutoModel. 3 438 84
33 nemo-automodel-recipe-development nvidia/skills Configurer et exécuter des recettes de fine-tuning NeMo AutoModel via YAML et CLI. 3 438 84
34 nemotron-customize nvidia/skills Configurer et orchestrer des pipelines d'entraînement Nemotron via des configs YAML. 3 438 84
35 rag-eval nvidia/skills Évaluer la qualité d'un pipeline RAG NVIDIA via filesystem benchmarks et RAGAS. 3 438 84
36 nemo-mbridge-mlm-bridge-training nvidia/skills Comparer et valider les pertes entre Megatron-LM et Bridge sur GPU. 3 438 84
37 nemo-mbridge-multi-node-slurm nvidia/skills Convertir des commandes distribuées PyTorch en scripts Slurm multi-nœuds avec conteneurs Enroot. 3 438 84
38 nemo-mbridge-perf-activation-recompute nvidia/skills Réduire la mémoire GPU en recompilant les activations selon différentes granularités configurables. 3 438 84
39 nemo-mbridge-perf-cpu-offloading nvidia/skills Configurer le déchargement CPU des activations ou états optimiseur pour libérer la mémoire GPU. 3 438 84
40 nemo-mbridge-perf-cuda-graphs nvidia/skills Configurer et optimiser les CUDA graphs pour accélérer l'entraînement de modèles GPU. 3 438 84
41 nemo-mbridge-perf-expert-parallel-overlap nvidia/skills Masquer la latence de communication all-to-all dans les modèles MoE via le chevauchement calcul/dispatch. 3 438 84
42 nemo-mbridge-perf-hierarchical-context-parallel nvidia/skills Configurer le parallélisme de contexte hiérarchique imbriqué pour l'entraînement distribué. 3 438 84
43 nemo-mbridge-perf-megatron-fsdp nvidia/skills Configurer et activer Megatron FSDP pour l'entraînement distribué efficace de LLMs. 3 438 84
44 nemo-mbridge-perf-memory-tuning nvidia/skills Diagnostiquer et corriger les erreurs OOM GPU lors de l'entraînement de modèles. 3 438 84
45 nemo-mbridge-perf-moe-comm-overlap nvidia/skills Activer le chevauchement des communications MoE pour optimiser le débit en entraînement distribué. 3 438 84
46 nemo-mbridge-perf-moe-dispatcher-selection nvidia/skills Sélectionner le dispatcher MoE optimal selon le matériel, le degré EP et le modèle. 3 438 84
47 nemo-mbridge-perf-moe-long-context nvidia/skills Optimiser l'entraînement MoE longue séquence via parallélisme et recompute sélectif. 3 438 84
48 nemo-mbridge-perf-moe-optimization-workflow nvidia/skills Optimiser l'entraînement de modèles MoE en gérant mémoire, communication et calcul. 3 438 84
49 nemo-mbridge-perf-moe-vlm-training nvidia/skills Optimiser l'entraînement de VLMs MoE avec FSDP ou parallélisme 3D sur GPU. 3 438 84
50 nemo-mbridge-perf-sequence-packing nvidia/skills Configurer le packing de séquences pour le fine-tuning LLM et VLM avec Megatron. 3 438 84

À propos de cette sélection

Quand un modèle de base commence à produire des réponses trop génériques pour rester crédibles en production, le travail sérieux commence. Cette section s'adresse aux ingénieurs ML et aux équipes qui adaptent, évaluent et débogent des modèles en conditions réelles : affiner un LLM sur un corpus métier avec Hugging Face, tracer des expériences d'entraînement bout en bout, ou remonter un bug de compilation dans le runtime PyTorch avant qu'il bloque un pipeline entier. Les skills training & fine-tuning couvrent un spectre plus large que le seul fine-tuning supervisé. On y trouve des outils d'annotation, de benchmarking, de kernels custom côté NVIDIA, et quelques skills orientés recherche reproductible. L'outillage reste majoritairement Python, avec une densité forte autour des frameworks majeurs. Certains cas avancés demandent encore de composer plusieurs skills ensemble, mais la base est solide.