nemotron-voice-agent-builder

Par nvidia · skills

Créez, affinez ou corrigez des agents vocaux NVIDIA (Cascaded ou Omni) avec Pipecat ou LiveKit. À utiliser pour construire, scaffolder ou itérer sur un pipeline d'agents vocaux en temps réel, y compris la personnalisation de la parole (ASR/TTS) et le déploiement cloud ou local. Non applicable pour la transcription hors ligne/par lots, les chats texte uniquement ou les RAG, ni pour les travaux génériques Docker ou CUDA sans rapport avec un agent vocal.

npx skills add https://github.com/nvidia/skills --skill nemotron-voice-agent-builder

Créer un agent vocal

Crée un agent vocal NVIDIA fonctionnel ou met à jour un projet existant :

  • Cascaded : ASR transcrit, un LLM textuel répond, TTS parle.
  • Omni : un LLM audio-in remplace ASR et le LLM textuel. TTS parle toujours.

Quand utiliser cette compétence

Utilisez cette compétence quand l'utilisateur souhaite construire, structurer, configurer, affiner ou corriger un agent vocal NVIDIA — un pipeline de parole temps réel avec entrée audio et sortie vocale — sur Pipecat ou LiveKit. Cela couvre les pipelines Cascaded (ASR → LLM → TTS) et Omni (audio-in LLM + TTS), la personnalisation vocale (ASR word boosting, prononciation TTS), le routage multilingue et le déploiement sur cloud ou local (NIM, vLLM, NeMo-Speech.cpp) sur postes de travail, DGX Spark ou Jetson Thor.

N'utilisez pas cette compétence pour les chatbots texte uniquement ou RAG, la transcription speech-to-text par lots autonome, l'aide Docker ou infrastructure générique, ou les travaux CUDA ou modèles non liés qui n'ont pas de pipeline d'agent vocal.

Flux de travail

Classifiez l'état initial avant de suivre les phases :

  • Pour un projet vide, suivez toutes les phases dans l'ordre.
  • Pour un projet existant fonctionnel, lisez d'abord references/operations/iterate.md, puis routez uniquement les références nécessaires au changement demandé.
  • Pour un projet existant défaillant, lisez d'abord references/operations/troubleshoot.md. Après restauration de la baseline, continuez avec references/operations/iterate.md.

Pour un projet vide, suivez ces phases dans l'ordre :

Phase Lire
1. Intake references/intake.md résout d'abord le pipeline et le framework, puis route les fichiers preflight, models, language et domain
2. Build references/platforms/readiness.md si auto-hébergé → profile exact ou variante de quantification dans le fichier modèle routé → references/output-contract.md → chemin de déploiement routé → references/operations/observability.md → fichiers framework sélectionnés
3. Handover references/operations/run.md contrôle le client sur le scripts/smoke.sh généré, puis references/operations/troubleshoot.md si l'échange parlé échoue
4. Iterate references/operations/iterate.md pour les changements apportés à un agent fonctionnel

Attendez l'approbation avant d'écrire des fichiers.

references/preflight.md §4 sonde l'hôte et sélectionne le chemin de déploiement. Le fichier platform routé en est propriétaire à partir de là.

Lisez aussi references/networking/remote-webrtc.md quand WebRTC Pipecat traverse des hôtes ou des réseaux.

Règles

  • Résolvez chaque model id, image tag, profile et serve flag à partir de la documentation NVIDIA actuelle au moment du build. Jamais de mémoire.
  • Lisez chaque fichier routé avant de générer du code, et conservez les verrous de langue et de comportement approuvés à l'intake.
  • Handover exige un échange parlé réussi. Un processus en cours n'est pas un agent vocal fonctionnel.

Skills similaires