physical-ai-event-video-generation

Par nvidia · skills

Skill NVIDIA vérifié pour orchestrer le pipeline complet de génération de vidéos d'anomalies Physical AI (PAIDF) sur Kubernetes via Apache Airflow.

npx skills add https://github.com/nvidia/skills --skill physical-ai-event-video-generation

Physical AI Event Video Generation

Ce skill fait partie du catalogue officiel de skills NVIDIA, conçu pour être installé dans des agents de code comme Claude Code ou Codex. Il guide l'agent à travers l'exécution complète du DAG event_video_generation_dag_k8s sur un cluster Kubernetes, en s'appuyant sur le framework d'orchestration PAIDF (Physical AI Data Factory).

Ce que fait ce skill

Le skill couvre l'intégralité du pipeline de bout en bout : préparation des images sources (seed images), génération de vidéos d'anomalies via le modèle Cosmos3 (image-to-video), auto-labeling (détection, tracking, captioning, QA visuelle), et production d'un dataset d'anomalies prêt à l'emploi. Les cas d'usage typiques incluent la génération de clips vidéo simulant des chutes de personnes, escalades, bagarres, fumée/vapotage, incendies ou vols à l'étalage à partir d'une image initiale — notamment pour des applications de surveillance et de safety SDG.

Structure et procédure

Avant tout déclenchement, le skill impose une séquence de vérifications : connectivité au cluster Kubernetes, état des pods du contrôleur Airflow, disponibilité de l'API Airflow, slots dans les pools requis, et capacité GPU effective (au minimum 3 GPUs en mode externe, 7 en mode interne). Si l'un de ces contrôles échoue, le skill redirige automatiquement vers le skill environment-setup sans attendre une instruction de l'utilisateur.

Le skill collecte systématiquement auprès de l'utilisateur toutes les valeurs requises — chemin d'entrée S3, répertoire de sortie, mode de service (external ou internal), URLs des endpoints d'inférence — avant de construire le payload via scripts/payload.py. Il soumet ensuite exactement un DAG run, monitore son avancement par polling toutes les 60 à 120 secondes, et propose en fin de run le téléchargement et l'analyse des résultats via scripts/summarize_results.py.

Périmètre et limites

Ce skill gère uniquement le DAG end-to-end enregistré dans Airflow : il n'existe pas de variante génération-seule ou labeling-seul. Les demandes d'augmentation d'attributs vestimentaires sur crops de personnes relèvent du skill image-attribute-augmentation-workflow, et le transfert de style vidéo est hors périmètre. Le skill ne substitue jamais de valeurs par défaut issues du dépôt et n'expose jamais de credentials dans les prompts.

Skills similaires