agent-observability-experiment-bootstrap

Par datadog-labs · agent-skills

Skill Datadog (datadog-labs/agent-skills) qui génère un artefact d'expérimentation LLM Observability reproductible via le Python ddtrace SDK ou le Node dd-trace SDK.

npx skills add https://github.com/datadog-labs/agent-skills --skill agent-observability-experiment-bootstrap

agent-observability-experiment-bootstrap

Ce skill fait partie du repository officiel datadog-labs/agent-skills, une collection de skills conçus pour les agents IA (Claude Code, Codex CLI, Gemini CLI, Cursor, etc.). Il s'inscrit dans la suite Agent Observability (LLMO), aux côtés de sept autres skills dédiés à l'expérimentation, l'évaluation et la classification de sessions LLM.

Ce que fait ce skill

Son rôle est de générer un artefact d'expérimentation LLM Observability unique et reproductible. L'artefact évalue une tâche sur un dataset versionné, enregistre les sorties et les métriques d'évaluation, embarque la configuration et la provenance, et affiche un lien ou des identifiants de résultat lorsque c'est possible. Le skill supporte deux adapters : le Python ddtrace.llmobs SDK (adapter par défaut) et le Node dd-trace SDK (lorsque tracer.llmobs.experiments est disponible localement).

Structure et références

Le skill est organisé autour d'un répertoire references/ qui isole les contrats spécifiques à chaque adapter (references/python/ et references/node/). Cette séparation garantit que seule la référence de l'adapter sélectionné est chargée lors de la génération — les références Python (providers, evaluator styles) et Node restent indépendantes. Les artefacts générés peuvent utiliser des records inline, des fichiers locaux (JSON, CSV) ou des datasets Datadog nommés et versionnés.

Comment l'utiliser

Après avoir installé le skill via npx skills add datadog-labs/agent-skills --skill agent-observability-experiment-bootstrap --full-depth -y, invoquez-le depuis votre agent en précisant l'objectif de l'expérience, le format de sortie souhaité (py, ipynb ou mjs) et les options de dataset et d'évaluateurs. Le skill prend en charge des options avancées comme --task-source, --evaluator-style, ou --placeholder-task pour adapter la génération à votre contexte applicatif sans modifier le code source de l'application cible.

Points d'attention

Le skill applique des règles de sécurité strictes : aucune credential n'est écrite dans les artefacts générés, aucune donnée de production n'est utilisée comme vérité terrain sans validation explicite, et les erreurs de tâche ou d'évaluateur ne sont jamais masquées en valeurs positives. Il est conçu pour s'intégrer naturellement dans le pipeline agent-observability-eval-pipeline ou être utilisé de façon autonome.

Skills similaires