agent-observability-build-eval-from-annotations
Ce skill fait partie du repo public datadog-labs/agent-skills, qui regroupe des skills Datadog pour agents IA (Claude Code, Codex CLI, Gemini CLI, Cursor, etc.). Il appartient à la suite agent-observability, dédiée à l'observation et à l'évaluation des applications LLM via Datadog LLM Observability.
Ce que fait ce skill
Lorsqu'une annotation queue contient déjà des labels humains (par exemple, des évaluateurs humains qui ont noté les premières lignes d'une queue), ce skill automatise la fabrication d'un évaluateur LLM qui reproduit ces jugements. Il opère en plusieurs phases : lire la queue et ses labels, localiser dans l'arbre de spans l'endroit exact où vit la propriété labellisée (la evidence map), rédiger un premier LLM-judge, puis confier la boucle d'amélioration itérative au skill agent-observability-auto-experiment. La version gagnante est ensuite publiée dans l'org Datadog de l'utilisateur en tant qu'évaluateur réel avec enabled: false — elle ne score rien tant que l'utilisateur ne l'active pas manuellement dans l'UI.
Dépendance obligatoire
Ce skill ne contient pas lui-même la boucle de hill-climbing : il prépare le juge, constitue le corpus à partir des interactions annotées, et délègue l'optimisation itérative à agent-observability-auto-experiment. Les deux skills doivent être installés ensemble. Si agent-observability-auto-experiment est absent, le skill s'arrête explicitement à la Phase 5 plutôt que d'improviser une boucle de substitution.
Comment l'utiliser
On déclenche ce skill lorsqu'on dit à l'agent : "build an eval from my annotations", "turn my annotations into an evaluator", "automate this annotation queue", ou toute formulation équivalente. Le skill demande obligatoirement plusieurs informations avant de démarrer : l'identifiant de la queue, le ou les labels à apprendre, le framing du juge (replicator, grader ou corrector), la métrique d'évaluation, le backend Datadog (mcp ou pup), et le nom de l'évaluateur à publier. Aucun de ces champs n'a de valeur par défaut silencieuse.
Ce que le skill ne fait pas
Il n'active jamais l'évaluateur (enabled: true n'est jamais positionné par le skill), n'écrit pas de prédictions dans la queue humaine, et ne réinterprète pas les labels humains pour avantager le juge. Si le corpus est trop petit, si le signal labellisé est inaccessible dans les traces, ou si le juge ne bat pas la baseline constante, le skill s'arrête et l'explique — il ne publie pas un évaluateur qui n'a pas passé la barre minimale.