run-evals

Par flutter · skills

Exécutez des évaluations pour un, plusieurs ou tous les skills à l'aide du framework d'orchestration d'agents. Utilisez ce skill dès que l'utilisateur demande à lancer des evals, tester les performances d'un skill, exécuter des benchmarks ou comparer l'exécution avec et sans skill.

npx skills add https://github.com/flutter/skills --skill run-evals

Exécuter les Skill Evals

  1. Lire le Framework : Lisez tool/dart_skills_lint/evals/README.md pour comprendre la différence entre les evals par skill et les evals cross-skill.
  2. Localiser les Cibles : Trouvez les fichiers cibles evals/evals.json dans .agents/skills/ et/ou skills/.
  3. Déterminer la Configuration de l'Agent : Vérifiez le champ agent_config dans le fichier evals.json cible pour déterminer l'environnement/harness à lancer. Si agent_config est "bare-agent", lancez un subagent avec le profil bare-agent. S'il s'agit d'un profil de contributeur spécifique (par ex. "reidbaker-agent"), utilisez ce profil pour fournir le contexte de contributeur nécessaire.
  4. Orchestrer : Par défaut, exécutez un Integration Test en lançant un seul subagent With-Skill en utilisant Workspace: branch et le agent_config identifié.
    • Fournissez le prompt de la tâche. Consultez resources/with_skill_execution_prompt.md pour le modèle. Lors du remplissage de <path-to-skill>, vous DEVEZ utiliser un chemin relatif à partir de la racine du repository, et non un chemin absolu, pour empêcher le subagent de s'ancrer accidentellement au workspace parent et de le modifier.
    • Uniquement si l'utilisateur demande explicitement une comparaison ou un benchmark, lancez également un subagent Baseline. Consultez resources/baseline_execution_prompt.md pour le modèle. Instruisez le(s) subagent(s) pour retourner leur git diff et les résultats de vérification (dart format, dart analyze, dart test) sans committer. CRITIQUE : Vous devez explicitement avertir le(s) subagent(s) de confiner toutes les modifications de fichiers strictement à leur répertoire de travail actuel et d'éviter d'utiliser des chemins absolus pour modifier le workspace parent.
  5. Évaluer : Analysez la rubrique combinée (en résolvant repo_criteria + les attentes de evals.json). Utilisez les instructions d'évaluation dans resources/agent_judge_prompt.md. Quand une attente échoue, vous DEVEZ explicitement lister à la fois l'attente et ce qui a réellement été trouvé causant l'échec.
  6. Artefact : Évaluez les résultats et générez un artefact Markdown (par ex. <skill>_eval_results.md) contenant les métadonnées, la justification réussite/échec, et les diffs/stdout bruts.

Skills similaires