Monitoring & Observabilité
Logs, traces et metriques : OpenTelemetry, Sentry, Application Insights, Grafana.
| # | Skill | Source | Description | Maj | |
|---|---|---|---|---|---|
| 1 | redis-observability | redis/agent-skills | Surveiller, diagnostiquer et alerter sur les métriques clés d'une instance Redis. | 95 | 15h |
| 2 | azure-diagnostics | microsoft/azure-skills | Diagnostiquer et résoudre les incidents Azure sur App Service, AKS, Functions et Messaging. | 1 369 | 1j |
| 3 | clickhouse-system-log-disk-exhaustion | divinevideo/divine-mobile | Diagnostiquer et résoudre l'épuisement disque des logs système ClickHouse. | 262 | 4j |
| 4 | firebase-crashlytics | firebase/agent-skills | Intégrer et configurer Crashlytics pour collecter des données de crash Android ou iOS. | 404 | 5j |
| 5 | otel-instrumentation | dash0hq/agent-skills | Implémenter une télémétrie OpenTelemetry de qualité, efficace et sécurisée. | 81 | 5j |
| 6 | rp-telemetry | wix/skills | Capturer la télémétrie d'exécution pour améliorer les skills et outils de migration Wix. | 26 | 5j |
| 7 | agent-observability-replay-trace | datadog-labs/agent-skills | Rejouer une trace de production en local et itérer jusqu'à corriger l'output indésirable. | 152 | 6j |
| 8 | agent-skills | datadog-labs/agent-skills | Gérer la surveillance, les logs et les traces Datadog via un agent IA. | 152 | 6j |
| 9 | doca-telemetry-exporter | nvidia/skills | Configurer, émettre et déboguer la télémétrie structurée via DOCA Telemetry Exporter. | 2 859 | 6j |
| 10 | nemo-relay-plugin-observability | nvidia/skills | Configurer et orchestrer les plugins d'observabilité pour capturer et exporter les événements d'un agent IA. | 2 859 | 12j |
| 11 | azure-cost | microsoft/azure-skills | Interroger, prévoir et optimiser les coûts Azure pour réduire les dépenses cloud. | 1 369 | 14j |
| 12 | azure-kusto | microsoft/azure-skills | Interroger et analyser des données massives dans Azure Data Explorer via KQL. | 1 369 | 14j |
| 13 | onboarding-summary | datadog-labs/agent-skills | Générer un rapport de validation APM complet après instrumentation Kubernetes réussie. | 152 | 14j |
| 14 | verify-ssi | datadog-labs/agent-skills | Vérifier qu'APM SSI instrumente correctement les pods Kubernetes et remonte la télémétrie. | 152 | 14j |
| 15 | dd-pup | datadog-labs/agent-skills | Interagir avec l'API Datadog via CLI pour logs, monitors, traces et incidents. | 152 | 14j |
| 16 | agent-observability-auto-experiment | datadog-labs/agent-skills | Automatiser une boucle d'amélioration itérative locale de code via évaluations et commits git. | 152 | 14j |
| 17 | doca-bench | nvidia/skills | Mesurer les performances des bibliothèques DOCA sur un dispositif réel avec doca_bench. | 2 859 | 15j |
| 18 | doca-pcc-counters | nvidia/skills | Lire les compteurs diagnostiques PCC firmware/HW d'un device ConnectX via debugfs. | 2 859 | 15j |
| 19 | doca-telemetry | nvidia/skills | Lire les compteurs matériels DOCA depuis un périphérique via les bibliothèques par domaine. | 2 859 | 15j |
| 20 | otel-ottl | dash0hq/agent-skills | Transformer, filtrer et manipuler des données de télémétrie OpenTelemetry via OTTL. | 81 | 18j |
| 21 | otel-semantic-conventions | dash0hq/agent-skills | Valider et placer correctement les attributs de télémétrie selon OpenTelemetry Semantic Conventions. | 81 | 18j |
| 22 | otel-collector | dash0hq/agent-skills | Configurer et déployer l'OpenTelemetry Collector pour collecter et exporter la télémétrie. | 81 | 21j |
| 23 | doca-collectx-deployment | nvidia/skills | Déployer et opérer un collecteur de télémétrie CollectX sur hôte ou BlueField. | 2 859 | 25j |
| 24 | doca-dpa-hl-tracer | nvidia/skills | Capturer et analyser les traces d'exécution haute-level du processeur DPA avec un overhead maîtrisé. | 2 859 | 25j |
| 25 | doca-flow-perf | nvidia/skills | Mesurer les performances d'insertion de règles DOCA Flow avec docaflowperf. | 2 859 | 25j |
| 26 | doca-telemetry-utils | nvidia/skills | Diagnostiquer et traduire les compteurs de télémétrie DOCA via l'utilitaire CLI hôte. | 2 859 | 25j |
| 27 | clickstack-otel-collector | clickhouse/agent-skills | Configurer un collecteur OpenTelemetry pour ingérer des données dans ClickHouse Cloud. | 516 | 29j |
| 28 | query-metrics | axiomhq/skills | Interroger et explorer des métriques OpenTelemetry stockées dans Axiom MetricsDB. | 15 | 29j |
| 29 | alert-investigation | launchdarkly/agent-skills | Diagnostiquer automatiquement une alerte déclenchée et recommander des actions correctives ciblées. | 25 | 1mo |
| 30 | create-graph | launchdarkly/agent-skills | Créer, prévisualiser et organiser des graphiques dans des dashboards d'observabilité LaunchDarkly. | 25 | 1mo |
| 31 | investigate | launchdarkly/agent-skills | Mener une investigation multi-produits pour identifier la cause racine d'un incident. | 25 | 1mo |
| 32 | ci-metrics | pytorch/pytorch | Interroger les métriques CI et infrastructure de PyTorch via Grafana et ClickHouse. | 102 327 | 1mo |
| 33 | troubleshooting-astro-deployments | astronomer/agents | Diagnostiquer et résoudre les problèmes de déploiements Astronomer en production via l'Astro CLI. | 419 | 1mo |
| 34 | status | oceanbase/powermem | Afficher le statut de connexion et l'état de santé du plugin PowerMem. | 846 | 1mo |
| 35 | aws-cloudwatch-investigation | github/awesome-copilot | Investiguer des incidents AWS production via CloudWatch Logs, Metrics et Alarms. | 37 704 | 1mo |
| 36 | dd-browser-sdk | datadog-labs/agent-skills | Mettre à niveau le SDK navigateur Datadog de la version 6 à 7. | 152 | 1mo |
| 37 | upgrade-browser-sdk-v7 | datadog-labs/agent-skills | Migrer le SDK Browser Datadog de la version 6 à la version 7. | 152 | 1mo |
| 38 | upgrade-browser-sdk-v5 | datadog-labs/agent-skills | Migrer le SDK Datadog Browser de la version 4 à la version 5 pas à pas. | 152 | 1mo |
| 39 | upgrade-browser-sdk-v6 | datadog-labs/agent-skills | Migrer le SDK Datadog Browser de la version 5 à la version 6 pas à pas. | 152 | 1mo |
| 40 | datadog-app | datadog-labs/agent-skills | Développer des Datadog Apps avec React, TypeScript et publication sur site Datadog. | 152 | 1mo |
| 41 | jetson-diagnostic | nvidia/skills | Capturer un snapshot de santé en temps réel d'un appareil Jetson pour diagnostiquer ses ressources. | 2 859 | 1mo |
| 42 | jetson-memory-audit | nvidia/skills | Auditer la mémoire d'un Jetson et libérer les caches CUDA bloqués après un workload. | 2 859 | 1mo |
| 43 | troubleshoot-ssi | datadog-labs/agent-skills | Diagnostiquer et résoudre les échecs d'injection SSI APM sur Linux. | 152 | 1mo |
| 44 | agent-observability-eval-bootstrap | datadog-labs/agent-skills | Analyser des traces LLM de production pour générer et publier une suite d'évaluateurs Datadog. | 152 | 1mo |
| 45 | agent-observability-eval-pipeline | datadog-labs/agent-skills | Orchestrer un pipeline d'évaluation en six phases pour analyser et améliorer des agents IA instrumentés. | 152 | 1mo |
| 46 | agent-observability-experiment-analyzer | datadog-labs/agent-skills | Analyser un ou deux experiments LLM pour en extraire insights et comparaisons. | 152 | 1mo |
| 47 | agent-observability-experiment-py-bootstrap | datadog-labs/agent-skills | Générer un script Python ou notebook Jupyter d'expérimentation LLM avec ddtrace.llmobs. | 152 | 1mo |
| 48 | agent-observability-session-classify | datadog-labs/agent-skills | Classifier la satisfaction des sessions d'agents IA via Datadog LLM Observability. | 152 | 1mo |
| 49 | agent-observability-trace-rca | datadog-labs/agent-skills | Diagnostiquer les défaillances d'applications LLM en analysant les traces de production jusqu'à la cause racine. | 152 | 1mo |
| 50 | vss-manage-alerts | nvidia/skills | Gérer les alertes VSS : détection, notifications Slack, caméras et abonnements en temps réel. | 2 859 | 1mo |
À propos de cette sélection
L'observabilité est souvent le dernier chantier qu'on branche et le premier qu'on regrette d'avoir bâclé. Quand un agent commence à enchaîner des appels LLM en production, savoir exactement où la latence explose ou quel span a silencieusement échoué transforme radicalement le débogage. Les skills monitoring & observabilité rassemblés ici couvrent des cas concrets : instrumenter un pipeline d'inférence pour en extraire des traces exploitables, ou auditer la consommation réelle d'un assistant Copilot avant que la facture surprenne tout le monde. L'outillage disponible est déjà dense, avec des contributions notables de Datadog Labs et Dash0 couvrant OpenTelemetry, les métriques système sous Linux et le troubleshooting de performance sur des stacks variées. Le profil qui atterrit ici : un SRE ou un ML engineer qui veut enfin piloter avec des données concrètes sous les yeux.