Monitoring & Observabilité

Logs, traces et metriques : OpenTelemetry, Sentry, Application Insights, Grafana.

157 skills

# Skill Source Description Maj
1 redis-observability redis/agent-skills Surveiller, diagnostiquer et alerter sur les métriques clés d'une instance Redis. 95 15h
2 azure-diagnostics microsoft/azure-skills Diagnostiquer et résoudre les incidents Azure sur App Service, AKS, Functions et Messaging. 1 369 1j
3 clickhouse-system-log-disk-exhaustion divinevideo/divine-mobile Diagnostiquer et résoudre l'épuisement disque des logs système ClickHouse. 262 4j
4 firebase-crashlytics firebase/agent-skills Intégrer et configurer Crashlytics pour collecter des données de crash Android ou iOS. 404 5j
5 otel-instrumentation dash0hq/agent-skills Implémenter une télémétrie OpenTelemetry de qualité, efficace et sécurisée. 81 5j
6 rp-telemetry wix/skills Capturer la télémétrie d'exécution pour améliorer les skills et outils de migration Wix. 26 5j
7 agent-observability-replay-trace datadog-labs/agent-skills Rejouer une trace de production en local et itérer jusqu'à corriger l'output indésirable. 152 6j
8 agent-skills datadog-labs/agent-skills Gérer la surveillance, les logs et les traces Datadog via un agent IA. 152 6j
9 doca-telemetry-exporter nvidia/skills Configurer, émettre et déboguer la télémétrie structurée via DOCA Telemetry Exporter. 2 859 6j
10 nemo-relay-plugin-observability nvidia/skills Configurer et orchestrer les plugins d'observabilité pour capturer et exporter les événements d'un agent IA. 2 859 12j
11 azure-cost microsoft/azure-skills Interroger, prévoir et optimiser les coûts Azure pour réduire les dépenses cloud. 1 369 14j
12 azure-kusto microsoft/azure-skills Interroger et analyser des données massives dans Azure Data Explorer via KQL. 1 369 14j
13 onboarding-summary datadog-labs/agent-skills Générer un rapport de validation APM complet après instrumentation Kubernetes réussie. 152 14j
14 verify-ssi datadog-labs/agent-skills Vérifier qu'APM SSI instrumente correctement les pods Kubernetes et remonte la télémétrie. 152 14j
15 dd-pup datadog-labs/agent-skills Interagir avec l'API Datadog via CLI pour logs, monitors, traces et incidents. 152 14j
16 agent-observability-auto-experiment datadog-labs/agent-skills Automatiser une boucle d'amélioration itérative locale de code via évaluations et commits git. 152 14j
17 doca-bench nvidia/skills Mesurer les performances des bibliothèques DOCA sur un dispositif réel avec doca_bench. 2 859 15j
18 doca-pcc-counters nvidia/skills Lire les compteurs diagnostiques PCC firmware/HW d'un device ConnectX via debugfs. 2 859 15j
19 doca-telemetry nvidia/skills Lire les compteurs matériels DOCA depuis un périphérique via les bibliothèques par domaine. 2 859 15j
20 otel-ottl dash0hq/agent-skills Transformer, filtrer et manipuler des données de télémétrie OpenTelemetry via OTTL. 81 18j
21 otel-semantic-conventions dash0hq/agent-skills Valider et placer correctement les attributs de télémétrie selon OpenTelemetry Semantic Conventions. 81 18j
22 otel-collector dash0hq/agent-skills Configurer et déployer l'OpenTelemetry Collector pour collecter et exporter la télémétrie. 81 21j
23 doca-collectx-deployment nvidia/skills Déployer et opérer un collecteur de télémétrie CollectX sur hôte ou BlueField. 2 859 25j
24 doca-dpa-hl-tracer nvidia/skills Capturer et analyser les traces d'exécution haute-level du processeur DPA avec un overhead maîtrisé. 2 859 25j
25 doca-flow-perf nvidia/skills Mesurer les performances d'insertion de règles DOCA Flow avec docaflowperf. 2 859 25j
26 doca-telemetry-utils nvidia/skills Diagnostiquer et traduire les compteurs de télémétrie DOCA via l'utilitaire CLI hôte. 2 859 25j
27 clickstack-otel-collector clickhouse/agent-skills Configurer un collecteur OpenTelemetry pour ingérer des données dans ClickHouse Cloud. 516 29j
28 query-metrics axiomhq/skills Interroger et explorer des métriques OpenTelemetry stockées dans Axiom MetricsDB. 15 29j
29 alert-investigation launchdarkly/agent-skills Diagnostiquer automatiquement une alerte déclenchée et recommander des actions correctives ciblées. 25 1mo
30 create-graph launchdarkly/agent-skills Créer, prévisualiser et organiser des graphiques dans des dashboards d'observabilité LaunchDarkly. 25 1mo
31 investigate launchdarkly/agent-skills Mener une investigation multi-produits pour identifier la cause racine d'un incident. 25 1mo
32 ci-metrics pytorch/pytorch Interroger les métriques CI et infrastructure de PyTorch via Grafana et ClickHouse. 102 327 1mo
33 troubleshooting-astro-deployments astronomer/agents Diagnostiquer et résoudre les problèmes de déploiements Astronomer en production via l'Astro CLI. 419 1mo
34 status oceanbase/powermem Afficher le statut de connexion et l'état de santé du plugin PowerMem. 846 1mo
35 aws-cloudwatch-investigation github/awesome-copilot Investiguer des incidents AWS production via CloudWatch Logs, Metrics et Alarms. 37 704 1mo
36 dd-browser-sdk datadog-labs/agent-skills Mettre à niveau le SDK navigateur Datadog de la version 6 à 7. 152 1mo
37 upgrade-browser-sdk-v7 datadog-labs/agent-skills Migrer le SDK Browser Datadog de la version 6 à la version 7. 152 1mo
38 upgrade-browser-sdk-v5 datadog-labs/agent-skills Migrer le SDK Datadog Browser de la version 4 à la version 5 pas à pas. 152 1mo
39 upgrade-browser-sdk-v6 datadog-labs/agent-skills Migrer le SDK Datadog Browser de la version 5 à la version 6 pas à pas. 152 1mo
40 datadog-app datadog-labs/agent-skills Développer des Datadog Apps avec React, TypeScript et publication sur site Datadog. 152 1mo
41 jetson-diagnostic nvidia/skills Capturer un snapshot de santé en temps réel d'un appareil Jetson pour diagnostiquer ses ressources. 2 859 1mo
42 jetson-memory-audit nvidia/skills Auditer la mémoire d'un Jetson et libérer les caches CUDA bloqués après un workload. 2 859 1mo
43 troubleshoot-ssi datadog-labs/agent-skills Diagnostiquer et résoudre les échecs d'injection SSI APM sur Linux. 152 1mo
44 agent-observability-eval-bootstrap datadog-labs/agent-skills Analyser des traces LLM de production pour générer et publier une suite d'évaluateurs Datadog. 152 1mo
45 agent-observability-eval-pipeline datadog-labs/agent-skills Orchestrer un pipeline d'évaluation en six phases pour analyser et améliorer des agents IA instrumentés. 152 1mo
46 agent-observability-experiment-analyzer datadog-labs/agent-skills Analyser un ou deux experiments LLM pour en extraire insights et comparaisons. 152 1mo
47 agent-observability-experiment-py-bootstrap datadog-labs/agent-skills Générer un script Python ou notebook Jupyter d'expérimentation LLM avec ddtrace.llmobs. 152 1mo
48 agent-observability-session-classify datadog-labs/agent-skills Classifier la satisfaction des sessions d'agents IA via Datadog LLM Observability. 152 1mo
49 agent-observability-trace-rca datadog-labs/agent-skills Diagnostiquer les défaillances d'applications LLM en analysant les traces de production jusqu'à la cause racine. 152 1mo
50 vss-manage-alerts nvidia/skills Gérer les alertes VSS : détection, notifications Slack, caméras et abonnements en temps réel. 2 859 1mo

À propos de cette sélection

L'observabilité est souvent le dernier chantier qu'on branche et le premier qu'on regrette d'avoir bâclé. Quand un agent commence à enchaîner des appels LLM en production, savoir exactement où la latence explose ou quel span a silencieusement échoué transforme radicalement le débogage. Les skills monitoring & observabilité rassemblés ici couvrent des cas concrets : instrumenter un pipeline d'inférence pour en extraire des traces exploitables, ou auditer la consommation réelle d'un assistant Copilot avant que la facture surprenne tout le monde. L'outillage disponible est déjà dense, avec des contributions notables de Datadog Labs et Dash0 couvrant OpenTelemetry, les métriques système sous Linux et le troubleshooting de performance sur des stacks variées. Le profil qui atterrit ici : un SRE ou un ML engineer qui veut enfin piloter avec des données concrètes sous les yeux.