Monitoring & Observabilité

Logs, traces et metriques : OpenTelemetry, Sentry, Application Insights, Grafana.

21 skills

# Skill Source Description
1 distributed-tracing wshobson/agents Implémenter le traçage distribué avec Jaeger et Tempo pour visualiser les flux de requêtes. 39 975
2 python-observability wshobson/agents Instrumenter des applications Python avec logs structurés, métriques et traces distribuées. 39 975
3 dynamo-interconnect-check nvidia/skills Vérifier le transport RDMA/NVLink d'un déploiement Dynamo disaggrégé avant benchmark. 3 437
4 dynamo-troubleshoot nvidia/skills Diagnostiquer et classifier les pannes Dynamo pour proposer des actions correctives précises. 3 437
5 jetson-memory-audit nvidia/skills Auditer la mémoire d'un Jetson et libérer les caches CUDA bloqués après un workload. 3 437
6 jetson-video-benchmark nvidia/skills Mesurer le débit de codec vidéo en FPS et mégapixels/seconde sur Jetson. 3 437
7 azure-monitor-opentelemetry-exporter-py microsoft/skills Exporter des traces, métriques et logs OpenTelemetry vers Azure Application Insights. 3 052
8 azure-monitor-opentelemetry-py microsoft/skills Configurer Azure Monitor avec OpenTelemetry pour instrumenter automatiquement des apps Python. 3 052
9 azure-monitor-query-py microsoft/skills Interroger logs et métriques Azure Monitor via le SDK Python. 3 052
10 agent-observability-auto-experiment datadog-labs/agent-skills Automatiser une boucle d'amélioration itérative locale de code via évaluations et commits git. 174
11 agent-observability-eval-bootstrap datadog-labs/agent-skills Analyser des traces LLM de production pour générer et publier une suite d'évaluateurs Datadog. 174
12 agent-observability-eval-pipeline datadog-labs/agent-skills Orchestrer un pipeline d'évaluation en six phases pour analyser et améliorer des agents IA instrumentés. 174
13 agent-observability-experiment-bootstrap datadog-labs/agent-skills Générer un artefact d'expérience reproductible pour évaluer des tâches LLM avec métriques et provenance. 174
14 agent-observability-replay-trace datadog-labs/agent-skills Rejouer une trace de production en local et itérer jusqu'à corriger l'output indésirable. 174
15 dd-orchestrator datadog-labs/agent-skills Orchestrer l'onboarding Datadog en composant et enchaînant automatiquement les skills nécessaires. 174
16 redis-observability redis/agent-skills Surveiller, diagnostiquer et alerter sur les métriques clés d'une instance Redis. 157
17 redis-observability redis/agent-skills Surveiller, diagnostiquer et alerter sur les métriques clés d'une instance Redis. 157
18 error-tracking-python posthog/skills Intégrer le suivi d'erreurs PostHog dans des applications Python. 63
19 error-tracking-python posthog/skills Intégrer le suivi d'erreurs PostHog dans des applications Python. 63
20 logs-python posthog/skills Intégrer la collecte de logs PostHog dans des applications Python via OpenTelemetry. 63
21 logs-python posthog/skills Intégrer la collecte de logs PostHog dans des applications Python via OpenTelemetry. 63

À propos de cette sélection

L'observabilité est souvent le dernier chantier qu'on branche et le premier qu'on regrette d'avoir bâclé. Quand un agent commence à enchaîner des appels LLM en production, savoir exactement où la latence explose ou quel span a silencieusement échoué transforme radicalement le débogage. Les skills monitoring & observabilité rassemblés ici couvrent des cas concrets : instrumenter un pipeline d'inférence pour en extraire des traces exploitables, ou auditer la consommation réelle d'un assistant Copilot avant que la facture surprenne tout le monde. L'outillage disponible est déjà dense, avec des contributions notables de Datadog Labs et Dash0 couvrant OpenTelemetry, les métriques système sous Linux et le troubleshooting de performance sur des stacks variées. Le profil qui atterrit ici : un SRE ou un ML engineer qui veut enfin piloter avec des données concrètes sous les yeux.