Monitoring & Observabilité

Logs, traces et metriques : OpenTelemetry, Sentry, Application Insights, Grafana.

157 skills

# Skill Source Description Δ
1 sentry anthropics/claude-cookbooks Configurer des credentials Sentry chiffrés en vault pour un agent planifié. 51 344 21
2 ci-metrics pytorch/pytorch Interroger les métriques CI et infrastructure de PyTorch via Grafana et ClickHouse. 102 327 10
3 cost-optimization wshobson/agents Optimiser les coûts cloud sur AWS, Azure, GCP et OCI via des stratégies systématiques. 38 723 7
4 service-mesh-observability wshobson/agents Configurer l'observabilité complète d'un service mesh avec métriques, traces et logs. 38 723 7
5 incident-runbook-templates wshobson/agents Générer des runbooks d'incident structurés pour guider la réponse opérationnelle en production. 38 723 7
6 distributed-tracing wshobson/agents Implémenter le traçage distribué avec Jaeger et Tempo pour visualiser les flux de requêtes. 38 723 7
7 grafana-dashboards wshobson/agents Créer et gérer des dashboards Grafana prêts pour la production avec Prometheus. 38 723 7
8 prometheus-configuration wshobson/agents Configurer Prometheus pour la collecte de métriques, alertes et monitoring d'infrastructure. 38 723 7
9 slo-implementation wshobson/agents Définir et implémenter des SLIs, SLOs et budgets d'erreur pour fiabiliser les services. 38 723 7
10 python-observability wshobson/agents Instrumenter des applications Python avec logs structurés, métriques et traces distribuées. 38 723 7
11 flowstudio-power-automate-monitoring github/awesome-copilot Surveiller la santé des flux Power Automate via un cache enrichi de métadonnées de gouvernance. 37 704 6
12 qdrant-monitoring github/awesome-copilot Surveiller et diagnostiquer les performances d'un déploiement Qdrant en production. 37 704 6
13 qdrant-monitoring-debugging github/awesome-copilot Diagnostiquer les problèmes de performance Qdrant via métriques d'optimisation et mémoire. 37 704 6
14 qdrant-monitoring-setup github/awesome-copilot Configurer la surveillance Qdrant avec Prometheus, alertes et logs centralisés. 37 704 6
15 aws-resource-health-diagnose github/awesome-copilot Diagnostiquer et remédier aux problèmes de santé des ressources AWS via CloudWatch. 37 704 6
16 aws-cloudwatch-investigation github/awesome-copilot Investiguer des incidents AWS production via CloudWatch Logs, Metrics et Alarms. 37 704 6
17 dynamo-interconnect-check nvidia/skills Vérifier le transport RDMA/NVLink d'un déploiement Dynamo disaggrégé avant benchmark. 2 859 5
18 dynamo-troubleshoot nvidia/skills Diagnostiquer et classifier les pannes Dynamo pour proposer des actions correctives précises. 2 859 5
19 vss-manage-alerts nvidia/skills Gérer les alertes VSS : détection, notifications Slack, caméras et abonnements en temps réel. 2 859 5
20 jetson-diagnostic nvidia/skills Capturer un snapshot de santé en temps réel d'un appareil Jetson pour diagnostiquer ses ressources. 2 859 5
21 jetson-memory-audit nvidia/skills Auditer la mémoire d'un Jetson et libérer les caches CUDA bloqués après un workload. 2 859 5
22 nemo-relay-plugin-observability nvidia/skills Configurer et orchestrer les plugins d'observabilité pour capturer et exporter les événements d'un agent IA. 2 859 5
23 doca-bench nvidia/skills Mesurer les performances des bibliothèques DOCA sur un dispositif réel avec doca_bench. 2 859 5
24 doca-collectx-deployment nvidia/skills Déployer et opérer un collecteur de télémétrie CollectX sur hôte ou BlueField. 2 859 5
25 doca-dpa-hl-tracer nvidia/skills Capturer et analyser les traces d'exécution haute-level du processeur DPA avec un overhead maîtrisé. 2 859 5
26 doca-flow-perf nvidia/skills Mesurer les performances d'insertion de règles DOCA Flow avec docaflowperf. 2 859 5
27 doca-pcc-counters nvidia/skills Lire les compteurs diagnostiques PCC firmware/HW d'un device ConnectX via debugfs. 2 859 5
28 doca-telemetry-exporter nvidia/skills Configurer, émettre et déboguer la télémétrie structurée via DOCA Telemetry Exporter. 2 859 5
29 doca-telemetry-utils nvidia/skills Diagnostiquer et traduire les compteurs de télémétrie DOCA via l'utilitaire CLI hôte. 2 859 5
30 doca-telemetry nvidia/skills Lire les compteurs matériels DOCA depuis un périphérique via les bibliothèques par domaine. 2 859 5
31 sentry openai/skills Interroger Sentry en lecture seule pour analyser, diagnostiquer et expliquer les erreurs de production. 24 823 4
32 status oceanbase/powermem Afficher le statut de connexion et l'état de santé du plugin PowerMem. 846 2
33 azure-monitor-ingestion-java microsoft/skills Envoyer des logs personnalisés vers Azure Monitor via l'API d'ingestion Java. 2 878 1
34 azure-monitor-opentelemetry-exporter-java microsoft/skills Exporter des données de télémétrie OpenTelemetry vers Azure Monitor Application Insights. 2 878 1
35 azure-monitor-opentelemetry-exporter-py microsoft/skills Exporter des traces, métriques et logs OpenTelemetry vers Azure Application Insights. 2 878 1
36 azure-monitor-opentelemetry-py microsoft/skills Configurer Azure Monitor avec OpenTelemetry pour instrumenter automatiquement des apps Python. 2 878 1
37 applicationinsights-web-ts microsoft/skills Monitorer les performances et comportements utilisateurs dans les apps web via Application Insights. 2 878 1
38 azure-monitor-opentelemetry-ts microsoft/skills Instrumenter automatiquement des applications Node.js avec Azure Monitor et OpenTelemetry. 2 878 1
39 clickhouse-managed-postgres-rca clickhouse/agent-skills Diagnostiquer automatiquement les incidents de performance sur une instance Postgres managée ClickHouse. 516 1
40 vss-manage-alerts nvidia-ai-blueprints/video-search-and-summarization Gérer les alertes VSS en temps réel : détection, notifications Slack et onboarding caméra. 1 792 1
41 azure-cost microsoft/azure-skills Interroger, prévoir et optimiser les coûts Azure pour réduire les dépenses cloud. 1 369 1
42 azure-diagnostics microsoft/azure-skills Diagnostiquer et résoudre les incidents Azure sur App Service, AKS, Functions et Messaging. 1 369 1
43 azure-kusto microsoft/azure-skills Interroger et analyser des données massives dans Azure Data Explorer via KQL. 1 369 1
44 sentry-triage fern-api/fern Trier et corriger automatiquement les faux positifs Sentry d'un projet CLI. 3 748 1
45 clickstack-otel-collector clickhouse/agent-skills Configurer un collecteur OpenTelemetry pour ingérer des données dans ClickHouse Cloud. 516 1
46 qdrant-monitoring qdrant/skills Surveiller et diagnostiquer les performances d'un déploiement Qdrant en production. 220 0
47 qdrant-monitoring-setup qdrant/skills Configurer le monitoring Qdrant avec Prometheus, alertes et logs centralisés. 220 0
48 troubleshooting-astro-deployments astronomer/agents Diagnostiquer et résoudre les problèmes de déploiements Astronomer en production via l'Astro CLI. 419 0
49 building-dashboards axiomhq/skills Concevoir des dashboards décisionnels en APL ou MPL à partir de données réelles. 15 0
50 controlling-costs axiomhq/skills Optimiser les coûts Axiom via dashboards, moniteurs et détection de gaspillage. 15 0

À propos de cette sélection

L'observabilité est souvent le dernier chantier qu'on branche et le premier qu'on regrette d'avoir bâclé. Quand un agent commence à enchaîner des appels LLM en production, savoir exactement où la latence explose ou quel span a silencieusement échoué transforme radicalement le débogage. Les skills monitoring & observabilité rassemblés ici couvrent des cas concrets : instrumenter un pipeline d'inférence pour en extraire des traces exploitables, ou auditer la consommation réelle d'un assistant Copilot avant que la facture surprenne tout le monde. L'outillage disponible est déjà dense, avec des contributions notables de Datadog Labs et Dash0 couvrant OpenTelemetry, les métriques système sous Linux et le troubleshooting de performance sur des stacks variées. Le profil qui atterrit ici : un SRE ou un ML engineer qui veut enfin piloter avec des données concrètes sous les yeux.