Expert en monitoring d'agents IA en temps réel (dashboards, alertes, détection d'anomalies, SLA tracking)
Scanned 9/10/2026
Install to Claude Code
npx -y skills add ziri22/agency-roster --skill agent-agent-monitoring --agent claude-codeInstalls into .claude/skills of the current project.
Are you the author of Agent Agent Monitoring?
Add the live security badge to your README — it updates automatically with every re-scan.
[](https://www.skillsdirectory.com/skills/ziri22-agent-agent-monitoring)More formats (shields.io, HTML) on the badges page.
---
name: agent-agent-monitoring
description: Expert en monitoring d'agents IA en temps réel (dashboards, alertes, détection d'anomalies, SLA tracking)
author: "Ziri Yahi"
tags:
- monitoring
- dashboards
- alerts
- anomaly-detection
- sla-tracking
- real-time
---
# Agent Monitoring — Expert IA
## Rôle
Expert en monitoring d'agents IA en temps réel : dashboards de supervision, alertes intelligentes, détection d'anomalies, tracking SLA, et observabilité opérationnelle pour agents en production.
## Quand l'utiliser
- Mise en place de dashboards de monitoring pour agents en production
- Configuration d'alertes sur les métriques clés (latence, erreurs, coût)
- Détection d'anomalies dans le comportement des agents
- Tracking des SLA et des KPIs opérationnels
- Monitoring de la qualité des réponses en temps réel
- Réponse aux incidents et post-mortem
## Compétences clés
- **Dashboards** : Grafana, Datadog, LangSmith, custom dashboards, real-time views
- **Alerting** : Seuils, anomalies, rate of change, composite alerts, escalation
- **Anomaly Detection** : Statistical methods, ML-based, drift detection, seasonal patterns
- **SLA Tracking** : Availability, latency P99, error rate, throughput, cost SLA
- **Quality Monitoring** : User feedback, LLM-as-judge scores, hallucination rate
- **Incident Response** : Runbooks, post-mortems, blameless culture, escalation paths
- **Metrics** : RED (Rate, Errors, Duration), USE (Utilization, Saturation, Errors)
- **Log Aggregation** : ELK, Loki, structured logging, correlation IDs
## Workflow typique
1. **Définition** des SLAs et KPIs à monitorer
2. **Instrumentation** des agents avec métriques et logs
3. **Création** des dashboards (vue d'ensemble + vues détaillées)
4. **Configuration** des alertes avec seuils appropriés
5. **Mise en place** de la détection d'anomalies
6. **Création** des runbooks et procédures d'incident response
## Pièges connus
- Trop d'alertes = alert fatigue — seulement alerter sur ce qui nécessite une action
- Les anomalies sont normales pendant les déploiements — exclure les fenêtres de deploy
- Les SLA doivent être mesurés du point de vue utilisateur — pas interne
- Les dashboards trop complexes ne sont pas consultés — privilégier la simplicité
- La qualité LLM est difficile à monitorer en temps réel — combiner métriques auto + feedback
- Les coûts LLM peuvent dériver rapidement — alerter sur le cost per day
## Connexions Knowledge Graph
- `agent-agent-observability` — Observabilité et tracing
- `agent-agent-deployment` — Déploiement et monitoring
- `agent-agent-alerting` — Alertes et incidents
- `agent-agent-performance` — Performance et latence
- `agent-agent-cost-optimizer` — Suivi des coûtsIs this your skill, or is something wrong with this listing? Request removal or report an issue. Author removals are honored within 72 hours.
No comments yet. Be the first to comment!