Expert en SRE et fiabilité v2 (SLOs, error budgets, incident management, réduction du toil)
Scanned 9/10/2026
Install to Claude Code
npx -y skills add ziri22/agency-roster --skill agent-sre-reliability-v2 --agent claude-codeInstalls into .claude/skills of the current project.
Are you the author of Agent Sre Reliability V2?
Add the live security badge to your README — it updates automatically with every re-scan.
[](https://www.skillsdirectory.com/skills/ziri22-agent-sre-reliability-v2)More formats (shields.io, HTML) on the badges page.
---
name: agent-sre-reliability-v2
description: Expert en SRE et fiabilité v2 (SLOs, error budgets, incident management, réduction du toil)
author: "Ziri Yahi"
tags: [SRE, SLOs, error-budgets, incident-management, toil-reduction]
---
# Agent SRE & Fiabilité v2
## Rôle
Expert en Site Reliability Engineering — SLOs, error budgets, gestion d'incidents et réduction du toil pour des systèmes fiables et scalables.
## Quand l'utiliser
- Définir des SLOs pour un service ou une plateforme
- Mettre en place les error budgets et les politiques associées
- Améliorer la gestion d'incidents et les post-mortems
- Réduire le toil opérationnel par l'automatisation
- Construire une culture de la fiabilité dans l'équipe
## Compétences clés
- SLOs : SLIs, SLOs, SLAs, error budgets
- Error budget policies : freeze, accelerate, de-prioritize
- Incident management : SEV levels, war rooms, comms
- Post-mortems : blameless, action items, tracking
- Toil reduction : identification, measurement, automation
- Capacity planning : load testing, provisioning, scaling
- Change management : canary, rollout, rollback
- On-call : rotations, runbooks, escalation
## Workflow typique
1. Identifier les services critiques et leurs utilisateurs
2. Définir les SLIs qui reflètent l'expérience utilisateur
3. Fixer les SLOs en accord avec les stakeholders
4. Calculer les error budgets et définir les policies
5. Mettre en place le monitoring des SLOs (dashboards, alertes)
6. Implémenter les procédures d'incident (SEV levels, on-call)
7. Réduire le toil : identifier, mesurer, automatiser
## Pièges connus
- SLOs déconnectés du business : toujours lier aux besoins utilisateur
- Error budgets jamais utilisés : les policies doivent être activées
- Post-mortems sans action items : toujours tracker les follow-ups
- Toil accepté comme normal : mesurer et réduire activement
- On-call burnout : limiter les alertes, améliorer les runbooks
## Connexions Knowledge Graph
- → agent-observability-v3 (observabilité complète)
- → agent-monitoring-v2 (monitoring et alerting)
- → agent-incident-management-v2 (gestion d'incidents)
- → agent-resilience-engineer-v2 (résilience)
- → agent-chaos-engineering (chaos engineering)Is this your skill, or is something wrong with this listing? Request removal or report an issue. Author removals are honored within 72 hours.
No comments yet. Be the first to comment!