---
title: "reliability"
lang: "en"
author: "Mohammad Abu Mattar"
canonical: https://mkabumattar.com/case-studies/categories/reliability
---

[All Categories](/case-studies/categories)

# Reliability

[Home](/)›[All Case Studies](/case-studies)›[All Categories](/case-studies/categories)›[Reliability](/case-studies/categories/reliability)

Category

# Reliability

CategoryAllDevOps (6)Cloud Native (4)Cloud Computing (3)Architecture (2)Reliability (2)Databases (1)Management (1)Platform Engineering (1)Security (1)TagAllKubernetes (3)Argo CD (2)EKS (2)GitOps (2)Active Active (1)Alerting (1)Argo Rollouts (1)ArtifactHub (1)AWS (1)Backstage (1)Containers (1)Cosign (1)Cost Optimization (1)Cutover (1)Database Migration (1)Error Budget (1)Failover (1)FinOps (1)Golden Paths (1)Helm (1)High Availability (1)Idempotency (1)Internal Developer Platform (1)Logical Replication (1)Microservices (1)Migration (1)Multi Region (1)Observability (1)On Call (1)Payments (1)PostgreSQL (1)Prometheus (1)RDS (1)Rollback (1)RPO (1)RTO (1)Savings Plans (1)Self Service (1)SLO (1)SLSA (1)SRE (1)Strangler Pattern (1)Supply Chain Security (1)Terraform (1)Traffic Shifting (1)Trivy (1)Wolfi (1)Zero Downtime (1)SortNewest firstOldest firstA to ZShortest read first

[![Taming a 3am Pager: SLOs and Error Budgets That Stuck](/_astro/hero.an3xFV8m_q9tWb.webp)](/case-studies/post/slo-error-budget-rollout-case-study)

## [Taming a 3am Pager: SLOs and Error Budgets That Stuck](/case-studies/post/slo-error-budget-rollout-case-study)

-   [Reliability](/case-studies/categories/reliability)
-   [DevOps](/case-studies/categories/devops)
-   29 Aug 2026
-   07 Mins read

A platform team was losing people to burnout, and the cause was the pager. On-call meant a phone that went off day and night with alerts about CPU, memory, and pod restarts, the overwhelming majority

[#SLO](/case-studies/tags/slo)[#Error Budget](/case-studies/tags/error-budget)[#SRE](/case-studies/tags/sre)+4 tags

[Read Case Study](/case-studies/post/slo-error-budget-rollout-case-study)

[![Multi-Region Active-Active for a Payments API](/_astro/hero.RPbRRCdE_flG0g.webp)](/case-studies/post/multi-region-active-active-payments)

## [Multi-Region Active-Active for a Payments API](/case-studies/post/multi-region-active-active-payments)

-   [Architecture](/case-studies/categories/architecture)
-   [Cloud Computing](/case-studies/categories/cloud-computing)
-   16 Aug 2026
-   06 Mins read

A payments API that moves real money had been running comfortably in a single AWS region for years. It was reliable until the day it was not: a regional control-plane incident took the whole service o

[#Multi Region](/case-studies/tags/multi-region)[#Active Active](/case-studies/tags/active-active)[#Payments](/case-studies/tags/payments)+5 tags

[Read Case Study](/case-studies/post/multi-region-active-active-payments)
