Practice path · 9 games

Production Reliability

Work through scaling, queues, retries, duplicate prevention, observability, and resilience for production systems.

Best after the basics, especially for system design prep.

Start this path
01
Scaling Intermediate

Load Balancer Challenge

Route simulated traffic across backend servers using round robin, weighted round robin, least connections, and random strategies.

Time
6-10 minutes
Concept
Load balancing strategies
  • Production Reliability
  • load balancing
  • scaling
  • latency
Play Load Balancer Challenge
02
Reliability Advanced

Overload Control Room

Control queue growth, adaptive concurrency, health probes, and priority-aware load shedding during overload.

Time
9-12 minutes
Concept
Backpressure and overload control
  • Production Reliability
  • Rate Limiting
  • Backpressure
  • Reliability
Play Overload Control Room
03
04
Queues Intermediate

Message Queue Simulator

Tune workers, retries, and dead-letter behavior while jobs move through an async queue with failures and poison messages.

Time
7-11 minutes
Concept
Async jobs, retries, visibility timeout, and dead-letter queues
  • Production Reliability
  • Async Workflows
  • queues
  • retries
  • dead-letter queue
Play Message Queue Simulator
05
Reliability Intermediate

Idempotency Key Clinic

Diagnose retry scenarios and choose safe idempotency behavior for payments, emails, imports, orders, PUT updates, and scarce inventory.

Time
6-9 minutes
Concept
Idempotency, retries, duplicate prevention, and consistency
  • Production Reliability
  • Async Workflows
  • Idempotency
  • Reliability
  • Consistency
Play Idempotency Key Clinic
06
Observability Advanced

Telemetry Pipeline Builder

Build a bounded telemetry path for structured logs, trace context, sampling, batching, and safe attributes.

Time
9-11 minutes
Concept
Telemetry pipelines and context propagation
  • Production Reliability
  • Observability
  • Logs
  • Traces
Play Telemetry Pipeline Builder
07
Observability Advanced

SLO Incident Commander

Direct incident response with RED, USE, service-level indicators, burn rates, and explicit recovery criteria.

Time
9-12 minutes
Concept
Service objectives and incident command
  • Production Reliability
  • Observability
  • SLO
  • Incidents
Play SLO Incident Commander
08
Reliability Intermediate

Observability Incident Triage

Triage production incidents by choosing useful metrics, logs, traces, queue signals, database evidence, request ids, and alerting strategies.

Time
6-9 minutes
Concept
Production observability, incident triage, metrics, logs, traces, and alerts
  • Production Reliability
  • observability
  • incidents
  • metrics
Play Observability Incident Triage
09
Reliability Intermediate

Circuit Breaker Clinic

Diagnose dependency failures and choose circuit breaker, timeout, fallback, retry, half-open, and bulkhead strategies that reduce blast radius.

Time
6-9 minutes
Concept
Circuit breakers, timeouts, retries, fallbacks, and dependency isolation
  • Production Reliability
  • resilience
  • circuit breaker
  • timeouts
Play Circuit Breaker Clinic