SRE: Build Resilient, Observability-Driven Platforms

Chair.com.pk

Toronto

Hybrid

CAD 120,000 - 180,000

Full time

23 hours ago
Be an early applicant
Application generator

Stand out for this role — generate a tailored resume and cover letter in about a minute.

Get past ATS filters

Job summary

Quix is seeking a Site Reliability Engineer to improve reliability and observability across enterprise platforms. You’ll define SLIs/SLOs, build observability infrastructure, and lead post-incident analyses.

This role emphasizes automation, capacity planning, and collaboration with engineering to ensure production readiness and reduce toil. Ideal candidates bring deep experience in distributed systems, on-call discipline, and strong scripting in Python, Bash, or Go.

Qualifications

  • Substantial production experience in an SRE, platform engineering, or infrastructure reliability role.
  • Deep expertise with observability tooling: Prometheus, Grafana, Datadog, OpenTelemetry, or equivalents.
  • Experience managing distributed systems reliability: load balancing, failover, circuit breakers, and retry logic.
  • Strong incident management experience: on-call discipline, root cause analysis, and post-mortem culture.
  • Proficiency with scripting and automation for operational tasks in Python, Bash, or Go.
  • Ability to communicate reliability requirements and tradeoffs clearly to engineering and product teams.

Responsibilities

  • Define and track service-level indicators and service-level objectives for critical platform services.
  • Build and maintain observability infrastructure: metrics, distributed tracing, structured logging, and alerting.
  • Lead post-incident analysis and drive systematic improvements that reduce mean time to recovery.
  • Establish runbooks, escalation paths, and operational playbooks for production platform teams.
  • Conduct capacity planning, load testing, and failure mode analysis to proactively identify reliability risks.
  • Collaborate with engineering teams on production readiness reviews, deployment gates, and reliability requirements.
  • Identify and drive down toil through automation, infrastructure improvements, and process redesign.

Skills

SRE / Platform engineering
Observability
Automation scripting
Incident management
Communication of reliability

Tools

Prometheus
Grafana
Datadog
OpenTelemetry

Job description

Quix is seeking a Site Reliability Engineer to improve reliability and observability across enterprise platforms. You’ll define SLIs/SLOs, build observability infrastructure, and lead post-incident analyses.

This role emphasizes automation, capacity planning, and collaboration with engineering to ensure production readiness and reduce toil. Ideal candidates bring deep experience in distributed systems, on-call discipline, and strong scripting in Python, Bash, or Go.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Site Reliability Engineer
Site Reliability Engineer

Chair.com.pk • Toronto

Hybrid
CAD 120,000 - 180,000
Senior Platform SRE: Observability, Infra & On-Call
Senior Platform SRE: Observability, Infra & On-Call

Elastic • Ottawa

Hybrid
CAD 120,000 - 170,000
Health coverage for you and family
Flexible location and schedule
Generous vacation days
+3
Senior SRE: Cloud, Automation & Observability
Senior SRE: Cloud, Automation & Observability

RXinsider LTD. • Montreal (administrative region)

Hybrid
CAD 100,000 - 150,000
Senior Site Reliability Engineer
Senior Site Reliability Engineer

LanceSoft, Inc. • Montreal (administrative region)

On-site
CAD 110,000 - 140,000
Cloud & DevOps Engineer
Cloud & DevOps Engineer

Chair.com.pk • Canada

Hybrid
CAD 90,000 - 120,000
Senior SRE Lead: Reliability Strategy & Incidents
Senior SRE Lead: Reliability Strategy & Incidents

KEV Group • Toronto

Hybrid
CAD 150,000 - 180,000
Hybrid model
RRSP matching in Canada
401(k) contributions in the U.S.
+3
Site Reliability Engineer (SRE) – Observability
Site Reliability Engineer (SRE) – Observability

Astra-North Infoteck Inc. ~ Conquering today’s challenges, achieving tomorrow’s vision! • Toronto

Hybrid
CAD 75,000 - 95,000
Site Reliability Engineer - Automation & Observability
Site Reliability Engineer - Automation & Observability

ALLTECH CONSULTING SVC INC • Quebec

On-site
CAD 90,000 - 130,000
Security & Reliability Engineer
Security & Reliability Engineer

Chair.com.pk • Toronto

Hybrid
CAD 110,000 - 170,000
Senior Full-Stack Engineer: Enterprise APIs & Reliability
Senior Full-Stack Engineer: Enterprise APIs & Reliability

Chair.com.pk • Canada

Hybrid
CAD 120,000 - 180,000