Site Reliability Engineer

Chair.com.pk

Toronto

Hybrid

CAD 120,000 - 180,000

Full time

19 hours ago
Be an early applicant
Application generator

Stand out for this role — generate a tailored resume and cover letter in about a minute.

Get past ATS filters

Job summary

Quix is seeking a Site Reliability Engineer to improve reliability and observability across enterprise platforms. You’ll define SLIs/SLOs, build observability infrastructure, and lead post-incident analyses.

This role emphasizes automation, capacity planning, and collaboration with engineering to ensure production readiness and reduce toil. Ideal candidates bring deep experience in distributed systems, on-call discipline, and strong scripting in Python, Bash, or Go.

Qualifications

  • Substantial production experience in an SRE, platform engineering, or infrastructure reliability role.
  • Deep expertise with observability tooling: Prometheus, Grafana, Datadog, OpenTelemetry, or equivalents.
  • Experience managing distributed systems reliability: load balancing, failover, circuit breakers, and retry logic.
  • Strong incident management experience: on-call discipline, root cause analysis, and post-mortem culture.
  • Proficiency with scripting and automation for operational tasks in Python, Bash, or Go.
  • Ability to communicate reliability requirements and tradeoffs clearly to engineering and product teams.

Responsibilities

  • Define and track service-level indicators and service-level objectives for critical platform services.
  • Build and maintain observability infrastructure: metrics, distributed tracing, structured logging, and alerting.
  • Lead post-incident analysis and drive systematic improvements that reduce mean time to recovery.
  • Establish runbooks, escalation paths, and operational playbooks for production platform teams.
  • Conduct capacity planning, load testing, and failure mode analysis to proactively identify reliability risks.
  • Collaborate with engineering teams on production readiness reviews, deployment gates, and reliability requirements.
  • Identify and drive down toil through automation, infrastructure improvements, and process redesign.

Skills

SRE / Platform engineering
Observability
Automation scripting
Incident management
Communication of reliability

Tools

Prometheus
Grafana
Datadog
OpenTelemetry

Job description

Maintain and improve the reliability, observability, and operational maturity of enterprise platforms through systematic engineering discipline.

Quix is looking for a Site Reliability Engineer who approaches operational problems with an engineering mindset — building systems, tooling, and processes that prevent incidents rather than only responding to them. This role is for someone with deep experience in observability, incident management, capacity planning, and reliability engineering in distributed, production environments.

Work is calm, technical, and delivery-focused. You’ll help teams make durable decisions in enterprise environments where reliability and operational clarity matter.

What You’ll Do
  • Define and track service-level indicators and service-level objectives for critical platform services.
  • Build and maintain observability infrastructure: metrics, distributed tracing, structured logging, and alerting.
  • Lead post-incident analysis and drive systematic improvements that reduce mean time to recovery.
  • Establish runbooks, escalation paths, and operational playbooks for production platform teams.
  • Conduct capacity planning, load testing, and failure mode analysis to proactively identify reliability risks.
  • Collaborate with engineering teams on production readiness reviews, deployment gates, and reliability requirements.
  • Identify and drive down toil through automation, infrastructure improvements, and process redesign.
What We’re Looking For
  • Substantial production experience in an SRE, platform engineering, or infrastructure reliability role.
  • Deep expertise with observability tooling: Prometheus, Grafana, Datadog, OpenTelemetry, or equivalents.
  • Experience managing distributed systems reliability: load balancing, failover, circuit breakers, and retry logic.
  • Strong incident management experience: on-call discipline, root cause analysis, and post-mortem culture.
  • Proficiency with scripting and automation for operational tasks in Python, Bash, or Go.
  • Ability to communicate reliability requirements and tradeoffs clearly to engineering and product teams.
Nice to Have
  • Experience with chaos engineering practices and failure injection tooling.
  • Background in SLO and SLA management in enterprise or regulated service environments.
  • Experience with multi-region or multi-cloud reliability architectures.

Platform reliability is not an afterthought — it is a core commitment to clients who depend on Quix systems for operational continuity. The SRE function protects that commitment by building systems that fail gracefully, recover quickly, and improve systematically, reducing operational risk across every deployment.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

SRE: Build Resilient, Observability-Driven Platforms
SRE: Build Resilient, Observability-Driven Platforms

Chair.com.pk • Toronto

Hybrid
CAD 120,000 - 180,000
Security & Reliability Engineer
Security & Reliability Engineer

Chair.com.pk • Toronto

Hybrid
CAD 110,000 - 170,000
Senior Site Reliability Engineer
Senior Site Reliability Engineer

LanceSoft, Inc. • Montreal (administrative region)

On-site
CAD 110,000 - 140,000
Cloud & DevOps Engineer
Cloud & DevOps Engineer

Chair.com.pk • Canada

Hybrid
CAD 90,000 - 120,000
Cloud Infrastructure Engineer
Cloud Infrastructure Engineer

Chair.com.pk • Toronto

Hybrid
CAD 100,000 - 160,000
Site Reliability Engineer
Site Reliability Engineer

ALLTECH CONSULTING SVC INC • Quebec

On-site
CAD 90,000 - 130,000
Site Reliability Engineer
Site Reliability Engineer

Compunnel, Inc. • Montreal (administrative region)

On-site
CAD 90,000 - 130,000
Senior Full-Stack Engineer
Senior Full-Stack Engineer

Chair.com.pk • Canada

Hybrid
CAD 120,000 - 180,000
Senior Site Reliability Engineer (Observability & Analytics, Platform Infra)
Senior Site Reliability Engineer (Observability & Analytics, Platform Infra)

Elastic • Ottawa

Hybrid
CAD 120,000 - 170,000
Health coverage for you and family
Flexible location and schedule
Generous vacation days
+3
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

twentysix • Vancouver

On-site
CAD 90,000 - 130,000