Site Reliability Engineering (SRE) Architect

Info Way Solutions

Vancouver

On-site

CAD 120,000 - 170,000

Full time

8 days ago
Application generator

Turn this role into an interview — a resume and cover letter built around what this employer wants.

Get past ATS filters

Job summary

Info Way Solutions seeks an experienced Site Reliability Engineering (SRE) Architect to lead enterprise reliability transformation across large-scale cloud-native environments. You will drive observability strategy, SLO governance, and production readiness for mission-critical platforms.

Responsibilities include defining SLI/SLO/SLA, implementing robust incident management, automation, and resilience practices while guiding DevSecOps, GitOps, and IaC adoption across the organization.

Qualifications

  • Extensive experience implementing SLI, SLO, SLA, Error Budget, and Reliability Governance.
  • Strong expertise with Dynatrace and enterprise observability platforms.
  • Experience with OpenTelemetry, APM, RUM, and Synthetic Monitoring.

Responsibilities

  • Define and implement enterprise SLI, SLO, SLA, Error Budget, and Reliability Governance frameworks.
  • Develop and execute enterprise observability strategies using platforms such as Dynatrace, OpenTelemetry, APM, RUM, and Synthetic Monitoring.
  • Design and implement highly available, resilient, and scalable cloud-native architectures.

Skills

Leadership
Observability strategy
SRE transformation
Stakeholder management
Incident management
RCA
Toil reduction
Automation
DevSecOps
GitOps
IaC
Production Readiness

Tools

Dynatrace
OpenTelemetry
APM
RUM
Synthetic Monitoring
Docker
OpenShift

Job description

Site Reliability Engineering (SRE) Architect
Role Overview

We are seeking an experienced Site Reliability Engineering (SRE) Architect to lead enterprise reliability transformation initiatives across large-scale cloud-native environments. The ideal candidate will have deep expertise in observability strategy, SLO governance, reliability engineering, operational excellence, and enterprise-scale SRE adoption. This role requires strong technical leadership to drive reliability frameworks, automation, resilience, and production readiness across mission-critical platforms.

Key Responsibilities
  • Define and implement enterprise SLI, SLO, SLA, Error Budget, and Reliability Governance frameworks.
  • Develop and execute enterprise observability strategies using platforms such as Dynatrace, OpenTelemetry, APM, Distributed Tracing, RUM, and Synthetic Monitoring.
  • Design and implement highly available, resilient, and scalable cloud-native architectures.
  • Lead initiatives around High Availability (HA), Disaster Recovery (DR), Resilience Engineering, and Business Continuity.
  • Drive Incident Management, Problem Management, Root Cause Analysis (RCA), and Continuous Service Improvement practices.
  • Lead automation initiatives focused on toil reduction, self-healing, auto-remediation, and operational excellence.
  • Establish enterprise monitoring standards, governance models, and observability frameworks.
  • Implement AIOps, predictive analytics, intelligent alerting, and event correlation capabilities.
  • Support CI/CD, DevSecOps, GitOps, and Infrastructure as Code (IaC) adoption.
  • Lead Production Readiness Reviews (PRR), Operational Readiness Reviews (ORR), and reliability assessments.
  • Collaborate with engineering, architecture, and business leadership to improve platform reliability and operational maturity.
  • Drive enterprise-wide SRE transformation and reliability engineering adoption across large-scale environments.
Required Qualifications
  • Extensive experience implementing SLI, SLO, SLA, Error Budget, and Reliability Governance frameworks.
  • Strong expertise with Dynatrace and enterprise observability platforms including:
  • Application Performance Monitoring (APM)
  • Real User Monitoring (RUM)
  • Synthetic Monitoring
  • OpenTelemetry
  • Strong experience with:
  • Docker
  • OpenShift
  • Cloud-native architectures
  • High Availability (HA)
  • Disaster Recovery (DR)
  • Resilience Engineering
  • Business Continuity solutions
  • Root Cause Analysis (RCA)
  • Experience driving:
  • Toil reduction
  • Self-healing solutions
  • Auto-remediation
  • Operational automation
  • Strong understanding of:
  • Capacity Planning
  • Performance Engineering
  • Experience establishing enterprise observability strategies, governance, and monitoring standards.
  • Familiarity with:
  • AIOps
  • Predictive Analytics
  • Event Correlation
  • Experience with:
  • CI/CD
  • DevSecOps
  • GitOps
  • Infrastructure as Code (IaC)
  • Ability to lead:
  • Production Readiness Reviews
  • Operational Readiness Reviews
  • Reliability Assessments
  • Excellent stakeholder management and leadership skills with the ability to influence engineering, architecture, and business teams.
Preferred Qualifications
  • Experience leading enterprise-wide SRE transformation initiatives.
  • Proven expertise in developing enterprise observability strategies and reliability engineering adoption.
  • Strong background in SLO governance and operational excellence programs.
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Site Reliability Engineer
Site Reliability Engineer

Gemini Solutions Pvt Ltd • Toronto

On-site
CAD 120,000 - 170,000
Manager, Site Reliability Engineering (SRE)
Manager, Site Reliability Engineering (SRE)

Quantum Technology Recruiting Inc. (QTR) • Toronto

On-site
CAD 155,000 - 165,000
Senior Manager, Site Reliability Engineering (SRE)
Senior Manager, Site Reliability Engineering (SRE)

Dawninfotek • Toronto

On-site
CAD 150,000 - 210,000
Senior Site Reliability Engineer (SRE) – Kubernetes
Senior Site Reliability Engineer (SRE) – Kubernetes

Software Mind Americas • Montreal (administrative region)

On-site
CAD 110,000 - 170,000
Competitive salary
Laptop provided
Professional development
+2
Site Reliability Engineer
Site Reliability Engineer

Compunnel, Inc. • Montreal (administrative region)

Hybrid
CAD 90,000 - 130,000
Site Reliability Engineer
Site Reliability Engineer

ALLTECH CONSULTING SVC INC • Quebec

On-site
CAD 90,000 - 130,000
Senior Site Reliability Engineer
Senior Site Reliability Engineer

iManage • Toronto

Hybrid
CAD 90,000 - 120,000
Market-competitive salary
Annual performance-based bonus
Comprehensive Health, Vision, Dental, and Life insurance
+4
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

twentysix • Vancouver

On-site
CAD 90,000 - 130,000
Site Reliability Engineer (SRE) – Observability
Site Reliability Engineer (SRE) – Observability

Astra-North Infoteck Inc. ~ Conquering today’s challenges, achieving tomorrow’s vision! • Toronto

Hybrid
CAD 75,000 - 95,000
Director, Global DevOps, Site Reliability, & Infrastructure (Vancouver, B.C. or Austin, TX)
Director, Global DevOps, Site Reliability, & Infrastructure (Vancouver, B.C. or Austin, TX)

Bitkernel Technology Inc • Vancouver

On-site
CAD 160,000 - 240,000
Flexible work options