Manager, Site Reliability Engineering

Akkodis

Toronto

Hybrid

CAD 140,000 - 165,000

Full time

2 days ago
Be an early applicant

Get more replies from employers

Send a job-specific resume in minutes.

Benefits offered by this job

Bonus
Benefits

Job summary

Akkodis Canada is seeking a hands-on Manager, Site Reliability Engineering (SRE) to lead a team responsible for reliability, availability, performance, and operational excellence of critical enterprise applications and platforms in a hybrid work model in Etobicoke, ON.

You will balance people leadership with technical strategy and collaborate with Development, DevOps, Infrastructure, Security, and Incident Management teams.

Qualifications

  • 8+ years of experience supporting large-scale production environments, distributed systems, or cloud platforms.
  • 3+ years of people leadership experience managing technical teams.
  • Experience leading SRE, Platform Engineering, DevOps, Production Operations, or Reliability Engineering teams.
  • Strong understanding of Site Reliability Engineering principles and practices.
  • Experience with observability and monitoring platforms such as Dynatrace, Datadog, New Relic, AppDynamics, or similar.
  • Hands‑on experience with Azure (preferred) or AWS.
  • Strong Kubernetes and container platform experience.
  • Expertise with Infrastructure as Code and automation tools such as Terraform and Ansible.
  • Experience leading incident response, problem management, and production operations.
  • Strong scripting or programming skills (Python, PowerShell, Bash, etc.)
  • Excellent communication, stakeholder management, and leadership skills.

Responsibilities

  • Lead and develop a team of Site Reliability Engineers.
  • Drive adoption of SRE principles, including SLOs, SLIs, error budgets, and reliability best practices.
  • Improve observability, monitoring, alerting, and operational health across critical services.
  • Reduce operational toil through automation and self-healing capabilities.
  • Oversee production support, incident management, escalation processes, and on-call operations.
  • Partner with engineering teams to embed reliability into application design and delivery pipelines.
  • Lead capacity planning, resiliency testing, and disaster recovery readiness initiatives.
  • Act as a senior escalation point during major incidents.
  • Improve deployment reliability and reduce operational risk.
  • Establish runbook standards, documentation practices, and operational governance.
  • Collaborate with leadership teams to execute strategic SRE initiatives and roadmaps.
  • Foster a blameless culture focused on continuous improvement and operational excellence.

Skills

Leadership
SRE principles
Observability
Incident response
Automation
Cloud platforms
Scripting
Kubernetes

Tools

Dynatrace
Datadog
New Relic
AppDynamics
Azure
AWS
Kubernetes
Terraform
Ansible

Job description

Title: Manager, Site Reliability Engineering (SRE)

Position Type: Full-time, Permanent

Location: Etobicoke, ON

Working Model: Hybrid - 3 days per week in office

Compensation: $140K - 165K per annum plus bonus and benefits

About Our Client

Our client is a leading Canadian organization operating highly available, mission-critical technology platforms that support millions of transactions and customer interactions annually.

As part of a broader technology transformation and operational excellence initiative, the organization is continuing to invest in its Site Reliability Engineering (SRE) capabilities to improve reliability, scalability, observability, and production resilience across a large portfolio of business-critical applications.

This is an exciting opportunity to join a growing SRE function at an important stage of its evolution, helping shape reliability practices, operational standards, automation strategies, and engineering culture.

About the Opportunity

We are seeking a hands-on Manager, Site Reliability Engineering (SRE) to lead a team of SRE engineers responsible for improving the reliability, availability, performance, and operational excellence of critical enterprise applications and platforms.

This role offers a balance of people leadership and technical leadership, making it ideal for an experienced SRE, Platform Engineering, DevOps, or Production Engineering leader who enjoys building high-performing teams while remaining engaged in technical strategy and operational improvements.

You will partner closely with Application Development, DevOps, Infrastructure, Security, and Incident Management teams to drive observability, automation, incident response, resiliency, and continuous reliability improvements across both cloud and on-premises environments.

What You'll Do
  • Lead and develop a team of Site Reliability Engineers
  • Drive adoption of SRE principles, including SLOs, SLIs, error budgets, and reliability best practices
  • Improve observability, monitoring, alerting, and operational health across critical services
  • Reduce operational toil through automation and self-healing capabilities
  • Oversee production support, incident management, escalation processes, and on-call operations
  • Partner with engineering teams to embed reliability into application design and delivery pipelines
  • Lead capacity planning, resiliency testing, and disaster recovery readiness initiatives
  • Act as a senior escalation point during major incidents
  • Improve deployment reliability and reduce operational risk
  • Establish runbook standards, documentation practices, and operational governance
  • Collaborate with leadership teams to execute strategic SRE initiatives and roadmaps
  • Foster a blameless culture focused on continuous improvement and operational excellence
What You Bring
Must-Have Qualifications
  • 8+ years of experience supporting large-scale production environments, distributed systems, or cloud platforms
  • 3+ years of people leadership experience managing technical teams
  • Experience leading SRE, Platform Engineering, DevOps, Production Operations, or Reliability Engineering teams
  • Strong understanding of Site Reliability Engineering principles and practices
  • Experience with observability and monitoring platforms such as Dynatrace, Datadog, New Relic, AppDynamics, or similar
  • Hands‑on experience with Azure (preferred) or AWS
  • Strong Kubernetes and container platform experience
  • Expertise with Infrastructure as Code and automation tools such as Terraform and Ansible
  • Experience leading incident response, problem management, and production operations
  • Strong scripting or programming skills (Python, PowerShell, Bash, etc.)
  • Excellent communication, stakeholder management, and leadership skills
Nice-to-Have Qualifications
  • Experience in payments, fintech, banking, or highly regulated environments
  • Knowledge of PCI-DSS, NIST, or related compliance frameworks
  • Experience with change management and release governance processes
  • Experience implementing SLOs, SLIs, and error budget frameworks
  • Background building or maturing an SRE function
  • Experience supporting enterprise-scale cloud transformation initiatives
What You'll Love About This Opportunity
  • Opportunity to help shape and mature a growing SRE organization
  • Lead a team responsible for business-critical services and platforms
  • Drive meaningful improvements in reliability, observability, and automation
  • Balance people leadership with hands‑on technical influence
  • Work alongside highly skilled Engineering, Infrastructure, Security, and DevOps teams
  • High visibility role with broad organizational impact
  • Collaborative culture focused on innovation, resilience, and continuous improvement
  • Competitive compensation, bonus, and benefits package
  • Strong career growth opportunities within a modern technology organization
Important

We thank all applicants for their interest in this opportunity. Only candidates meeting the above qualifications will be contacted for further discussions.

Akkodis Canada will never share your resume or any personal details without your explicit consent.

We thank all applicants for their interest in this opportunity. Only candidates meeting the above qualifications will be contacted for further discussions.

Our Commitment:

At Akkodis, part of The Adecco Group, our purpose is simple: to make the future work for everyone. We live our values, Passion, Collaboration, Inclusion, Courage, and Customers at Heart, by fostering a workplace where diversity is celebrated and every voice matters. We encourage applications from individuals of all backgrounds and identities. Together, we’re making the future work for everyone.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Manager, Site Reliability Engineering (SRE)
Manager, Site Reliability Engineering (SRE)

Quantum Technology Recruiting Inc. (QTR) • Toronto

On-site
CAD 155,000 - 165,000
Senior Site Reliability Developer
Senior Site Reliability Developer

United States Digital Space LLC • Toronto

On-site
CAD 107,000 - 157,000
Salary transparency
In-person onboarding
Lead Database Developer (SQL Server)
Lead Database Developer (SQL Server)

Akkodis • Montreal (administrative region)

Hybrid
CAD 130,000 - 155,000
Team Lead, Site Reliability Engineer (SRE)
Team Lead, Site Reliability Engineer (SRE)

Loblaw Companies Limited • Brampton

On-site
CAD 128,000 - 176,000
On-site Gym
Tuition Reimbursement
Pension & Benefits
+2
Site Reliability Engineer
Site Reliability Engineer

Tecsys Inc. • Montreal (administrative region)

On-site
CAD 90,000 - 120,000
Digital-first work environment
Collaborative workspaces
Continuous learning opportunities
Lead, Site Reliability Engineering (Application Support)
Lead, Site Reliability Engineering (Application Support)

OMERS • Toronto

Hybrid
CAD 86,000 - 130,000
Manager, Cloud Services and Site Reliability
Manager, Cloud Services and Site Reliability

Barracuda • Ottawa

Hybrid
CAD 136,000 - 182,000
Equity options
Health benefits
Retirement plan
+3
Site Reliability Engineer (SRE), Cloud Operations
Site Reliability Engineer (SRE), Cloud Operations

United States Digital Space LLC • Toronto

On-site
CAD 110,000 - 140,000
Bonuses
Flexible benefits
Stock options
+1
Staff Site Reliability Engineer
Staff Site Reliability Engineer

Johnson Controls, Inc. • Richmond Hill

On-site
CAD 120,000 - 180,000
Site Reliability Engineer
Site Reliability Engineer

Kyndryl • Toronto

Hybrid
CAD 100,000 - 130,000