Senior SRE: Cloud, Automation & Observability

RXinsider LTD.

Montreal (administrative region)

Hybrid

CAD 100,000 - 150,000

Full time

14 days+
Application generator

An application made for this job — a tailored resume and cover letter that speak straight to the posting.

Get past ATS filters

Job summary

Tecsys is seeking a Site Reliability Engineer to join our NOC, responsible for reliability across our cloud infrastructure in AWS and Kubernetes. You will focus on automation, observability, and continuous improvement, owning uptime and performance in a fast-growing SaaS environment.

Join a highly skilled team that values problem-solving, operational excellence, and blameless postmortems. This role requires strong coding, incident leadership, and a proactive mindset with occasional travel.

Qualifications

  • 5+ years in Site Reliability, Cloud, or DevOps in SaaS/large-scale setups.
  • AWS multi-account setup and Kubernetes at scale.
  • IaC and automation with Terraform/Ansible, etc.
  • CI/CD pipelines and release automation (GitLab preferred).
  • Monitoring/observability using Datadog or equivalent.
  • Experience deploying large distributed multi-vendor systems.
  • Incident management incl. on-call rotations, escalations, postmortems.
  • Scripting in Python/Bash/Java or similar.
  • Familiar with AI-assisted engineering tools (Amazon Kiro).
  • Basic knowledge of Java or .NET environments.
  • Ownership mindset; on-call readiness; travel <10%.

Responsibilities

  • Collaborate with engineering to support design through launch.
  • Maintain service reliability post-deployment via monitoring.
  • Drive continuous improvements for scalability and resilience.
  • Own observability with monitoring, alerts, dashboards, SLOs/SLIs.
  • Build automation and IaC to enable self-healing systems.
  • Scale systems sustainably through reliability enhancements.
  • Leverage AI tools to accelerate work and validate outputs.
  • Lead incident response and postmortems with long-term fixes.
  • Document tech practices and contribute to SRE standards.
  • Partner with platform engineering and cross-functional teams.

Skills

Site Reliability
AWS
Kubernetes
Infrastructure as Code
Terraform
CI/CD
Datadog/Observability
Incident management
Scripting (Python/Bash)
AI tools familiarity

Education

Bachelor's degree in CS or related field

Tools

Terraform
Ansible
GitLab
Jenkins
Datadog
Amazon Kiro

Job description

Tecsys is seeking a Site Reliability Engineer to join our NOC, responsible for reliability across our cloud infrastructure in AWS and Kubernetes. You will focus on automation, observability, and continuous improvement, owning uptime and performance in a fast-growing SaaS environment.

Join a highly skilled team that values problem-solving, operational excellence, and blameless postmortems. This role requires strong coding, incident leadership, and a proactive mindset with occasional travel.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Senior SRE & Cloud Platform Manager
Senior SRE & Cloud Platform Manager

TekRek • Vancouver

On-site
CAD 150,000 - 210,000
Senior SRE – AI-Driven Cloud & Reliability Leader
Senior SRE – AI-Driven Cloud & Reliability Leader

Cover Genius • Vancouver

Hybrid
CAD 115,000 - 145,000
Senior Site Reliability Engineer
Senior Site Reliability Engineer

LanceSoft, Inc. • Montreal (administrative region)

On-site
CAD 110,000 - 140,000
Senior SRE: CI/CD Automation for Cloud & On-Prem Infra
Senior SRE: CI/CD Automation for Cloud & On-Prem Infra

HRB • Montreal (administrative region)

On-site
CAD 110,000 - 170,000
Site Reliability Engineer
Site Reliability Engineer

Tecsys Inc. • Montreal (administrative region)

On-site
CAD 90,000 - 120,000
Digital-first work environment
Collaborative workspaces
Continuous learning opportunities
Senior Site Reliability Engineer – Cloud & Automation Lead
Senior Site Reliability Engineer – Cloud & Automation Lead

Tecsys Inc. • Toronto

Remote
CAD 90,000 - 120,000
Digital-first work environment
Collaborative workspaces
Continuous learning opportunities
Senior SRE: Cloud & Containers
Senior SRE: Cloud & Containers

OpenText • Ottawa

On-site
CAD 118,000 - 168,000
Senior SRE Leader: Scale Reliability & Observability
Senior SRE Leader: Scale Reliability & Observability

Rootly • Toronto

On-site
CAD 120,000 - 180,000
Competitive compensation
Comprehensive medical coverage
3 weeks of vacation
+2
Senior Site Reliability Engineer, SRE
Senior Site Reliability Engineer, SRE

Jobtailor • Toronto

On-site
CAD 120,000 - 180,000
Founding SRE: Cloud Reliability & Platform Lead
Founding SRE: Cloud Reliability & Platform Lead

Katalyze AI, Inc. • Toronto

On-site
CAD 120,000 - 180,000