Site Reliability Engineer (SRE) – Observability

Astra-North Infoteck Inc. ~ Conquering today’s challenges, achieving tomorrow’s vision!

Toronto

Hybrid

CAD 75,000 - 95,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

A technology solutions firm in Toronto seeks a Site Reliability Engineer (SRE) focusing on observability. This hybrid role requires hands-on implementation of observability tools and collaboration with various teams to enhance system readiness. Ideal candidates will have 2-4 years of experience in observability, proficiency with tools like Dynatrace or Datadog, and skills in scripting. Join us in ensuring systems are operational and ready for production, while actively improving our monitoring processes.

Qualifications

  • 2–4 years of experience in Observability, or SRE.
  • Hands-on experience with at least one observability platform.
  • Ability to write scripts for automation and troubleshooting.

Responsibilities

  • Implement and maintain metrics, logs, and traces for applications.
  • Support root cause analysis using observability tools.
  • Work with development teams to enable structured logging.

Skills

Observability expertise
Cloud platform knowledge
Scripting (Python, Bash, PowerShell)
Incident management tools familiarity

Tools

Dynatrace
Elastic/ELK
Datadog

Job description

Job Description: Site Reliability Engineer (SRE) – Observability

Toronto - Hybrid (1-2 days office)

We are looking for a Observability Engineer to help implement, operate, and improve observability capabilities across our applications and platforms. This role focuses on hands‑on onboarding, instrumentation, dashboarding, and alerting, working under established standards and guidance from senior engineers.

You will collaborate with application, SRE, and operations teams to ensure systems are observable, supportable, and production‑ready.

Key Responsibilities
Observability Implementation
  • Implement and maintain metrics, logs, and traces for applications and infrastructure
  • Assist with onboarding applications into observability platforms (e.g., Dynatrace, ELK, Datadog)
  • Configure dashboards, alerts, and basic anomaly detection
Application Support & Instrumentation
  • Work with development teams to enable structured logging, basic distributed tracing, and core metrics
  • Validate observability requirements during Production Readiness Reviews (PRR)
  • Troubleshoot missing or low‑quality telemetry
Monitoring & Alerting
  • Configure alerts based on golden signals (latency, errors, traffic, saturation)
  • Help reduce alert noise by tuning thresholds and alert logic
  • Support incident response by gathering logs, metrics, and traces
Operations & Reliability
  • Support root cause analysis using observability tools
  • Maintain dashboards and documentation used by on‑call and support teams
  • Participate in on‑call rotations (as applicable)
Automation & Continuous Improvement
  • Assist in automating observability onboarding and validation tasks
  • Create and maintain reusable dashboards and alert templates
  • Follow established observability standards and best practices
Required Qualifications
  • 2–4 years of experience in Observability, or SRE
  • Working knowledge of metrics, logs, and basic tracing concepts
  • Hands‑on experience with at least one observability platform (Dynatrace, Elastic/ELK, Datadog, New Relic, etc.)
  • Basic understanding of SLIs/SLOs and service health indicators
  • Experience with cloud platforms or hybrid environments
  • Ability to write scripts (Python, Bash, PowerShell) for automation and troubleshooting
Preferred Qualifications
  • Experience with OpenTelemetry or APM agents
  • Familiarity with Kubernetes or containerized workloads
  • Experience working with incident management tools (PagerDuty, ServiceNow)
  • Exposure to Dynatrace/Kibana ELK or similar cloud‑native monitoring
  • Experience in regulated or enterprise environments
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

SRE Observability Engineer - Instrumentation & Dashboards
SRE Observability Engineer - Instrumentation & Dashboards

Astra-North Infoteck Inc. ~ Conquering today’s challenges, achieving tomorrow’s vision! • Toronto

Hybrid
CAD 75,000 - 95,000
SRE Observability Engineer
SRE Observability Engineer

Tata Consultancy Services • Toronto

On-site
CAD 90,000 - 120,000
Observability Engineer — SRE for Metrics, Logs & Traces
Observability Engineer — SRE for Metrics, Logs & Traces

Tata Consultancy Services • Toronto

On-site
CAD 90,000 - 120,000
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

TEEMA • Vancouver

On-site
CAD 83,000 - 110,000
Dynatrace SRE — End-to-End Observability (Hybrid)
Dynatrace SRE — End-to-End Observability (Hybrid)

Dexian • Toronto

Hybrid
CAD 80,000 - 100,000
Principal Observability Engineer
Principal Observability Engineer

ISG Search Inc • Toronto

On-site
CAD 150,000 - 190,000
Azure or GCP experience
Red Hat technologies
Virtualization
+3
Senior SRE Leader: Scale Reliability & Observability
Senior SRE Leader: Scale Reliability & Observability

Rootly • Toronto

On-site
CAD 80,000 - 100,000
Senior SRE/DevOps Engineer - Kubernetes & Observability
Senior SRE/DevOps Engineer - Kubernetes & Observability

Infotek Consulting Inc. • Toronto

Hybrid
CAD 125,000 - 150,000
Senior Support Engineer
Senior Support Engineer

Tata Consultancy Services • Toronto

On-site
CAD 100,000 - 120,000
Site Reliability Engineer
Site Reliability Engineer

Gemini Solutions Pvt Ltd • Toronto

On-site
CAD 120,000 - 170,000