OBSERVABILITY ENGINEER

Apptoza Inc.

Halifax

On-site

CAD 100,000 - 150,000

Full time

4 hours ago
Be an early applicant
Application generator

Stand out for this role — generate a tailored resume and cover letter in about a minute.

Get past ATS filters

Job summary

Apptoza Inc. seeks an experienced Observability Engineer to own the complete observability stack across 50+ production Kubernetes clusters, providing metrics, logging, tracing, and alerting for mission-critical apps.

You’ll blend modern observability with AI/ML to enable intelligent monitoring and self-healing infrastructure. The role involves designing, deploying, and maintaining enterprise-scale observability systems, including Prometheus, Grafana, Thanos, Loki, and related tooling, with

Qualifications

  • Proven experience designing and operating complex observability stacks.
  • Strong skills with Prometheus, Grafana, Loki, Thanos and logging tools.
  • Experience with GitOps and IaC for deploying monitoring infrastructure.

Responsibilities

  • Own enterprise-scale observability across 50+ Kubernetes clusters and multi-cloud deployments.
  • Configure dashboards, alerts, and SLO/SLI tracking for reliability and performance.
  • Design and implement long-term metrics storage and efficient querying.

Skills

Kubernetes expertise
Observability design
AI/ML awareness

Tools

Prometheus
Grafana
Thanos
Loki
GitOps
ELK
Splunk
ServiceMonitors
PodMonitors
LogQL

Job description

We are seeking an experienced Observability Engineer to join our Enterprise Kubernetes Platform team at a leading financial services organization. You’ll own the complete observability stack across 50+ production Kubernetes clusters| providing metrics| logging| tracing| and alerting capabilities that ensure exceptional reliability and performance for mission-critical applications.

This role combines deep technical expertise in modern observability tools with emerging AI/ML capabilities to build intelligent monitoring solutions| predictive alerting| and self-healing infrastructure.

WHAT YOULL DO

OBSERVABILITY STACK OWNERSHIP

Design| deploy| and maintain enterprise-scale observability infrastructure including Prometheus| Grafana| Thanos| Loki| and modern collection agents

Manage observability deployments using GitOps principles and infrastructure as code

Implement long-term metrics storage solutions with cloud object storage

Maintain and upgrade observability components across development| QA| UAT| production| and DR environments

Configure distributed observability architecture spanning multiple datacenters and cloud providers

METRICS & MONITORING

Design and implement Prometheus monitoring strategies for Kubernetes infrastructure and containerized applications

Create ServiceMonitors| PodMonitors for automated metrics collection

Develop rules for intelligent alerting with minimal false positives

Configure multi-cluster metrics federation and aggregation

Optimize metrics cardinality| storage e_iciency| and query performance

Implement recording rules for pre-aggregated metrics and SLI calculations

DASHBOARDS & VISUALIZATION

Build comprehensive Grafana dashboards for infrastructure health| application performance| and business metrics

Create reusable dashboard templates and libraries for development teams

Design executive dashboards with SLO/SLI tracking and business KPIs

Implement role-based access control and multi-tenancy in Grafana

LOGGING INFRASTRUCTURE

Deploy and manage centralized logging solutions (Loki| ELK| Splunk| or similar)

Design log retention policies balancing cost| compliance| and operational needs

Create LogQL/Lucene queries and log-base

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Observability Engineer – Kubernetes Platform
Observability Engineer – Kubernetes Platform

BullTechSystem • Halifax

On-site
CAD 90,000 - 120,000
Platform Engineer
Platform Engineer

LanceSoft, Inc. • Montreal (administrative region)

On-site
CAD 80,000 - 120,000
GCP Observability Engineer
GCP Observability Engineer

ALLTECH CONSULTING SVC INC • Quebec

On-site
CAD 85,000 - 115,000
Senior Observability Engineer for Multi-Cluster Kubernetes
Senior Observability Engineer for Multi-Cluster Kubernetes

BullTechSystem • Halifax

On-site
CAD 90,000 - 120,000
Senior Observability Engineer
Senior Observability Engineer

Astra-North Infoteck Inc. ~ Conquering today’s challenges, achieving tomorrow’s vision! • Montreal (administrative region)

On-site
CAD 120,000 - 160,000
Site Reliability Engineer (AI Observability)
Site Reliability Engineer (AI Observability)

Appnovation • Montreal (administrative region)

On-site
CAD 90,000 - 135,000
Cloud Observability Engineer
Cloud Observability Engineer

TMC • Montreal (administrative region)

On-site
CAD 80,000 - 100,000
Permanent employment contract
Profit sharing
One-on-one coaching and training
+2
Dynatrace Observability Platform Engineer
Dynatrace Observability Platform Engineer

Astra-North Infoteck Inc. ~ Conquering today’s challenges, achieving tomorrow’s vision! • Mississauga

On-site
CAD 90,000 - 140,000
Staff Backend Engineer (Mimir Query, Databases)
Staff Backend Engineer (Mimir Query, Databases)

Grafana • Canada

Remote
CAD 120,000 - 170,000
Fully remote work
Learning stipend
Headspace access
+2
Platform & SRE Engineer
Platform & SRE Engineer

TechDoQuest • Montreal (administrative region)

On-site
CAD 90,000 - 130,000