Platform Reliability Lead for AI Systems

Société Financière Manuvie

Toronto

Hybrid

CAD 113,000 - 210,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Benefits offered by this job

Assurance soins médicaux
Soins dentaires
Santé mentale
Régimes d’épargne-retraite
Congés payés au Canada

Job summary

La Société Financière Manuvie recherche un Lead Platform Reliability Engineer pour assurer stabilité et évolutivité d'une plateforme partagée soutenant le développement interne d’IA. Le poste combine ingénierie logicielle, pratiques SRE et exploitation pour offrir une plateforme fiable et conviviale.

Vous définirez les SLO/SLI, gérerez l’observabilité, conduirez les incidents et déployez des pipelines CI/CD, Terraform/Ansible et politiques comme code.

Qualifications

  • Baccalauréat en informatique/ingénierie ou expérience équivalente.
  • 5–8 ans en DevOps/Platform Engineering ou ops.
  • Expérience sur grands systèmes distribués avec on-call.
  • Cloud-native: Azure, Kubernetes, containers, CI/CD et observabilité.
  • Python et/ou Java/Scala/TypeScript pour backend et automation.
  • IA/LlM et architectures de récupération, embeddings et orchestration.
  • Conception d’API, workflows asynchrones, SLOs et budgets d’erreur.
  • Sécurité et conformité IA/données (authN/authZ, audit).
  • Collaborer globalement et traduire besoins en SLAs.

Responsibilities

  • Définir SLOs/SLIs, budgets opérationnels, dimensionnement et autoscaling.
  • Construire et maintenir logs, métriques, tracing et alerting; dashboards.
  • Répondre aux incidents en on-call; triage, remediation et post-mortems.
  • Développer des capacités self-service et pipelines CI/CD, AIOps/MLOps.
  • Gérer infrastructure as code via Terraform/Ansible; prévenir drift.
  • Renforcer la sécurité et la conformité (RBAC, secrets, audit).
  • Optimiser l’utilisation des ressources et planifier la capacité.
  • Gérer les déploiements sûrs et les politiques comme code.
  • Traiter la plateforme comme produit et définir des SLAs.
  • Collaborer avec équipes globales; assurer conformité cross-geo.
  • Maintenir les services backend pour interactions à haut trafic et flux real-time.

Skills

DevOps experience
Platform engineering
On-call operations
Azure Kubernetes
Python / Java
IA solutions basics
API design
Security compliance
Global collaboration

Education

Bachelor's in Computer Science/Engineering

Tools

Terraform
Ansible
Kubernetes
CI/CD pipelines
GitOps

Job description

La Société Financière Manuvie recherche un Lead Platform Reliability Engineer pour assurer stabilité et évolutivité d'une plateforme partagée soutenant le développement interne d’IA. Le poste combine ingénierie logicielle, pratiques SRE et exploitation pour offrir une plateforme fiable et conviviale.

Vous définirez les SLO/SLI, gérerez l’observabilité, conduirez les incidents et déployez des pipelines CI/CD, Terraform/Ansible et politiques comme code.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Spécialiste SRE (Site Reliability Engineering)
Spécialiste SRE (Site Reliability Engineering)

ALFACONSEIL.CA • Montreal (administrative region)

On-site
CAD 110,000 - 140,000
Ingénieur DevOps et Fiabilité des Plateformes
Ingénieur DevOps et Fiabilité des Plateformes

desjardins • Montreal (administrative region)

Hybrid
CAD 110,000 - 150,000
4 semaines de vacances flexibles dès 1
Assurance collective + télémédecine
Remboursement des frais Santé et télé/
Spécialiste DevOps SRE (Senior)
Spécialiste DevOps SRE (Senior)

SII Canada • Montreal (administrative region)

Hybrid
CAD 85,000 - 110,000
Senior AI Platform Engineer | Full-Stack & MLOps
Senior AI Platform Engineer | Full-Stack & MLOps

Société Financière Manuvie • Toronto

Hybrid
CAD 113,000 - 163,000
SRE/DevOps -AWS
SRE/DevOps -AWS

Highspring • Montreal (administrative region)

On-site
CAD 80,000 - 100,000
Formation continue
Environnement de travail flexible
Projets à fort impact
Développeur full stack (SRE)
Développeur full stack (SRE)

CoFoMo Inc. • Montreal (administrative region)

On-site
CAD 110,000 - 140,000
Remote Ingénieur Fiabilité d'Infrastructure — SaaS
Remote Ingénieur Fiabilité d'Infrastructure — SaaS

Tecsys Inc. • Montreal

Hybrid
CAD 80,000 - 100,000
Travail à distance
Environnement inclusif
Opportunités d'apprentissage
Ingénieur SRE – Fiabilité Cloud et Incidents (Montréal)
Ingénieur SRE – Fiabilité Cloud et Incidents (Montréal)

SAP • Montreal (administrative region)

Hybrid
CAD 98,000 - 166,000
Senior DevOps IA: Cloud, MLOps & AI Production
Senior DevOps IA: Cloud, MLOps & AI Production

Wepoint • Montreal (administrative region)

Hybrid
CAD 110,000 - 160,000
3 semaines de vacances
Assurances collectives
REER collectif
+3
Administrateur Sytèmes - IA Agentique
Administrateur Sytèmes - IA Agentique

Familiprix • Quebec

On-site
CAD 110,000 - 170,000