Ingénieur SRE VMware

OVHcloud

Montreal (administrative region)

On-site

CAD 90,000 - 130,000

Full time

6 days ago
Be an early applicant
Application generator

Don’t send a generic resume — generate a resume and cover letter tailored to this exact role.

Get past ATS filters

Benefits offered by this job

Astreinte 24/7

Job summary

OVHcloud recherche un ingénieur SRE/Opérations pour assurer la stabilité des plateformes VMware et des solutions de sauvegarde (Veeam). Vous gérerez les incidents et contribuerez à l’amélioration continue via l’automatisation et les correctifs.

Dans un contexte Agile, vous participerez aux rotations d’astreinte et à l’analyse des root causes, afin de garantir la fiabilité et l’évolution des services Cloud VMware.

Qualifications

  • Expérience en exploitation ou SRE.
  • Connaissance des environnements VMware et des solutions de sauvegarde Veeam.
  • Maîtrise des pratiques d’incidents et de RCA.

Responsibilities

  • Assurer le suivi quotidien des incidents sur VMware et Veeam.
  • Participer à la résolution des incidents de niveau 3.
  • Analyser les causes racines et mettre en place des actions correctives.
  • Contribuer à l’amélioration du produit et à l’automatisation des processus.
  • Participer aux rotations d’astreinte et à la conduite des post-mortems.
  • Collaborer dans un cadre Agile et DevOps.

Skills

SRE/Opérations
VMware vSphere
Go/Perl scripting
CI/CD & automation
Gestion d’incidents
Agile
Bilinguisme FR/EN

Tools

Veeam
CI/CD tools
JIRA

Job description

L’équipe est responsable de l’exploitation, de la fiabilité et de l’amélioration continue des plateformes de virtualisation VMware ainsi que des solutions de sauvegarde associées.

Dans un environnement orienté SRE et opérations cloud, l’équipe assure la gestion des incidents, l’évolution des plateformes et la fiabilité des services pour les solutions existantes, récentes et futures.

Vous intégrerez une équipe responsable des produits :

Votre rôle consistera à assurer la stabilité des plateformes, contribuer à l’amélioration continue des services et participer aux activités d’exploitation et d’automatisation.

Vos principales responsabilités
  • Assurer le suivi quotidien de l’incidentologie sur les produits VMware et les solutions de backup (Veeam)
  • Participer à la gestion et la résolution des incidents de niveau 3
  • Analyser les causes racines des incidents (RCA) et mettre en place les actions correctives nécessaires
  • Contribuer à l’amélioration du produit Managed VMware vSphere, notamment via le développement de correctifs et d’automatisations
  • Participer aux tâches de migration, de mise à jour et aux projets d’évolution des plateformes VMware
  • Développer et maintenir des scripts ou correctifs simples à intermédiaires afin de réduire la récurrence des incidents
  • Participer aux rotations d’astreinte afin d’assurer la continuité du service
  • Contribuer à l’automatisation et à l’amélioration des opérations via des outils CI/CD
  • Collaborer avec les équipes techniques dans un environnement Agile
  • Participer à l’amélioration continue des processus SRE et opérationnels
Votre futur impact
Dans les 6 mois
  • Autonomie opérationnelle : gérer de façon indépendante les incidents N3 sur vSphere et Public VCFaaS, incluant l'analyse de root cause et la production de post-mortems.
  • Début des rotations d'astreintes.
  • Développement : prendre en charge des correctifs de code de complexité simple à intermédiaire (Go / Perl) sans supervision systématique.
  • Documenter les problemes via jira et prendre en charge tout le cycle du jira de sa création a sa resolution.
  • Prompt engineering : appliquer des workflows IA efficaces en contexte SRE et partager ses pratiques avec l'équipe.
  • Autonomie : gérer la majorité des incidents N3 de façon indépendante sur l'ensemble du périmètre (vSphere, Public et Private VCFaaS, Veeam), tout en ayant accès à du soutien au besoin.
  • Efficacité et qualité : atteindre constamment les indicateurs clés de performance (KPI) liés à la fiabilité et à la satisfaction client.
  • Connaissance des produits : développer une connaissance approfondie de l'ensemble du portfolio Cloud VMware et contribuer activement aux projets d'amélioration du produit.
Compétences requises
  • Expérience dans un environnement d’exploitation ou SRE
  • Bonne compréhension des méthodologies SRE et des pratiques d’exploitation
  • Expérience avec les environnements de virtualisation VMware
  • Connaissance des solutions de backup Veeam
  • Compréhension des langages Go et Perl
  • Maîtrise des outils et pratiques CI/CD
  • Maîtrise du prompt engineering dans un contexte opérationnel :
  • rédaction de system prompts efficaces
  • structuration de conversations multi-tours
  • utilisation de techniques avancées (few-shot, chain-of-thought, self-consistency)
  • Capacité à analyser des incidents complexes et diagnostiquer les causes racines
  • Travail en équipe et expérience dans un environnement Agile
  • Capacité à évoluer dans un environnement d’incidentologie et de production
  • Bilinguisme est nécessaire afin de répondre à des demandes de soutien à l'international
Atouts
  • Expérience avec VMware Cloud Foundation (VCF) ou d’autres solutions de virtualisation
  • Expérience avec les technologies de sauvegarde Veeam
Informations complémentaires
  • Participation à une rotation d’astreinte afin d’assurer un service 24/7/365
Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Site Reliability Engineer
Site Reliability Engineer

OVH GmbH • Montreal (administrative region)

On-site
CAD 90,000 - 140,000
Télétravail hybride
Plan d'actionnariat salarié
Subventions vacances et sport
+2
Ingénieur SRE VMware — Fiabilité & Automatisation Cloud
Ingénieur SRE VMware — Fiabilité & Automatisation Cloud

OVHcloud • Montreal (administrative region)

On-site
CAD 90,000 - 130,000
Astreinte 24/7
SDE / SRE Senior – VPC / Network
SDE / SRE Senior – VPC / Network

OVHcloud • Montreal (administrative region)

On-site
CAD 110,000 - 150,000
Administrateur Stockage (Senior)
Administrateur Stockage (Senior)

SII Canada • Montreal (administrative region)

On-site
CAD 80,000 - 100,000
Network Engineer
Network Engineer

OVH GmbH • Montreal (administrative region)

On-site
CAD 90,000 - 120,000
Télétravail hybride
Plan actionnariat salarié
Reconnaissance de l'ancienneté
+6
Network Engineer – Operate / Network Infrastructure
Network Engineer – Operate / Network Infrastructure

OVHcloud • Montreal (administrative region)

On-site
CAD 90,000 - 130,000
Chef d’équipe – cloud et hébergement
Chef d’équipe – cloud et hébergement

ALFACONSEIL.CA • Boucherville

On-site
CAD 80,000 - 100,000
Administrateur Sénior – Système, Serveurs, Cloud et Virtualisation
Administrateur Sénior – Système, Serveurs, Cloud et Virtualisation

IPConsul • Varennes

Hybrid
CAD 110,000 - 150,000
Salaire compétitif
Plan de boni à la performance
Horaire hybride
+1
IT Team Leader
IT Team Leader

OVH GmbH • Montreal (administrative region)

Hybrid
CAD 110,000 - 190,000
DevOps / Site Reliability Engineer – Linux
DevOps / Site Reliability Engineer – Linux

Akkodis • Montreal (administrative region)

Hybrid
CAD 90,000 - 130,000