Site Reliability Expert

Valtech

Montreal (administrative region)

On-site

CAD 120,000 - 170,000

Full time

9 days ago

Get more replies from employers

Send a job-specific resume in minutes.

Benefits offered by this job

Assurance complète
REER et RPDB
Vacances flexibles
Remboursement matériel 30$/mois
Programme d'aide et santé mentale

Job summary

Valtech recrute un Expert en Fiabilité des Sites (SRE) pour piloter les initiatives d'observabilité et l'excellence opérationnelle dans des environnements cloud natifs.

Vous définirez les standards SRE, les SLIs/SLOs et superviserez les outils de monitoring (Dynatrace, Datadog, New Relic) tout en accompagnant les équipes produit et DevOps.

Qualifications

  • Expertise SRE et Observabilité, en production complexe.
  • Connaissance SLI/SLO et budgets d'erreur.
  • Maîtrise des outils d'observabilité ( Dynatrace, Datadog, New Relic, AppDynamics).
  • Expérience Terraform, Bash et Python pour automatisation et pipelines CI/CD.
  • Connaissance OpenTelemetry et traçage distribué ± Kubernetes/AWS.

Responsibilities

  • Définir la stratégie d'observabilité et les standards de gouvernance.
  • Concevoir et déployer les solutions de surveillance et d'alerte.
  • Promouvoir les meilleures pratiques SRE et l'automatisation.
  • Collaborer avec les équipes produit pour améliorer fiabilité et performance.
  • Définir et documenter les standards de tagging et de gouvernance.
  • Former les équipes sur l'observabilité.
  • Diriger des chantiers techniques et prioriser les livrables.
  • Analyser et résoudre des incidents dans une architecture microservices.
  • Favoriser l'excellence opérationnelle et la documentation.
  • Travailler avec des équipes distribuées dans un contexte international.

Skills

SRE et Observabilité
SLI/SLO/Error Budgets
Cloud natifs (AWS)
Kubernetes
OpenTelemetry (OTEL)
Dynatrace / Datadog / New Relic
Automation & DevOps
Terraform
Bash / Python
Communication FR/EN

Tools

Dynatrace
Datadog
New Relic
AppDynamics
OTEL
Terraform
Bash
Python
GitLab CI/CD

Job description

Opportunité À Valtech, vous trouverez un environnement propice à l'apprentissage continu, à l'impact concret et à la croissance professionnelle. Que vous développiez de nouvelles solutions digitales, remettiez en question les idées reçues ou construisiez la prochaine génération d'expériences client, votre travail contribuera à transformer les secteurs d'activité.

Nous sommes fiers de: Notre travail et l'innovation que nous encourageons. Nos valeurs: "share, dare, care". Une culture d'entreprise qui favorise la créativité, la diversité et l'autonomie. Notre structure mondiale sans frontières, qui permet une collaboration fluide. La maîtrise de l'anglais est requise, car le rôle implique des communications régulières avec des clients et des collègues situés à l'extérieur du Québec.

À propos du poste

Nous recherchons un(e) Expert(e) en Fiabilité des Sites (SRE) expérimenté(e) pour piloter les initiatives d'observabilité, de fiabilité et d'excellence opérationnelle au sein d'environnements cloud natifs complexes. Ce rôle va bien au-delà de l'administration d'une plateforme d'observabilité et nécessite une solide expertise en Site Reliability Engineering (SRE), combinée à une expérience approfondie des opérations en production, de l'automatisation et des pratiques de fiabilité à grande échelle. La personne idéale possède une expertise technique reconnue, est capable de définir des standards d'observabilité, d'accompagner les équipes produit et d'améliorer continuellement la fiabilité et la performance des plateformes.

Responsabilités principales
  • Définir et mettre en œuvre la stratégie d'observabilité ainsi que les standards et modèles de gouvernance associés.
  • Concevoir, déployer et maintenir les solutions de surveillance, d'alerte et de visualisation à l'aide de Dynatrace ou d'outils équivalents.
  • Mettre en place et promouvoir les meilleures pratiques SRE, notamment les SLI, SLO, Error Budgets et les mécanismes d'alerte basés sur les symptômes.
  • Collaborer avec les équipes de développement et de produit afin d'améliorer la fiabilité, la performance et la résilience des systèmes.
  • Définir les standards liés au tagging, à la gouvernance, à l'attribution des responsabilités, aux tableaux de bord et à la gestion des alertes.
  • Accompagner et former les équipes n'ayant pas d'expertise spécifique en observabilité.
  • Piloter des chantiers techniques, gérer les priorités et assurer la livraison des travaux dans les délais et budgets définis.
  • Analyser et résoudre des incidents complexes dans des architectures distribuées basées sur des microservices.
  • Promouvoir une culture d'amélioration continue, de documentation et d'excellence opérationnelle.
  • Collaborer efficacement avec des équipes distribuées dans un contexte international.
Qualifications requises
  • Site Reliability Engineering et Observabilité
  • Expérience significative en Site Reliability Engineering (SRE) dans des environnements de production complexes.
  • Solide maîtrise des concepts suivants : Service Level Indicators (SLI), Service Level Objectives (SLO), Error Budgets, Alerting basé sur les symptômes.
  • Expertise démontrée avec une plateforme d'observabilité telle que : Dynatrace, Datadog, New Relic, AppDynamics.
  • Expérience pratique avec : Application Performance Monitoring (APM), Real User Monitoring (RUM), Instrumentation et agents de monitoring, Gestion des alertes, Contrôle d'accès basé sur les rôles (RBAC), Gestion des SLO, Gouvernance et standards de tagging.
  • Cloud et systèmes distribués: Bonne connaissance d'OpenTelemetry (OTEL) et du traçage distribué. Expérience dans des architectures composables basées sur des microservices. Expérience pratique en environnement de production avec : AWS, Kubernetes.
  • Automatisation et DevOps: Expérience en automatisation d'infrastructure et d'opérations. Maîtrise de : Terraform, Bash, Python. Expérience avec GitLab CI ou tout autre outil de gestion de pipelines et workflows CI/CD.
  • Leadership et collaboration: Capacité démontrée à diriger un chantier technique de bout en bout. Expérience dans des environnements opérationnels et Agile complexes. Excellentes compétences en communication en français et en anglais, à l'oral comme à l'écrit. Forte capacité de transmission des connaissances et d'accompagnement des équipes.
  • Rigueur, autonomie et sens élevé de la documentation. Excellentes compétences en organisation, collaboration et gestion des priorités.
Atouts supplémentaires
  • Expérience dans la surveillance et l'exploitation d'applications Java Spring Boot.
  • Expérience au sein d'une plateforme ou d'un environnement e-commerce.
  • Expérience dans la définition et le déploiement de standards d'observabilité à l'échelle de l'entreprise.
  • Expérience de consultation ou d'accompagnement de multiples équipes de développement.
Profil recherché

Vous considérez l'observabilité comme un levier stratégique de fiabilité et non simplement comme un outil de monitoring. Vous combinez une expertise approfondie des plateformes telles que Dynatrace avec une solide expérience SRE, des environnements cloud natifs, de l'automatisation et des opérations en production. Vous aimez accompagner les équipes, influencer les meilleures pratiques et contribuer directement à l'amélioration de la fiabilité des systèmes à grande échelle.

Engagement pour l'inclusion

Nous concevons des expériences qui conviennent à toutes les personnes - et cela commence par nos équipes. À Valtech, nous avons à cœur de bâtir une culture inclusive où chaque individu se sent soutenu pour grandir, s'épanouir et atteindre ses objectifs. Quel que soit votre parcours, vous avez votre place. Explorez notre site Diversité et Inclusion pour en savoir plus sur nos actions en faveur d’un Valtech plus équitable.

Bénéfices et avantages

Il s’agit d’un poste en Temps Plain basé à Quebec, Montreal. La fourchette salariale proposée est de 120 000 CAD - 170 000 CAD bruts par an, selon l'expérience et la localisation.

  • Valtech offre un programme d’avantages sociaux complet, en vigueur après trois mois de service continu : Un régime d'assurance complet, avec la possibilité de choisir le module qui répond le mieux à vos besoins - Or, Argent ou Bronze. Selon le module sélectionné, l'employeur peut contribuer jusqu’à 80 % de votre couverture.
  • Ce régime comprend des assurances invalidité de courte et de longue durée.
  • Dialogue via Sun Life vous donne accès à des services de soins de santé virtuels, vous permettant de consulter un professionnel de la santé pour des urgences, des renouvellements d'ordonnance, et plus encore.
  • Vous avez également accès au Programme d'aide aux employés et à leur famille, ainsi qu'à un programme complet de soutien en santé mentale.
  • Un Compte de dépenses personnel de $500, pouvant être utilisé pour des remboursements de soins de santé, des abonnements au gym, des passes de transport en commun, des fournitures de bureau ou des contributions à votre REER par l'intermédiaire de Valtech.
  • Un régime de retraite dans lequel Valtech égalera 100 % de vos contributions à votre REER par l'entremise d'un Régime de participation différée aux bénéfices (RPDB), jusqu'à un maximum de 4 %.
  • Vous pouvez commencer à cotiser à votre REER immédiatement, et au RPDB après 3 mois. L'acquisition des droits du RPDB est complétée après 24 mois de service.
  • L'accès à un programme de vacances flexibles selon la politique de Valtech pour soutenir votre équilibre travail-vie personnelle, comprenant 5 jours disponibles pendant votre période de probation et un montant au prorata pour le reste de l'année.
  • Un remboursement de technologie personnelle - $30/mois offert à chaque employé dès le premier jour.
  • Nous fermons durant les vacances d'hiver et offrons des horaires flexibles tout au long de l'année, afin que vous puissiez profiter des après-midi ensoleillées du vendredi - pourvu que vos heures hebdomadaires soient complétées.
À propos de Valtech

Valtech est une entreprise d'innovation et d'expérience qui a pour vocation d'offrir une meilleure façon d'appréhender le monde. En combinant expertises, secteurs et cultures, nous aidons les marques à créer de la valeur dans un monde de plus en plus digital.

À l'intersection des données, de l'IA, de la créativité et de la technologie, nous accompagnons la transformation de grandes entreprises telles que L'Oréal, Mars, Audi, P&G, Volkswagen Dolby, et bien d'autres.

À Valtech, la transformation ne se limite pas aux discours. Nous la concrétisons. Nos collaborateurs sont au cœur de notre succès, et nous cultivons un environnement où chaque talent peut s'épanouir, évoluer et innover. Prêt·e à imaginer la suite? Rejoignez-nous.

Conformément à la loi allemande sur l'égalité de traitement et à son équivalent français, les offres d'emploi doivent être publiées de manière non sexiste. Nous utilisons la mention pour préciser que ce poste est ouvert à tous les genres dans ces pays, même si le titre du poste lui-même peut être traduit ou interprété comme "masculin" en allemand ou en français.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Site Reliability Expert
Site Reliability Expert

Valtech • Canada

On-site
CAD 100,000 - 150,000
Insurance plan
Retirement plan
Flexible vacation
+1
Data Scientist Google ADK
Data Scientist Google ADK

Valtech • Quebec

Remote
CAD 140,000 - 160,000
Insurance plan up to 80%
Virtual healthcare via Sun Life
Employee and Family Assistance Program
+5
Site Reliability Expert
Site Reliability Expert

NEPSE Trading • Canada

On-site
CAD 100,000 - 150,000
Comprehensive insurance plan (Gold/SIl
Virtual healthcare via Sun Life
Employee and Family Assistance Program
+2
Directeur de la Gestion Produit
Directeur de la Gestion Produit

Trackforce • Montreal (administrative region)

Hybrid
CAD 150,000 - 210,000
Directeur de la Gestion Produit
Directeur de la Gestion Produit

Tracktik • Montreal (administrative region)

Hybrid
CAD 120,000 - 180,000
Senior Software Developer (Digital Workflow) / Développeur(-euse) sénior, logiciel
Senior Software Developer (Digital Workflow) / Développeur(-euse) sénior, logiciel

Vention • Montreal (administrative region)

Hybrid
CAD 110,000 - 150,000
Hybrid work model
Professional development
Diversity & inclusion program
+2
Responsable du marketing terrain
Responsable du marketing terrain

Ivalua • Montreal (administrative region)

Hybrid
CAD 70,000 - 100,000
Mode de travail hybride
En-cas et déjeuners hebdomadaires au b
Casual snacks and weekly lunches
Talent Acquisition Team Lead - EPD
Talent Acquisition Team Lead - EPD

MaintainX • Montreal West

On-site
CAD 85,000 - 110,000
Salaire compétitif
Couverture santé, dentaire et vision
Congés illimités
[VO2 Canada] - Ingénieur.e Devops – Missions Ponctuelles
[VO2 Canada] - Ingénieur.e Devops – Missions Ponctuelles

Socket.dev • Montreal (administrative region)

On-site
CAD 90,000 - 130,000
Health insurance
Gym access
Udemy & Babbel training
+2
Développeur(euse) logiciel principal(e) - Équipe Digital Workflow
Développeur(euse) logiciel principal(e) - Équipe Digital Workflow

Vention • Montreal

Hybrid
CAD 100,000 - 130,000
Développement professionnel
Travail hybride
Engagement communautaire