SRE Architect: Cloud & Data Reliability Leader

Hitachids

Greater London

On-site

GBP 90,000 - 140,000

Full time

14 days+
Application generator

Stand out for this role — generate a tailored resume and cover letter in about a minute.

Get past ATS filters

Job summary

Hitachi Digital Services seeks a senior SRE/DevOps professional to lead the Site Reliability Engineering practice, transforming operations toward proactive, engineering-led reliability. You will define NFRs with FMEA-based methods, champion observability, self-healing automation, and automated incident management, while ensuring cost efficiency and continuous improvement.

Responsibilities include defining NFRs, building self-healing automation, and leading DB automation with UK release

Qualifications

  • 7+ years in SRE, DevOps, or production engineering with 3+ years in a senior or lead capacity.
  • Proven track record of improving availability, reducing MTTR, and implementing self-healing at scale.
  • Experience managing or automating database operations in enterprise environments.
  • Relevant certifications preferred: CKA, AWS DevOps Professional, Azure DevOps Expert, SRE Foundation.
  • Bachelor’s degree in Computer Science, Engineering, or related field (or equivalent experience).

Responsibilities

  • Define and enforce non-functional requirements (NFRs) for performance, scalability, availability, fault tolerance, and cost efficiency using FMEA-based failure analysis.
  • Design and implement self-healing automation for known failure patterns, reducing human intervention and on-call burden by 50%+.
  • Build comprehensive observability stacks (metrics, logs, traces) with ML-driven anomaly detection and AIOps capabilities.
  • Lead automated incident management: detection, triage, escalation, remediation, and post-incident review automation.
  • Drive DB automation: automated provisioning, release management (UK focus), backup/restore, and operational request workflows for all database operations.
  • Define and track SLIs, SLOs, and error budgets across all critical services, using them to balance reliability with feature velocity.
  • Conduct chaos engineering exercises and game days to validate resiliency and uncover hidden failure modes.
  • Mentor 2 SRE Engineers, establish engineering standards, and build a culture of reliability and continuous improvement.
  • Collaborate with Platform Engineering and Cloud teams to embed reliability into infrastructure and deployment pipelines.

Skills

Observability
Resiliency
Service management
Reliability
Performance engineering
Scalability
Release management
Cloud cost management
Kubernetes
AWS
Azure
GCP
Python
Go
Bash
Datadog
Prometheus
Grafana
ELK/OpenSearch

Education

Bachelor’s degree in Computer Science or Engineering

Tools

Liquibase
Flyway
SQL
Jenkins
GitLab CI
Spinnaker
ArgoCD
Kubernetes
Prometheus
Grafana
ELK/OpenSearch
Jaeger
Zipkin
Datadog
Dynatrace

Job description

Hitachi Digital Services seeks a senior SRE/DevOps professional to lead the Site Reliability Engineering practice, transforming operations toward proactive, engineering-led reliability. You will define NFRs with FMEA-based methods, champion observability, self-healing automation, and automated incident management, while ensuring cost efficiency and continuous improvement.

Responsibilities include defining NFRs, building self-healing automation, and leading DB automation with UK release

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Senior SRE Architect: Reliability & Self-Healing at Scale
Senior SRE Architect: Reliability & Self-Healing at Scale

Hitachi • Greater London

On-site
GBP 42,000 - 70,000
SRE Architect (68019) (DEAI DS) Cloud & Data Engineering United Kingdom
SRE Architect (68019) (DEAI DS) Cloud & Data Engineering United Kingdom

Hitachids • Greater London

On-site
GBP 90,000 - 140,000
SRE Architect
SRE Architect

Hitachi • Greater London

On-site
GBP 42,000 - 70,000
Site Reliability Engineer
Site Reliability Engineer

Falconsmartit • Hove

Hybrid
GBP 90,000 - 130,000
SRE
SRE

Technopride Ltd • Hove

Hybrid
GBP 60,000 - 80,000
AWS Site Reliability Engineer
AWS Site Reliability Engineer

Marks Sattin • Greater London

On-site
GBP 60,000 - 80,000
SRE Manager: Reliability & Incident Leadership (Hybrid London)
SRE Manager: Reliability & Incident Leadership (Hybrid London)

Gravitas Recruitment Group (Global) Ltd • Greater London

Hybrid
GBP 75,000 - 100,000
SRE Engineer – FinTech Reliability, Observability & Cloud
SRE Engineer – FinTech Reliability, Observability & Cloud

Hamilton Barnes Associates Limited • Greater London

On-site
GBP 90,000 - 130,000
Global engineering organisation
Engineering-led culture
Technically challenging problems
+1
Senior SRE: Cloud Reliability & Observability Lead
Senior SRE: Cloud Reliability & Observability Lead

Pulse Recruit • Greater London

Hybrid
GBP 65,000 - 85,000
Remote Senior Azure SRE - Reliability & Automation
Remote Senior Azure SRE - Reliability & Automation

OMEGA, Inc. • United Kingdom

Remote
GBP 100,000 - 140,000
Competitive salary and benefits
Professional development
Certification support
+1