Site Reliability Engineer (SRE) – Cloud Platforms

Talenzon group

Greater London

Hybrid

GBP 70,000 - 110,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

Talenzon group in London is seeking a Site Reliability Engineer (SRE) with strong cloud infrastructure experience to join the on-site team. You will help design reliable, scalable production systems and automate operational processes for improved reliability.

Responsibilities include monitoring, incident response, capacity planning, and building observability with logging, metrics, and tracing. You will implement infrastructure as code and collaborate across engineering teams.

Qualifications

  • Experience operating production systems in cloud environments (AWS, GCP or Azure).
  • Strong knowledge of Kubernetes-based architectures and observability tools (Prometheus, Grafana).
  • Proficiency with scripting/programming languages (Python, Go, Bash) and IaC (Terraform).
  • Solid understanding of Linux, networking and distributed systems.

Responsibilities

  • Design reliability strategies for high-availability production systems.
  • Monitor health, performance and uptime across cloud infrastructure.
  • Automate operations to reduce manual tasks and improve reliability.
  • Develop and maintain observability systems including logging, metrics, and tracing.
  • Lead incident response and root cause analysis for production issues.
  • Improve resilience through capacity planning and fault tolerance.
  • Collaborate with engineering to embed reliability in the SDLC.
  • Implement infrastructure automation using Infrastructure as Code.

Skills

AWS
GCP
Azure
Kubernetes
Prometheus
Grafana
Python
Go
Bash
Terraform
Linux
Networking
Distributed systems

Tools

Terraform

Job description

# Site Reliability Engineer (SRE) – Cloud Platforms,March 11, 2026### Job Description**Location:** London, UK **Work Model:** On-site **Role Type:** Full-TimeWe are looking for a **Site Reliability Engineer (SRE)** with strong experience in cloud infrastructure and production reliability to join our client’s on-site team in London.This role focuses on ensuring the reliability, scalability, and performance of mission-critical systems. You will work closely with software engineering and platform teams to build resilient infrastructure, automate operational processes, and improve system observability across production environments.---### **What You’ll Do*** Design and implement reliability strategies for high-availability production systems* Monitor system health, performance, and uptime across cloud infrastructure* Build automation to reduce manual operations and improve system reliability* Develop and maintain observability systems including logging, metrics, and tracing* Manage incident response processes and perform root cause analysis for production issues* Improve system resilience through capacity planning, performance optimisation, and fault tolerance* Collaborate with engineering teams to integrate reliability practices into the software development lifecycle* Implement infrastructure automation using Infrastructure as Code---### **What We’re Looking For**#### **Required Skills & Experience*** Strong experience operating production systems in cloud environments such as **Amazon Web Services**, **Google Cloud**, or **Microsoft Azure*** Experience with container orchestration platforms such as **Kubernetes*** Strong experience with monitoring and observability tools such as **Prometheus** and **Grafana*** Proficiency in scripting or programming languages such as Python, Go, or Bash* Experience implementing Infrastructure as Code with tools such as Terraform* Strong understanding of Linux systems, networking, and distributed systems---#### **Nice to Have*** Experience with CI/CD pipelines using platforms such as **GitHub** Actions or **GitLab*** Familiarity with incident management frameworks and reliability engineering practices (SLIs, SLOs, error budgets)* Experience supporting microservices architectures and high-scale systems* Knowledge of distributed tracing and performance monitoring---**Location:** London, UK **Work Model:** On-site **Role Type:** Full-TimeLocation,Experience levelMid–Senior level## Work Location
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Platform Reliability Engineer – Cloud Infrastructure
Platform Reliability Engineer – Cloud Infrastructure

Talenzon group • Greater London

On-site
GBP 60,000 - 80,000
Site Reliability Engineer
Site Reliability Engineer

DNS INFO LTD • City Of London

On-site
GBP 70,000 - 95,000
Site Reliability Engineer (SRE) / Platform Engineer
Site Reliability Engineer (SRE) / Platform Engineer

Adecco • City Of London

Hybrid
Hybrid work arrangement
Competitive day rate
London-based contract
Site Reliability Engineer
Site Reliability Engineer

Insight International (UK) Ltd • Bournemouth

On-site
GBP 55,000 - 75,000
Site Reliability Engineer
Site Reliability Engineer

ReVybe IT Recruitment Limited • Greater London

Hybrid
GBP 51,000 - 85,000
Bonus
Benefits
Site Reliability Engineer (SRE) – Cloud Engineer
Site Reliability Engineer (SRE) – Cloud Engineer

Dianaduggan • Glasgow

Hybrid
GBP 74,000 - 83,000
SRE
SRE

Technopride Ltd • Hove

Hybrid
GBP 60,000 - 80,000
Site Reliability Engineer
Site Reliability Engineer

Incite Insight • Greater London

Hybrid
GBP 70,000 - 90,000
Senior SRE
Senior SRE

Pulse Recruit • Greater London

Hybrid
GBP 65,000 - 85,000
Senior Platform Engineer / SRE
Senior Platform Engineer / SRE

Myn • Greater London

Hybrid
GBP 90,000 - 120,000