Site Reliability Engineer - Live Ops & Cloud Resilience

World Wrestling Entertainment, Inc.

Greater London

Hybrid

GBP 70,000 - 110,000

Full time

10 days ago
Application generator

Don’t send a generic resume — generate a resume and cover letter tailored to this exact role.

Get past ATS filters

Job summary

IMG is seeking an experienced Site Reliability Engineer to design, build, and operate resilient, secure platforms underpinning our digital and live operations. You’ll focus on reliability, observability, automation, and disaster recovery across hybrid environments, collaborating with engineering, operations, and project stakeholders.

The role emphasizes improving service availability, incident response, and continuous improvement in high-availability production environments.

Qualifications

  • Proven experience in a Site Reliability Engineer, DevOps Engineer, Platform Engineer, or similar role.
  • Strong knowledge of Linux and operating system fundamentals.
  • Experience with cloud platforms such as AWS, Azure, or Google Cloud.
  • Experience with containerisation and orchestration technologies such as Docker and Kubernetes.
  • Strong experience with CI/CD tooling and modern software delivery practices.
  • Hands-on experience with Infrastructure as Code tools such as Terraform or CloudFormation.
  • Experience with monitoring, logging, and alerting tooling, and with designing actionable observability solutions.
  • Solid understanding of networking, security, system architecture, and distributed systems principles.
  • Strong scripting or programming capability in Python, Bash, or similar languages.
  • Experience working in high-availability, live production, or other business-critical operational environments.
  • Strong troubleshooting skills, calm decision-making under pressure, and a continuous improvement mindset.
  • Excellent communication and collaboration skills, including the ability to work effectively with technical and non-technical stakeholders.

Responsibilities

  • Design, build, and maintain reliable, scalable infrastructure and platform services across on-premises and cloud environments.
  • Improve service availability, latency, performance, and operational efficiency through engineering-led reliability practices.
  • Build and enhance observability across services and infrastructure, including monitoring, logging, alerting, dashboards, and service health indicators.
  • Define and maintain SLIs, SLOs, alerting standards, and operational runbooks for critical services.
  • Automate infrastructure provisioning, configuration, deployment, and recovery processes using Infrastructure as Code and scripting.
  • Partner with software, platform, broadcast engineering, and operational teams to improve release quality, resilience, and supportability.
  • Act as an escalation point for production incidents, leading or supporting rapid diagnosis, mitigation, communication, and post-incident follow-up.
  • Drive root cause analysis and corrective actions following incidents, with a focus on prevention and continuous improvement.
  • Support the design, testing, and documentation of high availability, backup, failover, and disaster recovery arrangements.
  • Help enforce security, access control, patching, and operational best practices across infrastructure and services.

Skills

Linux fundamentals
Cloud platforms (AWS/Azure/GCP)
Docker & Kubernetes
CI/CD tooling
Infrastructure as Code (Terraform/CF)
Observability & monitoring
Scripting (Python/Bash)
Networking & security
Incident response & problem solving

Tools

Terraform
Docker
Kubernetes
CI/CD pipelines

Job description

IMG is seeking an experienced Site Reliability Engineer to design, build, and operate resilient, secure platforms underpinning our digital and live operations. You’ll focus on reliability, observability, automation, and disaster recovery across hybrid environments, collaborating with engineering, operations, and project stakeholders.

The role emphasizes improving service availability, incident response, and continuous improvement in high-availability production environments.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Site Reliability Engineer — Cloud & Live Ops (Hybrid)
Site Reliability Engineer — Cloud & Live Ops (Hybrid)

IMG • Uxbridge

Hybrid
GBP 70,000 - 100,000
Senior Site Reliability Engineer - Cloud Observability & Automation
Senior Site Reliability Engineer - Cloud Observability & Automation

Omilia • Greater London

On-site
GBP 90,000 - 120,000
Fixed compensation
Long-term vacation
Professional growth
+3
Site Reliability Engineer – Live Ops (Contract, Hybrid)
Site Reliability Engineer – Live Ops (Contract, Hybrid)

Lorien • Glasgow

Hybrid
GBP 100,000 - 125,000
Site Reliability Engineer - Hybrid, Observability
Site Reliability Engineer - Hybrid, Observability

bet365 Group • United Kingdom

Hybrid
GBP 75,000 - 110,000
Eye care and Flu Vaccinations
Life Assurance
24/7 SRE-NOC Engineer: Automate & Improve Reliability
24/7 SRE-NOC Engineer: Automate & Improve Reliability

Nice • United Kingdom

On-site
GBP 50,000 - 75,000
Site Reliability Engineer - Cloud, Linux & On-Call
Site Reliability Engineer - Cloud, Linux & On-Call

Oracle • United Kingdom

On-site
GBP 70,000 - 110,000
Jira & Confluence access
Senior Site Reliability Engineer: Lead Resilience & Incidents
Senior Site Reliability Engineer: Lead Resilience & Incidents

Allwyn UK • Watford

On-site
GBP 90,000 - 130,000
Company Bonus Scheme
Matched pension contributions up to 8
26 days annual leave + 2 Life Days
+3
Senior Site Reliability Engineer — Hybrid, Global Impact
Senior Site Reliability Engineer — Hybrid, Global Impact

twentysix • United Kingdom

Hybrid
GBP 51,000 - 77,000
Hybrid work options
25 vacation days
Transportation subsidies
+6
Site Reliability Engineer
Site Reliability Engineer

Falconsmartit • England

On-site
GBP 90,000 - 130,000
Site Reliability Engineer
Site Reliability Engineer

Insight International (UK) Ltd • Bournemouth

On-site
GBP 55,000 - 75,000