AVP - Site Reliability Engineer

Singapore Exchange Limited

Singapore

On-site

SGD 140,000 - 210,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

Singapore Exchange Limited is seeking an experienced Site Reliability Engineer to own the reliability of critical platforms in a complex enterprise environment. You will drive SRE practices, incident response, and continuous improvement across cloud-native systems and monitoring stacks.

The role requires expertise in Kubernetes and IaC, with strong leadership, communication, and stakeholder management to ensure production readiness and fault-tolerant services.

Qualifications

  • 5-10+ years in Site Reliability Engineering, Platform Engineering, Cloud Operations, DevOps, or related technical discipline.
  • Proven experience defining and managing SLIs, SLOs, error budgets, and reliability governance.
  • End-to-End Service Ownership across onboarding, release readiness, production monitoring, incident response, problem management, recovery validation, and continuous improvement.
  • Hands-on with observability and monitoring platforms such as Prometheus, Grafana, ELK, CloudWatch, DataDog, Coralogix, or similar.

Responsibilities

  • Lead major incident management, problem management, root-causes and post-incident reviews.
  • Drive capacity planning, performance engineering, resilience testing, and risk management in high-availability environments.
  • Collaborate with engineering, infrastructure, security, product, and business teams to improve reliability.
  • Coach engineers and promote reliability culture and continuous improvement initiatives.

Skills

Site Reliability Engineering
Platform Engineering
Cloud Operations
DevOps
Reliability governance
SLI/SLO management
Incident management
Post-incident review
Capacity planning
Performance engineering
Automation
Infra as Code
Python
Kubernetes
EKS

Tools

Terraform
Ansible
Python
Prometheus
Grafana
ELK
CloudWatch
DataDog
Coralogix

Job description

  • 5-10+ years of experience in Site Reliability Engineering, Platform Engineering, Cloud Operations, DevOps, or a related technical discipline, with experience leading reliability initiatives in complex enterprise environments.
  • Proven experience defining and managing Service Level Indicators (SLIs), Service Level Objectives (SLOs), error budgets, and reliability governance frameworks.
  • End-to-End Service Ownership to Support the full operational lifecycle of assigned applications and platforms, including onboarding, release readiness, production monitoring, incident response, problem management, recovery validation, and continuous service improvement.
  • Hands-on expertise with observability and monitoring platforms such as Prometheus, Grafana, ELK, AWS CloudWatch, DataDog, Coralogix, or similar technologies.
  • Strong experience operating and supporting cloud-native platforms, Kubernetes/EKS environments, and distributed systems at scale.
  • Proficiency in automation and infrastructure-as-code using tools such as Terraform, Ansible AAP, Python, or equivalent technologies.
  • Experience leading major incident management, problem management, root-cause analysis, and post-incident review processes.
  • Demonstrated capability in capacity planning, performance engineering, resilience testing, and operational risk management within high-availability environments.
  • Strong stakeholder management and communication skills, with the ability to collaborate effectively across engineering, infrastructure, security, product, and business teams.
  • Experience coaching and mentoring engineers while driving operational excellence, reliability culture, and continuous improvement initiatives.
Preferred Qualifications
  • Experience or exposure within financial services, financial market infrastructure, exchanges, index calculation platforms, reference data systems, market data services, trading, clearing, settlement, or other highly regulated environments.
  • Professional certifications in cloud platforms (AWS, Azure, GCP), Kubernetes, Site Reliability Engineering, DevOps, or related disciplines.
  • Experience implementing AIOps, observability analytics, predictive monitoring, and intelligent automation solutions.
  • Hands-on experience leveraging AI or agentic AI technologies for alert triage, incident investigation, operational automation, runbook optimisation, and knowledge management.
  • Exposure to FinOps practices, cloud cost optimisation, and platform engineering operating models.
  • Familiarity with security, resilience, and regulatory requirements applicable to critical financial systems.
  • Experience driving large-scale technology transformation, platform modernisation, or cloud adoption initiatives.
  • Advanced knowledge of software engineering practices, CI/CD pipelines, and reliability-focused architecture patterns.
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Site Reliability Engineer
Site Reliability Engineer

SGX Group • Singapore

On-site
SGD 180,000 - 300,000
Site Reliability Engineer
Site Reliability Engineer

Singapore Exchange Limited • Singapore

On-site
SGD 180,000 - 250,000
AVP/VP - Site Reliability Engineer
AVP/VP - Site Reliability Engineer

Singapore Exchange Limited • Singapore

On-site
SGD 120,000 - 160,000
Lead Platform Site Reliability Engineer
Lead Platform Site Reliability Engineer

JPMorgan Chase & Co. • Singapore

On-site
SGD 120,000 - 190,000
Observability Engineer
Observability Engineer

U3 SOLUTIONS PTE. LTD. • Singapore

On-site
SGD 120,000 - 180,000
AVP/VP - Site Reliability Engineer
AVP/VP - Site Reliability Engineer

SGX Group • Singapore

On-site
SGD 120,000 - 170,000
AVP/VP - Site Reliability Engineer
AVP/VP - Site Reliability Engineer

United States Digital Space LLC • Singapore

On-site
SGD 120,000 - 180,000
Devops Engineer
Devops Engineer

KRIS INFOTECH PTE. LTD. • Singapore

On-site
SGD 120,000 - 180,000
Site Reliability Engineer(Senior SRE)
Site Reliability Engineer(Senior SRE)

XIAOMI TECHNOLOGIES SINGAPORE PTE. LTD. • Singapore

On-site
SGD 120,000 - 180,000
Lead Platform Site Reliability Engineer
Lead Platform Site Reliability Engineer

JPMORGAN CHASE BANK, N.A. • Singapore

On-site
SGD 180,000 - 260,000