Site Reliability Engineer - Data Availability

SIX

Singapore

Hybrid

SGD 100,000 - 180,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

SIX is seeking a skilled Site Reliability Engineer to join our engineering team in a hybrid role. You will blend hands-on 2nd level production support with proactive monitoring, automation, and reliability engineering for our real-time financial data processing platform.

You will design monitoring and observability dashboards, implement thresholding, automate with Ansible and scripting, and contribute to CI/CD and deployment reliability while improving system availability and efficiency.

Qualifications

  • Proven SRE/DevOps or 2nd level production support experience.
  • Strong analytical and troubleshooting skills in distributed environments.
  • Ownership mindset with a focus on automation and reliability.
  • Excellent communication and ability to work with cross-functional teams.
  • Experience with monitoring, logging, and incident response processes.

Responsibilities

  • Provide 2nd level support for production systems and critical business applications.
  • Investigate, troubleshoot, and resolve incidents; perform RCA and document findings.
  • Collaborate with development teams to ensure sustainable issue resolution.
  • Contribute to post-incident reviews and continuous improvement initiatives.
  • Design, implement, and maintain monitoring dashboards; optimize alerting.
  • Automate operational processes using Ansible and scripting.
  • Support CI/CD and deployment reliability improvements.
  • Continuously enhance system reliability, availability, and operational efficiency.

Skills

Analytical thinking
Troubleshooting
Ownership mindset
Cross-functional teamwork
Automation mindset

Tools

Elastic Stack
Grafana
Ansible
GitLab
Scripting

Job description

We are looking for a skilled and reliability-driven Site Reliability Engineer (SRE) to strengthen our engineering team. In this hybrid role, you will combine hands-on 2nd level support responsibilities with monitoring, automation, and reliability engineering. You will play a key role in ensuring the stability, observability, and continuous improvement of our production systems supporting real-time financial data processing.

What You Will Do
Operational Support & Incident Management
  • Provide 2nd level support for production systems and critical business applications.
  • Investigate, troubleshoot, and resolve incidents and performance issues. Perform root cause analysis (RCA) and document findings in a structured manner.
  • Collaborate closely with development teams to ensure sustainable issue resolution.
  • Contribute to post-incident reviews and continuous improvement initiatives.
Monitoring, Observability & Automation
  • Design, implement, and maintain monitoring dashboards.
  • Improve alert quality and reduce noise through effective threshold and metric design.
  • Analyze logs, metrics, and system behavior to proactively detect anomalies.
  • Automate operational processes using Ansible and scripting.
  • Contribute to CI/CD and deployment reliability improvements.
  • Continuously optimize system reliability, availability, and operational efficiency.
What You Bring
Operational Mindset & Collaboration
  • Proven experience in Site Reliability Engineering, DevOps, or 2nd level production support.
  • Strong analytical and troubleshooting skills in complex distributed environments.
  • Structured, solution-oriented approach with strong ownership mindset.
  • Effective communication skills and ability to work with cross-functional teams.
  • Motivation to reduce manual effort through automation and process improvements.
Technical Skills
  • Hands-on experience with Elastic Stack and Grafana for monitoring and logging.
  • Experience with Ansible for configuration management and automation.
  • Experience with Git/GitLab.
  • Familiarity with scripting languages.
Tooling & Ecosystem (Nice to Have)
  • Good understanding of networking fundamentals (TCP/IP, DNS, HTTP).
  • Experience with Linux systems and shell scripting.
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Site Reliability Engineer
Site Reliability Engineer

IDEMIA Public Security • Singapore

On-site
SGD 120,000 - 180,000
Senior Site Reliability Engineer (SRE)
Senior Site Reliability Engineer (SRE)

VANGUARD SOFTWARE PTE. LTD. • Singapore

On-site
SGD 100,000 - 150,000
Technical Leadership
Career Growth
High-Performance Team
+1
Site Reliability Engineer
Site Reliability Engineer

Singapore Exchange Limited • Singapore

On-site
SGD 180,000 - 250,000
Software Engineer/ Site Reliability Engineer
Software Engineer/ Site Reliability Engineer

United States Digital Space LLC • Singapore

On-site
SGD 90,000 - 150,000
Site Reliability Engineer - Data Availability
Site Reliability Engineer - Data Availability

SIX Group Services Ltd. • Singapore

Hybrid
SGD 70,000 - 90,000
Flexible work models
Personal development opportunities
Agile working methods
Site Reliability Engineer, Enterprise Technology Services
Site Reliability Engineer, Enterprise Technology Services

United States Digital Space LLC • Singapore

On-site
SGD 120,000 - 200,000
Site Reliability Engineer
Site Reliability Engineer

TEKsystems • Singapore

Hybrid
SGD 120,000 - 180,000
Site Reliability Engineer — Real-Time Data Availability
Site Reliability Engineer — Real-Time Data Availability

SIX • Singapore

Hybrid
SGD 100,000 - 180,000
Site Reliability Engineer(Senior SRE)
Site Reliability Engineer(Senior SRE)

XIAOMI TECHNOLOGIES SINGAPORE PTE. LTD. • Singapore

On-site
SGD 120,000 - 180,000
Site Reliability Engineer (Splunk, Python, OCI, Dynatrace, RCA, Terraform, Ansible )
Site Reliability Engineer (Splunk, Python, OCI, Dynatrace, RCA, Terraform, Ansible )

NEPTUNEZ SINGAPORE PTE. LTD. • Singapore

On-site
SGD 120,000 - 180,000