Site Reliability Engineer( SRE)

XIAOMI TECHNOLOGIES SINGAPORE PTE. LTD.

Singapore

On-site

SGD 90,000 - 130,000

Full time

8 days ago

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

XIAOMI TECHNOLOGIES SINGAPORE PTE. LTD. is hiring a Site Reliability Engineer to ensure the stability, reliability, and high availability of our overseas production environment.

You will manage provisioning, capacity planning, monitoring, incident response, and daily operations to maintain business continuity. The role requires 3+ years in SRE or related fields, strong programming and automation skills, and familiarity with multi-cloud platforms.

Qualifications

  • 3+ years in SRE, Platform Engineering, or Cloud/Systems administration.
  • Proficient in at least one programming language (Python/Go/Java/C++) and strong automation skills.
  • Experience with multi-cloud or hybrid cloud platforms (Alibaba Cloud/AWS/Azure/GCP) preferred.
  • Solid understanding of Linux, networking, load balancing, distributed systems, and high-availability architectures.
  • Ability to diagnose issues quickly, communicate across teams, and drive stability plans aligned with business goals.
  • Experience with observability tools (Prometheus, Grafana, ELK) and scripting (Bash or Python).
  • Familiarity with AI tools in operations or R&D efficiency is a plus.

Responsibilities

  • Ensure stability, reliability, and high availability of overseas production environment.
  • Manage provisioning, capacity planning, monitoring, change management, incident response, and daily operations.
  • Review architectures and mitigate risks to optimize stability and resource efficiency.
  • Participate in on-call rotations and respond to production incidents.
  • Build and enhance observability systems (monitoring/logging/tracing).
  • Develop automation platforms and engineering efficiency tools.
  • Explore AI technologies to improve automation, fault analysis, and knowledge management.
  • Collaborate with R&D, product, security, and infra teams to drive stability initiatives.

Skills

Python
Go
Java
C++
Linux
Networking
Automation

Education

Bachelor's degree (CS/Software/IT)

Tools

Prometheus
Grafana
ELK
CI/CD

Job description

Job Responsibilities:
  • Ensure the stability, reliability, and high availability of the company's overseas production environment, continuously improving system availability and service quality.
  • Manage resource provisioning, capacity planning, monitoring, change management, incident response, and daily operations to maintain business continuity and stability.
  • Review system architecture and technical solutions, identify potential risks, and implement mitigations to optimize system stability, performance, and resource efficiency.
  • Participate in on-call rotations, responding promptly to production incidents to safeguard business operations.
  • Build and enhance observability systems, including monitoring, logging, and distributed tracing, to improve monitoring capabilities and fault detection efficiency.
  • Develop and optimize automation platforms and engineering efficiency tools to advance operational automation and team delivery effectiveness.
  • Explore and promote the application of AI technologies in operations scenarios, leveraging AI tools to improve automation, fault analysis, knowledge management, and R&D efficiency.
  • Collaborate closely with R&D, product, security, and infrastructure teams to drive stability initiatives, implement best practices, and support ongoing business development.
Job Requirements:
  • Bachelor's degree or above in Computer Science, Software Engineering, Information Technology, or a related field, with 3+ years of experience in Site Reliability Engineering (SRE), Computer Systems Administrator, Platform Engineer, or Cloud Engineer.
  • Proficiency in at least one programming language (e.g., Python, Go, Java, or C++), with strong software development and automation skills.
  • Familiarity with cloud computing services; experience with multi-cloud or hybrid cloud platforms (e.g., Alibaba Cloud, Azure, AWS, GCP) is a plus.
  • Solid understanding of Linux, computer networking, load balancing, distributed systems, and high-availability architectures.
  • Ability to quickly diagnose issues, communicate across teams, and drive solutions-developing system optimization and stability plans aligned with business goals, including dependency management, traffic governance, and disaster recovery planning.
  • Experience with system monitoring and observability tools (e.g., Prometheus, Grafana, ELK, or similar), along with scripting knowledge (Bash or Python) and familiarity with CI/CD concepts is preferred.
  • Familiarity with AI tools and their applications in software development, automated operations, or R&D efficiency-understanding of AI Agents or AIOps technologies; practical experience is a plus.
  • Strong communication, teamwork, and project management skills; ability to adapt to a fast-paced technical environment and continuously learn and apply new technologies.
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

PURVIEW ASIA PACIFIC PTE. LTD. • Singapore

On-site
SGD 90,000 - 130,000
Senior Site Reliability Engineer (SRE)
Senior Site Reliability Engineer (SRE)

VANGUARD SOFTWARE PTE. LTD. • Singapore

On-site
SGD 100,000 - 150,000
Technical Leadership
Career Growth
High-Performance Team
+1
Lead Platform Site Reliability Engineer
Lead Platform Site Reliability Engineer

JPMorgan Chase & Co. • Singapore

On-site
SGD 120,000 - 190,000
Site Reliability Engineer
Site Reliability Engineer

SEVEN HILLS CONSULTING PTE. LTD. • Singapore

On-site
SGD 90,000 - 130,000
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

Beecruit Pte Ltd • Singapore

On-site
SGD 70,000 - 100,000
Site Reliability Engineer
Site Reliability Engineer

TEKsystems • Singapore

Hybrid
SGD 120,000 - 180,000
SRE Engineer
SRE Engineer

BOUNTEOUSXACCOLITE SINGAPORE PTE. LTD. • Singapore

On-site
SGD 90,000 - 180,000
Site Reliability Engineer
Site Reliability Engineer

SGX Group • Singapore

On-site
SGD 180,000 - 300,000
Senior SRE (DevOps)
Senior SRE (DevOps)

MOZAT PTE LTD • Singapore

On-site
SGD 120,000 - 170,000
Competitive compensation
Performance-based bonuses
Growth opportunities
+1
Site Reliability Engineer
Site Reliability Engineer

SINGAPORE EXCHANGE LIMITED • Singapore

On-site
SGD 120,000 - 160,000