Senior Site Reliability Engineer — 99.99% Cloud Availability

PT. HTC Global Software Services

Jakarta Utara

On-site

IDR 550,000,000 - 900,000,000

Full time

11 days ago
Application generator

An application made for this job — a tailored resume and cover letter that speak straight to the posting.

Get past ATS filters

Job summary

HTC Global Services is seeking an experienced Site Reliability Engineer in Jakarta to maintain and optimize Tencent Cloud production services. The role focuses on ensuring 99.99%+ availability, running highly distributed systems and collaborating with Tencent product teams.

You will define SLIs/SLOs, build monitoring and alerting, lead incident responses and implement self-healing automation, while participating in on-call rotations for critical cloud services.

Qualifications

  • Minimum 5 years experience as Site Reliability Engineer (SRE).
  • Core Skills: Linux, Kubernetes, containers, Python/Go/C++, distributed systems, observability, automation, CI/CD, cloud infrastructure, incident management and performance engineering.

Responsibilities

  • Maintain the reliability, availability, scalability and performance of Tencent Cloud's production services and infrastructure.
  • Engineer Tencent Cloud services to achieve 99.99%+ availability targets, depending on the service SLA.
  • Operate and improve highly distributed production systems supporting large numbers of customers.
  • Define and monitor SLIs, SLOs, error budgets and service health indicators.
  • Build monitoring, logging, tracing and automated alerting capabilities.
  • Detect and resolve live production incidents across compute, network, storage and database environments.
  • Lead incident response, root-cause analysis and post-mortem activities.
  • Develop self-healing and automated remediation mechanisms.
  • Automate repetitive operational activities and reduce engineering toil.
  • Perform capacity planning, performance optimization and resilience testing.
  • Design failover and disaster-recovery mechanisms.
  • Participate in production/on-call rotations for critical cloud services.
  • Work directly with Tencent Cloud product engineering teams to improve service reliability

Skills

Linux
Kubernetes
containers
Python
Go
C++
distributed systems
observability
automation
CI/CD
cloud infrastructure
incident management
performance engineering

Job description

HTC Global Services is seeking an experienced Site Reliability Engineer in Jakarta to maintain and optimize Tencent Cloud production services. The role focuses on ensuring 99.99%+ availability, running highly distributed systems and collaborating with Tencent product teams.

You will define SLIs/SLOs, build monitoring and alerting, lead incident responses and implement self-healing automation, while participating in on-call rotations for critical cloud services.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

PT. HTC Global Software Services • Jakarta Utara

On-site
IDR 550,000,000 - 900,000,000
Hyperscale Cloud Infra Engineer - SDN, K8s & Automation
Hyperscale Cloud Infra Engineer - SDN, K8s & Automation

PT. HTC Global Software Services • Jakarta Utara

On-site
IDR 200,000,000 - 500,000,000
24x7 Cloud Operations Engineer (GCP & GKE)
24x7 Cloud Operations Engineer (GCP & GKE)

PT. HTC Global Software Services • Jakarta Utara

On-site
IDR 279,000,000 - 502,200,000
Cloud Infrastructure Engineer
Cloud Infrastructure Engineer

PT. HTC Global Software Services • Jakarta Utara

On-site
IDR 200,000,000 - 500,000,000
Cloud Operations ( GCP & Kubernetes )
Cloud Operations ( GCP & Kubernetes )

PT. HTC Global Software Services • Jakarta Utara

On-site
IDR 279,000,000 - 502,200,000
SRE & DevOps Engineer - Reliability, Automation, Monitoring
SRE & DevOps Engineer - Reliability, Automation, Monitoring

Catalyst Tech • Daerah Khusus Ibukota Jakarta

On-site
IDR 720,720,000 - 1,081,082,000
Site Reliability Engineer New Jakarta, Jakarta, Indonesia
Site Reliability Engineer New Jakarta, Jakarta, Indonesia

StraitsX Group • Jakarta Pusat

On-site
IDR 200,000,000 - 300,000,000
Senior SRE: Multi-Cloud Resilience & Kubernetes
Senior SRE: Multi-Cloud Resilience & Kubernetes

BookCabin • Jakarta Pusat

On-site
IDR 250,000,000 - 420,000,000
Site Reliability Engineer - Jakarta Department Tech Employment Type
Site Reliability Engineer - Jakarta Department Tech Employment Type

Stockbit • Daerah Khusus Ibukota Jakarta

On-site
24/7 Game SRE — Cloud Infra & Reliability Lead
24/7 Game SRE — Cloud Infra & Reliability Lead

AccelByte • Sleman

On-site