Site Reliability Engineer (SRE) - Ads / Monetization Platform

Two95 International Inc.

Kuala Lumpur

On-site

MYR 120,000 - 180,000

Full time

14 days+
Application generator

A complete application in a minute — tailored resume and cover letter, ready to send.

Get past ATS filters

Job summary

Two95 International Inc. is seeking a Site Reliability Engineer to build and operate highly available, globally distributed advertising/monetization services.

You will enhance reliability, scalability, and operability through automation, observability, incident management, and strong engineering practices. You will own reliability across the service lifecycle, improve resilience across regions, and lead blameless postmortems with actionable follow-ups, collaborating with security and compliance

Qualifications

  • 3+ years of experience in SRE, DevOps, systems engineering, or production operations for large-scale services.
  • Strong coding skills in Python or Go or C++ (Java acceptable).
  • Solid Linux/Unix fundamentals: processes, memory, filesystems, permissions, troubleshooting.
  • Networking fundamentals in cloud environments: TCP/IP, DNS, HTTP/HTTPS, load balancing, security basics.
  • SQL proficiency and ETL experience is a plus for ads/analytics systems.
  • Excellent communication and global collaboration skills.

Responsibilities

  • Own reliability across the service lifecycle: design reviews, capacity planning, deployment, and ops.
  • Build and operate highly available services across regions; improve resilience and latency.
  • Develop automation and tooling to reduce toil and enable self-healing.
  • Define and monitor SLOs/SLIs/SLAs with dashboards and alerts.
  • Lead incident response, RCA, blameless postmortems, and follow-ups.
  • Collaborate with software engineering, security, and compliance teams.

Skills

Python
Go
C++
Linux/Unix
Networking
SQL
Communication

Tools

Docker
Kubernetes
Terraform
Ansible
Prometheus
Grafana
ELK/Splunk
OpenTelemetry

Job description

Role Summary

As a Site Reliability Engineer (SRE), you will build and operate highly available, globally distributed advertising/monetization services. You will improve reliability, scalability, and operability through automation, observability, incident management, and sound engineering practices.

Key Responsibilities
  • Own reliability across the service lifecycle: design reviews, capacity planning, launch, deployment, operations, and continuous improvement.
  • Build and operate highly available services across multiple regions/data centers; improve resilience, latency, and scalability.
  • Develop automation and tooling to reduce toil (deployment, remediation, runbooks, self-healing) using scripting and software engineering best practices.
  • Define and implement SLOs/SLIs/SLAs; create dashboards and alerting to track service health (availability, latency, errors, saturation).
  • Lead sustainable incident response: triage, mitigation, root-cause analysis (RCA), and blameless postmortems with actionable follow-ups.
  • Collaborate with software engineering, security, and compliance stakeholders to meet data governance and regulatory requirements.
Must-have Qualifications
  • 3+ years of experience in SRE, DevOps, systems engineering, or production operations for large-scale services.
  • Strong coding skills in one language: Python or Go or C++ (Java acceptable).
  • Solid Linux/Unix fundamentals: processes, memory/CPU, filesystems, permissions, and troubleshooting.
  • Networking fundamentals in cloud environments: TCP/IP, DNS, HTTP/HTTPS, load balancing, basic security concepts.
  • SQL proficiency and experience with data workflows/ETL is a plus for ads/analytics-related systems.
  • Strong communication, ownership mindset, and ability to work effectively across global teams.
Preferred Qualifications
  • Experience supporting advertising, recommendation, or high-traffic consumer internet platforms.
  • Hands-on experience with cloud platforms (AWS/GCP/Azure) and infrastructure-as-code (Terraform/Ansible).
  • Experience with containers and orchestration (Docker, Kubernetes).
  • Observability experience with tools such as Prometheus, Grafana, ELK/Splunk, OpenTelemetry.
  • Experience operating large data systems (streaming, distributed storage/compute) and performance tuning.
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Site Reliability Engineer-Ads / Monetization Platform
Site Reliability Engineer-Ads / Monetization Platform

Two95 International Inc. • Kuala Lumpur

On-site
MYR 120,000 - 180,000
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

Career Wise • Kuala Lumpur

On-site
MYR 80,000 - 120,000
Senior SRE – Ads & Monetization Platform
Senior SRE – Ads & Monetization Platform

Two95 International Inc. • Kuala Lumpur

On-site
MYR 120,000 - 180,000
Global SRE: Reliability, Automation & Observability
Global SRE: Reliability, Automation & Observability

Two95 International Inc. • Kuala Lumpur

On-site
MYR 120,000 - 180,000
SRE Lead
SRE Lead

Chubblifefund • Malaysia

On-site
MYR 250,000 - 420,000
SRE Lead
SRE Lead

Chubb Ltd. • Malaysia

On-site
MYR 240,000 - 420,000
Site Reliability Engineer
Site Reliability Engineer

Lavu Tech Solutions • Selangor

On-site
MYR 180,000 - 280,000
System Reliability Engineer, Consultant
System Reliability Engineer, Consultant

AIA Malaysia • Kuala Lumpur

On-site
MYR 70,000 - 110,000
High-impact team environment
Opportunities for innovation
Influence engineering culture
Site Reliability Engineer
Site Reliability Engineer

LAVU TECH SOLUTIONS SDN. BHD. • Petaling Jaya

On-site
MYR 180,000 - 300,000
SRE Lead
SRE Lead

Chubb • Malaysia

On-site
MYR 300,000 - 420,000