Observability Engineer

U3 SOLUTIONS PTE. LTD.

Singapore

On-site

SGD 120,000 - 180,000

Full time

3 days ago
Be an early applicant

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

U3 SOLUTIONS PTE. LTD. seeks an senior Observability, Reliability, and Platform Engineer to lead enterprise observability architecture across cloud and on-prem environments in a regulated setting.

You will own platform selection, governance, and incident readiness, coordinating with risk, security, and IT teams. You will implement SRE practices, automate runbooks with Python, Ansible, and Terraform, and integrate Datadog, Dynatrace, and Splunk into CI/CD.

Qualifications

  • Hands-on with Observability Platforms (Datadog, Dynatrace, Splunk, ELK).
  • Automation/IaC using Terraform, Ansible, Python.
  • Cloud-native observability in AWS and Azure, with security focus.
  • Knowledge of SRE principles, error budgets, and auto-remediation.

Responsibilities

  • Define and own Enterprise Observability Architecture aligned with regulatory mandates.
  • Deploy and optimize platforms for full-stack visibility across infra, app, network, UX.
  • Establish governance standards for telemetry data, retention and security controls.
  • Integrate observability with incident management, ITSM, and AIOps for predictive alerts.
  • Implement SRE frameworks; automate runbooks, alerts, self-healing actions.
  • Collaborate with Cloud, DevOps, Sec to embed reliability into delivery lifecycle.
  • Conduct resilience testing, chaos engineering, and capacity validation.
  • Develop error budgets and reliability scorecards for production services.

Skills

Observability
SRE
Automation
IaC
Cloud platforms
Datadog
Dynatrace
Splunk
Python
Terraform
Ansible
Security controls
Stakeholder management

Tools

Datadog
Dynatrace
Splunk
ELK
Terraform
Ansible
Python
CI/CD tools

Job description

Observability Strategy and Governance


  • Define and own Enterprise Observability Architecture aligned with operational resilience mandates (MAS TRM, DORA, APRA CPS 230).

  • Deploy and optimize observability platforms (Datadog, Dynatrace, Splunk) for full-stack visibility across infra, application, network, and user experience.

  • Establish governance standards for telemetry data (metrics, logs, traces), ensuring consistency, retention compliance, and security controls.

  • Integrate observability platforms with incident management, ITSM, and AIOps systems for predictive alerting and anomaly detection.


Reliability Engineering and Automation


  • Implement SRE frameworks for infrastructure and business-critical applications.

  • Automate runbooks, alerts, self-healing actions, and auto-remediation workflows via Python, Ansible, and Terraform.

  • Partner with Application, Infrastructure, and Cyber teams to codify operational reliability into the delivery lifecycle.

  • Conduct resilience testing, chaos engineering, and capacity validation.

  • Develop error budget policies and reliability scorecards for key production services.


Cloud Observability and Platform Engineering


  • Architect and manage observability for Cloud-native workloads in AWS and Azure.

  • Integrate cloud observability into landing zones and CI/CD pipelines for continuous compliance.

  • Implement IaC models using Terraform and Ansible for consistent, auditable provisioning.

  • Collaborate with Cloud, DevOps, and Security teams on real-time telemetry aligned to audit requirements.


Operational Excellence and Stakeholder Management


  • Drive reduction in incident recurrence, MTTR, and manual intervention through observability-led automation.

  • Deliver executive dashboards highlighting availability, reliability KPIs, and operational risk indicators.

  • Act as technical advisor to senior management during major incidents, post-incident reviews, and audits.


Skillset Requirements:


  • At least 5 years of experience in Infrastructure, Cloud, or Site Reliability Engineering (SRE) related roles, with minimum 3 years in an SRE SME capacity, ideally within financial institutions or regulated environments.

  • Hands-on expertise with Observability Platforms: Datadog, Dynatrace, Splunk, ELK.

  • Hands-on expertise with Automation/IaC: Terraform, Ansible, Python, CI/CD tools.

  • Hands-on expertise with Cloud Platforms: AWS (CloudWatch, X-Ray, CloudTrail), Azure (Monitor, Log Analytics, App Insights).

  • Deep understanding of SRE principles, service health modelling, error budgets, and auto-remediation design.

  • Familiarity with financial sector operational resilience frameworks, regulatory compliance, and incident governance.

  • A good team player with excellent written and verbal communication skills, able to coordinate across diverse stakeholders.

  • Certification in at least one of the following required:

  • Datadog Certified Observability Professional / Dynatrace Certified Associate

  • Terraform/Ansible/Python Certified Expert

  • Certification in the following will be advantageous:

  • AWS Certified DevOps Engineer / Azure DevOps Expert

  • SRE Foundation/Practitioner (DevOps Institute)

  • ITIL v4 Managing Professional

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Observability Engineer
Observability Engineer

U3 INFOTECH PTE. LTD. • Singapore

On-site
SGD 120,000 - 180,000
Software & Applications Manager (Technical Lead/Supervisor)
Software & Applications Manager (Technical Lead/Supervisor)

optimum solutions (singapore) pte ltd • Singapore

On-site
SGD 120,000 - 180,000
Senior Observability & Reliability Engineer
Senior Observability & Reliability Engineer

U3 INFOTECH PTE. LTD. • Singapore

On-site
SGD 120,000 - 180,000
G13 - Operations Support Engineer
G13 - Operations Support Engineer

FPT Asia Pacific • Singapore

On-site
SGD 120,000 - 180,000
Observability Solutions Architect
Observability Solutions Architect

Cisco • Singapore

On-site
SGD 80,000 - 120,000
Site Reliability Engineer (Splunk, Python, OCI, Dynatrace, RCA, Terraform, Ansible )
Site Reliability Engineer (Splunk, Python, OCI, Dynatrace, RCA, Terraform, Ansible )

NEPTUNEZ SINGAPORE PTE. LTD. • Singapore

On-site
SGD 120,000 - 180,000
Observability Engineer - Site Reliability Engineering (SRE)
Observability Engineer - Site Reliability Engineering (SRE)

OCBC Group • Singapore

On-site
SGD 120,000 - 180,000
Competitive base salary.
Flexible benefits package
Community initiatives.
+2
Observability & Reliability Engineer - Cloud, SRE Innovator
Observability & Reliability Engineer - Cloud, SRE Innovator

U3 SOLUTIONS PTE. LTD. • Singapore

On-site
SGD 120,000 - 180,000
Site Reliability Engineer
Site Reliability Engineer

Singapore Exchange Limited • Singapore

On-site
SGD 180,000 - 250,000
Site Reliability Engineer
Site Reliability Engineer

SGX Group • Singapore

On-site
SGD 180,000 - 300,000