Observability Engineer

U3 INFOTECH PTE. LTD.

Singapore

On-site

SGD 120,000 - 180,000

Full time

3 days ago
Be an early applicant

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

U3 INFOTECH PTE. LTD. seeks an experienced Observability/SRE leader to define enterprise observability architecture aligned with MAS TRM, DORA, and APRA CPS 230. You will deploy Datadog, Dynatrace, and Splunk across infra, apps, and user experience, and drive governance for telemetry data.

Protect production reliability by implementing SRE practices, automating runbooks with Python, Ansible, Terraform, and integrating with CI/CD, ITSM, and AIOps for predictive alerting and audits.

Qualifications

  • Minimum 5 years in Infrastructure/SRE roles, with at least 3 years in SRE SME capacity.
  • Hands-on with Observability Platforms: Datadog, Dynatrace, Splunk, ELK.
  • Hands-on with Automation/IaC: Terraform, Ansible, Python, CI/CD tools.
  • Cloud Platforms experience: AWS (CloudWatch/X-Ray/CloudTrail), Azure Monitor/Log Analytics.
  • Deep understanding of SRE principles, service health modelling, and auto-remediation design.
  • Familiarity with financial sector resilience frameworks, regulatory compliance, and incident governance.
  • Strong written and verbal communication across diverse stakeholders.
  • Certifications in Datadog, Dynatrace, Terraform/Ansible/Python are advantageous.

Responsibilities

  • Define and govern enterprise observability architecture across infra, apps, and network.
  • Deploy and optimize observability platforms for full-stack visibility.
  • Integrate observability with incident management, ITSM, and AIOps for predictive alerting.
  • Implement SRE frameworks and automate runbooks, alerts, and auto-remediation workflows.
  • Lead collaboration with Cloud, DevOps, Security to align telemetry with audit needs.
  • Provide executive dashboards on availability, reliability KPIs, and risk indicators.

Skills

SRE principles
Stakeholder communication
Automation & IaC
Cloud platform experience

Tools

Datadog
Dynatrace
Splunk
ELK
Terraform
Ansible
Python

Job description

Key Responsibilities:
Observability Strategy and Governance
  • Define and own Enterprise Observability Architecture aligned with operational resilience mandates (MAS TRM, DORA, APRA CPS 230).
  • Deploy and optimize observability platforms (Datadog, Dynatrace, Splunk) for full-stack visibility across infra, application, network, and user experience.
  • Establish governance standards for telemetry data (metrics, logs, traces), ensuring consistency, retention compliance, and security controls.
  • Integrate observability platforms with incident management, ITSM, and AIOps systems for predictive alerting and anomaly detection.
Reliability Engineering and Automation
  • Implement SRE frameworks for infrastructure and business-critical applications.
  • Automate runbooks, alerts, self-healing actions, and auto-remediation workflows via Python, Ansible, and Terraform.
  • Partner with Application, Infrastructure, and Cyber teams to codify operational reliability into the delivery lifecycle.
  • Conduct resilience testing, chaos engineering, and capacity validation.
  • Develop error budget policies and reliability scorecards for key production services.
Cloud Observability and Platform Engineering
  • Architect and manage observability for Cloud-native workloads in AWS and Azure.
  • Integrate cloud observability into landing zones and CI/CD pipelines for continuous compliance.
  • Implement IaC models using Terraform and Ansible for consistent, auditable provisioning.
  • Collaborate with Cloud, DevOps, and Security teams on real-time telemetry aligned to audit requirements.
Operational Excellence and Stakeholder Management
  • Drive reduction in incident recurrence, MTTR, and manual intervention through observability-led automation.
  • Deliver executive dashboards highlighting availability, reliability KPIs, and operational risk indicators.
  • Act as technical advisor to senior management during major incidents, post-incident reviews, and audits.
Skillset Requirements:
  • At least 5 years of experience in Infrastructure, Cloud, or Site Reliability Engineering (SRE) related roles, with minimum 3 years in an SRE SME capacity, ideally within financial institutions or regulated environments.
  • Hands‑on expertise with Observability Platforms: Datadog, Dynatrace, Splunk, ELK.
  • Hands‑on expertise with Automation/IaC: Terraform, Ansible, Python, CI/CD tools.
  • Hands‑on expertise with Cloud Platforms: AWS (CloudWatch, X‑Ray, CloudTrail), Azure (Monitor, Log Analytics, App Insights).
  • Deep understanding of SRE principles, service health modelling, error budgets, and auto‑remediation design.
  • Familiarity with financial sector operational resilience frameworks, regulatory compliance, and incident governance.
  • A good team player with excellent written and verbal communication skills, able to coordinate across diverse stakeholders.
  • Certification in at least one of the following required:
  • Datadog Certified Observability Professional / Dynatrace Certified Associate
  • Terraform/Ansible/Python Certified Expert
  • Certification in the following will be advantageous:
  • AWS Certified DevOps Engineer / Azure DevOps Expert
  • SRE Foundation/Practitioner (DevOps Institute)
  • ITIL v4 Managing Professional
U3 Privacy Notice:

Please refer to U3’s Privacy Notice for Job Applicants/Seekers at https://u3infotech.com/privacy-notice-job-applicants/.When you apply, you voluntarily consent to the collection, use and disclosure of your personal data for recruitment/employment and related purposes.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Observability Engineer
Observability Engineer

Optimum Solutions (Singapore) Pte Ltd. • Singapore

On-site
SGD 90,000 - 130,000
Software & Applications Manager (Technical Lead/Supervisor)
Software & Applications Manager (Technical Lead/Supervisor)

optimum solutions (singapore) pte ltd • Singapore

On-site
SGD 120,000 - 180,000
Senior Observability & Reliability Engineer
Senior Observability & Reliability Engineer

U3 INFOTECH PTE. LTD. • Singapore

On-site
SGD 120,000 - 180,000
Datadog Admin
Datadog Admin

Optimum Solutions (Singapore) Pte Ltd. • Singapore

On-site
SGD 120,000 - 180,000
Observability Engineer - Site Reliability Engineering (SRE)
Observability Engineer - Site Reliability Engineering (SRE)

United States Digital Space LLC • Singapore

On-site
SGD 90,000 - 120,000
Competitive base salary
Holistic, flexible benefits
Industry‑leading learning and dev
Observability Engineer (JD#11214)
Observability Engineer (JD#11214)

SCIENTE INTERNATIONAL PTE. LTD. • Singapore

On-site
SGD 90,000 - 130,000
Observability Engineer - Site Reliability Engineering (SRE)
Observability Engineer - Site Reliability Engineering (SRE)

OCBC Group • Singapore

On-site
SGD 120,000 - 180,000
Competitive base salary.
Flexible benefits package
Community initiatives.
+2
Engineer
Engineer

OCBC Bank • Singapore

On-site
SGD 80,000 - 120,000
Observability Solutions Architect
Observability Solutions Architect

Cisco • Singapore

On-site
SGD 80,000 - 120,000
Associate/AVP, Observability & SRE Engineering, Technology Group
Associate/AVP, Observability & SRE Engineering, Technology Group

GIC Private Limited • Singapore

On-site
SGD 150,000 - 190,000