Senior SRE: Observability, Cloud Automation & Reliability

Omilia Natural Language Solutions Ua Ltd

Philippines

On-site

PHP 1,000,000 - 1,800,000

Full time

14 days+
Application generator

An application made for this job — a tailored resume and cover letter that speak straight to the posting.

Get past ATS filters

Benefits offered by this job

Fixed compensation
Long-term vacation
Career development courses
Apple gear

Job summary

Omilia Natural Language Solutions Ua Ltd is seeking a Senior Site Reliability Engineer with cloud platform experience to join our production operations team in the Philippines. You will focus on reliability, monitoring, automation, and reducing incidents across clusters.

You'll collaborate with development and cloud teams, design observability solutions using Prometheus, Grafana, and ELK, and drive runbooks, on-call practices, and performance improvements throughout the software lifecycle.

Qualifications

  • Bachelor's Degree or MS in Engineering or equivalent.
  • Experience in operating at least one container orchestration cluster (Kubernetes, Docker Swarm).
  • Experience developing or maintaining software for production services at scale.
  • Experience with ELK.
  • Experience with AWS.
  • Experience with Grafana/Prometheus stack.
  • Strong scripting skills (Bash, Python or Go).
  • Excellent communication skills.
  • Thinking out of the box and anticipating challenges.
  • Versatility. We work with agile/lean methods.
  • Being a team player.

Responsibilities

  • Ensure platform reliability and availability across production and pre-production environments through proactive monitoring, alerting, and automation.
  • First response for incidents, contribute to problem management and root cause analysis.
  • Supporting the development team's effort towards reliability, creating a solid reliability culture within the development lifecycle.
  • Develop troubleshooting documentation for production support resources.
  • Collaborate with Engineering teams to develop optimised and productive runbooks, operational documentation and automation of operational tasks.
  • Collaborate with development and cloud engineering teams to embed reliability and performance into the software delivery lifecycle.
  • Design, implement, and evolve observability solutions (metrics, logs, traces, dashboards) using tools such as Prometheus, Grafana, and ELK.
  • Participate in on-call rotations and continuously improve alert quality and response processes.
  • Champion a culture of reliability, performance, and continuous improvement across teams.

Skills

Kubernetes
Docker Swarm
Observability
Monitoring & alerting
Automation
Incident response
Scripting
Team collaboration
Communication

Education

Bachelor's or MS in Engineering

Tools

ELK stack
Grafana
Prometheus
AWS

Job description

Omilia Natural Language Solutions Ua Ltd is seeking a Senior Site Reliability Engineer with cloud platform experience to join our production operations team in the Philippines. You will focus on reliability, monitoring, automation, and reducing incidents across clusters.

You'll collaborate with development and cloud teams, design observability solutions using Prometheus, Grafana, and ELK, and drive runbooks, on-call practices, and performance improvements throughout the software lifecycle.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Senior Site Reliability Engineer: Cloud Observability Lead
Senior Site Reliability Engineer: Cloud Observability Lead

Omilia Natural Language Solutions Ltd • Philippines

Remote
PHP 1,200,000 - 1,600,000
Fixed compensation
Long-term employment with vacation days
Professional growth development
+3
Senior Site Reliability Engineer: Cloud & Observability
Senior Site Reliability Engineer: Cloud & Observability

Omilia • Philippines

On-site
PHP 1,000,000 - 1,800,000
Fixed compensation
Vacation leaves
Professional development opportunities
+3
Azure SRE: Observability, Monitoring & Incident Response
Azure SRE: Observability, Monitoring & Incident Response

Gratitude Philippines • Quezon City

Hybrid
PHP 1,200,000 - 1,800,000
Hybrid work arrangement
Night shift
SRE: Cloud, Observability & Automation
SRE: Cloud, Observability & Automation

Trinity Workforce Solutions, Inc. • Makati

On-site
PHP 558,000 - 892,800
Senior Site Reliability Engineer - Cloud & Observability
Senior Site Reliability Engineer - Cloud & Observability

Dencom Consultancy and Manpower Services • Parañaque

On-site
PHP 558,000 - 1,004,400
Cloud SRE (AWS/Azure) - Observability & FinOps
Cloud SRE (AWS/Azure) - Observability & FinOps

EROAD Philippines Inc • Manila

On-site
PHP 900,000 - 1,300,000
Azure Observability & SRE Engineer
Azure Observability & SRE Engineer

Gratitude Philippines • Quezon City

Hybrid
PHP 914,000 - 1,095,000
Senior Site Reliability Engineer
Senior Site Reliability Engineer

Omilia • Philippines

On-site
PHP 1,000,000 - 1,800,000
Fixed compensation
Vacation leaves
Professional development opportunities
+3
Senior SRE: Reliability Architect for Cloud-Native Platforms
Senior SRE: Reliability Architect for Cloud-Native Platforms

Accenture • Cebu City

On-site
PHP 700,000 - 1,100,000
Platform SRE Lead: Reliability, Automation & Scale
Platform SRE Lead: Reliability, Automation & Scale

Broadridge • Metro Manila

On-site
PHP 1,000,000 - 1,500,000