Senior Site Reliability Engineer

Doist

Philippines

On-site

PHP 1,500,000 - 2,700,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

Doist is seeking a Senior Site Reliability Engineer with cloud platform experience to join our reliability-first team in the Philippines. You will operate and maintain production clusters, design observability solutions, and drive automation to improve platform reliability.

You will collaborate with cross-functional teams, implement monitoring with Prometheus, Grafana, ELK, and contribute to incident response and runbooks.

Qualifications

  • Proven experience managing production or pre-production environments.
  • Strong understanding of monitoring, incident response, and root cause analysis.
  • Experience implementing automation to improve reliability and efficiency.

Responsibilities

  • Ensure platform reliability and availability across production and pre-production environments through proactive monitoring, alerting, and automation.
  • First response for incidents, contribute to problem management and root cause analysis.
  • Support the development team’s effort towards reliability, creating a solid reliability culture within the development lifecycle.
  • Develop troubleshooting documentation for production support resources.
  • Collaborate with Engineering teams to develop optimised and productive runbooks, operational documentation and automation of operational tasks.
  • Collaborate with development and cloud engineering teams to embed reliability and performance into the software delivery lifecycle.
  • Design, implement, and evolve observability solutions (metrics, logs, traces, dashboards) using tools such as Prometheus, Grafana, and ELK.
  • Participate in on-call rotations and continuously improve alert quality and response processes.
  • Champion a culture of reliability, performance, and continuous improvement across teams.

Skills

Cloud platforms
Observability
Incident response
Automation
DevOps culture

Tools

Prometheus
Grafana
ELK

Job description

We are looking for a Senior Site Reliability Engineer with Cloud platform experience. This individual will be part of a team responsible for operating and maintaining production clusters and developing our observability solutions; they will collaborate with team members to develop automation strategies, monitoring & alerting, and ensuring overall platform reliability. Your goal will be to become an integral part of the team, making every challenge of the platform - your own challenge, and solving them accordingly.

Responsibilities
  • Ensure platform reliability and availability across production and pre-production environments through proactive monitoring, alerting, and automation.
  • First response for incidents, contribute to problem management and root cause analysis.
  • Supporting the development team's effort towards reliability, creating a solid reliability culture within the development lifecycle.
  • Develop troubleshooting documentation for production support resources.
  • Collaborate with Engineering teams to develop optimised and productive runbooks, operational documentation and automation of operational tasks.
  • Collaborate with development and cloud engineering teams to embed reliability and performance into the software delivery lifecycle.
  • Design, implement, and evolve observability solutions (metrics, logs, traces, dashboards) using tools such as Prometheus, Grafana, and ELK.
  • Participate in on-call rotations and continuously improve alert quality and response processes.
  • Champion a culture of reliability, performance, and continuous improvement across teams.
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Senior Site Reliability Engineer: Cloud & Observability
Senior Site Reliability Engineer: Cloud & Observability

Omilia • Philippines

On-site
PHP 1,000,000 - 1,800,000
Fixed compensation
Vacation leaves
Professional development opportunities
+3
Senior Site Reliability Engineer
Senior Site Reliability Engineer

Omilia • Philippines

On-site
PHP 1,000,000 - 1,800,000
Fixed compensation
Vacation leaves
Professional development opportunities
+3
Senior Site Reliability Engineer: Cloud Observability Lead
Senior Site Reliability Engineer: Cloud Observability Lead

Omilia Natural Language Solutions Ltd • Philippines

Remote
PHP 1,200,000 - 1,600,000
Fixed compensation
Long-term employment with vacation days
Professional growth development
+3
Site Reliability Engineer
Site Reliability Engineer

NCS Philippines • Taguig

Hybrid
PHP 900,000 - 1,300,000
Lead Site Reliability Engineer (SRE)
Lead Site Reliability Engineer (SRE)

EPAM Systems • Mexico

On-site
PHP 5,846,000 - 8,616,000
Senior Platform Engineer (DevOps / Site Reliability Engineer) RTO 1x In A Month
Senior Platform Engineer (DevOps / Site Reliability Engineer) RTO 1x In A Month

Avensys Consulting • Philippines

On-site
PHP 1,339,000 - 2,009,000
Site Reliability Engineer
Site Reliability Engineer

Philtech Inc. • Taguig

On-site
PHP 670,000 - 1,339,000
Health insurance
Retirement plans
Career growth opportunities
Site Reliability Engineer
Site Reliability Engineer

Private Advertiser • Makati

On-site
PHP 1,200,000 - 1,800,000
Senior SRE: Cloud Reliability, Observability & Automation
Senior SRE: Cloud Reliability, Observability & Automation

Doist • Philippines

On-site
PHP 1,500,000 - 2,700,000
Staff SRE Engineer
Staff SRE Engineer

Stellar Cyber • España

On-site
PHP 5,528,000 - 7,372,000