Site Reliability Engineer

NCS Philippines

Taguig

On-site

PHP 900,000 - 1,300,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

NCS Philippines is seeking a Site Reliability Engineer to define SLOs/SLIs, build and maintain monitoring, logging, and alerting systems, and embed reliability into CI/CD workflows.

You will drive automated remediation, lead post-incident RCAs, and partner with cross-functional teams to improve scalability, fault tolerance, and system resilience across cloud platforms.

Qualifications

  • Bachelor’s degree in Computer Science, Engineering, or related field.
  • Master’s degree or relevant DevOps certifications preferred.

Responsibilities

  • Define, implement, and enforce SLOs and SLIs to balance speed and stability.
  • Develop and maintain monitoring, logging, and alerting systems for anomaly detection.
  • Establish metrics-driven performance monitoring for availability, latency, and errors.
  • Integrate SLOs and monitoring within CI/CD workflows for reliable releases.
  • Implement automated remediation to reduce MTTR.
  • Conduct post-incident RCAs and implement preventive measures.
  • Refine alerting policies to reduce fatigue and improve relevance.
  • Participate in on-call rotations and escalate issues per protocols.
  • Collaborate with cross-functional teams to improve scalability and resilience.

Skills

SLOs/SLIs design
Monitoring & alerting
CI/CD integration
On-call readiness
Cross-functional collaboration

Education

Bachelor’s degree in CS/Engineering
Master’s degree or relevant certifications

Tools

Prometheus
Grafana
Datadog
New Relic
PagerDuty
Opsgenie
Terraform
Ansible
Python
Bash

Job description

DUTIES AND RESPONSIBILITIES:
  • Define, implement, and enforce SLOs and SLIs to balance innovation speed and system stability.

  • Develop and maintain monitoring, logging, and alerting systems for early detection of anomalies using industry-standard tools.

  • Establish metrics-driven approaches to performance monitoring, ensuring continuous tracking of availability, latency, error rates, and resource utilization.

  • Integrate SLOs and monitoring within CI/CD workflows to ensure new releases meet reliability standards.

  • Implement automated remediation for recurring incidents, optimizing incident management to reduce Mean Time to Resolution (MTTR).

  • Conduct post-incident RCAs, recommending and implementing preventive measures.

  • Continuously refine alerting policies to ensure they are actionable, relevant, and reduce alert fatigue.

  • Participate in on-call rotations and elevate issues following established protocols.

  • Collaborate with cross-functional teams to improve scalability, fault tolerance, and system resilience.

JOB SPECIFICATIONS:
Education:
  • Bachelor’s degree in Computer Science, Engineering, or related technical field.

  • Master’s degree or relevant certifications (e.g., Google Cloud Professional DevOps Engineer, AWS Certified DevOps Engineer) preferred.

Related Work Experience:
  • 4+ years in a Site Reliability, DevOps, or similar role managing production systems at scale.

  • Proven experience defining SLOs, SLIs, and implementing monitoring/alerting systems in cloud environments.

  • Experience with incident management, RCA, and improving system resilience.

Knowledge:
  • Distributed systems, microservices architecture, and cloud platforms (AWS, GCP, Azure).

  • System performance metrics and availability management principles.

  • Incident response processes and tools (PagerDuty, Opsgenie).

  • Monitoring and observability tools (Prometheus, Grafana, Datadog, New Relic).

  • CI/CD workflows with integrated monitoring.

  • Alerting strategies, escalation processes, and on-call best practices.

  • Scripting and automation tools (Python, Bash, Terraform, Ansible).

  • Performance optimization, fault tolerance, and scalability techniques.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Site Reliability Engineer
Site Reliability Engineer

PeoplePlusTech Inc. • Metro Manila

Hybrid
PHP 1,000,000 - 1,600,000
Senior Engineer - Site Reliability
Senior Engineer - Site Reliability

Dencom Consultancy and Manpower Services • Parañaque

On-site
Site Reliability Engineer
Site Reliability Engineer

Philtech Inc. • Taguig

On-site
PHP 670,000 - 1,339,000
Health insurance
Retirement plans
Career growth opportunities
Lead Site Reliability Engineer (SRE)
Lead Site Reliability Engineer (SRE)

EPAM Systems • Mexico

On-site
PHP 5,846,000 - 8,616,000
Site Reliability Engineer
Site Reliability Engineer

Trends Group, Inc. • Makati

On-site
PHP 900,000 - 1,500,000
Service Reliability Engineer
Service Reliability Engineer

Metrobank • Philippines

On-site
PHP 480,000 - 720,000
Senior Site Reliability Engineer
Senior Site Reliability Engineer

Doist • Philippines

On-site
PHP 1,500,000 - 2,700,000
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

AIPI Acquire Intelligence Philippines Inc. • Taguig

On-site
PHP 1,000,000 - 1,500,000
Site Reliability Engineer
Site Reliability Engineer

Private Advertiser • Makati

On-site
PHP 1,200,000 - 1,800,000
Site Reliability Engineers
Site Reliability Engineers

Trinity Workforce Solutions, Inc. • Makati

On-site