Site Reliability Engineer

PeoplePlusTech Inc.

Metro Manila

Hybrid

PHP 900,000 - 1,500,000

Full time

24 hours ago
Be an early applicant

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

PeoplePlusTech Inc. is seeking a Site Reliability Engineer (SRE) to join our growing tech team in the Philippines.

The role blends software engineering and systems administration to build and operate resilient, automated platforms that ensure reliability, availability and performance of critical services. The successful candidate will collaborate with development, security, and operations to design scalable infrastructure, implement IaC, support CI/CD, and lead incident response with RCA.

Qualifications

  • Bachelor's degree in Computer Science, Information Technology, Engineering, or related field.
  • Minimum 3 years in Site Reliability Engineering, DevOps, Cloud Engineering, or Infrastructure Operations.
  • Experience with production environments demanding high availability.

Responsibilities

  • Design, implement, and maintain highly available and scalable infrastructure and applications.
  • Monitor system health, performance, and service availability using observability tools.
  • Develop automation scripts, tools, and workflows to improve efficiency.
  • Manage incident response, RCA, and post-incident reviews.
  • Collaborate with teams to improve reliability, deployment processes, and readiness.
  • Establish and maintain SLIs, SLOs, and SLAs.
  • Implement IaC for consistent deployments.
  • Support CI/CD pipelines and automation.
  • Perform capacity planning and performance tuning.
  • Ensure security and governance best practices.
  • Create operational runbooks and disaster recovery procedures.
  • Participate in on-call and incident management.

Skills

Kubernetes
Docker
CI/CD Tools
Python scripting
Linux
Monitoring tools
Terraform
Ansible
Cloud platforms AWS/Azure/GCP
Networking basics
Root cause analysis

Education

Bachelor's degree in CS/IT/Engineering

Tools

Azure DevOps
GitHub Actions
Jenkins
GitLab CI/CD
Prometheus
Grafana
Datadog
ELK Stack
Terraform
Ansible
CloudFormation

Job description

Job Title: Site Reliability Engineer (SRE)

Work Setup: Hybrid (3 Days Onsite, 2 Days Remote)

Employment Type: Full-Time

Job Summary

We are seeking a highly skilled Site Reliability Engineer (SRE) to join our growing technology team. The ideal candidate will be responsible for maintaining the reliability, availability, scalability, and performance of critical applications and infrastructure. This role combines software engineering and systems administration principles to build and operate resilient, automated, and highly available platforms.

The successful candidate will work closely with development, infrastructure, security, and operations teams to improve system reliability, optimize performance, and enhance operational efficiency through automation and continuous improvement initiatives.

Key Responsibilities

  • Design, implement, and maintain highly available and scalable infrastructure and application environments.
  • Monitor system health, application performance, and service availability using industry-standard monitoring and observability tools.
  • Develop and maintain automation scripts, tools, and workflows to improve operational efficiency.
  • Manage incident response, troubleshooting, root cause analysis (RCA), and post-incident reviews.
  • Collaborate with development teams to improve application reliability, deployment processes, and operational readiness.
  • Establish and maintain Service Level Indicators (SLIs), Service Level Objectives (SLOs), and Service Level Agreements (SLAs).
  • Implement infrastructure-as-code (IaC) solutions for consistent and repeatable deployments.
  • Support CI/CD pipelines and deployment automation initiatives.
  • Perform capacity planning, performance tuning, and proactive system optimization.
  • Ensure compliance with security, governance, and operational best practices.
  • Create and maintain technical documentation, operational runbooks, and disaster recovery procedures.
  • Participate in on-call support and incident management activities as required.

Required Qualifications

  • Bachelor's degree in Computer Science, Information Technology, Engineering, or a related field.
  • Minimum of 3 years of experience in Site Reliability Engineering, DevOps, Cloud Engineering, Systems Engineering, or Infrastructure Operations.
  • Experience supporting production environments with high availability and uptime requirements.
  • Strong understanding of Linux and/or Windows server administration.
  • Experience with cloud platforms such as AWS, Microsoft Azure, or Google Cloud Platform (GCP).
  • Experience with containerization technologies such as Docker and orchestration platforms such as Kubernetes.
  • Hands-on experience with CI/CD tools such as Azure DevOps, GitHub Actions, Jenkins, GitLab CI/CD, or similar.
  • Experience with infrastructure-as-code tools such as Terraform, CloudFormation, or Ansible.
  • Familiarity with monitoring and observability platforms such as Prometheus, Grafana, Datadog, New Relic, Dynatrace, Splunk, or ELK Stack.
  • Strong scripting and automation skills using Python, Bash, PowerShell, or similar languages.
  • Experience in troubleshooting complex production incidents and conducting root cause analysis.
  • Knowledge of networking concepts, DNS, load balancing, firewalls, and security best practices.

Preferred Qualifications

  • Experience working in enterprise or cloud-native environments.
  • Familiarity with microservices architecture and distributed systems.
  • Experience implementing reliability engineering practices, including SLOs, SLIs, and error budgets.
  • Cloud certifications (AWS, Azure, or GCP) are an advantage.
  • Experience with security and compliance frameworks.
  • Knowledge of disaster recovery and business continuity planning.

Technical Skills

  • Terraform, Ansible, CloudFormation
  • Monitoring & Observability Tools
  • Python, Bash, PowerShell
  • Networking & Security Fundamentals
  • Incident Management & Root Cause Analysis
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Lead Site Reliability Engineer (SRE)
Lead Site Reliability Engineer (SRE)

EPAM Systems • Mexico

On-site
PHP 5,846,000 - 8,616,000
Site Reliability Engineering Onsite
Site Reliability Engineering Onsite

Gratitude Philippines • Manila

On-site
PHP 900,000 - 1,800,000
Site Reliability Engineer
Site Reliability Engineer

NCS Philippines • Taguig

Hybrid
PHP 900,000 - 1,300,000
Site Reliability Engineer
Site Reliability Engineer

Trends Group, Inc. • Makati

On-site
PHP 900,000 - 1,500,000
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

LTM • Mexico

On-site
PHP 900,000 - 1,300,000
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

AIPI Acquire Intelligence Philippines Inc. • Taguig

On-site
PHP 1,000,000 - 1,500,000
Site Reliability Engineer
Site Reliability Engineer

Alsons/AWS Information Systems Inc. • Cebu City

Hybrid
PHP 600,000 - 1,000,000
Site Reliability Engineer
Site Reliability Engineer

Private Advertiser • Makati

On-site
PHP 1,200,000 - 1,800,000
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

Acquire Intelligence • Taguig

On-site
PHP 900,000 - 1,500,000
Staff SRE Engineer
Staff SRE Engineer

Stellar Cyber • España

On-site
PHP 5,528,000 - 7,372,000