Site Reliability Engineer (Machine Learning) - REMOTE

Lewis Personnel Management

Metro Manila

Remote

PHP 1,200,000 - 1,700,000

Full time

2 days ago
Be an early applicant
Application generator

Stand out for this role — generate a tailored resume and cover letter in about a minute.

Get past ATS filters

Job summary

Lewis Personnel Management is seeking an experienced Site Reliability Engineer (SRE) with ML expertise for a fully remote role in Metro Manila, Philippines. You will maintain and scale a 24/7 production environment on AWS and Kubernetes for a Japan-based restaurant platform.

Responsibilities include designing IaC with Terraform, Helm, and ArgoCD; managing AWS services including EKS, EC2, RDS, and S3; driving incident response and observability; and enabling ML model deployment pipelines on

Qualifications

  • Minimum 2 years of hands-on AWS experience with EKS, EC2, RDS, Fargate, CloudFront, Lambda, and S3.
  • Deep experience deploying, managing, and scaling production workloads on Kubernetes.
  • Strong familiarity with MLOps practices and hands-on Python experience with ML-adjacent tooling (e.g., inference serving, model deployment, ML pipelines).
  • Experience in direct software engineering under DevOps/SRE practices, including at least 1 year in a Technical Lead capacity.
  • Current proficiency in Python (preferred) or Ruby, Elixir, Go, JavaScript, or Rust.
  • Strong skills in configuration management (YAML, Bash) along with containerization and hypervisor fundamentals.
  • Track record of operating large-scale production systems with a deep understanding of fault-tolerance and distributed systems failure modes.
  • Experience in fast-paced startup environments.
  • Infrastructure as Code & GitOps tools: Terraform, Pulumi, ArgoCD
  • Observability stacks: Prometheus, Grafana

Responsibilities

  • Maintain and scale a 24/7 production environment on AWS and Kubernetes.
  • Design, build, and evolve IaC using Terraform, Helm, and ArgoCD.
  • Manage AWS core services including EKS, EC2, RDS, Fargate, CloudFront, Lambda, and S3.
  • Drive incident response, proactive monitoring, configuration management, and postmortem processes.
  • Implement DevOps best practices to boost developer productivity, platform scalability, and system reliability.
  • Apply SRE discipline to ML infrastructure, ensuring high availability, observability, and performance for model training and inference pipelines.
  • Support, streamline, and automate ML model deployment pipelines on Kubernetes.
  • Build monitoring, logging, and alerting systems tailored to production ML models.
  • Partner with data science and engineering teams to operationalize and scale intelligent features across the platform.

Skills

AWS
Kubernetes
MLOps
Python
DevOps
Technical Lead
GitOps
Terraform
Pulumi
ArgoCD
YAML
Bash
Observability
Prometheus
Grafana
Amazon EKS

Tools

Terraform
Helm
ArgoCD
Pulumi
Prometheus
Grafana

Job description

Location: Metro Manila, Philippines | Remote

Employment type: Full-time | Day Shift

About the role

This is a fully remote Site Reliability Engineer (SRE) position with Machine Learning Expertise, partnering with Japan's leading restaurant reservation management platform. You will maintain and scale a 24/7 high-traffic production environment built on AWS and Kubernetes, while bringing SRE and MLOps discipline to machine learning pipelines and inference services.

Key responsibilities
  • Maintain and scale a 24/7 high-traffic production environment built on AWS and Kubernetes

  • Design, build, and evolve Infrastructure as Code (IaC) using Terraform, Helm, and ArgoCD

  • Manage AWS core services, including EKS, EC2, RDS, Fargate, CloudFront, Lambda, and S3

  • Drive incident response, proactive monitoring, configuration management, and postmortem processes

  • Implement DevOps best practices to boost developer productivity, platform scalability, and system reliability

  • Apply SRE discipline to ML infrastructure, ensuring high availability, observability, and performance for model training and inference pipelines

  • Support, streamline, and automate ML model deployment pipelines on Kubernetes

  • Build monitoring, logging, and alerting systems tailored to production ML models

  • Partner with data science and engineering teams to operationalize and scale intelligent features across the platform

About you
  • Minimum 2 years of hands-on experience with AWS, with significant depth in AWS EKS, EC2, RDS, Fargate, CloudFront, Lambda, and S3

  • Deep experience deploying, managing, and scaling production workloads on Kubernetes

  • Strong familiarity with MLOps practices and hands-on Python experience with ML-adjacent tooling (e.g., inference serving, model deployment, ML pipelines)

  • Experience in direct software engineering under DevOps/SRE practices, including at least 1 year in a Technical Lead capacity

  • Current proficiency in Python (preferred) or Ruby, Elixir, Go, JavaScript, or Rust

  • Strong skills in configuration management (YAML, Bash) along with containerization and hypervisor fundamentals

  • Track record of operating large-scale production systems with a deep understanding of fault-tolerance and distributed systems failure modes

  • Experience in fast-paced startup environments

  • Infrastructure as Code & GitOps tools: Terraform, Pulumi, ArgoCD

  • Observability stacks: Prometheus, Grafana

Job Ref: RYAN - TT

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Remote SRE & MLOps Engineer | AWS & Kubernetes
Remote SRE & MLOps Engineer | AWS & Kubernetes

Lewis Personnel Management • Metro Manila

Remote
PHP 1,200,000 - 1,700,000
Site Reliability Engineer (SRE) - AWS & Kurbernetes
Site Reliability Engineer (SRE) - AWS & Kurbernetes

Lewis Personnel Management • Metro Manila

Remote
PHP 900,000 - 1,500,000
Full-Time: Senior Site Reliability Engineer (SRE) - URGENT
Full-Time: Senior Site Reliability Engineer (SRE) - URGENT

Lewis Personnel Management • Manila

On-site
PHP 1,800,000 - 2,400,000
Remote SRE: AWS & Kubernetes, ML Infra Focus
Remote SRE: AWS & Kubernetes, ML Infra Focus

Lewis Personnel Management • Metro Manila

Remote
PHP 900,000 - 1,500,000
Site Reliability Engineer
Site Reliability Engineer

MicroSourcing • Manila

On-site
PHP 900,000 - 1,500,000
Healthcare coverage
Paid time-off with cash conversion
Group life insurance
+3
Site Reliability Engineer
Site Reliability Engineer

Coretex • Manila

On-site
PHP 1,200,000 - 2,000,000
Remote Site Reliability Engineer – Scale Cloud Infra
Remote Site Reliability Engineer – Scale Cloud Infra

Philippines (PHC1) Avid Philippines • Philippines

Remote
PHP 1,200,000 - 1,800,000
Health & life insurance
Referral rewards
Generous leave policies
Site Reliability Engineer - LInE (Remote)
Site Reliability Engineer - LInE (Remote)

Quik Hire Staffing • Philippines

Remote
PHP 5,653,000 - 9,422,000
Site Reliability Engineer - Remote Philippines
Site Reliability Engineer - Remote Philippines

MicroSourcing • Manila

On-site
PHP 900,000 - 1,500,000
Healthcare coverage
Paid time-off with cash conversion
Group life insurance
+3
Site Reliability Engineer
Site Reliability Engineer

EROAD Philippines Inc • Manila

On-site
PHP 900,000 - 1,300,000