Cloud Engineer- Kubernetes

OPENSOURCE PTE. LTD.

Singapore

On-site

SGD 120,000 - 180,000

Full time

4 days ago
Be an early applicant
Application generator

Don’t send a generic resume — generate a resume and cover letter tailored to this exact role.

Get past ATS filters

Job summary

OPENSOURCE PTE. LTD. in Singapore is seeking experienced Kubernetes and Site Reliability Engineers to support highly scalable, production platforms for a global technology customer.

You will operate large-scale Kubernetes environments, drive reliability, incident management, and automation, and collaborate with platform, security, and DevOps teams to maintain availability and performance. You will build monitoring, logging and observability frameworks, define SLIs/SLOs, and contribute to

Qualifications

  • Hands-on Kubernetes administration and troubleshooting skills.
  • Strong Linux systems administration and networking knowledge.
  • Experience with monitoring/observability tools and incident RCA.
  • Proficiency in Python or Bash scripting.
  • Experience with CI/CD and automated deployment environments.

Responsibilities

  • Operate, maintain and troubleshoot large-scale Kubernetes-based production environments.
  • Ensure reliability, scalability, availability and performance of critical services.
  • Investigate complex production issues and perform root-cause analysis.
  • Participate in incident response and drive permanent corrective actions.
  • Automate repetitive operational activities and improve platform reliability.
  • Build and improve monitoring, alerting, logging and observability frameworks.
  • Define and track SLIs, SLOs and operational reliability metrics.
  • Support Kubernetes upgrades, configuration changes, patching and platform improvements.
  • Work with application engineering, infrastructure, platform, security and DevOps teams.
  • Perform capacity planning, performance tuning and reliability improvements.
  • Develop and maintain runbooks, automation scripts and troubleshooting docs.
  • Participate in production readiness reviews and ensure apps meet operational standards.

Skills

Kubernetes administration
Kubernetes troubleshooting
Linux systems administration
Networking fundamentals
SRE principles
Incident management
Python scripting
Bash/Shell scripting
CI/CD tooling
Observability tools

Tools

Prometheus
Grafana
ELK/OpenSearch
Datadog
Splunk
Terraform
Ansible
Helm
Argo CD
Flux
GitOps

Job description

Role Overview
  • We are looking for experienced Kubernetes & Site Reliability Engineers to support highly scalable, business-critical production platforms for a global technology customer in Singapore.
  • The role requires strong hands-on expertise in Kubernetes, Linux, production reliability, automation, observability, incident management and troubleshooting of distributed systems.
  • Candidates should be comfortable operating large-scale production environments where availability, performance, automation and operational excellence are critical.
Key Responsibilities
  • Operate, maintain and troubleshoot large-scale Kubernetes-based production environments.
  • Ensure reliability, scalability, availability and performance of critical services.
  • Investigate complex production issues and perform detailed root-cause analysis.
  • Participate in incident response and drive permanent corrective actions.
  • Automate repetitive operational activities and improve platform reliability.
  • Build and improve monitoring, alerting, logging and observability frameworks.
  • Define and track SLIs, SLOs and operational reliability metrics.
  • Support Kubernetes upgrades, configuration changes, patching and platform improvements.
  • Work closely with application engineering, infrastructure, platform, security and DevOps teams.
  • Perform capacity planning, performance tuning and reliability improvements.
  • Develop and maintain operational runbooks, automation scripts and troubleshooting documentation.
  • Participate in production readiness reviews and ensure applications meet operational standards.
Mandatory Skills
  • Strong hands-on experience with Kubernetes administration and troubleshooting.
  • Strong understanding of Kubernetes architecture, including:
  • Pods
  • Deployments
  • StatefulSets
  • Services
  • Ingress
  • ConfigMaps / Secrets
  • RBAC
  • Storage
  • Networking
  • Strong Linux systems administration and troubleshooting skills.
  • Good understanding of networking concepts such as DNS, TCP/IP, load balancing and service connectivity.
  • Strong understanding of Site Reliability Engineering principles.
  • Experience supporting large-scale, high-availability production systems.
  • Strong incident management and RCA experience.
  • Hands-on scripting/automation experience using Python, Bash/Shell or similar.
  • Experience with monitoring and observability tools such as Prometheus, Grafana, Splunk, ELK/OpenSearch, Datadog or equivalent.
  • Experience working with CI/CD and automated deployment environments.
  • Strong debugging and problem-solving capabilities.
Preferred Skills
  • Infrastructure-as-Code experience using Terraform, Ansible or equivalent.
  • Helm or similar Kubernetes package/deployment management tools.
  • GitOps experience using tools such as Argo CD or Flux.
  • Knowledge of service mesh concepts.
  • Experience with container security and Kubernetes security practices.
  • Experience with cloud or private-cloud infrastructure.
  • Familiarity with distributed systems and microservices architectures.
  • Exposure to performance engineering and capacity management.
  • Experience working in globally distributed engineering environments.
Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Cloud Engineer Kubernetes
Cloud Engineer Kubernetes

OPENSOURCE TECHNOLOGIES PTE. LTD. • Singapore

On-site
SGD 120,000 - 180,000
Kubernetes & Site Reliability Engineer (SRE)
Kubernetes & Site Reliability Engineer (SRE)

OPENSOURCE PTE. LTD. • Singapore

On-site
SGD 120,000 - 160,000
Kubernetes & Site Reliability Engineer (SRE)
Kubernetes & Site Reliability Engineer (SRE)

OPENSOURCE TECHNOLOGIES PTE. LTD. • Singapore

On-site
SGD 90,000 - 130,000
DevOps SRE
DevOps SRE

Wipro • Singapore

On-site
SGD 120,000 - 150,000
DevOps / Site Reliability Engineer
DevOps / Site Reliability Engineer

ACCORD INNOVATIONS PTE. LTD. • Singapore

On-site
SGD 120,000 - 180,000
Platform Engineer / Site Reliability Engineer (Kubernetes)
Platform Engineer / Site Reliability Engineer (Kubernetes)

BOUNTEOUSXACCOLITE SINGAPORE PTE. LTD. • Singapore

On-site
SGD 120,000 - 170,000
Kubernetes Platform Engineer – Global Investment Firm
Kubernetes Platform Engineer – Global Investment Firm

Pinpoint Asia • Singapore

On-site
SGD 120,000 - 180,000
Cloud Automation & Kubernetes Specialist
Cloud Automation & Kubernetes Specialist

EAMES CONSULTING GROUP (SINGAPORE) PTE. LTD. • Singapore

On-site
SGD 120,000 - 180,000
Senior Kubernetes & Site Reliability Engineer
Senior Kubernetes & Site Reliability Engineer

OPENSOURCE PTE. LTD. • Singapore

On-site
SGD 120,000 - 160,000
Platform Engineer / Specialist (Kubernetes)
Platform Engineer / Specialist (Kubernetes)

THIRD PARTY CONSULTING PTE. LTD. • Singapore

On-site
SGD 90,000 - 130,000