Cloud Messaging SRE: Kubernetes Ops & Resilience

Alibaba Cloud

Sunnyvale (CA)

On-site

USD 104,000 - 171,000

Full time

2 days ago
Be an early applicant

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

Alibaba Cloud is seeking a Reliability Engineer for its Cloud Product Operations & Reliability team in Sunnyvale. The role focuses on stability, performance tuning, and high-availability design for messaging middleware and cloud services.

You will manage Kubernetes-based deployments, automations, and disaster recovery workflows. The ideal candidate has 2+ years in distributed systems reliability, proficiency in Python/Go/Java, and hands-on experience with Kubernetes, Terraform, and Helm.

Qualifications

  • Over 2 years of experience in distributed systems reliability engineering.
  • Familiar with high-availability architecture design.
  • Proficient in Python, Go, or Java.

Responsibilities

  • Oversee stability maintenance, performance tuning, and HA design for cloud middleware.
  • Manage containerized middleware lifecycles on Kubernetes clusters (deployments, auto-scaling, upgrades).
  • Lead incident response, RCA efforts, and log tracing for production issues.
  • Develop diagnostic tools in Python/Go to resolve bottlenecks and compatibility challenges.
  • Build automation tools (Python/Go/Shell) and IaC workflows to standardize deployment and DR.

Skills

Kubernetes
Python
Go
Java
Distributed systems
Terraform

Tools

Helm
Operator

Job description

Alibaba Cloud is seeking a Reliability Engineer for its Cloud Product Operations & Reliability team in Sunnyvale. The role focuses on stability, performance tuning, and high-availability design for messaging middleware and cloud services.

You will manage Kubernetes-based deployments, automations, and disaster recovery workflows. The ideal candidate has 2+ years in distributed systems reliability, proficiency in Python/Go/Java, and hands-on experience with Kubernetes, Terraform, and Helm.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Cloud Infrastructure – Site Reliability Engineer (SRE)-Sunnyvale
Cloud Infrastructure – Site Reliability Engineer (SRE)-Sunnyvale

Alibaba Cloud • Sunnyvale (CA)

On-site
USD 104,000 - 171,000
SRE Leader: Kubernetes & Container Service Reliability
SRE Leader: Kubernetes & Container Service Reliability

Alibaba Cloud • Bellevue (WA)

On-site
USD 133,000 - 220,000
Cloud SRE Specialist - Reliability & Automation Engineer
Cloud SRE Specialist - Reliability & Automation Engineer

Alibaba Cloud • Seattle (WA)

On-site
USD 133,000 - 220,000
Medical, dental, and vision insurance
401(k) plan
Paid holidays and vacation days
+1
Senior Cloud Reliability Engineer: AWS & Kubernetes
Senior Cloud Reliability Engineer: AWS & Kubernetes

Salve.Inno Consulting • United States

On-site
USD 140,000 - 190,000
Fully remote position
Long-term cooperation
Work with enterprise customers
+1
Senior Cloud Reliability Engineer – AI-Powered SRE
Senior Cloud Reliability Engineer – AI-Powered SRE

Cerebras • Mountain View (CA)

On-site
USD 190,000 - 240,000
Cloud SRE: Platform Reliability & Automation
Cloud SRE: Platform Reliability & Automation

ManpowerGroup Global, Inc. • Town of Norway (WI), Charlotte (NC)

On-site
USD 96,000 - 103,000
Senior Cloud Resilience Engineer: HA, Chaos Testing & SRE
Senior Cloud Resilience Engineer: HA, Chaos Testing & SRE

UKG • Atlanta (GA)

Hybrid
USD 140,000 - 190,000
Reliability Engineer
Reliability Engineer

Compunnel, Inc. • Town of Texas (WI)

On-site
USD 140,000 - 190,000
Platform Reliability Engineer - Kubernetes & Multi-Cloud
Platform Reliability Engineer - Kubernetes & Multi-Cloud

Sierra Ventures • Austin (TX)

On-site
USD 125,000 - 130,000
Real-Time Cloud SRE & Reliability Engineer
Real-Time Cloud SRE & Reliability Engineer

Zoom • San Jose (CA)

Hybrid
USD 99,000 - 229,000