Infra SRE: Cloud-Native Ops & Platform Reliability

Alibaba Cloud

Sunnyvale (CA)

On-site

USD 145,000 - 238,000

Full time

8 days ago
Application generator

Turn this role into an interview — a resume and cover letter built around what this employer wants.

Get past ATS filters

Job summary

Alibaba Cloud is seeking an experienced infrastructure operations professional in Sunnyvale to monitor and manage Kubernetes clusters, databases, and middleware at scale. You will lead deployment, capacity planning, and automation efforts, ensuring high availability and disaster readiness.

The role requires 3+ years in SRE/Infra operations, strong Linux scripting, and experience with MySQL/Redis/Kafka/MongoDB. Proficiency in Python/Go/Java and gateway management is essential for success.

Qualifications

  • Bachelor's degree in Computer Science or related field.
  • 3+ years of experience in infrastructure operations, SRE, or Infra operations.
  • Solid Linux administration and Shell/Python scripting; familiarity with Kubernetes and cloud-native monitoring.
  • Experience with databases or middleware such as MySQL, Redis, Kafka, MongoDB; backup/restore and disaster recovery knowledge.
  • Proficient in Python/Go/Java for automation and tooling.
  • Familiarity with application release processes and gateway configuration management.
  • Strong ownership, collaboration, and incident response skills.

Responsibilities

  • Perform daily monitoring, health checks, and capacity management of Kubernetes clusters; track resource utilization and metrics; respond to alerts and scale as needed.
  • Troubleshoot failures of K8s nodes, middleware components, and applications; perform fault isolation and workload migrations to ensure fast recovery.
  • Maintain databases and middleware (MySQL, Redis, Kafka, RocketMQ, MongoDB, etc.); conduct backup/restore and DR drills; manage gateway domains and certificates.
  • Own application initialization, version releases, and configuration changes; enable elastic scaling for traffic fluctuations and node failures.
  • Manage permission provisioning for middleware, databases, servers, and networks; synchronize accounts for daily operations requests.
  • Drive production safety and security: remediation, incident coordination, postmortems, and day-to-day ops support.
  • Own data onboarding and operations for Infra stability platforms; ensure data completeness and accuracy; support platform iteration.
  • Ensure stability of operations platforms in independent cloud environments; build monitoring, emergency playbooks, and incident response mechanisms.

Skills

Kubernetes
Linux
Python
Go
Java
Shell scripting
Monitoring

Education

Bachelor's degree in Computer Science or related field

Tools

MySQL
Redis
Kafka
MongoDB
RabbitMQ

Job description

Alibaba Cloud is seeking an experienced infrastructure operations professional in Sunnyvale to monitor and manage Kubernetes clusters, databases, and middleware at scale. You will lead deployment, capacity planning, and automation efforts, ensuring high availability and disaster readiness.

The role requires 3+ years in SRE/Infra operations, strong Linux scripting, and experience with MySQL/Redis/Kafka/MongoDB. Proficiency in Python/Go/Java and gateway management is essential for success.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Platform Reliability Engineer — Kubernetes & Infra Ops
Platform Reliability Engineer — Kubernetes & Infra Ops

Alibaba Cloud • Sunnyvale (CA)

On-site
USD 145,000 - 238,000
Senior SRE - Global Cloud Infra & Reliability
Senior SRE - Global Cloud Infra & Reliability

Alibaba Cloud • Sunnyvale (CA)

On-site
USD 145,000 - 238,000
Infra Operations SRE -Sunnyvale
Infra Operations SRE -Sunnyvale

Alibaba Cloud • Sunnyvale (CA)

On-site
USD 145,000 - 238,000
Cloud SRE: Drive 99.99% Availability & Stability
Cloud SRE: Drive 99.99% Availability & Stability

Alibaba Cloud • Sunnyvale (CA)

On-site
USD 104,000 - 171,000
AI Inference Platform SRE — Build Reliable Cloud Operations
AI Inference Platform SRE — Build Reliable Cloud Operations

BBG Ventures, LLC • Bellevue (WA)

On-site
USD 133,000 - 220,000
Medical insurance
Dental insurance
Vision insurance
+5
Senior Site Reliability Engineer - Global Cloud Platform
Senior Site Reliability Engineer - Global Cloud Platform

Alibaba Cloud • Sunnyvale (CA)

On-site
USD 145,000 - 238,000
Java SRE Engineer
Java SRE Engineer

EITACIES Inc. • Santa Clara (CA)

On-site
USD 120,000 - 160,000
Cloud SRE Specialist - Reliability & Automation Engineer
Cloud SRE Specialist - Reliability & Automation Engineer

Alibaba Cloud • Seattle (WA)

On-site
USD 133,200 - 219,600
Medical, dental, and vision insurance
401(k) plan
Paid holidays and vacation days
+1
Senior SRE, Cloud Baseline & Kubernetes Platform
Senior SRE, Cloud Baseline & Kubernetes Platform

United States Digital Space LLC • Paris (TX)

On-site
USD 140,000 - 210,000
Senior SRE: AI-Driven Kubernetes Reliability at Scale
Senior SRE: AI-Driven Kubernetes Reliability at Scale

fal - Features & Labels • San Francisco (CA)

On-site
USD 180,000 - 240,000
Health insurance
Dental insurance
Vision insurance
+1