Senior SRE & Automation Engineer — GPU Cloud Reliability

Bitdeer Technologies Group

Austin (TX)

On-site

USD 150,000 - 230,000

Full time

14 days+
Application generator

An application made for this job — a tailored resume and cover letter that speak straight to the posting.

Get past ATS filters

Job summary

Bitdeer Technologies Group is building an AI-operated GPU cloud where reliability is the product. You will own the reliability of the customer-facing GPU cloud end-to-end—from tenant onboarding and provisioning to workload execution, incident response, and post-incident recovery.

You are the SRE between infrastructure and customer experience, designing observability and automation for a scalable 10,000-GPU environment.

Qualifications

  • 5+ years in SRE / cloud operations, with at least 2 years operating GPU workloads at scale.
  • Deep understanding of Kubernetes operations and GPU workload management (Nvidia GPU operator, device plugin, MIG, time-slicing, GPU scheduling).
  • Experience with multi-tenant cloud platforms with strong isolation guarantees.
  • Customer-facing cloud service experience—defining and operating against customer SLAs/SLOs, handling tenant incidents and communications.

Responsibilities

  • Own end-to-end reliability of the customer-facing GPU cloud service, including availability and tenant experience.
  • Operate production Kubernetes clusters optimized for GPU workloads at scale (100–10,000 GPUs).
  • Manage Nvidia GPU operator, device plugin, MIG, time-slicing, and multi-tenant allocation policies.
  • Implement topology-aware scheduling and ensure tenant isolation with namespaces, RBAC, and quotas.
  • Develop and enforce runbooks, incident response processes, and post-incident reviews.

Skills

SRE
Kubernetes operations
GPU workload management
Multi-tenant isolation
Incident management
Go/Python automation
Observability design
Runbook automation

Tools

Kubernetes
Terraform
Helm
GitOps (ArgoCD/Flux)
Prometheus
Grafana
Ironic
MAAS

Job description

Bitdeer Technologies Group is building an AI-operated GPU cloud where reliability is the product. You will own the reliability of the customer-facing GPU cloud end-to-end—from tenant onboarding and provisioning to workload execution, incident response, and post-incident recovery.

You are the SRE between infrastructure and customer experience, designing observability and automation for a scalable 10,000-GPU environment.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Senior SRE - Customer-Facing GPU Cloud Reliability
Senior SRE - Customer-Facing GPU Cloud Reliability

Bitdeer • San Jose (CA)

On-site
USD 180,000 - 260,000
Sr SRE & Automation Engineer (Customer Facing)
Sr SRE & Automation Engineer (Customer Facing)

Bitdeer Technologies Group • Austin (TX)

On-site
USD 150,000 - 230,000
Entry-Level SRE: Observability Platform for GPU Cloud
Entry-Level SRE: Observability Platform for GPU Cloud

Bitdeer • San Jose (CA)

On-site
USD 110,000 - 150,000
Sr SRE & Automation Engineer (Customer Facing)
Sr SRE & Automation Engineer (Customer Facing)

Bitdeer • San Jose (CA)

On-site
USD 180,000 - 260,000
Senior DevOps Engineer — CI/CD for AI GPU Cloud
Senior DevOps Engineer — CI/CD for AI GPU Cloud

Bitdeer • San Jose (CA)

On-site
USD 180,000 - 240,000
Senior DevOps Engineer – AI Cloud & MLOps
Senior DevOps Engineer – AI Cloud & MLOps

Bitdeer (NASDAQ: BTDR) • Austin (TX)

On-site
USD 140,000 - 190,000
Senior DevOps Engineer - CI/CD & MLOps for AI GPU Cloud
Senior DevOps Engineer - CI/CD & MLOps for AI GPU Cloud

Bitdeer Technologies Group • San Jose (CA)

On-site
USD 160,000 - 220,000
Senior Cloud DevOps Engineer for AI Platform & Security
Senior Cloud DevOps Engineer for AI Platform & Security

Bitdeer (NASDAQ: BTDR) • Austin (TX)

On-site
USD 140,000 - 190,000
Junior SRE: Monitoring Platform Engineer (GPU Cloud)
Junior SRE: Monitoring Platform Engineer (GPU Cloud)

Bitdeer Technologies Group • San Jose (CA)

On-site
USD 90,000 - 130,000
Senior SRE, AI Infrastructure & GPU Fleet Reliability
Senior SRE, AI Infrastructure & GPU Fleet Reliability

Hamilton Barnes Associates Limited • San Francisco (CA)

On-site
USD 297,500 - 402,500
Huge stock options
Company bonus
Unlimited PTO
+1