Senior SRE: Customer-Facing GPU Cloud Reliability

Bitdeer (NASDAQ: BTDR)

San Jose (CA)

On-site

USD 180,000 - 240,000

Full time

2 days ago
Be an early applicant
Application generator

Stand out for this role — generate a tailored resume and cover letter in about a minute.

Get past ATS filters

Job summary

Bitdeer Technologies Group is building NeoCloud, a customer-facing GPU cloud where reliability is the product. You will own the end-to-end reliability of this service, from onboarding and provisioning to workload execution, incident response, and post-incident recovery, shaping observability and automation for a scalable, multi-tenant platform.

You will work on production Kubernetes clusters, GPU operators, topology-aware scheduling, and BMaaS-like provision, with a focus on SLAs, capacity

Qualifications

  • 5+ years in SRE / cloud operations, with GPU workloads at scale.
  • Deep understanding of Kubernetes operations and GPU workload management.
  • Experience with multi-tenant cloud platforms and strong isolation guarantees.

Responsibilities

  • Own reliability of the customer-facing GPU cloud end-to-end.
  • Design observability, automation, and operational practices for a large GPU cluster.
  • Manage incident response, post-incident reviews, and customer communications.
  • Define and publish customer-facing SLAs/SLOs and drive error-budget prioritization.

Skills

SRE
Cloud operations
Kubernetes
GPU workloads
Multi-tenant isolation
Incident management
Go / Python automation
SLAs / SLOs
Capacity planning

Education

Bachelor's in CS or related field

Tools

Prometheus
Grafana
Alertmanager
ArgoCD / Flux
Terraform
Helm
GitOps
Ironic / MAAS

Job description

Bitdeer Technologies Group is building NeoCloud, a customer-facing GPU cloud where reliability is the product. You will own the end-to-end reliability of this service, from onboarding and provisioning to workload execution, incident response, and post-incident recovery, shaping observability and automation for a scalable, multi-tenant platform.

You will work on production Kubernetes clusters, GPU operators, topology-aware scheduling, and BMaaS-like provision, with a focus on SLAs, capacity

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Senior SRE - Customer-Facing GPU Cloud Reliability
Senior SRE - Customer-Facing GPU Cloud Reliability

Bitdeer • San Jose (CA)

On-site
USD 180,000 - 260,000
Senior SRE - GPU Cloud Reliability & Automation
Senior SRE - GPU Cloud Reliability & Automation

Bitdeer (NASDAQ: BTDR) • Austin (TX)

On-site
USD 140,000 - 180,000
Senior SRE & Automation Engineer — GPU Cloud Reliability
Senior SRE & Automation Engineer — GPU Cloud Reliability

Bitdeer Technologies Group • Austin (TX)

On-site
USD 150,000 - 230,000
Senior GPU Cloud Platform Engineer
Senior GPU Cloud Platform Engineer

Bitdeer • San Jose (CA)

On-site
USD 180,000 - 230,000
Junior SRE: GPU Cloud Observability Platform
Junior SRE: GPU Cloud Observability Platform

Bitdeer Technologies Group • San Jose (CA)

On-site
USD 90,000 - 125,000
Entry-Level SRE: Observability Platform for GPU Cloud
Entry-Level SRE: Observability Platform for GPU Cloud

Bitdeer • San Jose (CA)

On-site
USD 110,000 - 150,000
Sr SRE & Automation Engineer (Customer Facing)
Sr SRE & Automation Engineer (Customer Facing)

Bitdeer (NASDAQ: BTDR) • Austin (TX)

On-site
USD 140,000 - 180,000
Sr SRE & Automation Engineer (Customer Facing)
Sr SRE & Automation Engineer (Customer Facing)

Bitdeer Technologies Group • Austin (TX)

On-site
USD 150,000 - 230,000
Sr SRE & Automation Engineer (Customer Facing)
Sr SRE & Automation Engineer (Customer Facing)

Bitdeer • San Jose (CA)

On-site
USD 180,000 - 260,000
Sr SRE & Automation Engineer (Customer Facing)
Sr SRE & Automation Engineer (Customer Facing)

Bitdeer (NASDAQ: BTDR) • San Jose (CA)

On-site
USD 180,000 - 240,000