Lead SRE - Large-Scale Data Platforms & AI-Driven Ops

Apple Inc.

Cupertino (CA)

On-site

USD 120,000 - 180,000

Full time

13 hours ago
Be an early applicant
Application generator

Turn this role into an interview — a resume and cover letter built around what this employer wants.

Get past ATS filters

Job summary

Apple is seeking an extraordinary DevOps/SRE engineer to scale large data platforms and analytics tools within the Insight ecosystem. You will drive reliability, automation, and observability for a multi-exabyte data landscape supporting Apple’s products and manufacturing operations.

You’ll apply AI/ML techniques to operations, implement deep observability dashboards, and collaborate with global teams across time zones to improve system resilience and performance at scale.

Qualifications

  • 3+ years of experience in SRE, DevOps, or platform engineering.
  • Proficiency in Python or Java.
  • Experience with AWS or GCP and big-data or streaming tech like Kafka/Elasticsearch/Redis/Bigtable.
  • Experience applying AI/ML or LLM techniques to development or operations.

Responsibilities

  • Own reliability, performance, and scalability of services within the Insight ecosystem.
  • Drive automation to reduce toil and improve observability (SLOs/SLIs).
  • Lead incident response and post-incident reviews with architectural improvements.
  • Develop AI-driven alerting, anomaly detection, and automated incident triage.
  • Collaborate with cross-functional teams across Apple’s manufacturing services.

Skills

Python programming
Java programming
Analytical thinking

Education

BS/MS in Computer Science

Tools

Kafka
Elasticsearch
Redis
Bigtable
Druid
ClickHouse
Object storage
Docker
Kubernetes
Grafana
Prometheus
Kibana
ArgoCD
Jenkins
GitHub Actions

Job description

Apple is seeking an extraordinary DevOps/SRE engineer to scale large data platforms and analytics tools within the Insight ecosystem. You will drive reliability, automation, and observability for a multi-exabyte data landscape supporting Apple’s products and manufacturing operations.

You’ll apply AI/ML techniques to operations, implement deep observability dashboards, and collaborate with global teams across time zones to improve system resilience and performance at scale.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

SRE - AI Data Platform & ML Infra at Scale
SRE - AI Data Platform & ML Infra at Scale

Apple Inc. • Austin (TX), Northern (KY)

Hybrid
USD 140,000 - 180,000
Site Reliability Engineer - Insights
Site Reliability Engineer - Insights

Apple Inc. • Cupertino (CA)

On-site
USD 120,000 - 180,000
SRE – AI Data Platform Infra & ML Pipelines
SRE – AI Data Platform Infra & ML Pipelines

Apple • Austin (TX)

On-site
USD 120,000 - 180,000
Senior Observability SRE Leader — AI-Driven Reliability
Senior Observability SRE Leader — AI-Driven Reliability

Apple Inc. • Seattle (WA)

On-site
USD 226,000 - 338,000
Site Reliability Engineer, Apple Data Platform - AI/ML Platform
Site Reliability Engineer, Apple Data Platform - AI/ML Platform

Apple • Austin (TX)

On-site
USD 120,000 - 180,000
AI & Data Platform SRE: Scale, Reliability, Cloud
AI & Data Platform SRE: Scale, Reliability, Cloud

Apple Inc. • Cupertino (CA)

On-site
USD 150,000 - 190,000
SRE: Data Platform & Multi-Cloud Infra
SRE: Data Platform & Multi-Cloud Infra

Apple Inc. • Austin (TX), Northern (KY)

Hybrid
USD 120,000 - 180,000
Site Reliability Engineer, Apple Data Platform - AI/ML Platform
Site Reliability Engineer, Apple Data Platform - AI/ML Platform

Apple Inc. • Austin (TX), Northern (KY)

On-site
USD 140,000 - 180,000
Site Reliability Engineer - Big Data Platform & Multi-Cloud
Site Reliability Engineer - Big Data Platform & Multi-Cloud

Apple Inc. • Austin (TX), Northern (KY)

Hybrid
USD 120,000 - 170,000
Site Reliability Engineer, Apple Data Platform / Big Data Platform
Site Reliability Engineer, Apple Data Platform / Big Data Platform

Apple Inc. • Austin (TX), Northern (KY)

Hybrid
USD 120,000 - 170,000