Senior AI Reliability Engineer - Observability & Incidents

engineeringjobs.net, Inc.

Milwaukee (WI)

On-site

USD 140,000 - 180,000

Full time

9 days ago
Application generator

Don’t send a generic resume — generate a resume and cover letter tailored to this exact role.

Get past ATS filters

Benefits offered by this job

Medical Insurance
Dental Insurance
Vision Insurance
401(k) Matching
Paid Parental Leave
Short-Term Disability Coverage
Long-Term Disability Coverage
Life Insurance
Paid Holidays
Floating Holiday
Birthday Leave
Year-End Holiday Shutdown
Personal Wellness Days
Paid Vacation
Sick Leave
Family Emergency Leave
Volunteer Leave
Annual Bonuses
Restricted Stock Units

Job summary

engineeringjobs.net, Inc. is seeking a seasoned Reliability Engineer to own application-level reliability for AI-powered features, defining SLI/SLOs, error budgets, and building observability dashboards and automated diagnostic agents.

You will lead incident response and reliability improvements using operational analytics and Python tooling, collaborating with application, data, and infrastructure teams to reduce incidents and improve production stability.

Qualifications

  • Requires at least 7 years of software engineering experience focused on reliability, observability, or production operations.
  • Candidates must have a bachelor’s or master’s degree in a relevant technical discipline.
  • Strong Python and SQL skills with production GCP experience (GKE, BigQuery, Bigtable) or equivalent.

Responsibilities

  • Define SLI/SLOs, error budgets, and observability dashboards for AI-powered features.
  • Lead application incident response and reliability improvements using operational analytics and Python tooling.
  • Collaborate with application, data, and infrastructure teams to improve production reliability.

Skills

Python
Kubernetes
Google Cloud Platform
BigQuery
Bigtable
SQL
Application Reliability
Observability
SLI/SLO Frameworks
LangGraph
AI Agent Engineering
Looker
Distributed Tracing
Incident Response
Automated Remediation
Generative AI

Education

Bachelor's or Master's degree in a relevant technical discipline

Tools

Looker
LangGraph

Job description

engineeringjobs.net, Inc. is seeking a seasoned Reliability Engineer to own application-level reliability for AI-powered features, defining SLI/SLOs, error budgets, and building observability dashboards and automated diagnostic agents.

You will lead incident response and reliability improvements using operational analytics and Python tooling, collaborating with application, data, and infrastructure teams to reduce incidents and improve production stability.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Senior AI Reliability Engineer - Observability (Hybrid)
Senior AI Reliability Engineer - Observability (Hybrid)

Cisco • San Jose (CA)

Hybrid
USD 168,000 - 245,000
Medical Insurance
Dental Insurance
Vision Insurance
+5
Senior AI Observability & Reliability Engineer
Senior AI Observability & Reliability Engineer

NVIDIA AI • Santa Clara (CA)

On-site
USD 190,000 - 240,000
Equity
Benefits
Senior Software Engineer - AI Reliability & Observability
Senior Software Engineer - AI Reliability & Observability

Cisco • Milwaukee (WI)

Hybrid
USD 150,000 - 250,000
Lead Applied AI SRE: Reliability & Observability
Lead Applied AI SRE: Reliability & Observability

Deloitte France • Tampa (FL)

On-site
USD 180,000 - 240,000
Lead AI Reliability Engineer for Production Systems
Lead AI Reliability Engineer for Production Systems

Meta • Boise (ID)

On-site
USD 271,000 - 347,000
Remote Site Reliability Engineer: AI Observability
Remote Site Reliability Engineer: AI Observability

Upstart • United States

Remote
USD 142,000 - 197,000
Bonus opportunities
Equity grants
401(k) with company match
+5
Staff Site Reliability Engineer — AI-Driven Reliability
Staff Site Reliability Engineer — AI-Driven Reliability

EarnIn • Mountain View (CA)

Hybrid
USD 252,000 - 308,000
Equity
Hybrid work model
Principal AI Reliability Engineer — Production Systems
Principal AI Reliability Engineer — Production Systems

Meta • Denver (CO)

On-site
USD 271,000 - 347,000
Bonus
Equity
Benefits
Principal AI Reliability Engineer — Autonomous Incident Agent
Principal AI Reliability Engineer — Autonomous Incident Agent

Meta • Carson City (NV)

On-site
USD 271,000 - 347,000
AI Production & Observability Leader
AI Production & Observability Leader

Xsolis • Franklin (TN)

Hybrid
USD 150,000 - 230,000
401K match
Flexible PTO
Paid parental leave
+3