Senior AI Reliability Engineer - Observability & Incidents

engineeringjobs.net, Inc.

Milwaukee (WI)

On-site

USD 140,000 - 180,000

Full time

9 days ago
Application generator

Don’t send a generic resume — generate a resume and cover letter tailored to this exact role.

Get past ATS filters

Benefits offered by this job

Medical Insurance
Dental Insurance
Vision Insurance
401(k) Matching
Paid Parental Leave
Short-Term Disability Coverage
Long-Term Disability Coverage
Life Insurance
Paid Holidays
Floating Holiday
Birthday Leave
Year-End Holiday Shutdown
Personal Wellness Days
Paid Vacation
Sick Leave
Family Emergency Leave
Volunteer Leave
Annual Bonuses
Restricted Stock Units

Job summary

engineeringjobs.net, Inc. is seeking a seasoned Reliability Engineer to own application-level reliability for AI-powered features, defining SLI/SLOs, error budgets, and building observability dashboards and automated diagnostic agents.

You will lead incident response and reliability improvements using operational analytics and Python tooling, collaborating with application, data, and infrastructure teams to reduce incidents and improve production stability.

Qualifications

  • Requires at least 7 years of software engineering experience focused on reliability, observability, or production operations.
  • Candidates must have a bachelor’s or master’s degree in a relevant technical discipline.
  • Strong Python and SQL skills with production GCP experience (GKE, BigQuery, Bigtable) or equivalent.

Responsibilities

  • Define SLI/SLOs, error budgets, and observability dashboards for AI-powered features.
  • Lead application incident response and reliability improvements using operational analytics and Python tooling.
  • Collaborate with application, data, and infrastructure teams to improve production reliability.

Skills

Python
Kubernetes
Google Cloud Platform
BigQuery
Bigtable
SQL
Application Reliability
Observability
SLI/SLO Frameworks
LangGraph
AI Agent Engineering
Looker
Distributed Tracing
Incident Response
Automated Remediation
Generative AI

Education

Bachelor's or Master's degree in a relevant technical discipline

Tools

Looker
LangGraph

Job description

engineeringjobs.net, Inc. is seeking a seasoned Reliability Engineer to own application-level reliability for AI-powered features, defining SLI/SLOs, error budgets, and building observability dashboards and automated diagnostic agents.

You will lead incident response and reliability improvements using operational analytics and Python tooling, collaborating with application, data, and infrastructure teams to reduce incidents and improve production stability.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Senior AI Reliability Engineer - Observability (Hybrid)
Senior AI Reliability Engineer - Observability (Hybrid)

Cisco • San Jose (CA)

Hybrid
USD 168,000 - 245,000
Medical Insurance
Dental Insurance
Vision Insurance
+5
Senior AI Observability & Reliability Engineer
Senior AI Observability & Reliability Engineer

NVIDIA AI • Santa Clara (CA)

On-site
USD 190,000 - 240,000
Equity
Benefits
Senior Software Engineer - AI Reliability & Observability
Senior Software Engineer - AI Reliability & Observability

Cisco • Milwaukee (WI)

Hybrid
USD 150,000 - 250,000
Lead AI Reliability Engineer for Production Systems
Lead AI Reliability Engineer for Production Systems

Meta • Boise (ID)

On-site
USD 271,000 - 347,000
Remote Site Reliability Engineer: AI Observability
Remote Site Reliability Engineer: AI Observability

Upstart • United States

Remote
USD 142,000 - 197,000
Bonus opportunities
Equity grants
401(k) with company match
+5
AI Production & Observability Leader
AI Production & Observability Leader

Xsolis • Franklin (TN)

Hybrid
USD 150,000 - 230,000
401K match
Flexible PTO
Paid parental leave
+3
Staff Site Reliability Engineer — AI-Driven Reliability
Staff Site Reliability Engineer — AI-Driven Reliability

EarnIn • Mountain View (CA)

Hybrid
USD 252,000 - 308,000
Equity
Hybrid work model
Senior Software Engineer – Application Reliability (Kubernetes, GCP, SQL), Hybrid
Senior Software Engineer – Application Reliability (Kubernetes, GCP, SQL), Hybrid

engineeringjobs.net, Inc. • Milwaukee (WI)

On-site
USD 140,000 - 180,000
Medical Insurance
Dental Insurance
Vision Insurance
+16
Principal AI Reliability Engineer — Autonomous Incident Agent
Principal AI Reliability Engineer — Autonomous Incident Agent

Meta • Carson City (NV)

On-site
USD 271,000 - 347,000
Site Reliability Engineer, AI Platform & Observability
Site Reliability Engineer, AI Platform & Observability

Schonfeld • Northern (KY), New York (NY)

Hybrid
USD 175,000 - 225,000
Performance bonus
Competitive benefits package