Senior Software Engineer – Application Reliability (Kubernetes, GCP, SQL), Hybrid

engineeringjobs.net, Inc.

Milwaukee (WI)

On-site

USD 140,000 - 180,000

Full time

9 days ago
Application generator

A complete application in a minute — tailored resume and cover letter, ready to send.

Get past ATS filters

Benefits offered by this job

Medical Insurance
Dental Insurance
Vision Insurance
401(k) Matching
Paid Parental Leave
Short-Term Disability Coverage
Long-Term Disability Coverage
Life Insurance
Paid Holidays
Floating Holiday
Birthday Leave
Year-End Holiday Shutdown
Personal Wellness Days
Paid Vacation
Sick Leave
Family Emergency Leave
Volunteer Leave
Annual Bonuses
Restricted Stock Units

Job summary

engineeringjobs.net, Inc. is seeking a seasoned Reliability Engineer to own application-level reliability for AI-powered features, defining SLI/SLOs, error budgets, and building observability dashboards and automated diagnostic agents.

You will lead incident response and reliability improvements using operational analytics and Python tooling, collaborating with application, data, and infrastructure teams to reduce incidents and improve production stability.

Qualifications

  • Requires at least 7 years of software engineering experience focused on reliability, observability, or production operations.
  • Candidates must have a bachelor’s or master’s degree in a relevant technical discipline.
  • Strong Python and SQL skills with production GCP experience (GKE, BigQuery, Bigtable) or equivalent.

Responsibilities

  • Define SLI/SLOs, error budgets, and observability dashboards for AI-powered features.
  • Lead application incident response and reliability improvements using operational analytics and Python tooling.
  • Collaborate with application, data, and infrastructure teams to improve production reliability.

Skills

Python
Kubernetes
Google Cloud Platform
BigQuery
Bigtable
SQL
Application Reliability
Observability
SLI/SLO Frameworks
LangGraph
AI Agent Engineering
Looker
Distributed Tracing
Incident Response
Automated Remediation
Generative AI

Education

Bachelor's or Master's degree in a relevant technical discipline

Tools

Looker
LangGraph

Job description

Own application-level reliability for AI-powered features by defining SLIs, SLOs, and error budgets, and building observability dashboards and automated diagnostic and remediation agents. Lead application incident response and reliability improvements, using operational analytics, Python tooling, and collaboration with application, data, and infrastructure teams.

Requirements: Requires at least 7 years of software engineering experience focused on reliability, observability, or production operations, plus a bachelor's or master's degree in a relevant technical discipline. Candidates need strong Python and SQL skills, production GCP experience with GKE, BigQuery, and Bigtable or an equivalent, and experience operating application-level SLI/SLO frameworks and debugging production applications.

Key Skills: Python, Kubernetes, Google Cloud Platform, BigQuery, Bigtable, SQL, Application Reliability, Observability, SLI/SLO Frameworks, LangGraph, AI Agent Engineering, Looker, Distributed Tracing, Incident Response, Automated Remediation, Generative AI

Benefits: Medical Insurance, Dental Insurance, Vision Insurance, 401(k) Matching, Paid Parental Leave, Short-Term Disability Coverage, Long-Term Disability Coverage, Life Insurance, Paid Holidays, Floating Holiday, Birthday Leave, Year-End Holiday Shutdown, Personal Wellness Days, Paid Vacation, Sick Leave, Family Emergency Leave, Volunteer Leave, Annual Bonuses, Restricted Stock Units

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Senior AI Reliability Engineer - Observability & Incidents
Senior AI Reliability Engineer - Observability & Incidents

engineeringjobs.net, Inc. • Milwaukee (WI)

On-site
USD 140,000 - 180,000
Medical Insurance
Dental Insurance
Vision Insurance
+16
Site Reliability Engineer
Site Reliability Engineer

Hidden Jobs • United States

On-site
USD 150,000 - 190,000
Healthcare
Retirement matching
Paid family leave
+3
Staff SRE
Staff SRE

Selby Jennings • Chicago (IL)

On-site
USD 140,000 - 180,000
Senior SRE / Cloud / Kubernetes / Terraform / 100% Remote
Senior SRE / Cloud / Kubernetes / Terraform / 100% Remote

Motion Recruitment • United States

Remote
USD 140,000 - 170,000
Medical, dental, and vision
Equity / Stock Options
Remote equipment stipend
+3
Sr. Availability & Reliability Software Engineer
Sr. Availability & Reliability Software Engineer

Truist • Charlotte (NC)

On-site
USD 140,000 - 200,000
Medical Insurance
Dental Insurance
Vision Insurance
+4
Staff Software Engineer
Staff Software Engineer

CoreWeave • Bellevue (WA)

On-site
USD 180,000 - 240,000
Medical Insurance
Dental Insurance
Vision Insurance
+6
Senior SRE / Cloud / Kubernetes / Terraform / 100% Remote
Senior SRE / Cloud / Kubernetes / Terraform / 100% Remote

Motion Recruitment • Mount Laurel Township (NJ)

Remote
USD 130,000 - 180,000
Medical, dental, and vision benefits
Equity / Stock Options
Remote equipment stipend
+3
Sr. Site Reliability Engineer
Sr. Site Reliability Engineer

Clearwater Analytics • Boise (ID)

On-site
USD 130,000 - 170,000
Software Engineer - Data Infrastructure Services
Software Engineer - Data Infrastructure Services

CoreWeave • Bellevue (WA)

On-site
USD 120,000 - 160,000
Medical Insurance
Dental Insurance
Vision Insurance
+15
Senior Software Engineer
Senior Software Engineer

Aditi Consulting • Urbandale (IA)

On-site
USD 120,000 - 150,000
Medical Insurance
Dental Insurance
Life Insurance
+14