Platform Reliability & Incident Response Engineer

Vizient

Missouri

On-site

USD 77,000 - 135,000

Full time

14 days+
Application generator

A complete application in a minute — tailored resume and cover letter, ready to send.

Get past ATS filters

Benefits offered by this job

Incentive eligible

Job summary

Vizient in Missouri seeks a production support professional to provide technical triage, diagnostics, and operational support across Vizient's core platforms and business domains. You will improve incident response, restoration speed, and stakeholder communication while partnering with Engineering, Product, and Operations teams to diagnose issues and strengthen platform reliability.

The role requires 2+ years in application/production support, strong SQL/log analysis, cloud-hosted service

Qualifications

  • Relevant degree preferred.
  • 2 or more years of relevant experience required.
  • Experience in application support, production support engineering, software engineering, DevOps, Site Reliability Engineering (SRE), technical systems analysis, monitoring and observability instrumentation, or technical product support required.
  • Strong troubleshooting, SQL/data analysis, log analysis, stack trace analysis, monitoring review, and technical documentation skills required.
  • Experience supporting enterprise applications, cloud-hosted services, integrations, APIs, reporting platforms, or data-driven systems required.
  • Strong verbal and written communication skills with the ability to communicate technical issues clearly to technical and non-technical audiences required.
  • Experience with Databricks, Azure, Spark, data pipelines, observability tools, ServiceNow, Azure DevOps, Python, Splunk, Datadog, or Application Insights preferred.
  • Familiarity with ITSM/ITIL processes, Incident Management, Problem Management, Root Cause Analysis (RCA), corrective action preventative action, or known error management practices preferred.
  • Experience leveraging AI-assisted tools and technologies to improve operational support, incident diagnostics, troubleshooting efficiency, documentation generation, or workflow automation preferred.
  • Experience supporting healthcare technology, analytics platforms, enterprise SaaS platforms, or data-driven systems preferred.

Responsibilities

  • Investigate production issues involving logs, SQL/data patterns, failed jobs, alerts, workflows, APIs, integrations, reporting, access, configuration, and application behavior.
  • Analyze platform dependencies, workflows, monitoring events, and system health indicators to identify suspected causes and resolution paths.
  • Identify workarounds, ownership paths, escalation readiness, and supportable resolution options.
  • Perform Tier 2 triage for production incidents.
  • Create evidence-based escalation summaries and handoffs for Product Engineering, Platform Engineering, or Data Engineering teams.
  • Improve incident intake quality, classification accuracy, ownership clarity, and stakeholder communication.
  • Develop and maintain runbooks, Standard Operating Procedures (SOPs), known error articles, diagnostic checklists, and support documentation.
  • Support Root Cause Analysis (RCA) documentation, Problem Records, corrective action tracking, and recurring incident reduction initiatives.
  • Partner with Product, Engineering, Operations, Support teams, and business stakeholders to improve operational stability and support processes.
  • Reduce avoidable escalations and recurring production issues through improved diagnostics, documentation, and operational follow-through.

Skills

Troubleshooting
SQL/data analysis
Log analysis
Monitoring review
Technical documentation
Communication

Education

Bachelor's degree

Tools

Databricks
Azure
Spark
Datadog
Splunk
ServiceNow
Azure DevOps
Python
Application Insights

Job description

Vizient in Missouri seeks a production support professional to provide technical triage, diagnostics, and operational support across Vizient's core platforms and business domains. You will improve incident response, restoration speed, and stakeholder communication while partnering with Engineering, Product, and Operations teams to diagnose issues and strengthen platform reliability.

The role requires 2+ years in application/production support, strong SQL/log analysis, cloud-hosted service

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Production Support Engineer: Platform Reliability & Incidents
Production Support Engineer: Platform Reliability & Incidents

Vizient • Chicago (IL)

On-site
USD 77,000 - 135,000
Development Support Engineer
Development Support Engineer

Vizient • Chicago (IL)

On-site
USD 77,000 - 135,000
Development Support Engineer
Development Support Engineer

Vizient • Missouri

On-site
USD 77,000 - 135,000
Incentive eligible
Production Operations & Incident Specialist
Production Operations & Incident Specialist

UZURV • Richmond (VA)

On-site
USD 65,000 - 95,000
401K matching
Healthcare benefits
PTO and holidays
+1
Production Incident & Reliability Lead
Production Incident & Reliability Lead

State Street • Boston (MA)

On-site
USD 70,000 - 119,000
401K with company match
Healthcare coverage (medical, dental,
Paid time off and disability benefits
+3
Production Reliability Engineer - Incident Response & Monitoring
Production Reliability Engineer - Incident Response & Monitoring

TechDigital Group • Jersey City (NJ)

On-site
USD 90,000 - 120,000
Production Reliability Engineer: Monitoring & Incident Response
Production Reliability Engineer: Monitoring & Incident Response

Kissht • United States

Remote
USD 70,000 - 110,000
Incident Response Lead - Production Reliability & Automation
Incident Response Lead - Production Reliability & Automation

UST • Richmond (VA)

Hybrid
USD 83,000 - 125,000
Health insurance
401(k) with employer matching
Paid time off
+2
Production Support Engineer: Incident Response & Automation
Production Support Engineer: Incident Response & Automation

Next Frontier Capital • Boston (MA)

On-site
USD 90,000 - 130,000
Production Reliability Engineer
Production Reliability Engineer

Infinite Computer Solutions • Pennsylvania

On-site
USD 70,000 - 100,000