Site Reliability Engineer

Jobtailor

New Jersey

On-site

USD 120,000 - 180,000

Full time

11 days ago

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

Jobtailor in New Jersey seeks an experienced Site Reliability Engineer to enhance production readiness, reliability design reviews, and release planning. You will own monitoring, alert strategies, and incident response while collaborating with cross-functional teams to drive improvements in high-availability environments.

The role requires strong scripting skills (Python/Java/Go/PowerShell) and experience with distributed systems; ITIL or SRE certifications are a plus.

Qualifications

  • 10+ years of related technical experience across application support engineering, software engineering, site reliability engineering, production support, or application operations.
  • Bachelor’s degree preferred or equivalent practical experience.
  • Experience supporting business-critical applications in production environments.
  • SRE, observability, automation, or ITIL certifications are a plus.

Responsibilities

  • Participate in design reviews, sprint zero, and delivery planning to define and validate reliability requirements.
  • Collaborate with Major Release Management to ensure releases meet SRE standards and support-readiness requirements.
  • Define and improve monitoring, observability, dashboards, telemetry coverage, and alert strategy.
  • Assist in major incident response and root cause analysis.
  • Drive automation, intelligent tooling, and AI-assisted remediation.
  • Serve as the operational readiness authority before production releases.
  • Lead capacity, performance, workload trend, and resiliency analysis.
  • Establish and track reliability metrics including availability, incident volume, MTTx, alert quality, automation coverage, and change failure rate.
  • Participate in application reliability governance and service reviews.
  • Prepare executive reporting on reliability posture, release readiness, observability maturity, incident trends, risks, and improvement outcomes.
  • Promote SRE practices through mentoring, standards adoption, best-practice sharing, and approved AI tools

Skills

SRE Skills
Monitoring & Observability
Automation
Programming in Python/Java/Go/PowerShe
High-Availability Environments

Education

Bachelor’s degree

Tools

AI Concepts
Data Platforms
Anomaly Detection
Incident Correlation
Intelligent Automation

Job description

  • Participate in design reviews, sprint zero, and delivery planning to define and validate reliability requirements
  • Collaborate with Major Release Management to ensure releases meet SRE standards and support-readiness requirements
  • Define and improve monitoring, observability, dashboards, telemetry coverage, and alert strategy
  • Assist in major incident response and root cause analysis
  • Drive automation, intelligent tooling, and AI-assisted remediation
  • Serve as the operational readiness authority before production releases
  • Lead capacity, performance, workload trend, and resiliency analysis
  • Establish and track reliability metrics including availability, incident volume, MTTx, alert quality, automation coverage, and change failure rate
  • Participate in application reliability governance and service reviews
  • Prepare executive reporting on reliability posture, release readiness, observability maturity, incident trends, risks, and improvement outcomes
  • Promote SRE practices through mentoring, standards adoption, best-practice sharing, and approved AI tools
Requirements
  • Minimum of 10+ years of related technical experience across application support engineering, software engineering, site reliability engineering, production support, or application operations
  • Bachelor’s degree preferred or equivalent practical experience
  • Experience supporting business-critical applications in production environments
  • SRE, observability, automation, or ITIL certifications are a plus
  • Proven experience in one or more in-scope roles including Application Support Engineer, SDET, Software Engineer, or SRE
  • Strong understanding of monitoring and observability platforms, including dashboard design, alert tuning, telemetry coverage, log analysis, metrics, traces, and event correlation
  • Programming or scripting proficiency in one or more languages such as Python, Java, Go, PowerShell, or similar
  • Familiarity with distributed applications, middleware, messaging, batch processing, real-time processing, and production application behavior in high-availability environments
  • Experience in financial services, capital markets, regulated environments, or other high-availability operational settings
  • Demonstrated participation in disaster recovery, performance testing, resiliency testing, release readiness, incident response, and root cause analysis
  • Knowledge of AI concepts, data platforms, anomaly detection, incident correlation, and intelligent automation use cases
  • Strong collaboration skills across application support, application development, release management, risk, security, business, and vendor stakeholders
  • Ability to translate production support insights into actionable engineering improvements
Core Competencies

Demonstrates expertise in Site Reliability Engineering (SRE) practices, including monitoring, observability, and automation, while effectively collaborating with cross-functional teams to enhance production readiness and incident response. Proven ability to analyze performance metrics and drive improvements in high-availability environments.

Highest-signal resume keywords
  • Site Reliability Engineering (SRE)
  • Monitoring And Observability
  • Automation And Intelligent Tooling
  • Programming Proficiency In Python, Java, Go, Or PowerShell
  • Experience In Financial Services Or Regulated Environments
ATS Optimization Keywords
Hard Skills
  • Monitoring And Observability Platforms
  • Dashboard Design
  • Alert Tuning
  • Telemetry Coverage
  • Log Analysis
  • Metrics And Traces
  • Event Correlation
  • Disaster Recovery
  • Performance Testing
  • Resiliency Testing
Soft Skills
  • Strong Collaboration Skills
  • Mentoring And Best-Practice Sharing
Certifications & Qualifications
  • SRE Certification
  • Observability Certification
  • Automation Certification
  • ITIL Certification
Industry Keywords
  • Application Support Engineering
  • Software Engineering
  • Production Support
  • Application Operations
  • High-Availability Environments
  • Capital Markets
  • Regulated Environments
Tools & Technologies
  • AI Concepts
  • Data Platforms
  • Anomaly Detection
  • Incident Correlation
  • Intelligent Automation
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Staff Site Reliability Engineer, SRE
Staff Site Reliability Engineer, SRE

Jobtailor • California (MO)

On-site
USD 120,000 - 210,000
Site Reliability Engineer -Jersey City, NJ & Dallas, TX
Site Reliability Engineer -Jersey City, NJ & Dallas, TX

StradIT • Jersey City (NJ)

Hybrid
USD 120,000 - 160,000
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

Virtual Tech Gurus • Puerto Rico

On-site
USD 140,000 - 210,000
Site Reliability Engineer
Site Reliability Engineer

TalentDome Staffing • United States

On-site
USD 140,000 - 210,000
Site Reliability Engineer
Site Reliability Engineer

System One • Pittsburgh

On-site
USD 140,000 - 190,000
Software Engineer Manager
Software Engineer Manager

Jobtailor • Alabama

On-site
USD 120,000 - 180,000
Site Reliability Engineer -Jersey City, NJ & Dallas, TX
Site Reliability Engineer -Jersey City, NJ & Dallas, TX

StradIT • Dallas (TX)

Hybrid
USD 140,000 - 180,000
Vice President, SRE Lead (Incident Management), Application Production Services & Engineering
Vice President, SRE Lead (Incident Management), Application Production Services & Engineering

Bank of America • United States

On-site
USD 110,000 - 140,000
Lead, Site Reliability Engineer
Lead, Site Reliability Engineer

CardWorks • Pittsburgh

Hybrid
USD 146,000 - 163,000
Competitive Pay
Medical, Dental, and Vision Benefits
401(k) Plan with Company Match
+1
Site Reliability Engineer
Site Reliability Engineer

SCIGON • Naperville (IL)

Hybrid
USD 110,000 - 170,000