Site Reliability Engineer -Jersey City, NJ & Dallas, TX

StradIT

Jersey City (NJ)

Hybrid

USD 120,000 - 160,000

Full time

14 days+
Application generator

An application made for this job — a tailored resume and cover letter that speak straight to the posting.

Get past ATS filters

Job summary

StradIT is seeking a Site Reliability Engineer to advance production reliability, observability, and automation across applications in production. The role spans collaborating with development, release management, and operations to drive reliability and standardized practices.

Responsibilities include defining resilience requirements, improving monitoring, and contributing to incident response and disaster recovery planning.

Qualifications

  • This role requires at least 10 years of related experience across application support engineering, software engineering, SRE, or production operations.
  • Bachelor’s degree preferred or equivalent practical experience.
  • Experience supporting business-critical applications in production environments.
  • SRE, observability, automation, or ITIL certifications are a plus.

Responsibilities

  • Participate in design reviews, sprint zero, and delivery planning to define and validate reliability requirements.
  • Collaborate with release management to ensure releases meet SRE standards for observability and reliability.
  • Define and improve monitoring, dashboards, telemetry, and alert strategies.
  • Assist in major incident response and root cause analysis to close observability gaps.
  • Drive automation and AI-assisted remediation to reduce toil and accelerate recovery.
  • Serve as the operational readiness authority before production releases.
  • Lead capacity and performance analyses to ensure scalable applications.
  • Track reliability metrics such as availability, incident volume, and change failure rate.
  • Prepare executive reporting on reliability posture and readiness.
  • Mentor teams to promote SRE practices and approved AI tools.

Skills

SRE practices
Observability
Automation
Incident response
Disaster recovery
Performance testing
Release readiness
Programming (Python/Java/Go/PowerShell

Education

Bachelor’s degree

Tools

Monitoring platforms
Dashboards
Telemetry
Log analysis
Metrics & traces

Job description

Role: Site Reliability Engineer

Experience: Min 10 Years

Locations: Jersey City, NJ & Dallas, TX

Work mode: Hybrid

Employment: W2

The Application Support Engineering roleadvancesSite Reliability Engineering (SRE) practicesforapplications running inproduction. Therole scope includesApplication Support Engineers, SDETs, Software Engineers, and SREsfocused on improving reliability, observability, recovery, automation, and operational readiness.

This role brings production supportexpertiseand engineering discipline earlier in the lifecycle to influence design,validatereliability requirements, reduce production risk, and drive measurable operational improvement.

Your Primary Responsibilities
  • Participate in design reviews, sprint zero, and delivery planning todefine andvalidatereliabilityrequirements,including resiliency, observability, fault tolerance,performance, scalability,holiday and special-day processing,and disaster recovery.
  • Collaborate with Major Release Management to ensure each release meets SRE standards for observability, resiliency,and reliability requirements, support readiness, and knowledge base coverage.
  • Define and improve monitoring,observability, dashboards, telemetry coverage, and alertstrategyto strengthen outage detection, reduce noise, improve signal quality, andaccelerateincident response.
  • Assistin major incident response and root cause analysis byidentifyingobservability gaps, improvingtelemetryandknowledge articles, and drivingactionsthat reduce repeat incidents.
  • Drive automation, intelligent tooling, and AI-assisted remediationto reduce manual toil, improve consistency, accelerate recovery, andscaleoperationalsupport.
  • Serve as theoperational readinessauthority before production releases byvalidatingreliability requirements,assessing support readiness, surfacingproductionrisks, andconfirming releasesupportability.
  • Lead capacity, performance, workload trend, and resiliencyanalysisto ensure applications scale reliably under normal, peak, and stress conditions.
  • Establishand track reliabilitymetrics such as availability, incident volume,MTTx, alert quality, automation coverage,reliability requirementcompliance, change failure rate, and repeat incident reduction.
  • Participate in application reliability governance and service reviews by presenting incident trends,compliance metrics, operational risks, improvement actions, and readiness gaps.
  • Prepare executive reporting on reliability posture, release readiness, observability maturity, alert quality, incident trends, automation progress,risks, andimprovement outcomes.
  • PromoteSREpracticesthrough mentoring,standardsadoption, best-practice sharing, andapproved AI toolsthat improveknowledge, observability, performance, security, and maintainability.
Qualifications
  • Minimum of10+years of related technicalexperience acrossapplication support engineering, software engineering,sitereliability engineering,production support,or application operations.
  • Bachelor’s degree preferred or equivalent practical experience.
  • Experience supporting business-critical applications in production environments.
  • SRE,observability,automation,or ITIL certifications are a plus.
Talents Needed for Success
  • Proven experiencein one or more in-scope roles includingApplication SupportEngineer, SDET, SoftwareEngineer, or SRE, with responsibility for improvingreliabilitypractices,application validation, observability coverage, automation frameworks, and reliability standards.
  • Strong understanding of monitoring and observability platforms, including dashboard design, alert tuning, telemetry coverage, log analysis, metrics, traces, and event correlation.
  • Programming or scriptingproficiencyin one or more languages such as Python, Java, Go, PowerShell, orsimilar forautomation, tooling, and operational efficiency.
  • Familiarity withdistributedapplications, middleware, messaging, batchprocessing,real-time processing, andproductionapplication behavior in high-availabilityenvironments.
  • Experience in financial services, capital markets, regulated environments, or other high-availability operational settings.
  • Demonstrated participation in disaster recovery, performance testing, resiliency testing, release readiness, incident response, and root cause analysis.
  • Knowledge of AI concepts, data platforms, anomaly detection, incident correlation, and intelligent automation use cases.
  • Strong collaboration skills across applicationsupport, applicationdevelopment,release management, risk, security, business,and vendor stakeholders.
  • Ability to translate production support insights into actionable engineering improvements that reduce risk, improve stability, and enhance customer experience.
Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Sr SRE Automation Engineer
Sr SRE Automation Engineer

Compunnel, Inc. • Austin (TX), Northern (KY)

Hybrid
USD 130,000 - 180,000
Lead Site Reliability Engineer (SRE) / Principal Site Reliability Engineer (SRE)
Lead Site Reliability Engineer (SRE) / Principal Site Reliability Engineer (SRE)

Mindlance • Irving (TX)

Hybrid
USD 120,000 - 160,000
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

Knack Solutions • Reston (VA)

On-site
USD 120,000 - 160,000
SRE Engineer
SRE Engineer

TalentOla • Austin (TX)

On-site
USD 90,000 - 120,000
Engineering - SRE Platforms - SRE Engineer - Associate - Dallas
Engineering - SRE Platforms - SRE Engineer - Associate - Dallas

The Goldman Sachs Group • Dallas (TX)

On-site
USD 110,000 - 140,000
Senior Site Reliability Engineer
Senior Site Reliability Engineer

Mission Staffing • New York (NY)

Hybrid
USD 140,000 - 200,000
Site Reliability Engineer
Site Reliability Engineer

TalentDome Staffing • United States

On-site
USD 140,000 - 210,000
SRE - Site Reliability Engineer - Senior
SRE - Site Reliability Engineer - Senior

ManpowerGroup Global, Inc. • Austin (TX)

On-site
USD 66,000 - 90,000
Senior Site Reliability Engineer
Senior Site Reliability Engineer

SDI International • Chicago (IL)

Hybrid
USD 130,000 - 180,000
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

Methodic • San Francisco (CA)

On-site
USD 140,000 - 210,000