SRE Engineer

SFE

Englewood Cliffs (NJ)

On-site

USD 130,000 - 170,000

Full time

11 days ago
Application generator

A complete application in a minute — tailored resume and cover letter, ready to send.

Get past ATS filters

Job summary

SFE in New Jersey is seeking an experienced Site Reliability Engineer to design and operate highly available production systems. You will implement automation, monitor health, and ensure service reliability across cloud and on-prem components.

Responsibilities include incident management, RCA, capacity planning, and collaboration with development, QA, cloud, and support teams to improve deployment processes and reliability.

Qualifications

  • 6-7 years of experience in Site Reliability Engineering, Production Support, DevOps, or Infrastructure Operations.
  • Strong understanding of Linux administration and troubleshooting.
  • Hands-on experience with AWS cloud services (EC2, RDS, IAM, VPC, CloudWatch, S3).
  • Experience with monitoring, alerting, and observability tools.
  • Knowledge of incident management, problem management, and RCA processes.
  • Experience with automation and scripting using Shell and/or Python.
  • Working knowledge of PostgreSQL and MySQL databases.
  • Experience with Git version control.
  • Understanding of CI/CD concepts and tools such as Jenkins.

Responsibilities

  • Design, implement, and maintain highly available and reliable production systems.
  • Automate operational tasks and infrastructure management using Shell, Python, Ansible, or Terraform.
  • Manage and support AWS services including EC2, RDS, S3, IAM, VPC, CloudWatch, and related cloud services.
  • Perform Linux server administration, troubleshooting, patching, and performance tuning.
  • Monitor application and infrastructure health using tools such as Grafana, Prometheus, CloudWatch, Datadog, Splunk.
  • Participate in incident management, root cause analysis (RCA), and problem management activities.
  • Define and maintain SLIs, SLOs, and SLAs to ensure service reliability.
  • Support PostgreSQL and MySQL databases for operational and basic administration tasks.
  • Collaborate with development, QA, cloud, and support teams to improve system reliability and deployment processes.
  • Drive automation, observability, capacity planning, security, and operational best practices.
  • Participate in on-call support and production issue resolution.

Skills

Linux administration
AWS
Observability
Automation
Scripting
PostgreSQL
MySQL
Git
CI/CD concepts

Tools

Jenkins
Terraform
Ansible
Shell
Python
Grafana
Prometheus
CloudWatch
Datadog
Splunk

Job description

Must Have Technical/Functional Skills:
  • 6-7 years of experience in Site Reliability Engineering, Production Support, DevOps, or Infrastructure Operations.
  • Strong understanding of Linux administration and troubleshooting.
  • Hands-on experience with AWS cloud services (EC2, RDS, IAM, VPC, CloudWatch, S3).
  • Experience with monitoring, alerting, and observability tools.
  • Knowledge of incident management, problem management, and RCA processes.
  • Experience with automation and scripting using Shell and/or Python.
  • Working knowledge of PostgreSQL and MySQL databases.
  • Experience with Git version control.
  • Understanding of CI/CD concepts and tools such as Jenkins.
Roles & Responsibilities:
  • Design, implement, and maintain highly available and reliable production systems.
  • Automate operational tasks and infrastructure management using Shell, Python, Ansible, or Terraform.
  • Manage and support AWS services including EC2, RDS, S3, IAM, VPC, CloudWatch, and related cloud services.
  • Perform Linux server administration, troubleshooting, patching, and performance tuning.
  • Monitor application and infrastructure health using tools such as Grafana, Prometheus, CloudWatch, Datadog, Splunk.
  • Participate in incident management, root cause analysis (RCA), and problem management activities.
  • Define and maintain SLIs, SLOs, and SLAs to ensure service reliability.
  • Support PostgreSQL and MySQL databases for operational and basic administration tasks.
  • Collaborate with development, QA, cloud, and support teams to improve system reliability and deployment processes.
  • Drive automation, observability, capacity planning, security, and operational best practices.
  • Participate in on-call support and production issue resolution.
Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

SRE Engineer
SRE Engineer

Tata Consultancy Services • Englewood Cliffs (NJ)

On-site
USD 110,000 - 125,000
Senior Engineer Site Reliability Engineer
Senior Engineer Site Reliability Engineer

Tata Consultancy Services • Englewood Cliffs (NJ)

On-site
USD 110,000 - 125,000
Site Reliability Engineer Lead
Site Reliability Engineer Lead

Good co India • United States

Remote
USD 120,000 - 160,000
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

Knack Solutions • Reston (VA)

On-site
USD 120,000 - 160,000
SRE Engineer
SRE Engineer

Programmers.io • Austin (TX)

Hybrid
USD 120,000 - 180,000
Site Reliability Engineer
Site Reliability Engineer

Harvey Nash • United States

Remote
USD 120,000 - 150,000
Sr SRE Automation Engineer
Sr SRE Automation Engineer

Compunnel, Inc. • Austin (TX), Northern (KY)

On-site
USD 130,000 - 180,000
Site Reliability Engineer
Site Reliability Engineer

TalentDome Staffing • United States

On-site
USD 140,000 - 210,000
Principal Site Reliability Engineer
Principal Site Reliability Engineer

Prosum • Scottsdale (AZ)

On-site
USD 150,000 - 190,000
Senior SRE Engineer
Senior SRE Engineer

Compunnel, Inc. • New Jersey

On-site
USD 140,000 - 190,000