Site Reliability Engineer: Cloud, Automation & Observability

TechDigital Group

Houston, Juno Beach (TX, MA, FL)

On-site

USD 120,000 - 180,000

Full time

14 days+
Application generator

Get a reply from this recruiter — a resume and cover letter tailored to exactly what they’re hiring for.

Get past ATS filters

Job summary

TechDigital Group in Houston, TX seeks an experienced Site Reliability Engineer/DevOps professional to strengthen production systems reliability and operations.

You will implement monitoring, automation, CI/CD, and IaC, lead incident responses, and collaborate with cross-functional teams to ensure scalable, resilient infrastructure.

Candidates should have 5+ years in SRE/DevOps/Cloud Operations and hands-on Linux, scripting, and cloud platforms.

Qualifications

  • Strong Python or R programming skills required.
  • Experience with ML libraries and data visualization tools required.
  • Experience with Linux/Unix administration and cloud platforms is essential.

Responsibilities

  • Monitor, maintain, and improve reliability, availability, and performance of production systems.
  • Design and implement monitoring, alerting, logging, and observability solutions.
  • Establish and track SLIs, SLOs, and error budgets.
  • Automate operational tasks using scripting and IaC.
  • Lead incident response, RCA, and post-incident reviews.
  • Collaborate with development, infrastructure, and platform teams to improve resilience.
  • Perform capacity planning, performance tuning, and scalability assessments.
  • Support CI/CD pipelines and deployment automation initiatives.
  • Implement high-availability, disaster recovery, and failover strategies.

Skills

Python
R
Machine learning libraries
scikit-learn
TensorFlow
PyTorch
Data analysis
Data visualization
Pandas
NumPy
Power BI
Tableau
SQL
Database management

Job description

TechDigital Group in Houston, TX seeks an experienced Site Reliability Engineer/DevOps professional to strengthen production systems reliability and operations.

You will implement monitoring, automation, CI/CD, and IaC, lead incident responses, and collaborate with cross-functional teams to ensure scalable, resilient infrastructure.

Candidates should have 5+ years in SRE/DevOps/Cloud Operations and hands-on Linux, scripting, and cloud platforms.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Site Reliability Engineer – Observability & Automation Lead
Site Reliability Engineer – Observability & Automation Lead

Talentify • Houston (TX)

On-site
USD 140,000 - 180,000
Site Reliability Engineer
Site Reliability Engineer

Ethos Group • Irving (TX)

On-site
USD 110,000 - 160,000
Site Reliability Engineer
Site Reliability Engineer

IntraEdge • Austin (TX)

On-site
USD 120,000 - 180,000
Site Reliability Engineer -- SINDC5717546
Site Reliability Engineer -- SINDC5717546

Compunnel Inc. • Denton (TX)

On-site
USD 120,000 - 150,000
Site Reliability Engineer
Site Reliability Engineer

Spectraforce Technologies • Austin (TX)

On-site
USD 120,000 - 155,000
Contract Site Reliability Engineer - Automation & Observability
Contract Site Reliability Engineer - Automation & Observability

Skill • Southlake (TX)

On-site
USD 66,000 - 73,000
Health insurance
Vision insurance
Dental insurance
+2
Site Reliability Engineer
Site Reliability Engineer

TalentDome Staffing • United States

On-site
USD 140,000 - 210,000
Senior SRE: Cloud Automation & Observability
Senior SRE: Cloud Automation & Observability

Talentify • Chicago (IL)

On-site
USD 110,000 - 140,000
Site Reliability Engineer
Site Reliability Engineer

NextGen | GTA: A Kelly Telecom Company • Mount Laurel Township (NJ)

On-site
USD 110,000 - 170,000
Senior Cloud SRE Engineer — Infra, CI/CD & Observability
Senior Cloud SRE Engineer — Infra, CI/CD & Observability

Hewlett Packard Enterprise Development LP • San Juan (PR)

Hybrid
USD 130,000 - 190,000
Health & Wellbeing
Personal & Professional Development
Unconditional Inclusion