Site Reliability Engineer: Cloud, Automation & Observability

TechDigital Group

Houston, Juno Beach (TX, MA, FL)

On-site

USD 120,000 - 180,000

Full time

10 days ago

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

TechDigital Group in Houston, TX seeks an experienced Site Reliability Engineer/DevOps professional to strengthen production systems reliability and operations.

You will implement monitoring, automation, CI/CD, and IaC, lead incident responses, and collaborate with cross-functional teams to ensure scalable, resilient infrastructure.

Candidates should have 5+ years in SRE/DevOps/Cloud Operations and hands-on Linux, scripting, and cloud platforms.

Qualifications

  • Strong Python or R programming skills required.
  • Experience with ML libraries and data visualization tools required.
  • Experience with Linux/Unix administration and cloud platforms is essential.

Responsibilities

  • Monitor, maintain, and improve reliability, availability, and performance of production systems.
  • Design and implement monitoring, alerting, logging, and observability solutions.
  • Establish and track SLIs, SLOs, and error budgets.
  • Automate operational tasks using scripting and IaC.
  • Lead incident response, RCA, and post-incident reviews.
  • Collaborate with development, infrastructure, and platform teams to improve resilience.
  • Perform capacity planning, performance tuning, and scalability assessments.
  • Support CI/CD pipelines and deployment automation initiatives.
  • Implement high-availability, disaster recovery, and failover strategies.

Skills

Python
R
Machine learning libraries
scikit-learn
TensorFlow
PyTorch
Data analysis
Data visualization
Pandas
NumPy
Power BI
Tableau
SQL
Database management

Job description

TechDigital Group in Houston, TX seeks an experienced Site Reliability Engineer/DevOps professional to strengthen production systems reliability and operations.

You will implement monitoring, automation, CI/CD, and IaC, lead incident responses, and collaborate with cross-functional teams to ensure scalable, resilient infrastructure.

Candidates should have 5+ years in SRE/DevOps/Cloud Operations and hands-on Linux, scripting, and cloud platforms.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Site Reliability Engineer — Infra Automation & Observability
Site Reliability Engineer — Infra Automation & Observability

TechDigital Group • Providence (RI)

On-site
USD 80,000 - 120,000
Site Reliability Engineer -- SINDC5717546
Site Reliability Engineer -- SINDC5717546

Compunnel Inc. • Denton (TX)

Hybrid
USD 120,000 - 150,000
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

myBridge Corporation • Austin (TX)

On-site
USD 120,000 - 160,000
Site Reliability Engineer: Build Resilient, Automated Cloud
Site Reliability Engineer: Build Resilient, Automated Cloud

SRE • Puerto Rico

Hybrid
USD 120,000 - 180,000
Senior Site Reliability Engineer — Cloud, CI/CD Expert
Senior Site Reliability Engineer — Cloud, CI/CD Expert

Jobtailor • California (MO)

Hybrid
USD 120,000 - 160,000
Site Reliability Engineer
Site Reliability Engineer

Jobtailor • California (MO)

Hybrid
USD 120,000 - 160,000
Senior Site Reliability Engineer – Cloud & CI/CD (Hybrid)
Senior Site Reliability Engineer – Cloud & CI/CD (Hybrid)

Thales • Austin (TX)

Hybrid
USD 110,000 - 183,000
Health, Dental, Vision coverage
Retirement Savings Plan
Paid Time Off
+2
Site Reliability Engineer
Site Reliability Engineer

TechDigital Group • Houston (TX), Juno Beach (FL)

On-site
USD 120,000 - 180,000
Site Reliability Engineer
Site Reliability Engineer

TalentDome Staffing • United States

On-site
USD 140,000 - 210,000
Site Reliability Engineer
Site Reliability Engineer

Encora Digital Inc. • United States

On-site
USD 120,000 - 180,000