Sr SRE Automation Engineer

Compunnel, Inc.

Austin, Northern (TX, KY)

Hybrid

USD 130,000 - 180,000

Full time

13 hours ago
Be an early applicant
Application generator

Don’t send a generic resume — generate a resume and cover letter tailored to this exact role.

Get past ATS filters

Job summary

Compunnel, Inc. in Austin, TX is seeking a Site Reliability Engineer (SRE) to drive automation, reliability, observability, and operational excellence across enterprise-scale applications. The role focuses on reducing toil, improving availability, and implementing AI/ML-driven operational solutions.

You will design automation, CI/CD orchestrations, and GitOps practices, partner with engineering and operations, and participate in on-call incident response to ensure platform resilience.

Qualifications

  • Bachelor's degree or equivalent experience in CS/IT/engineering.
  • Experience implementing SRE in enterprise environments.
  • Strong experience building automation frameworks and tooling.
  • Knowledge of cloud platforms, distributed systems, and high availability.
  • Experience with CI/CD pipelines and DevOps practices.

Responsibilities

  • Promote SRE principles and automation-driven operations.
  • Design and maintain automation to reduce manual effort.
  • Develop AI/ML-driven operational solutions for monitoring and alerting.
  • Enhance observability with monitoring, telemetry, and logging.
  • Lead capacity planning and performance forecasting.
  • Respond to incidents with effective root-cause analysis.
  • Collaborate across Engineering, Operations, and Infrastructure.
  • Implement CI/CD orchestration and GitOps practices.
  • Create runbooks and incident response procedures.
  • Participate in on-call rotations.

Skills

SRE practices
Automation
DevOps
CI/CD
GitOps
On-call
Troubleshooting
Analytical thinking
Collaboration

Education

Bachelor's degree in CS/IT/Engineering

Tools

Kubernetes
OpenShift
Grafana
Prometheus
Splunk
AppDynamics

Job description

We are seeking a Site Reliability Engineer (SRE) to drive automation, reliability, observability, and operational excellence across enterprise-scale, mission-critical applications. The ideal candidate will have strong experience in automation, cloud platforms, AIOps, monitoring, incident management, and production support. This role focuses on reducing operational toil, improving system availability, implementing AI/ML-driven operational solutions, and advancing platform reliability through modern SRE practices.

KEY RESPONSIBILITIES
  • Champion Site Reliability Engineering (SRE) principles and promote automation-driven operational excellence.
  • Identify opportunities to build innovative tools and solutions that address complex operational challenges across enterprise and mission-critical applications.
  • Design, develop, and maintain automation solutions that reduce manual effort and improve operational efficiency.
  • Create scripts and automation frameworks to streamline infrastructure management, deployment processes, and operational workflows.
  • Design and implement AI/ML-driven automation pipelines, anomaly detection, predictive alerting, and intelligent operational response solutions.
  • Enhance observability capabilities through advanced monitoring, telemetry, logging, and analytics platforms.
  • Lead the expansion of automation coverage across deployment, monitoring, alerting, remediation, and self-healing workflows.
  • Collaborate with Engineering, Scrum, Operations, and Infrastructure teams to improve system availability, reliability, and performance.
  • Monitor, triage, troubleshoot, and resolve critical production incidents and platform issues.
  • Implement operational changes with minimal risk while ensuring effective stakeholder communication.
  • Develop tools, frameworks, dashboards, and instrumentation to improve application deployment success and operational visibility.
  • Leverage AI/ML capabilities to enhance platform monitoring, rollout validation, and operational intelligence.
  • Drive adoption of AIOps platforms and machine learning-assisted observability practices.
  • Support capacity planning and performance forecasting using data-driven analytics and predictive models.
  • Design and implement CI/CD orchestration solutions to accelerate software delivery and improve deployment reliability.
  • Promote GitOps methodologies and automation best practices across engineering teams.
  • Troubleshoot mission-critical application workflows and collaborate with development teams to address reliability concerns.
  • Develop and maintain operational runbooks, support procedures, and knowledge documentation.
  • Participate in on-call support rotations and incident response activities.
  • Continuously identify opportunities to improve platform scalability, resilience, performance, and operational efficiency.
REQUIRED QUALIFICATIONS
  • Bachelor's degree in Computer Science, Information Technology, Engineering, or a related field, or equivalent professional experience.
  • Experience implementing Site Reliability Engineering (SRE) practices within enterprise environments.
  • Strong experience building automation frameworks and operational tooling.
  • Strong knowledge of cloud platforms, distributed systems, and high-availability architectures.
  • Experience designing and implementing monitoring, logging, observability, and alerting solutions.
  • Knowledge of AI/ML-driven operational automation, anomaly detection, and predictive monitoring.
  • Experience supporting production environments and mission-critical applications.
  • Strong troubleshooting, debugging, and root cause analysis skills.
  • Experience with CI/CD pipelines, deployment automation, and DevOps practices.
  • Knowledge of GitOps concepts and modern software delivery methodologies.
  • Strong understanding of networking concepts, infrastructure, and system administration.
  • Excellent verbal and written communication skills.
  • Ability to collaborate effectively across engineering, operations, and business teams.
  • Strong analytical and problem-solving abilities.
PREFERRED QUALIFICATIONS
  • Experience with AIOps platforms and ML-assisted observability tools.
  • Experience with cloud platforms such as AWS, Azure, GCP, or PCF.
  • Experience with Kubernetes, OpenShift, or container orchestration platforms.
  • Experience with Splunk, AppDynamics, Grafana, Prometheus, or similar monitoring solutions.
  • Knowledge of capacity planning, forecasting, and performance engineering.
  • Experience supporting enterprise authentication, login, or identity management platforms.
  • Experience integrating AI/ML capabilities into operational processes and CI/CD workflows.
  • Financial Services or Banking industry experience.
  • Experience working in Agile and Scrum environments.
CERTIFICATIONS
  • AWS Certified DevOps Engineer or SysOps Administrator preferred.
  • Google Professional Cloud DevOps Engineer preferred.
  • Relevant Cloud, DevOps, SRE, AIOps, or Observability certifications are a plus.
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Site Reliability Engineer
Site Reliability Engineer

TalentDome Staffing • United States

On-site
USD 140,000 - 210,000
Site Reliability Engineer
Site Reliability Engineer

Jobtailor • New Jersey

On-site
USD 120,000 - 180,000
Senior Site Reliability Engineer – AI & Automation.
Senior Site Reliability Engineer – AI & Automation.

Veriipro • Miami (FL)

On-site
USD 130,000 - 170,000
Associate Engineer, Site Reliability
Associate Engineer, Site Reliability

R&D • United States

On-site
USD 90,000 - 140,000
Lead Site Reliability Engineer (SRE) / Principal Site Reliability Engineer (SRE)
Lead Site Reliability Engineer (SRE) / Principal Site Reliability Engineer (SRE)

Mindlance • Irving (TX)

Hybrid
USD 120,000 - 160,000
Senior Site Reliability Engineer
Senior Site Reliability Engineer

Spectraforce Technologies • Austin (TX)

Hybrid
USD 130,000 - 170,000
Director, Site Reliability Engineering
Director, Site Reliability Engineering

Jobtailor • California (MO)

On-site
USD 180,000 - 260,000
Site Reliability Engineer
Site Reliability Engineer

Compunnel, Inc. • Greenwood Village (CO)

On-site
USD 120,000 - 150,000
Senior Site Reliability Engineer
Senior Site Reliability Engineer

Madison-Davis, LLC • United States

On-site
USD 120,000 - 150,000
Senior SRE Engineer
Senior SRE Engineer

Compunnel, Inc. • Alpharetta (GA)

On-site
USD 140,000 - 190,000