Senior Site Reliability Engineer – AI & Automation.

Veriipro

Miami (FL)

On-site

USD 130,000 - 170,000

Full time

8 days ago
Application generator

Turn this role into an interview — a resume and cover letter built around what this employer wants.

Get past ATS filters

Job summary

Veriipro in Miami, FL is seeking a Senior SRE/DevOps engineer to design AI-driven operations, build automation, and manage cloud infrastructure.

You will mentor engineers, improve observability, and ensure 24x7 reliability across AWS, Azure, and GCP, using Terraform, CDK, and modern AI tooling.

Qualifications

  • 5+ years of SRE, DevOps, or Site Reliability Engineering experience.
  • Strong Python development skills for automation, tooling, and integrations.
  • Experience with AI agents, LLMs, and agentic AI frameworks.
  • Experience with Splunk, Datadog, New Relic, AppDynamics, or similar observability platforms.
  • Hands-on experience with AWS, Azure, and/or GCP.
  • Experience with Terraform, CloudFormation, and/or CDK.
  • Strong production support and incident response experience.
  • Knowledge of AI/ML, prompt engineering, and operational AI automation.
  • Strong communication, stakeholder management, and mentoring skills.
  • Ability to work effectively in a 24x7 operational environment.

Responsibilities

  • Design and implement AI agents, LLM-based solutions, and operational automation for SRE and DevOps environments.
  • Support production systems, perform incident response, troubleshooting, and 24x7 operational triage.
  • Develop automation and integrations using Python.
  • Build and maintain monitoring and observability solutions using Splunk, Datadog, New Relic, or AppDynamics.
  • Design and manage cloud infrastructure across AWS, Azure, and/or GCP.
  • Implement Infrastructure as Code (IaC) using Terraform, CloudFormation, and/or AWS CDK.
  • Apply AI/ML, prompt engineering, and agentic AI concepts to operational use cases.
  • Develop runbook automation, anomaly detection, and intelligent incident management capabilities.
  • Collaborate with engineering, operations, and business stakeholders to improve system reliability and operational processes.
  • Mentor engineers and help establish SRE, DevOps, automation, and observability best practices.

Job description

Primary Responsibilities
  • Design and implement AI agents, LLM-based solutions, and operational automation for SRE and DevOps environments.
  • Support production systems, perform incident response, troubleshooting, and 24x7 operational triage.
  • Develop automation and integrations using Python.
  • Build and maintain monitoring and observability solutions using Splunk, Datadog, New Relic, or AppDynamics.
  • Design and manage cloud infrastructure across AWS, Azure, and/or GCP.
  • Implement Infrastructure as Code (IaC) using Terraform, CloudFormation, and/or AWS CDK.
  • Apply AI/ML, prompt engineering, and agentic AI concepts to operational use cases.
  • Develop runbook automation, anomaly detection, and intelligent incident management capabilities.
  • Collaborate with engineering, operations, and business stakeholders to improve system reliability and operational processes.
  • Mentor engineers and help establish SRE, DevOps, automation, and observability best practices.
Required Skills
  • 5+ years of SRE, DevOps, or Site Reliability Engineering experience.
  • Strong Python development skills for automation, tooling, and integrations.
  • Experience with AI agents, LLMs, and agentic AI frameworks.
  • Experience with Splunk, Datadog, New Relic, AppDynamics, or similar observability platforms.
  • Hands-on experience with AWS, Azure, and/or GCP.
  • Experience with Terraform, CloudFormation, and/or CDK.
  • Strong production support and incident response experience.
  • Knowledge of AI/ML, prompt engineering, and operational AI automation.
  • Strong communication, stakeholder management, and mentoring skills.
  • Ability to work effectively in a 24x7 operational environment.
Preferred Skills
  • Experience with Adobe Experience Manager (AEM).
  • Experience supporting CMS platforms and digital applications.
  • Knowledge of incident management, runbook automation, and anomaly detection.
  • Familiarity with Atlassian Rovo, AI operational tooling, and modern observability platforms.
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Site Reliability Engineer
Site Reliability Engineer

Compunnel, Inc. • Greenwood Village (CO)

On-site
USD 120,000 - 150,000
Senior Site Reliability Engineer
Senior Site Reliability Engineer

Madison-Davis, LLC • United States

On-site
USD 120,000 - 150,000
Site Reliability Engineer
Site Reliability Engineer

TalentDome Staffing • United States

On-site
USD 140,000 - 210,000
Site Reliability Engineer
Site Reliability Engineer

Jobtailor • New Jersey

On-site
USD 120,000 - 180,000
Senior Site Reliability Engineer
Senior Site Reliability Engineer

SDI International • Chicago (IL)

Hybrid
USD 130,000 - 180,000
Senior SRE Engineer
Senior SRE Engineer

Compunnel, Inc. • New Jersey

On-site
USD 140,000 - 190,000
Lead Site Reliability Engineer (SRE) / Principal Site Reliability Engineer (SRE)
Lead Site Reliability Engineer (SRE) / Principal Site Reliability Engineer (SRE)

Mindlance • Irving (TX)

Hybrid
USD 120,000 - 160,000
Senior AIOps and Incident Management / Site Reliability Engineering C2C jobs
Senior AIOps and Incident Management / Site Reliability Engineering C2C jobs

Tech Mirrors • Fort Mill (SC)

Hybrid
USD 140,000 - 190,000
Senior Forward Deployed Engineer (DevOps/SRE)
Senior Forward Deployed Engineer (DevOps/SRE)

LeoForce • Pleasanton (CA)

On-site
USD 300,000 - 350,000
Medical benefits
401(k) plan
Equity
+1
Site Reliability Engineer
Site Reliability Engineer

Optomi • Seattle (WA)

On-site
USD 140,000 - 180,000