SRE Expert

HCLTech

Bengaluru

On-site

INR 1,500,000 - 2,400,000

Full time

11 days ago

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

HCLTech in Bengaluru seeks an experienced Site Reliability Engineer to implement and mature SRE practices across the production stack, including SLI/SLO governance, error budgets, and service health management.

You will design end-to-end observability using Splunk Observability Cloud, Splunk ITSI and Splunk Enterprise; automate alerting; drive incident response improvements with RCA-based actions; mentor junior engineers and contribute to postmortems.

Qualifications

  • 8+ years of experience in Site Reliability Engineering, Production Support, Observability, or related roles.
  • Strong hands-on experience implementing SRE practices including SLI, SLO, Error Budgets, reliability governance, and service health management.
  • Experience with Splunk Observability Cloud, Splunk ITSI, and Splunk Enterprise.

Responsibilities

  • Implement and institutionalize SRE practices including SLIs, SLOs, Error Budgets, reliability reviews, and service health management.
  • Design and implement end-to-end observability solutions using Splunk Observability Cloud, Splunk ITSI, and Splunk Enterprise.
  • Configure and maintain business service monitoring, KPI frameworks, service health dashboards, event analytics, and business observability capabilities.

Skills

SRE Practices
SLI/SLO
Error Budgets
Observability
Splunk Cloud
ITSI
Splunk Enterprise
Incident Management
AIOps
Automation

Tools

Splunk Observability Cloud
Splunk ITSI
Splunk Enterprise
OpenTelemetry
Python
Ansible

Job description


  • Implement and institutionalize SRE practices including SLIs, SLOs, Error Budgets, reliability reviews, and service health management

  • Design and implement end-to-end observability solutions using Splunk Observability Cloud, Splunk ITSI, and Splunk Enterprise

  • Define and manage alert quality standards to reduce noise, eliminate alert fatigue, and improve incident response effectiveness

  • Configure and maintain business service monitoring, KPI frameworks, service health dashboards, event analytics, and business observability capabilities

  • Implement AIOps capabilities including event correlation, anomaly detection, intelligent alerting, and operational analytics

  • Drive continuous improvement initiatives to improve MTTD, MTTR, MTBF, service reliability, and operational efficiency

  • Integrate monitoring, logging, ITSM, cloud, application, infrastructure, and third-party platforms to enable end-to-end observability

  • Support incident management, problem management, RCA, and blameless postmortem activities

  • Partner with application, cloud, platform, and operations teams to improve production readiness and operational resilience

  • Develop automation solutions for monitoring, alerting, reporting, remediation, and operational workflows

  • Participate in Agile ceremonies, reliability reviews, and continuous service improvement programs


Skill Requirements

Must Have Skills:



  • 8+ years of experience in Site Reliability Engineering, Production Support, Application Support, Observability, Operations Engineering, or related roles

  • Strong hands-on experience implementing SRE practices including SLI, SLO, Error Budgets, reliability governance, and service health management

  • Strong expertise with Splunk Observability Cloud (OpenTelemetry, Infrastructure Monitoring, APM, RUM, Synthetic Monitoring)

  • Strong expertise with Splunk ITSI (Event Analytics, Service Modeling, KPI Management, Glass Tables, Service Health Monitoring, Business Observability)

  • Strong expertise with Splunk Enterprise (Logging, SPL, Log Analytics, Dashboarding)

  • Experience implementing alert quality management, alert rationalization, and noise reduction initiatives

  • Experience with Incident Management, Problem Management, RCA, and Blameless Postmortems

  • Experience implementing AIOps and intelligent operations capabilities

  • Hands-on experience integrating observability platforms with applications, cloud services, infrastructure, ITSM platforms, and enterprise tools

  • Experience supporting business applications including custom applications (Java, .NET and other technologies running on VM and container platforms), SAP, Salesforce, and SaaS/COTS platforms

  • Experience with automation technologies to reduce the operational toil (Ansible, Python, RPA and other automation platforms)

  • Strong analytical, problem-solving, communication, and stakeholder management skills


Other Requirements

Good to Have Skills:



  • Knowledge of DevOps practices, CI/CD pipelines, GitOps, and release automation

  • Experience with Platform Engineering and Internal Developer Platforms (IDP)

  • Experience with Resilience Engineering and Chaos Engineering practices

  • Exposure to Agentic AI, AI-driven Operations, and AI-assisted observability solutions

  • Experience with cloud platforms including Azure, AWS, and GCP

  • Splunk, SRE, Cloud, or Observability-related certifications

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

SRE Observability Engineer
SRE Observability Engineer

Awign • Hyderabad

On-site
INR 4,200,000 - 6,500,000
SRE Lead
SRE Lead

Acldigital • Ahmedabad District

On-site
INR 1,500,000 - 2,000,000
Site Reliability Engineering Lead_Truist
Site Reliability Engineering Lead_Truist

Infosys • Bengaluru

On-site
INR 4,000,000 - 7,000,000
AWS SRE Professional
AWS SRE Professional

Infosys • Bengaluru

On-site
INR 900,000 - 1,300,000
Site Reliability Engineer (SRE) – Core IT Infrastructure
Site Reliability Engineer (SRE) – Core IT Infrastructure

TECEZE • Chennai District

On-site
INR 1,000,000 - 2,000,000
Site Reliability Engineer
Site Reliability Engineer

Epam Systems • Bengaluru

Hybrid
INR 4,000,000 - 7,000,000
Sr. Site Reliability Engineer I
Sr. Site Reliability Engineer I

MetLife • Hyderabad

On-site
INR 1,800,000 - 2,400,000
SRE -Site Reliability Engineer II
SRE -Site Reliability Engineer II

QUEST DIAGNOSTICS INC • Hyderabad

On-site
INR 1,800,000 - 3,200,000
Senior SRE Engineer
Senior SRE Engineer

EPAM Systems • India

Hybrid
INR 1,800,000 - 2,800,000
Site Reliability Engineer
Site Reliability Engineer

Lloyds Technology Centre • Hyderabad

On-site
INR 1,200,000 - 2,400,000