Senior Site Reliability Engineer

Brillio

Bengaluru Urban

On-site

INR 1,200,000 - 2,000,000

Full time

14 days+
Application generator

Don’t send a generic resume — generate a resume and cover letter tailored to this exact role.

Get past ATS filters

Job summary

Brillio is seeking a Senior Observability / Monitoring Engineer to enhance enterprise platform reliability through effective monitoring solutions. This position involves designing observability frameworks and managing tools like Splunk and Datadog while enabling proactive issue detection.

The ideal candidate will have strong experience in monitoring, production environments, and collaboration with SRE teams. This role is primarily night shift and requires a proactive approach to continuous improvement in observability practices.

Qualifications

  • Strong experience in observability or monitoring roles.
  • Hands-on experience with tools like Splunk, Datadog, and Prometheus.
  • Experience supporting production environments in 24x7 models.

Responsibilities

  • Design and implement observability solutions across applications.
  • Manage monitoring tools and create actionable dashboards.
  • Support production monitoring and incident response in late night shifts.
  • Automate monitoring setup and integration into CI/CD pipelines.
  • Ensure monitoring practices align with security and compliance.

Skills

Strong experience in observability, monitoring, or SRE roles
Hands-on experience with tools like Splunk, Datadog, Prometheus, Grafana, New Relic
Strong understanding of logs, metrics, traces, and distributed systems
Scripting skills (Python, Bash, PowerShell)
Familiarity with CI/CD tools (Jenkins, GitHub Actions, Azure DevOps)
Knowledge of Infrastructure as Code (Terraform or similar)
Incident management and RCA capabilities
Ability to analyze performance issues and recommend improvements

Job description

We are seeking a Senior Observability / Monitoring Engineer to drive end-to-end observability and monitoring for enterprise platforms. This role will focus on enabling proactive issue detection, faster incident resolution, and improved system reliability through effective use of observability tools and practices.

The ideal candidate will bring strong experience in logs, metrics, traces, alerting strategies, and monitoring tools, along with hands-on exposure to production environments and SRE practices.

Complete Night Shift Role
Key Responsibilities
Observability Engineering
  • Design and implement end-to-end observability solutions across applications and infrastructure
  • Establish unified visibility across logs, metrics, and distributed tracing
  • Define and standardize monitoring frameworks, dashboards, and alerting strategies
  • Enable proactive detection of issues through intelligent alerting and anomaly detection
Monitoring & Tooling
  • Implement and manage tools such as Splunk, Datadog, Prometheus, Grafana, New Relic, or similar
  • Build actionable dashboards for SRE, operations, and business stakeholders
  • Optimize alert configurations to reduce noise and improve signal quality
  • Continuously enhance monitoring coverage across systems and services
Incident Support & Reliability
  • Support late night / US overlap shift for production monitoring and incident response
  • Analyze logs, metrics, and traces to support incident triage and root cause analysis (RCA)
  • Collaborate with SRE and engineering teams to improve system reliability and performance
  • Participate in post-incident reviews and continuous improvement initiatives
  • Participate in post-incident reviews and continuous improvement initiatives
Automation & Integration
  • Automate monitoring setup and configuration using Infrastructure as Code (IaC)
  • Integrate observability tools with CI/CD pipelines and DevOps workflows
  • Develop scripts/tools to improve data collection, alerting, and reporting
Platform & Integration Support
  • Monitor enterprise applications, APIs, and integration layers (e.g., middleware, cloud services)
  • Ensure end-to- end visibility across distributed systems and microservices architectures
  • Work closely with platform teams (cloud, Salesforce, etc.) to enhance observability
Governance & Compliance
  • Ensure monitoring practices align with security and compliance requirements (e.g., SOX)
  • Maintain runbooks, documentation, and monitoring standards
  • Support audit and governance requirements as needed
Required Skills & Qualifications
Technical Skills
  • Strong experience in observability, monitoring, or SRE roles
  • Hands-on experience with tools like Splunk, Datadog, Prometheus, Grafana, New Relic
  • Strong understanding of logs, metrics, traces, and distributed systems
  • Experience with APM tools and performance monitoring
  • Scripting skills (Python, Bash, PowerShell, or similar)
  • Familiarity with CI/CD tools (Jenkins, GitHub Actions, Azure DevOps)
  • Knowledge of Infrastructure as Code (Terraform or similar)
Operational Excellence
  • Experience supporting production environments in 24x7 models
  • Strong incident management and RCA capabilities
  • Ability to analyze performance issues and recommend improvements
Soft Skills
  • Ability to work effectively in a late night / US overlap shift
  • Strong communication and collaboration skills
  • Proactive mindset with a focus on continuous improvement
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

SRE Observability Engineer
SRE Observability Engineer

Awign • Hyderabad

On-site
INR 4,200,000 - 6,500,000
Lead Engineer - Reliability Engineering
Lead Engineer - Reliability Engineering

StoneX Group Inc. • Bengaluru

Hybrid
INR 3,500,000 - 6,000,000
Senior Site Reliability Engineer
Senior Site Reliability Engineer

GSPANN • Hyderabad

On-site
INR 1,500,000 - 3,000,000
Site Reliability Engineer
Site Reliability Engineer

Snapmint • Gurugram District

On-site
INR 800,000 - 1,200,000
Senior Site Reliability Engineer
Senior Site Reliability Engineer

AcquireX • Pune District

On-site
INR 1,200,000 - 1,800,000
Health insurance
Flexible working hours
Training opportunities
Site Reliability Engineer (SRE) / Observability Engineer
Site Reliability Engineer (SRE) / Observability Engineer

N Human Resources & Management Systems • Hyderabad

Hybrid
INR 4,000,000 - 7,000,000
Hybrid work
Certification reimbursement
Structured learning
SRE Expert
SRE Expert

HCLTech • Bengaluru

On-site
INR 1,500,000 - 2,400,000
Lead Site Reliability Engineer
Lead Site Reliability Engineer

Sierra Ventures • Bengaluru

On-site
INR 3,500,000 - 5,500,000
Senior Manager - Site Reliability Engineer|NR-2026-0246
Senior Manager - Site Reliability Engineer|NR-2026-0246

Media.net • Bengaluru

On-site
INR 6,000,000 - 8,000,000
Site Reliability Engineer II
Site Reliability Engineer II

GreyOrange • Gurugram District

On-site
INR 3,000,000 - 5,500,000