Site Reliability Engineer Lead

TechDigital Group

Fairfax (VA)

On-site

USD 100,000 - 130,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

A leading technology company in Fairfax, Virginia seeks a Support Lead (SRE) to oversee support operations and enhance system reliability. You will manage a team of engineers, optimize performance, and implement automation tools. Ideal candidates should have a strong background in site reliability engineering and relevant certifications. Excellent communication and project management skills are essential for driving initiatives and ensuring system efficacy. This role presents an opportunity for impactful leadership and innovation within the tech space.

Qualifications

  • Proficiency in site reliability engineering principles and practices.
  • Strong background in system administration and cloud computing.
  • Experience with monitoring tools like Prometheus and Grafana.

Responsibilities

  • Manage a team of support engineers to address system issues promptly.
  • Monitor system performance and implement improvements.
  • Develop incident response procedures to minimize downtime.
  • Lead automation tools implementation to streamline operations.

Skills

Site reliability engineering (SRE) principles
System administration
Networking
Cloud computing
Monitoring tools (Prometheus, Grafana, ELK stack)
Containerization technologies (Docker, Kubernetes)
Troubleshooting complex technical issues
Project management
Leadership skills
Communication skills

Education

Relevant certifications (AWS Certified DevOps Engineer, Google Professional Cloud DevOps Engineer)

Job description

Job Summary

Job Summary The Support Lead (SRE) is responsible for overseeing the support operations and site reliability engineering tasks, ensuring the effective functioning of systems and applications. The primary goal is to enhance system performance, availability, and resiliency.


Key Responsibilities


  • Manage a team of support engineers and SREs to provide technical support and address system issues promptly.

  • Monitor system performance and reliability metrics, identifying areas for improvement and implementing solutions.

  • Collaborate with cross functional teams to optimize application performance and enhance system reliability.

  • Develop and maintain incident response procedures and protocols to minimize system downtime.

  • Conduct regular audits and assessments to ensure compliance with industry standards and best practices.

  • Lead the implementation of automation tools and processes to streamline support operations and enhance efficiency.

  • Provide technical expertise and guidance to team members, promoting a culture of continuous learning and development.


Skill Requirements


  • Proficiency in site reliability engineering (SRE) principles and practices.

  • Strong background in system administration, networking, and cloud computing.

  • Experience with monitoring tools such as Prometheus, Grafana, and ELK stack.

  • Knowledge of containerization technologies like Docker and Kubernetes.

  • Ability to troubleshoot complex technical issues and perform root cause analysis.

  • Excellent communication skills and ability to work collaboratively in a team environment.

  • Strong project management and leadership skills to drive initiatives and deliver results efficiently.

  • Certifications in relevant areas such as AWS Certified DevOps Engineer or Google Professional Cloud DevOps Engineer are a plus.


Experience in dynatrace tool development
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Site Reliability Engineer
Site Reliability Engineer

Encora Digital Inc. • United States

On-site
USD 120,000 - 180,000
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

Veriipro • Washington

On-site
USD 120,000 - 180,000
Site Reliability Engineer – Lead
Site Reliability Engineer – Lead

Jobtailor • Arizona

On-site
USD 140,000 - 230,000
Site Reliability Engineer
Site Reliability Engineer

TechDigital Group • Charlotte (NC)

On-site
USD 90,000 - 120,000
Lead Site Reliability Engineer
Lead Site Reliability Engineer

Luxoft • Wilmington (DE)

On-site
USD 140,000 - 190,000
Lead Site Reliability Engineer
Lead Site Reliability Engineer

Luxoft • Buffalo (NY)

On-site
USD 140,000 - 190,000
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

Methodic • San Francisco (CA)

On-site
USD 140,000 - 210,000
Site Reliability Engineer
Site Reliability Engineer

TechDigital Group • Atlanta (GA)

On-site
USD 60,000 - 100,000
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

Knack Solutions • Reston (VA)

On-site
USD 120,000 - 160,000
Site Reliability Engineer
Site Reliability Engineer

SRE • Puerto Rico

Hybrid
USD 120,000 - 180,000