Observability Architect

TechDigital Group

Atlanta (GA)

On-site

USD 120,000 - 150,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

A leading technology firm in Atlanta is seeking an experienced Observability Architect who will design and implement enterprise-wide observability capabilities across hybrid environments. The ideal candidate will have extensive expertise in log aggregation, APM tools, and cloud-native technologies. You will direct observability strategy and ensure system reliability and performance while driving automation and best practices. Strong collaboration skills with DevOps and SRE teams will be crucial. This role offers competitive compensation and growth opportunities.

Qualifications

  • 5+ years of experience with log aggregation platforms like Splunk.
  • 5+ years in automated configuration management tools like Terraform.
  • 2+ years of experience with APM tools such as AppDynamics.
  • Familiarity with OpenTelemetry and distributed tracing.

Responsibilities

  • Design and implement observability solutions across hybrid environments.
  • Lead observability architecture development and maintenance.
  • Drive automation for monitoring and telemetry enrichment.
  • Integrate AI-driven observability features.

Skills

Log aggregation expertise
Application performance monitoring
Cloud-native technologies
Automation and AI-driven solutions
Collaboration with DevOps and SRE teams
Strong communication skills

Tools

Splunk
AppDynamics
Terraform
Kubernetes

Job description

Job Description

We are seeking an experienced Observability Architect to design, implement, and mature enterprise-wide observability capabilities across hybrid on-premises and cloud environments. The ideal candidate has deep expertise with log aggregation, metrics, tracing, and application performance monitoring technologies, and can drive automation, standardization, and best‑practice adoption at scale. This role will be a key influencer in shaping the organization’s observability strategy, ensuring end‑to‑end system visibility, performance, and reliability.

Key Responsibilities
  • Observability Architecture & Strategy
    • Develop and maintain the enterprise observability reference architecture, covering logs, metrics, traces, events, dashboards, and alerts.
    • Lead the design and implementation of observability solutions that support hybrid multi‑cloud and on‑premise environments.
    • Establish standards, governance, and reusable frameworks for telemetry generation, ingestion, correlation, storage, and visualization.
    • Drive continuous improvement of monitoring maturity, integrating data‑driven insights and AI‑based analytics where applicable.
  • Log Aggregation & Monitoring Solutions
    • Architect and administer large‑scale log aggregation platforms such as Splunk, supporting both on‑prem and cloud deployments.
    • Define and automate ingestion pipelines, parsing logic, index strategies, role‑based access, and performance tuning.
    • Implement configuration management and infrastructure‑as‑code (IaC) practices for repeatable deployment and scaling of observability tools.
  • Application & Network Performance Monitoring
    • Deploy, configure, and optimize APM solutions such as AppDynamics, Dynatrace, or equivalent platforms.
    • Integrate application tracing, synthetic monitoring, real‑user monitoring (RUM), and business transaction analytics.
    • Support and enhance Network Performance Monitoring (NPM) capabilities to ensure end‑to‑end visibility across distributed systems.
  • Cloud‑Native & Modern Monitoring
    • Leverage cloud‑native monitoring tools across AWS, Azure, or GCP (e.g., CloudWatch, Azure Monitor, GCP Operations Suite).
    • Guide teams in instrumenting microservices, serverless functions, containers, and Kubernetes clusters using OpenTelemetry and modern telemetry standards.
    • Partner with infrastructure, application, and SRE teams to ensure high availability, resilience, and performance.
  • Automation & AI‑Driven Engineering
    • Build automated workflows for alert tuning, anomaly detection, dashboards, and telemetry enrichment.
    • Explore and integrate AI/ML‑based observability features such as predictive analytics, signal correlation, and automated root‑cause analysis.
    • Advocate for automation‑first practices and reduction of operational toil.
Required Qualifications
  • 5+ years of hands‑on experience with enterprise‑scale log aggregation platforms, including architecture, deployment, and administration of tools like Splunk across on‑prem and cloud environments.
  • 5+ years of experience using automated configuration management and IaC tools (e.g., Ansible, Terraform, GitOps frameworks).
  • 2+ years of experience with APM tools such as AppDynamics or Dynatrace, including end‑to‑end application visibility and performance diagnostics.
  • Experience with Network Performance Monitoring tools and methodologies.
  • Strong understanding of cloud infrastructure and cloud‑native monitoring technologies (AWS, Azure, GCP).
  • Familiarity with OpenTelemetry, distributed tracing, and service mesh observability.
  • Expertise in designing dashboards, KPIs, and alerting strategies that align to business SLIs/SLOs.
  • Experience collaborating with DevOps, SRE, cloud engineering, and application teams in large enterprises.
Preferred Qualifications
  • Experience implementing AI/ML‑driven observability capabilities (e.g., anomaly detection, auto‑baselining, correlation engines).
  • Knowledge of container ecosystems and orchestration platforms (Kubernetes, AKS/EKS/GKE).
  • Experience working with event‑driven architectures and microservices environments.
  • Strong scripting or programming skills (Python, PowerShell, Bash, etc.).
  • Relevant certifications (e.g., Splunk Architect, Dynatrace Professional, Cloud certifications).
Soft Skills
  • Excellent communication and stakeholder management skills.
  • Ability to lead technical strategy and influence architectural decisions.
  • Strong analytical, troubleshooting, and problem‑solving abilities.
  • Adaptability and curiosity about new technologies and evolving observability trends.
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Solution Architect / Team Lead - Observability
Solution Architect / Team Lead - Observability

VOLTO Consulting • Irvine (CA)

On-site
USD 120,000 - 160,000
Enterprise Observability Architect
Enterprise Observability Architect

TechDigital Group • Portsmouth (NH)

On-site
USD 140,000 - 210,000
Principal Observability Architect (Splunk & Databricks)
Principal Observability Architect (Splunk & Databricks)

scicominfrastructureservices • Atlanta (GA)

On-site
USD 150,000 - 180,000
Health insurance
401(k) matching
Remote work flexibility
Principal Observability Architect (Splunk & Databricks)
Principal Observability Architect (Splunk & Databricks)

Scicominfra • Atlanta (GA)

On-site
USD 140,000 - 180,000
Health insurance
401(k) retirement plan
Paid time off
Back fill Engineer
Back fill Engineer

JPC TECHNO INC • Phoenix (AZ)

On-site
USD 120,000 - 180,000
Senior Observability Engineer
Senior Observability Engineer

Tata Consultancy Services • Los Angeles (CA)

On-site
USD 120,000 - 130,000
Lead Software Engineer – Enterprise Observability
Lead Software Engineer – Enterprise Observability

Jobtailor • Town of Florida (NY)

On-site
USD 150,000 - 210,000
Enterprise Observability Architect- Only W2
Enterprise Observability Architect- Only W2

Saransh Inc • Portsmouth (NH)

On-site
USD 150,000 - 190,000
Observability Engineer
Observability Engineer

Insight Global • New York (NY)

On-site
USD 120,000 - 180,000
Observability Engineer
Observability Engineer

Evolutyz Corp • Brea (CA)

On-site
USD 150,000 - 190,000