Observability & Infrastructure Engineer

HireHi

United States

Remote

USD 120,000 - 180,000

Full time

3 days ago
Be an early applicant
Application generator

Turn this role into an interview — a resume and cover letter built around what this employer wants.

Get past ATS filters

Benefits offered by this job

Health insurance
Paid leave
Vacation
Learning opportunities
Language learning
Modern hardware
International team
Relocation opportunities

Job summary

HireHi ищет специалиста по наблюдаемости и инфраструктуре для проектирования, внедрения и поддержки масштабируемых платформ мониторинга и логирования. Вы будете работать с Prometheus, Alertmanager, Grafana и стеком OpenSearch, обеспечивая надёжное хранение и быстрый доступ к данным, а также развивать self-service observability для инженеров.

Требуется 3+ лет опыта администрирования Linux и работы с контейнеризацией (Docker/Kubernetes), знание Ansible/Terraform и навыки автоматизации.

Qualifications

  • 3+ года опыта администрирования Linux и мониторинга/об observability систем
  • Опыт работы с системами на базе Debian
  • Практический опыт Prometheus, Alertmanager и Grafana
  • Опыт работы Fluent Bit, Kafka, OpenSearch и OpenSearch Dashboards
  • Понимание проектирования пайплайнов метрик и логов, надёжности и масштабируемости
  • Умение проектировать алерты и снижать шум уведомлений
  • Уверенное владение shell, скриптингом и автоматизацией (Ansible, Terraform)
  • Понимание сетевых концепций (TCP/IP, DNS, VPN, firewalls)
  • Опыт эксплуатации высокодоступных сервисов и планирования ресурсов
  • Опыт работы с инфраструктурой как кодом и Git-воркфлоу
  • Готовность обеспечить самообслуживание observability в командах

Responsibilities

  • Разработка и внедрение масштабируемых платформ мониторинга, логирования и алертинга
  • Операция Prometheus, Alertmanager, Grafana, Fluent Bit, Kafka, OpenSearch и Dashboards
  • Построение и поддержка потоков метрик и логов для критически важных сервисов
  • Создание дашбордов для видимости здоровья сервиса, производительности и рисков
  • Проектирование действующих правил оповещений и маршрутизации, снижение шума
  • Мониторинг метрик и логов, устранение проблем, повышение устойчивости под нагрузкой
  • Управление размерностью метрик, хранением, retention и производительностью запросов
  • Обеспечение HA и восстановления для observability-сервисов
  • Автоматизация конфигураций через Ansible, Terraform, Python и Bash
  • Разработка паттернов observability и документации
  • Поддержка инцидентов, анализ причин и улучшение дашбордов/рунабуков
  • Оценка новых технологий и взаимодействие с командами Kubernetes/Linux/сетями
  • Поддержка документации по архитектуре observability

Skills

Linux admin
Networking basics
Shell scripting
Git workflows
Security basics

Tools

Prometheus
Alertmanager
Grafana
Fluent Bit
Kafka
OpenSearch
OpenSearch Dashboards
Docker
Kubernetes
Ansible
Terraform
Python
Bash

Job description

HireHi ищет специалиста по наблюдаемости и инфраструктуре для проектирования, внедрения и поддержки масштабируемых платформ мониторинга и логирования. Вы будете работать с Prometheus, Alertmanager, Grafana и стеком OpenSearch, обеспечивая надёжное хранение и быстрый доступ к данным, а также развивать self-service observability для инженеров.

Требуется 3+ лет опыта администрирования Linux и работы с контейнеризацией (Docker/Kubernetes), знание Ansible/Terraform и навыки автоматизации.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Remote Platform Engineer - Cloud Analytics & Observability
Remote Platform Engineer - Cloud Analytics & Observability

HireHi • United States

Remote
USD 120,000 - 160,000
Kubernetes Infra Engineer - Production Reliability & Monitoring
Kubernetes Infra Engineer - Production Reliability & Monitoring

HireHi • United States

Remote
USD 110,000 - 170,000
Crypto payments
Paid vacation 28 days/year
Relocation assistance to LATAM
Data Platform DevOps Engineer
Data Platform DevOps Engineer

HireHi • United States

Remote
USD 130,000 - 170,000
Remote SRE Engineer: Reliability & Observability
Remote SRE Engineer: Reliability & Observability

HireHi • United States

Remote
USD 120,000 - 190,000
Компенсация обучения
Завтраки/обеды в офисе
Гибкий график 5/2
+1
IoT Connectivity Systems Administrator - On-Call
IoT Connectivity Systems Administrator - On-Call

HireHi • United States

Remote
USD 38,000 - 46,000
Medical insurance
Social benefits 200€
Wolt food allowance
+3
Platform Reliability Engineer - AI & On-Prem Ops
Platform Reliability Engineer - AI & On-Prem Ops

HireHi • United States

Remote
USD 120,000 - 170,000
Vacation days
English lessons
Системный инженер связи: мониторинг, автоматизация и CI/CD
Системный инженер связи: мониторинг, автоматизация и CI/CD

HireHi • United States

Remote
USD 90,000 - 120,000
Remote Cloud Ops Engineer — AWS, Kubernetes, CI/CD
Remote Cloud Ops Engineer — AWS, Kubernetes, CI/CD

HireHi • United States

Remote
USD 120,000 - 180,000
SRE: Надёжность Продукта, Наблюдаемость, Автоматизация
SRE: Надёжность Продукта, Наблюдаемость, Автоматизация

HireHi • United States

Remote
USD 140,000 - 180,000
Гибкий график
Расширенная ДМС со стоматологией
Компенсация спорта
+2
Cloud Platform Engineer: AWS, Terraform, CI/CD & Docker
Cloud Platform Engineer: AWS, Terraform, CI/CD & Docker

HireHi • United States

Remote
USD 90,000 - 130,000
Health insurance
Vacation policy
Sick leave
+3