Platform Reliability Engineer - AI & On-Prem Ops

HireHi

United States

Remote

USD 120,000 - 170,000

Full time

4 days ago
Be an early applicant
Application generator

Turn this role into an interview — a resume and cover letter built around what this employer wants.

Get past ATS filters

Benefits offered by this job

Vacation days
English lessons

Job summary

HireHi ищет специалиста по инцидентам и поддержке платформы, работающего в США. Вы будете отвечать за реагирование на оповещения, анализ причин с использованием логов и мониторинга, а также восстановление сервиса по утвержденным runbooks.

Роль требует владения Linux, навыков диагностики и умения работать с англоязычной документацией. Команда строит AI-продукты с акцентом на приватность и on-premises развёртывание; ожидается эффективная коммуникация в межфункциональных группах и умение быстро

Qualifications

  • Используйте Linux и CLI для навигации по файловой системе
  • Устранение проблем: собирайте факты, тестируйте гипотезы
  • Поиск и корреляция событий в логах
  • Опыт Grafana или аналогичных инструментов мониторинга
  • Понимание DNS, IP, портов, HTTP и API; диагностика ошибок
  • Чтение YAML и JSON; проверка окружения и конфигураций
  • Следование runbooks и умение работать автономно
  • Коммуникация на английском языке по техническим вопросам
  • Будет плюсом: Docker, Kubernetes, Helm, Git, CI/CD, Python/Bash, SQL, очереди сообщений
  • Опыт в микросервисной архитектуре и AI/LLM будет преимуществом

Responsibilities

  • Реагировать на оповещения, результаты проверки и запросы
  • Выяснять симптомы, оценивать влияние на пользователей, анализировать логи и конфигурации
  • Восстанавливать работу платформы по утверждённым runbooks, перезапуск и откат
  • Эскалировать инциденты к специалистам и передавать факты и выводы
  • Владеть инцидентами от сигнала до закрытия и держать команду в курсе статуса
  • Писать постмортемы, расследовать причины и перевести выводы в баг-репорты и задачи ремонта
  • Поддерживать актуальные runbooks и автоматизировать проверки
  • Обеспечивать ясную коммуникацию и инициативу в команде

Skills

Linux
CLI
Troubleshooting
Log correlation
Grafana
DNS, HTTP, APIs
YAML/JSON
Runbooks
English communication

Tools

Grafana
curl
Postman
Docker
Kubernetes
Helm
Git
CI/CD
Python/Bash
n8n

Job description

HireHi ищет специалиста по инцидентам и поддержке платформы, работающего в США. Вы будете отвечать за реагирование на оповещения, анализ причин с использованием логов и мониторинга, а также восстановление сервиса по утвержденным runbooks.

Роль требует владения Linux, навыков диагностики и умения работать с англоязычной документацией. Команда строит AI-продукты с акцентом на приватность и on-premises развёртывание; ожидается эффективная коммуникация в межфункциональных группах и умение быстро

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Senior AI Platform Engineer: Build Internal AI Tools
Senior AI Platform Engineer: Build Internal AI Tools

HireHi • United States

Hybrid
USD 101,000 - 169,000
Learning budget
Mental health sessions
On-site workshops
+1
Remote Platform Engineer - Cloud Analytics & Observability
Remote Platform Engineer - Cloud Analytics & Observability

HireHi • United States

Remote
USD 120,000 - 160,000
Remote Applied AI Engineer — AI Workflows & Orchestration
Remote Applied AI Engineer — AI Workflows & Orchestration

HireHi • United States

Remote
USD 150,000 - 210,000
Полностью удалённая работа
Международные часовые пояса
Observability & Infrastructure Engineer
Observability & Infrastructure Engineer

HireHi • United States

Remote
USD 120,000 - 180,000
Health insurance
Paid leave
Vacation
+5
Fullstack AI Platform Engineer — Ops Equity Flexible Hours
Fullstack AI Platform Engineer — Ops Equity Flexible Hours

HireHi • United States

Remote
USD 120,000 - 180,000
Equity package
Home office equipment sponsorship
Flexible vacation policy
+1
AI Platform Engineer — Cloud Infra & DevOps
AI Platform Engineer — Cloud Infra & DevOps

HireHi • United States

Remote
USD 120,000 - 180,000
Hybrid Cloud Platform Engineer: AWS EKS & AI/ML Infra
Hybrid Cloud Platform Engineer: AWS EKS & AI/ML Infra

HireHi • United States

Remote
USD 150,000 - 210,000
Mentorship program
Tech talks and trainings
Education reimbursement
+1
Senior Observability Engineer — AI Agent Platform
Senior Observability Engineer — AI Agent Platform

HireHi • United States

Remote
USD 120,000 - 190,000
Благополучие сотрудников
Профессиональный рост
SRE: Надёжность Продукта, Наблюдаемость, Автоматизация
SRE: Надёжность Продукта, Наблюдаемость, Автоматизация

HireHi • United States

Remote
USD 140,000 - 180,000
Гибкий график
Расширенная ДМС со стоматологией
Компенсация спорта
+2
Platform Engineering Lead – CI/CD, Kubernetes, Cloud
Platform Engineering Lead – CI/CD, Kubernetes, Cloud

HireHi • United States

Remote
USD 124,000 - 180,000
Performance bonus
Private health insurance
Corporate pension
+5