Site Reliability Engineer - HFT

Selby Jennings

Hong Kong

On-site

HKD 480,000 - 720,000

Full time

9 days ago
Application generator

Stand out for this role — generate a tailored resume and cover letter in about a minute.

Get past ATS filters

Job summary

Selby Jennings in Hong Kong is seeking a Mid-Level Site Reliability Engineer to support mission-critical production systems and observability platforms. This role blends SRE duties with data platform engineering to boost reliability, monitoring, and scalability in a complex distributed environment.

You will work with engineering teams to improve platform stability and operational visibility, implementing automation and cloud-native practices across real-time data pipelines.

Qualifications

  • Degree in Computer Science, Software Engineering, or equivalent practical experience.
  • Experience building observability and monitoring in production environments.
  • Strong incident management, troubleshooting, and RCA skills.
  • Hands-on with Prometheus, Grafana, ELK, Datadog, CloudWatch or similar.
  • Experience deploying via GitLab CI, Jenkins, or GitHub Actions.

Responsibilities

  • Own and enhance end-to-end observability across production systems.
  • Design dashboards, alerts, and operational metrics.
  • Investigate incidents, diagnose root causes, implement fixes.
  • Manage deployments through CI/CD pipelines and GitOps workflows.
  • Operate and optimize Kubernetes workloads in cloud environments.
  • Provision and maintain infrastructure with Infrastructure-as-Code.
  • Build and support near real-time data pipelines and telemetry platforms.
  • Design data quality controls and optimise analytical databases for large-scale querying.
  • Develop and improve SQL-based analytics and reporting capabilities.
  • Participate in a shared on-call rotation supporting critical production services.

Skills

Python
Java
Scala
Rust
SQL
Incident management
Observability

Education

Bachelor's degree in Computer Science or Software Engineering

Tools

Prometheus
Grafana
ELK
Datadog
CloudWatch
GitLab CI
Jenkins
GitHub Actions
Terraform
Kubernetes
ClickHouse
BigQuery
Druid
Redshift
Kafka
SQS
Airflow

Job description

Role Overview

The firm is seeking a Mid-Level Site Reliability Engineer to support mission-critical production systems and observability platforms. This role combines SRE responsibilities with data platform engineering, focusing on system reliability, monitoring, automation, cloud infrastructure, and real-time data pipelines. You will work closely with engineering teams to improve platform stability, operational visibility, and scalability across a complex distributed environmen

Key Responsibilities
  • Own and enhance end-to-end observability across production systems.
  • Design actionable monitoring dashboards, alerts, and operational metrics.
  • Investigate production incidents, diagnose root causes, and implement permanent fixes.
  • Manage deployments through CI/CD pipelines and GitOps workflows.
  • Operate and optimize Kubernetes-based workloads in cloud environments.
  • Provision and maintain infrastructure using Infrastructure-as-Code practices.
  • Build and support near real-time data pipelines and telemetry platforms.
  • Design data quality controls and optimize analytical databases for large-scale querying.
  • Develop and improve SQL-based analytics and reporting capabilities.
  • Participate in a shared on-call rotation supporting critical production services.
Key Requirements
  • Degree in Computer Science, Software Engineering, or equivalent practical experience.
  • Experience building and maintaining observability and monitoring solutions within production environments.
  • Strong understanding of incident management, troubleshooting, and root cause analysis.
  • Hands-on experience with monitoring tools such as Prometheus, Grafana, ELK, Datadog, CloudWatch, or similar.
  • Experience deploying software through CI/CD platforms such as GitLab CI, Jenkins, or GitHub Actions.
  • Exposure to distributed stream processing technologies such as Flink, Spark Structured Streaming, or comparable frameworks.
  • Experience working with OLAP or columnar databases such as ClickHouse, BigQuery, Druid, or Redshift.
  • Practical Kubernetes experience, including deployments, resource management, and application configuration.
  • Strong programming skills in Python, Java, Scala, Rust, or similar languages.
  • Advanced SQL skills with experience building and optimising analytical workloads.
  • Knowledge of messaging platforms and event-driven architectures such as Kafka or SQS
Nice to Have
  • Experience with OpenTelemetry and distributed tracing.
  • Knowledge of Airflow or workflow orchestration platforms.
  • Advanced Terraform and Infrastructure-as-Code expertise.
  • Familiarity with JVM build tooling or large-scale software delivery pipelines.
  • Prior exposure to trading, market data, financial technology, or other low-latency environments.
Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Site Reliability Engineer - J13203
Site Reliability Engineer - J13203

Pinpoint Asia • Hong Kong

On-site
HKD 600,000 - 900,000
Site Reliability Engineer, Data & Observability Platform
Site Reliability Engineer, Data & Observability Platform

Pulsar • Hong Kong

On-site
HKD 400,000 - 700,000
Mid-Level SRE
Mid-Level SRE

IO TECH SOLUTIONS LIMITED • Hong Kong

On-site
HKD 480,000 - 600,000
Sr. Manager, Site Reliability & Innovation, IT
Sr. Manager, Site Reliability & Innovation, IT

CLSA • Hong Kong

On-site
HKD 900,000 - 1,200,000
Core Site Reliability Engineer
Core Site Reliability Engineer

Selby Jennings • Hong Kong

On-site
HKD 900,000 - 1,200,000
Application Reliability Engineer
Application Reliability Engineer

IO Tech Solutions Limited • Hong Kong

On-site
HKD 900,000 - 1,500,000
Backend/Systems Engineer (Real-Time System)
Backend/Systems Engineer (Real-Time System)

Nahc • Hong Kong

On-site
HKD 900,000 - 1,200,000
Site Reliability Engineer: Observability & Data Pipelines
Site Reliability Engineer: Observability & Data Pipelines

Pinpoint Asia • Hong Kong

On-site
HKD 600,000 - 900,000
Senior Site Reliability Engineer (SRE)
Senior Site Reliability Engineer (SRE)

GFT TECHNOLOGIES SE • Hong Kong

On-site
HKD 700,000 - 1,200,000
Site Reliability Engineer - Global Financial Institution - Hong Kong
Site Reliability Engineer - Global Financial Institution - Hong Kong

NLS Executive Search • Hong Kong

On-site
HKD 600,000 - 900,000
Very competitive compensation (base +