On-Prem SRE: AI Platform Reliability & Kubernetes

Open Innovation AI

Abu Dhabi

On-site

AED 240,000 - 400,000

Full time

11 days ago
Application generator

An application made for this job — a tailored resume and cover letter that speak straight to the posting.

Get past ATS filters

Job summary

Open Innovation AI seeks a Site Reliability Engineer to support deployments across customer environments, including secure on‑prem infrastructure. You will troubleshoot hardware, Linux, Kubernetes, and middleware while maintaining service availability and program integrity.

You will work within Incident, Change, and Problem Management processes, document procedures, and collaborate with L1/L3 teams to resolve issues and optimize platform performance.

Qualifications

  • Bachelor's degree in Computer Science, Information Technology, Engineering, or a related field.
  • 4–7 years of experience in SRE, DevOps, Infrastructure Operations, or Platform Engineering in on-prem or secure environments.
  • Strong proficiency in Linux system administration, troubleshooting, log analysis, service management, and performance tuning.
  • Hands-on experience with Kubernetes, container runtimes, and distributed on‑prem systems.
  • Understanding of compute, storage, networking, and virtualization in enterprise installs.
  • Experience with middleware/data-layer components (Kafka, Redis, PostgreSQL) in distributed on‑prem setups.
  • Knowledge of ITIL-aligned operations and structured processes.
  • Ability to diagnose complex issues across multiple stack layers.
  • Experience in secure/restricted environments is an advantage.
  • Excellent communication and documentation skills.
  • Certifications such as RHCSA/RHCE, CKA/CKAD/CKS.

Responsibilities

  • Maintain and support deployments in customer environments including on-prem and air-gapped setups.
  • Ensure availability, upgrades, and stability of AI platforms and solutions.
  • Diagnose incidents across hardware, Linux, Kubernetes, containers, and middleware.
  • Analyze logs and system behavior to determine root causes and restore service.
  • Follow Change Management procedures for system updates and upgrades.
  • Understand OICM architecture and customer usage patterns.
  • Collaborate with L1/Service Desk for issue triage and guidance.
  • Escalate complex issues to L3 with detailed analysis.
  • Perform on-site health checks of Kubernetes clusters and resources.
  • Work with Systems Engineering to resolve performance issues across compute, storage, networking, and Kubernetes layers.
  • Update SOPs, runbooks, and known-issues documentation.
  • Contribute to post-incident reviews and improvement actions.
  • Adhere to Incident, Change, and Problem Management processes.

Skills

Linux administration
Incident management
Problem management
Analytical thinking
Communication
Troubleshooting
Documentation

Education

Bachelor's degree in Computer Science / IT / Engineering

Tools

Kubernetes
Container runtimes
Kafka
Redis
PostgreSQL
Virtualization

Job description

Open Innovation AI seeks a Site Reliability Engineer to support deployments across customer environments, including secure on‑prem infrastructure. You will troubleshoot hardware, Linux, Kubernetes, and middleware while maintaining service availability and program integrity.

You will work within Incident, Change, and Problem Management processes, document procedures, and collaborate with L1/L3 teams to resolve issues and optimize platform performance.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Site Reliability Engineer
Site Reliability Engineer

Open Innovation AI • Abu Dhabi

On-site
AED 240,000 - 400,000
Senior Site Reliability Engineer - AI Infra & Incidents
Senior Site Reliability Engineer - AI Infra & Incidents

AIQ • Abu Dhabi

On-site
AED 300,000 - 420,000
Healthcare
Education support for dependents
Leave benefits
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

Dicetek LLC • Dubai

On-site
AED 480,000 - 780,000
Site Reliability Engineer (SRE) - Azure focus
Site Reliability Engineer (SRE) - Azure focus

Dicetek LLC • Dubai

On-site
AED 300,000 - 550,000
Senior DevOps & SRE — AI-Driven Cloud Reliability
Senior DevOps & SRE — AI-Driven Cloud Reliability

Client of Salt • Abu Dhabi

On-site
AED 320,000 - 520,000
System Reliability Engineer (SRE)
System Reliability Engineer (SRE)

Dicetek LLC • Abu Dhabi

On-site
AED 120,000 - 180,000
SRE (Site Reliability Engineer)
SRE (Site Reliability Engineer)

Dicetek LLC • Abu Dhabi

On-site
AED 180,000 - 300,000
Senior SRE — Scale, Automate & Harden Carrier-Grade Infra
Senior SRE — Scale, Automate & Harden Carrier-Grade Infra

31 CONCEPT • United Arab Emirates

On-site
AED 300,000 - 460,000
Senior On-Site Infrastructure Delivery Engineer
Senior On-Site Infrastructure Delivery Engineer

Open Innovation AI • Abu Dhabi

On-site
AED 360,000 - 600,000
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

31 CONCEPT • United Arab Emirates

On-site
AED 300,000 - 460,000