Cloud Operations Engineer

GMP TECHNOLOGIES (S) PTE LTD

Singapore

On-site

SGD 60,000 - 110,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

GMP Technologies (S) Pte Ltd seeks a skilled IT Operations professional to oversee centralized monitoring across applications, databases, infrastructure, and networks for 24/7 services. You will monitor health via metrics, logs, and dashboards, triage incidents, and coordinate rapid resolutions with cross-functional teams.

Responsibilities include designing monitoring strategies, maintaining dashboards, managing cloud costs, and driving SRE practices with SLIs/SLOs.

Qualifications

  • Degree or Diploma in Computer Science, Information Technology, Engineering, or related discipline.
  • Min 3–5 years in IT Operations, infra monitoring, NOC, or cloud infra.
  • Hands-on with enterprise monitoring and observability platforms.

Responsibilities

  • Manage and operate centralized monitoring across applications, databases, infrastructure, and networks for 24/7 services.
  • Continuously monitor system health using metrics, logs, dashboards and alerts to detect issues.
  • Perform initial incident triage and coordinate resolution with cross-functional teams.
  • Design and improve monitoring strategies, alerts, escalation policies, and observability standards.
  • Develop real-time service health dashboards and operational reports for stakeholders.
  • Support major incident management with diagnostics and coordination.
  • Identify recurring incidents to improve monitoring coverage and reliability.
  • Monitor AWS cloud and infrastructure costs, implement cost governance and tagging.
  • Prepare cost reports and forecasts to optimise resource use while balancing performance.
  • Drive observability initiatives and site reliability engineering practices including SLIs/SLOs.
  • Maintain documentation on monitoring architecture and governance.
  • Participate in after-hours support when required.

Skills

Observability
Log analysis
Cross-team collaboration
AWS monitoring
Cost governance

Education

Degree or Diploma in IT/CS/Engineering

Tools

Amazon CloudWatch
Grafana
Prometheus
ELK/Splunk
Cost management tools

Job description

Responsibilities


  • Manage and operate centralized monitoring and observability platforms across applications, databases, infrastructure (compute and storage), and network environments supporting 24/7 services.

  • Continuously monitor system health using metrics, logs, dashboards, and alerts to proactively detect performance degradation, anomalies, and potential service issues.

  • Perform initial incident triage, impact assessment, event correlation, and coordinate timely resolution with Application, Infrastructure, Network, Cloud, and Database teams.

  • Design, implement, and continuously improve monitoring strategies, observability standards, alert thresholds, escalation policies, and monitoring frameworks.

  • Develop and maintain real-time service health dashboards, operational reports, and trend analysis for management and key stakeholders.

  • Support major incident management by providing technical diagnostics, operational visibility, and cross-functional coordination.

  • Identify recurring incidents and reliability gaps, driving continuous improvements in monitoring coverage, system stability, and operational response.

  • Monitor and optimise AWS cloud and infrastructure costs, including compute, storage, network connectivity, and data transfer expenses.

  • Implement cost allocation, tagging strategies, budget monitoring, and alerting mechanisms to improve cloud cost governance.

  • Prepare cost reports, dashboards, forecasts, and recommendations to optimise resource utilisation while balancing performance, reliability, and cost efficiency.

  • Drive initiatives to enhance observability, automate monitoring and alerting workflows, and support the adoption of Site Reliability Engineering (SRE) practices, including SLIs, SLOs, and Error Budgets.

  • Maintain accurate documentation covering monitoring architecture, dashboards, alerting rules, escalation procedures, and FinOps governance.

  • Participate in major incident response, critical service monitoring, and after-hours support, including weekends and public holidays, when required.


Requirements


  • Degree or Diploma in Computer Science, Information Technology, Engineering, or a related discipline.

  • Minimum 3 to 5 years of experience in IT Operations, Infrastructure Operations, System Monitoring, NOC, Service Assurance, or Cloud Infrastructure.

  • Hands-on experience with enterprise monitoring and observability platforms.

  • Experience supporting hybrid environments across on-premises infrastructure and AWS cloud.

  • Good understanding of system, application, infrastructure, and network monitoring concepts.

  • Experience with one or more monitoring platforms such as Amazon CloudWatch, Grafana, Prometheus, Splunk, ELK Stack, or equivalent solutions.

  • Strong ability to analyse logs, metrics, alerts, and performance data to identify and resolve operational issues.

  • Experience with AWS Cost Explorer, budgeting, tagging strategies, cloud cost optimisation, and FinOps best practices.

  • Familiarity with ITIL processes, including Incident, Problem, Change Management, Service Level Management, and Observability principles.

  • AWS Associate Certification or AWS FinOps Certified Practitioner certification will be an advantage.

  • Strong analytical, troubleshooting, and problem-solving skills.

  • Ability to correlate events across complex distributed systems and coordinate effectively with multiple technical teams.

  • Strong communication, stakeholder management, and organisational skills.

  • Self-motivated with a strong sense of ownership, accountability, and the ability to work independently.

  • Willing to provide after-hours operational support when required.


To apply, please visitwww.gmprecruit.comand search for Job Reference:X94RV4Y3


To learn more about this opportunity, please contact Yingying at yingying.lai@gmprecruit.com


We regret that only shortlisted candidates will be notified.


GMP Technologies (S) Pte Ltd | EA Licence: 11C3793 | EA Personnel: Lai Yingying | Registration No: R1110239

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Cloud Operations Engineer (Monitoring)
Cloud Operations Engineer (Monitoring)

SEARCH INDEX PTE. LTD. • Singapore

Hybrid
SGD 80,000 - 110,000
Cloud Operations Engineer (Monitoring / AWS)
Cloud Operations Engineer (Monitoring / AWS)

SEARCH INDEX PTE. LTD. • Singapore

On-site
SGD 60,000 - 80,000
Infrastructure Operations Engineer (Cloud & Monitoring)
Infrastructure Operations Engineer (Cloud & Monitoring)

SEARCH INDEX PTE. LTD. • Singapore

On-site
SGD 60,000 - 90,000
Cloud Engineer (Monitoring / AWS)
Cloud Engineer (Monitoring / AWS)

SEARCH INDEX PTE. LTD. • Singapore

On-site
SGD 70,000 - 110,000
IT Infrastructure Engineer
IT Infrastructure Engineer

GMP RECRUITMENT SERVICES (S) PTE LTD • Singapore

On-site
SGD 60,000 - 110,000
Cloud Engineer
Cloud Engineer

Search Index Pte Ltd • Singapore

On-site
SGD 80,000 - 120,000
Cloud Operations Engineer (AWS)
Cloud Operations Engineer (AWS)

United States Digital Space LLC • Singapore

On-site
SGD 90,000 - 130,000
Cloud Operations Engineer
Cloud Operations Engineer

U3 Infotech Pte Ltd • Singapore

On-site
SGD 90,000 - 120,000
Cloud Monitoring Engineer: AWS & FinOps Specialist
Cloud Monitoring Engineer: AWS & FinOps Specialist

SEARCH INDEX PTE. LTD. • Singapore

On-site
SGD 70,000 - 110,000
Cloud & Hybrid Infra Monitoring Engineer
Cloud & Hybrid Infra Monitoring Engineer

GMP RECRUITMENT SERVICES (S) PTE LTD • Singapore

On-site
SGD 60,000 - 110,000