Data Center Facility Operations Reliability Engineer

Meta

Lansing (MI)

On-site

USD 143,000 - 198,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

Meta is seeking an experienced Reliability Engineer to join our Asset Management & Reliability team within Facility Operations. You will lead FMEA initiatives, maintain a global maintenance library, and drive data-driven reliability across data center operations.

Ideal candidates have 8+ years in reliability engineering, strong ISO standards knowledge, and the ability to coordinate across time zones while reducing downtime and improving MTTR/MTBF metrics.

Qualifications

  • Bachelor’s in mechanical/electrical reliability or similar field with 8+ years of experience.
  • Experience in FMEA, RCM, and maintenance optimization.
  • Proven ability to scope work and lead complex problems.
  • Familiarity with ISO 14224/17359/55000 standards.
  • Strong data analysis and cross-functional leadership skills.

Responsibilities

  • Lead FMEA and maintenance strategies for critical assets.
  • Govern content for global maintenance library and change processes.
  • Drive corrective maintenance from root cause analysis.
  • Oversee CBM/Diagnostics programs including IR/PD and robotics.
  • Improve MTTR/MTBF and production risk models.
  • Manage supplier scope and insource vs outsource decisions.
  • Establish BOMs, spares strategies, and service readiness.
  • Collaborate with IBOS/ISCE on parts backlog and tooling.
  • Identify reliability opportunities and raise engineering standards.

Skills

FMEA
RCM
EAM data insights
ISO standards knowledge
Cross-functional leadership
Travel up to 25%

Education

Bachelor’s degree in Mechanical/Electrical Reliability Eng.
8+ years reliability/engineering experience

Tools

EAM software

Job description

Summary:

Meta is seeking an experienced and self-motivated Reliability Engineer to join our Asset Management & Reliability team within Facility Operations. This person will work at the leading edge of Facility Operations to identify and manage asset reliability risks and various stages of end-to-end asset lifecycle for the Data Center Operations. Managing stakeholders spread across time zones and key to the success of our individual projects and overall asset management, and reliability program. In this role, you will be expected to set the direction for your focus areas, drive scoping and roadmapping for reliability initiatives, and tackle the most complex technical ambiguities at the fleet level to ensure seamless operations across new and existing sites.

Required Skills:

Data Center Facility Operations Reliability Engineer Responsibilities:

  1. Lead operational Failure Mode and Effects Analysis (FMEA) and establish maintenance strategies.

  2. Manage and govern content for the Global Maintenance Library, ensuring rigorous Maintenance Change Management processes are followed.

  3. Drive Corrective Maintenance initiatives through deep Failure Mode Analysis to identify root causes and implement preventive measures.

  4. Evaluate regulatory and compliance requirements, providing governance and ensuring adherence across all reliability activities.

  5. Oversee Condition-Based Monitoring and Diagnostics programs, including testing, vibration analysis, infrared (IR), partial discharge (PD), and robotics applications.

  6. Assess and optimize Mean Time To Repair (MTTR) and Mean Time Between Failures (MTBF) metrics to drive continuous improvement.

  7. Develop and maintain continuous production risk models to prioritize resources and mitigate operational vulnerabilities.

  8. Manage non‑critical scope and oversee supplier scope management to ensure external partners meet reliability and quality standards.

  9. Implement and optimize sensor‑based condition monitoring and maintenance (e.g., infrared, temperature, pressure, flow, leak detection) to remotely monitor and assign maintenance tasks.

  10. Drive technical insourcing versus outsourcing decision‑making for maintenance and reliability activities.

  11. Establish Service Bill of Materials (BOM) setups and drive initial and continuous spares selection processes.

  12. Develop and execute a comprehensive whole‑equipment sparing strategy to minimize downtime.

  13. Identify First‑of‑Kind (FOK) parts and establish Parts Factory Base Part Number (FBPN) setups.

  14. Conduct Form‑Fit‑Function technical analysis to evaluate and approve replacement components.

  15. Act as the primary liaison to IBOS and ISCE teams for managing replacement parts backlog, timeliness, tooling requirements, and auditing.

  16. Create scope for yourself and others by identifying reliability opportunities and driving engineering excellence across the team.

Minimum Qualifications:

Minimum Qualifications:

  1. Bachelor’s degree in Mechanical, Electrical, Reliability Engineering, or a similar technical discipline plus 8+ years relevant industry experience will be considered in lieu of 10+ years relevant industry experience

  2. 10+ years of experience in reliability engineering (related to electrical or mechanical cooling equipment) or related Engineering roles

  3. Experienced in Reliability Centered Maintenance (RCM) and Failure Mode and Effects Analysis (FMEA) activities for maintenance, process, and equipment design optimization to meet reliability requirements

  4. Proven ability to independently scope work, set technical direction, and manage complex problems with high ambiguity

  5. Proficient in the usage of Enterprise Asset Management (EAM) solutions to extract data and develop meaningful insights

  6. Knowledgeable of relevant ISO standards (ISO 14224, ISO 17359, ISO 55000)

  7. Experience with program/project management and cross‑functional team leadership

  8. Ability to travel 25% domestically and internationally

Preferred Qualifications:

Preferred Qualifications:

  1. Experience with data center equipment such as critical cooling systems, generators, main switchboards, and network gear

  2. Proficient in data analysis techniques that can include Process Control, Reliability modeling and prediction, Fault Tree Analysis, Weibull Tree Analysis, and Six Sigma (6σ) Methodology

  3. Proficient in developing and executing comprehensive test plans for assets

  4. Experience stepping into technical leadership gaps to advocate for high‑quality engineering standards

  5. Certifications in Maintenance & Reliability such as CMRP, CRL, or CRE

Public Compensation:

$143,000/year to $198,000/year + bonus + equity + benefits

Industry: Internet

Equal Opportunity:

Meta is proud to be an Equal Employment Opportunity and Aff…?

Meta is committed to providing reasonable accommodations for candidates with disabilities in our recruiting process. If you need any assistance or accommodations due to a disability, please let us know at accommodations-ext@meta.com.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Data Center Facility Operations Reliability Engineer
Data Center Facility Operations Reliability Engineer

Meta • Trenton (NJ)

On-site
USD 143,000 - 198,000
Data Center Facility Operations Reliability Engineer
Data Center Facility Operations Reliability Engineer

Meta • Atlanta (GA)

On-site
USD 143,000 - 198,000
Data Center Facility Operations Reliability Engineer
Data Center Facility Operations Reliability Engineer

Meta • Augusta (ME)

On-site
USD 143,000 - 198,000
Bonus
Equity
Data Center Facility Operations Reliability Engineer
Data Center Facility Operations Reliability Engineer

Meta • Madison (WI)

On-site
USD 143,000 - 198,000
Reliability & Asset Management
Reliability & Asset Management

Meta • Charleston (WV)

On-site
USD 143,000 - 198,000
Data Center Facility Operations Reliability Engineer
Data Center Facility Operations Reliability Engineer

Meta • United States

On-site
USD 143,000 - 198,000
Reliability & Asset Management
Reliability & Asset Management

Meta • Montpelier (VT)

On-site
USD 143,000 - 198,000
Data Center Reliability Engineer — Asset Ops & FMEA Leader
Data Center Reliability Engineer — Asset Ops & FMEA Leader

Meta • Trenton (NJ)

On-site
USD 143,000 - 198,000
Data Center Reliability Engineer - Asset & Operations
Data Center Reliability Engineer - Asset & Operations

Meta • Atlanta (GA)

On-site
USD 143,000 - 198,000
Senior Reliability Engineer - Asset & Data Center Ops
Senior Reliability Engineer - Asset & Data Center Ops

Meta • Montpelier (VT)

On-site
USD 143,000 - 198,000