Data Center Facility Operations Reliability Engineer

Meta

Madison (WI)

On-site

USD 143,000 - 198,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

Meta is seeking an experienced Reliability Engineer to join the Asset Management & Reliability team within Facility Operations in Madison, WI. You will identify asset reliability risks across the data center lifecycle, drive scoping and roadmapping for reliability initiatives, and tackle complex technical ambiguities at the fleet level to ensure seamless operations across new and existing sites.

The role requires 10+ years in reliability or 8+ years with a relevant degree, experience with

Qualifications

  • Bachelor’s degree in Mechanical, Electrical, Reliability Engineering or similar field and 8+ years of experience (or 10+ years in lieu of degree)
  • 10+ years of reliability engineering experience or related roles for electrical/mechanical cooling equipment
  • Experience with Reliability Centered Maintenance and FMEA activities to optimize reliability
  • Ability to independently scope work, set technical direction and handle ambiguity
  • Proficient with EAM solutions to extract data and gain insights
  • Knowledge of ISO 14224, 17359, 55000 standards
  • Cross-functional leadership and program management experience
  • Able to travel 25% domestically and internationally

Responsibilities

  • Lead FMEA and maintenance strategy development
  • Govern content for Global Maintenance Library and maintenance change management
  • Drive corrective maintenance through root cause analysis and preventive actions
  • Ensure compliance with regulatory requirements across reliability activities
  • Oversee condition-based monitoring and diagnostics programs including IR and PD tests
  • Optimize MTTR and MTBF metrics for continuous improvement
  • Develop whole-equipment sparing and Parts FBPN setups
  • Liaise with IBOS/ISCE teams on replacement parts, tooling, and audits
  • Identify reliability opportunities and drive engineering excellence across the team
  • Establish service BOMs and supplier scope management

Skills

FMEA
RCM
Data analysis
Cross-functional leadership
Travel readiness

Education

Bachelor’s degree in Mechanical, Electrical, Reliability Engineering
10+ years reliability experience

Tools

Enterprise Asset Management (EAM)
Maintenance Library governance
Spare parts management

Job description

Summary:

Meta is seeking an experienced and self-motivated Reliability Engineer to join our Asset Management & Reliability team within Facility Operations. This person will work at the leading edge of Facility Operations to identify and manage asset reliability risks and various stages of end-to-end asset lifecycle for the Data Center Operations. Managing stakeholders spread across time zones and key to the success of our individual projects and overall asset management, and reliability program. In this role, you will be expected to set the direction for your focus areas, drive scoping and roadmapping for reliability initiatives, and tackle the most complex technical ambiguities at the fleet level to ensure seamless operations across new and existing sites.

Required Skills:

Data Center Facility Operations Reliability Engineer Responsibilities:

  1. Lead operational Failure Mode and Effects Analysis (FMEA) and establish maintenance strategies.

  2. Manage and govern content for the Global Maintenance Library, ensuring rigorous Maintenance Change Management processes are followed.

  3. Drive Corrective Maintenance initiatives through deep Failure Mode Analysis to identify root causes and implement preventive measures.

  4. Evaluate regulatory and compliance requirements, providing governance and ensuring adherence across all reliability activities.

  5. Oversee Condition-Based Monitoring and Diagnostics programs, including testing, vibration analysis, infrared (IR), partial discharge (PD), and robotics applications.

  6. Assess and optimize Mean Time To Repair (MTTR) and Mean Time Between Failures (MTBF) metrics to drive continuous improvement.

  7. Develop and maintain continuous production risk models to prioritize resources and mitigate operational vulnerabilities.

  8. Manage non‑critical scope and oversee supplier scope management to ensure external partners meet reliability and quality standards.

  9. Implement and optimize sensor‑based condition monitoring and maintenance (e.g., infrared, temperature, pressure, flow, leak detection) to remotely monitor and assign maintenance tasks.

  10. Drive technical insourcing versus outsourcing decision‑making for maintenance and reliability activities.

  11. Establish Service Bill of Materials (BOM) setups and drive initial and continuous spares selection processes.

  12. Develop and execute a comprehensive whole‑equipment sparing strategy to minimize downtime.

  13. Identify First‑of‑Kind (FOK) parts and establish Parts Factory Base Part Number (FBPN) setups.

  14. Conduct Form‑Fit‑Function technical analysis to evaluate and approve replacement components.

  15. Act as the primary liaison to IBOS and ISCE teams for managing replacement parts backlog, timeliness, tooling requirements, and auditing.

  16. Create scope for yourself and others by identifying reliability opportunities and driving engineering excellence across the team.

Minimum Qualifications:

Minimum Qualifications:

  1. Bachelor’s degree in Mechanical, Electrical, Reliability Engineering, or a similar technical discipline plus 8+ years relevant industry experience will be considered in lieu of 10+ years relevant industry experience

  2. 10+ years of experience in reliability engineering (related to electrical or mechanical cooling equipment) or related Engineering roles

  3. Experienced in Reliability Centered Maintenance (RCM) and Failure Mode and Effects Analysis (FMEA) activities for maintenance, process, and equipment design optimization to meet reliability requirements

  4. Proven ability to independently scope work, set technical direction, and manage complex problems with high ambiguity

  5. Proficient in the usage of Enterprise Asset Management (EAM) solutions to extract data and develop meaningful insights

  6. Knowledgeable of relevant ISO standards (ISO 14224, ISO 17359, ISO 55000)

  7. Experience with program/project management and cross‑functional team leadership

  8. Ability to travel 25% domestically and internationally

Preferred Qualifications:

Preferred Qualifications:

  1. Experience with data center equipment such as critical cooling systems, generators, main switchboards, and network gear

  2. Proficient in data analysis techniques that can include Process Control, Reliability modeling and prediction, Fault Tree Analysis, Weibull Tree Analysis, and Six Sigma (6σ) Methodology

  3. Proficient in developing and executing comprehensive test plans for assets

  4. Experience stepping into technical leadership gaps to advocate for high‑quality engineering standards

  5. Certifications in Maintenance & Reliability such as CMRP, CRL, or CRE

Public Compensation:

$143,000/year to $198,000/year + bonus + equity + benefits

Industry: Internet

Equal Opportunity:

Meta is proud to be an Equal Employment Opportunity and Aff…?

Meta is committed to providing reasonable accommodations for candidates with disabilities in our recruiting process. If you need any assistance or accommodations due to a disability, please let us know at accommodations-ext@meta.com.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Data Center Facility Operations Reliability Engineer
Data Center Facility Operations Reliability Engineer

Meta • Trenton (NJ)

On-site
USD 143,000 - 198,000
Data Center Facility Operations Reliability Engineer
Data Center Facility Operations Reliability Engineer

Meta • Lansing (MI)

On-site
USD 143,000 - 198,000
Data Center Facility Operations Reliability Engineer
Data Center Facility Operations Reliability Engineer

Meta • Atlanta (GA)

On-site
USD 143,000 - 198,000
Data Center Facility Operations Reliability Engineer
Data Center Facility Operations Reliability Engineer

Meta • Augusta (ME)

On-site
USD 143,000 - 198,000
Bonus
Equity
Reliability & Asset Management
Reliability & Asset Management

Meta • Charleston (WV)

On-site
USD 143,000 - 198,000
Reliability & Asset Management
Reliability & Asset Management

Meta • Montpelier (VT)

On-site
USD 143,000 - 198,000
Data Center Facility Operations Reliability Engineer
Data Center Facility Operations Reliability Engineer

Meta • United States

On-site
USD 143,000 - 198,000
Data Center Reliability Engineer — Asset Ops & FMEA Leader
Data Center Reliability Engineer — Asset Ops & FMEA Leader

Meta • Trenton (NJ)

On-site
USD 143,000 - 198,000
Data Center Reliability Engineer - Asset & Operations
Data Center Reliability Engineer - Asset & Operations

Meta • Atlanta (GA)

On-site
USD 143,000 - 198,000
Senior Reliability Engineer - Asset & Data Center Ops
Senior Reliability Engineer - Asset & Data Center Ops

Meta • Montpelier (VT)

On-site
USD 143,000 - 198,000