Hardware-Focused Site Reliability Engineer – Data Center

Pantera Capital

Southaven (MS)

On-site

USD 90,000 - 130,000

Full time

14 days+
Application generator

A complete application in a minute — tailored resume and cover letter, ready to send.

Get past ATS filters

Job summary

SpaceXAI in Memphis seeks a Site Reliability Engineer focused on hardware to own firmware analysis, hardware specs, vendor relations, and failure analysis for our data center fleet.

You will diagnose issues, push for reliable hardware, and contribute to a team knowledge base. The role requires hands-on engineering, strong debugging, and scripting in Python or Bash to automate tasks. Collaboration with operations technicians is essential.

Qualifications

  • Bachelor's degree in a related field or equivalent experience.
  • 2+ years hardware reliability engineering in HPC or data-center environments.
  • Proven firmware analysis, hardware spec review, and release validation.
  • Experience with RMA processes and vendor negotiations outside standard protocols.

Responsibilities

  • Analyze firmware packages and hardware specs for compatibility and reliability.
  • Investigate and diagnose hardware failures, including grey failures, via testing.
  • Manage vendor relationships and RMA processes.
  • Collaborate with Data Center Operations Technicians to troubleshoot in real time.
  • Develop monitoring tools and scripts to detect hardware anomalies early.
  • Document failure modes, RCAs, AFR/reliability models, and RMA outcomes.
  • Participate in on-call rotations and incident response for Memphis data center.

Skills

Firmware analysis
Hardware specs
Python scripting
C/C++

Education

Bachelor's degree in Systems Engineering
Bachelor's degree in Electrical Engineering
Bachelor's degree in Computer Science

Tools

Logic analyzers
Diagnostics software
RMA tooling

Job description

SpaceXAI in Memphis seeks a Site Reliability Engineer focused on hardware to own firmware analysis, hardware specs, vendor relations, and failure analysis for our data center fleet.

You will diagnose issues, push for reliable hardware, and contribute to a team knowledge base. The role requires hands-on engineering, strong debugging, and scripting in Python or Bash to automate tasks. Collaboration with operations technicians is essential.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Data Center Hardware Reliability Engineer (Firmware)
Data Center Hardware Reliability Engineer (Firmware)

xAI • Memphis (TN)

On-site
USD 120,000 - 160,000
Hardware SRE: Firmware, Failures & Data Center Reliability
Hardware SRE: Firmware, Failures & Data Center Reliability

SpaceXAI • Memphis (TN)

On-site
USD 90,000 - 130,000
Hardware SRE: Data Center Reliability & Firmware
Hardware SRE: Data Center Reliability & Firmware

Xai • Southaven (MS)

On-site
USD 90,000 - 140,000
Hardware Reliability & Failure Analysis Engineer
Hardware Reliability & Failure Analysis Engineer

Xai Limited • Southaven (MS)

On-site
USD 85,000 - 110,000
Hardware SRE: Data Center Reliability & Firmware
Hardware SRE: Data Center Reliability & Firmware

SpaceXAI • Southaven (MS)

On-site
USD 120,000 - 180,000
Data Center Hardware SRE — Reliability & Firmware Expert
Data Center Hardware SRE — Reliability & Firmware Expert

SpaceXAI • Memphis (TN)

On-site
USD 110,000 - 150,000
Hardware Reliability & Failure Analysis Engineer
Hardware Reliability & Failure Analysis Engineer

SpaceXAI • Southaven (MS)

On-site
USD 90,000 - 130,000
Hardware Failure & Reliability Engineer
Hardware Failure & Reliability Engineer

SpaceXAI • Memphis (TN)

On-site
USD 90,000 - 140,000
Site Reliability Engineer, Data Center - Memphis
Site Reliability Engineer, Data Center - Memphis

SpaceXAI • Memphis (TN)

On-site
USD 110,000 - 150,000
Site Reliability Engineer, Data Center - Memphis
Site Reliability Engineer, Data Center - Memphis

SpaceXAI • Southaven (MS)

On-site
USD 120,000 - 180,000