ML Systems Engineer: Cloud‑Scale Training Infra

Basis Research Institute

New York (NY)

On-site

USD 150,000 - 200,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Benefits offered by this job

Competitive salary
Collaborative work environment
In-person events

Job summary

A nonprofit AI research organization in New York City seeks a full-time ML Systems Engineer. This role involves managing distributed training infrastructure, debugging complex issues, and optimizing cloud resources to enhance operational efficiency. Ideal candidates will have expertise in ML systems and cloud administration. Join a team focused on solving impactful problems through advanced AI infrastructure.

Qualifications

  • Expertise in managing distributed training jobs across multiple GPUs.
  • Strong knowledge of debugging numerical instabilities in large-scale training.
  • Experience in cloud infrastructure management.

Responsibilities

  • Own and maintain the distributed training infrastructure.
  • Debug and resolve various training failures efficiently.
  • Profile and optimize training performance.

Skills

ML systems engineering
Cloud administration
Distributed training frameworks
Debugging skills
Documentation and knowledge sharing
Autonomous working

Tools

PyTorch
JAX
AWS
GCP
Azure
Terraform
Kubernetes

Job description

A nonprofit AI research organization in New York City seeks a full-time ML Systems Engineer. This role involves managing distributed training infrastructure, debugging complex issues, and optimizing cloud resources to enhance operational efficiency. Ideal candidates will have expertise in ML systems and cloud administration. Join a team focused on solving impactful problems through advanced AI infrastructure.
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

ML Training Platform Engineer | Multi-Cloud & Decentralized
ML Training Platform Engineer | Multi-Cloud & Decentralized

Pluralis Research • San Francisco (CA)

Remote
USD 120,000 - 160,000
ML Systems Engineer - Scalable Training & Inference
ML Systems Engineer - Scalable Training & Inference

Scale AI, Inc. • New York (NY)

On-site
USD 189,000 - 237,000
Equity
Benefits
Commuter stipend
Senior ML Systems Engineer: Scalable Training Frameworks
Senior ML Systems Engineer: Scalable Training Frameworks

Cohere • San Francisco (CA)

Hybrid
USD 150,000 - 180,000
LLM Systems Engineer & Research
LLM Systems Engineer & Research

Scale AI, Inc. • New York (NY)

On-site
USD 189,000 - 237,000
Comprehensive health coverage
Dental and vision coverage
Retirement benefits
+3
ML Systems Engineer: Scalable Training & Realtime Inference
ML Systems Engineer: Scalable Training & Realtime Inference

Jobzhr • New York (NY)

On-site
USD 180,000 - 280,000
ML Infra Engineer — Scalable Training Systems
ML Infra Engineer — Scalable Training Systems

Monograph • San Francisco (CA)

On-site
USD 120,000 - 160,000
ML Systems Engineer for Scalable Distributed Training
ML Systems Engineer for Scalable Distributed Training

Susquehanna International Group • Bala Cynwyd (PA)

On-site
USD 140,000 - 210,000
ML Systems Engineer: Low-Latency RL Training Infra
ML Systems Engineer: Low-Latency RL Training Infra

Periodic Labs • Menlo Park (CA)

On-site
USD 300,000 - 400,000
Staff ML Systems Engineer — Distributed Training at Scale
Staff ML Systems Engineer — Distributed Training at Scale

RadixArk • Palo Alto (CA)

On-site
USD 120,000 - 160,000
Comprehensive benefits
Flexible work arrangements
Senior ML Systems Engineer – LLM Infra & Governance
Senior ML Systems Engineer – LLM Infra & Governance

TRM Labs • San Francisco (CA)

On-site
USD 200,000 - 240,000
High-impact work
Competitive salary
Equity plan