A nonprofit AI research organization in New York City seeks a full-time ML Systems Engineer. This role involves managing distributed training infrastructure, debugging complex issues, and optimizing cloud resources to enhance operational efficiency. Ideal candidates will have expertise in ML systems and cloud administration. Join a team focused on solving impactful problems through advanced AI infrastructure.
Qualifications
Expertise in managing distributed training jobs across multiple GPUs.
Strong knowledge of debugging numerical instabilities in large-scale training.
Experience in cloud infrastructure management.
Responsibilities
Own and maintain the distributed training infrastructure.
Debug and resolve various training failures efficiently.
Profile and optimize training performance.
Skills
ML systems engineering
Cloud administration
Distributed training frameworks
Debugging skills
Documentation and knowledge sharing
Autonomous working
Tools
PyTorch
JAX
AWS
GCP
Azure
Terraform
Kubernetes
Job description
A nonprofit AI research organization in New York City seeks a full-time ML Systems Engineer. This role involves managing distributed training infrastructure, debugging complex issues, and optimizing cloud resources to enhance operational efficiency. Ideal candidates will have expertise in ML systems and cloud administration. Join a team focused on solving impactful problems through advanced AI infrastructure.