A tech-focused company in San Francisco seeks candidates with expertise in AI simulation development. The role emphasizes optimizing training efficiency, enhancing GPU performance, and ensuring low-latency inference. Applicants should be proficient in methodologies for gradient checkpointing, Nsight profiling, and job management tools like SLURM. The company values in-person collaboration in its dynamic team environment, providing opportunities for innovation and cutting-edge technology implementation.
Responsibilities
Optimize training efficiency with ML techniques.
Enhance GPU and kernel performance for AI models.
Implement inference optimization strategies for low-latency serving.
Ensure infra reliability with job management tools.
Skills
Dataloaders, fusion, activation remat
Gradient checkpointing
Nsight profiling
Triton/CUDA kernels
Quantization (GPTQ/AWQ)
Tools
SLURM
Kubernetes
Job description
A tech-focused company in San Francisco seeks candidates with expertise in AI simulation development. The role emphasizes optimizing training efficiency, enhancing GPU performance, and ensuring low-latency inference. Applicants should be proficient in methodologies for gradient checkpointing, Nsight profiling, and job management tools like SLURM. The company values in-person collaboration in its dynamic team environment, providing opportunities for innovation and cutting-edge technology implementation.