Job description
PcDs são sempre bem-vindas.
Buscamos um(a) profissional sênior para atuar na arquitetura, administração, automação, sustentação e otimização de ambientes HPC e infraestrutura para IA/Deep Learning.
A posição exige forte experiência prática em ambientes Linux, administração de cluster e troubleshooting de ambientes de alta performance, atuando desde o sistema operacional, rede, storage, GPUs, headnode e tunning de aplicações cientificas e corporativas.
Main responsibilities
- Implantar, administrar e otimizar ambientes de virtualização free e de mercado, como QEMU, Proxmox, Hyper-V, VMWare.
- Administração de sistemas operacionais Linux, desde configuração, hardening, troubleshooting, performance tuning, serviços, kernel, drivers, filesystem, networking e automação.
- Maximizar a eficiência de clusters de computação de alto desempenho através da configuração de partições e políticas de prioridade utilizando o Slurm ou soluções de mercado como PBS Professional e LSF
- Vivência no ecossistema LiCO para gerenciamento de clusters, monitoramento de infraestrutura e gerenciamento de templates de IA.
- Conhecimento em alternativas ao LiCO, familiaridade com ferramentas concorrentes de portais e orquestração de HPC/IA, como Open OnDemand, Run:ai, ou frameworks baseados em Kubernetes para HPC
- Automatizar provisionamento e operação de infraestrutura utilizando Ansible, Shell Script e Python, aplicando práticas de infrastructure as code.
- Administrar nós com GPUs NVIDIA/AMD, incluindo drivers CUDA, DCGM, MIG, NVLink, NCCL.
- Realizar monitoramento constante de infraestrutura e aplicações, identificando gargalos de CPU, GPU, memória, storage e rede.
- Atuar junto a pesquisadores e engenheiros no diagnóstico e otimização de workloads MPI/OpenMP, IA e Deep Learning.
- Contribuir para segurança, documentação, capacity planning, governança e evolução da arquitetura HPC.
Requirements and skills
- Graduação completa em Ciência da Computação, Engenharia de Software, Sistemas de Informação, Engenharia da Computação ou áreas correlatas;
- Experiênciasênior e hands-on em Linux, preferencialmente RHEL/Rocky/ Ubuntu Server
- Domíniode administração e troubleshooting Linux em ambientes de alta performancee/ou larga escala.
- Experiênciaavançada na administração de Slurm
- Forte conhecimento de Shell Scripting, Python, Ansiblee Git.
- Experiênciaprática com pelo menos uma solução de storage paralelo (Lustre, BeeGFS,GPFS/Spectrum Scale ou equivalente).
- Conhecimentossólidos de redes, Linux e autenticação centralizada (LDAP/FreeIPA/Kerberosou equivalente).
- Capacidadede atuar de forma independente em troubleshooting complexo, análise deperformance e resolução de problemas de infraestrutura.
Additional information
“O Instituto de Pesquisas Eldorado valoriza um ambiente diversificado e se orgulha de ser uma organização que oferece oportunidades de forma igualitária. Todos que se candidatarem serão avaliados, independentemente de raça, deficiência, cor, religião, sexo, identidade ou expressão de gênero, orientação sexual, nacionalidade ou idade”.