Pessoa Engenheira de HPC & AI Infrastructure - Sênior

Vagas Instituto de Pesquisas Eldorado

Brasília

Presencial

BRL 240 000 - 420 000

Tempo integral

Há 9 dias
Gerador de candidaturas

Recebe uma resposta deste empregador — um currículo e uma carta de apresentação adaptados exatamente ao que estão a contratar.

Ultrapassa os filtros ATS

Resumo da oferta

O Instituto de Pesquisas Eldorado procura profissional sênior para atuar na arquitetura, administração, automação e otimização de ambientes HPC e infraestrutura para IA/Deep Learning. Requer experiência prática em Linux, cluster e troubleshooting, com foco em LiCO, Slurm e GPUs.

O candidato trabalhará com LiCO, Open OnDemand, Run:AI ou Kubernetes para HPC, além de automação com Ansible, Shell e Python. Envolvimento com pesquisadores e engenheiros em workloads complexos é esperado.

Qualificações

  • Formação completa em área relacionada a computação.
  • Experiência sênior em Linux, preferencialmente RHEL/Rocky/Ubuntu Server.
  • Domínio em administração e troubleshooting de Linux em ambientes de alta performance.
  • Experiência avançada em Slurm e gestão de clusters HPC.
  • Sólidos conhecimentos de Shell, Python, Ansible e Git.
  • Prática com storage paralelo (Lustre, BeeGFS, GPFS/Spectrum Scale ou equivalente).
  • Conhecimento de redes, LDAP/FreeIPA/Kerberos ou similar.
  • Capacidade de atuar de forma independente em troubleshooting complexo e otimização de workloads MPI/OpenMP/IA.

Responsabilidades

  • Implantar e otimizar ambientes de virtualização (QEMU, Proxmox, Hyper-V, VMware).
  • Administrar Linux desde configuração até tuning e automação.
  • Otimizar clusters HPC com Slurm ou PBS/LSF.
  • Gerenciar LiCO e templates de IA, monitoramento de infraestrutura.
  • Conhecer Open OnDemand, Run:AI ou Kubernetes para HPC/IA.
  • Automatizar provisionamento com Ansible, Shell e Python.
  • Gerenciar GPUs (CUDA, DCGM, MIG, NVLink, NCCL).
  • Monitorar CPU/GPU/memória/storage/rede e identificar gargalos.
  • Colaborar com pesquisadores para workloads MPI/OpenMP/IA.
  • Contribuir para segurança, documentção e governança da arquitetura HPC.

Conhecimentos

Shell scripting
Python
Ansible
Git

Formação académica

Graduação em Ciência da Computação / Engenharia de Software / Sistemas de Informação

Ferramentas

QEMU
Proxmox
Hyper-V
VMware
Slurm
PBS Professional
LSF
LiCO
Open OnDemand
Run:AI
Kubernetes para HPC

Descrição da oferta de emprego

Job description

PcDs são sempre bem-vindas.

Buscamos um(a) profissional sênior para atuar na arquitetura, administração, automação, sustentação e otimização de ambientes HPC e infraestrutura para IA/Deep Learning.

A posição exige forte experiência prática em ambientes Linux, administração de cluster e troubleshooting de ambientes de alta performance, atuando desde o sistema operacional, rede, storage, GPUs, headnode e tunning de aplicações cientificas e corporativas.

Main responsibilities
  • Implantar, administrar e otimizar ambientes de virtualização free e de mercado, como QEMU, Proxmox, Hyper-V, VMWare.
  • Administração de sistemas operacionais Linux, desde configuração, hardening, troubleshooting, performance tuning, serviços, kernel, drivers, filesystem, networking e automação.
  • Maximizar a eficiência de clusters de computação de alto desempenho através da configuração de partições e políticas de prioridade utilizando o Slurm ou soluções de mercado como PBS Professional e LSF
  • Vivência no ecossistema LiCO para gerenciamento de clusters, monitoramento de infraestrutura e gerenciamento de templates de IA.
  • Conhecimento em alternativas ao LiCO, familiaridade com ferramentas concorrentes de portais e orquestração de HPC/IA, como Open OnDemand, Run:ai, ou frameworks baseados em Kubernetes para HPC
  • Automatizar provisionamento e operação de infraestrutura utilizando Ansible, Shell Script e Python, aplicando práticas de infrastructure as code.
  • Administrar nós com GPUs NVIDIA/AMD, incluindo drivers CUDA, DCGM, MIG, NVLink, NCCL.
  • Realizar monitoramento constante de infraestrutura e aplicações, identificando gargalos de CPU, GPU, memória, storage e rede.
  • Atuar junto a pesquisadores e engenheiros no diagnóstico e otimização de workloads MPI/OpenMP, IA e Deep Learning.
  • Contribuir para segurança, documentação, capacity planning, governança e evolução da arquitetura HPC.
Requirements and skills
  • Graduação completa em Ciência da Computação, Engenharia de Software, Sistemas de Informação, Engenharia da Computação ou áreas correlatas;
  • Experiênciasênior e hands-on em Linux, preferencialmente RHEL/Rocky/ Ubuntu Server
  • Domíniode administração e troubleshooting Linux em ambientes de alta performancee/ou larga escala.
  • Experiênciaavançada na administração de Slurm
  • Forte conhecimento de Shell Scripting, Python, Ansiblee Git.
  • Experiênciaprática com pelo menos uma solução de storage paralelo (Lustre, BeeGFS,GPFS/Spectrum Scale ou equivalente).
  • Conhecimentossólidos de redes, Linux e autenticação centralizada (LDAP/FreeIPA/Kerberosou equivalente).
  • Capacidadede atuar de forma independente em troubleshooting complexo, análise deperformance e resolução de problemas de infraestrutura.
Additional information

“O Instituto de Pesquisas Eldorado valoriza um ambiente diversificado e se orgulha de ser uma organização que oferece oportunidades de forma igualitária. Todos que se candidatarem serão avaliados, independentemente de raça, deficiência, cor, religião, sexo, identidade ou expressão de gênero, orientação sexual, nacionalidade ou idade”.

Obtém a tua avaliação gratuita e confidencial do currículo.
ou arrasta e larga o ficheiro aqui.
Similar jobs

Ofertas semelhantes que vale a pena comparar

Engenheiro de MLOps Sênior
Engenheiro de MLOps Sênior

Extractta • Brasil

Presencial
BRL 180 000 - 340 000
Analista de Software/Mentor de Tecnologia - Java, Backend e IA
Analista de Software/Mentor de Tecnologia - Java, Backend e IA

Instituto de Pesquisas ELDORADO • Campinas

Presencial
BRL 112 000 - 156 000
[Banco de Talentos] Pessoa Desenvolvedora Go
[Banco de Talentos] Pessoa Desenvolvedora Go

Instituto de Pesquisas ELDORADO • Porto Alegre

Presencial
BRL 180 000 - 260 000
Staff Infrastructure Engineer
Staff Infrastructure Engineer

LionX • São Paulo

Presencial
Engenheiro de AI Sênior | Remoto
Engenheiro de AI Sênior | Remoto

DHARMA-AI • Brasil

Teletrabalho
Trabalho remoto
Ambiente inovador
Oportunidades de desenvolvimento profissional
Engenharia de Machine Learning e Inteligência Artificial (Sênior) | Remota - 135805
Engenharia de Machine Learning e Inteligência Artificial (Sênior) | Remota - 135805

GFT Brasil • São Paulo

Presencial
BRL 220 000 - 380 000
Cartão benefícios
Bolsas de estudo
Incentivo à certificação
+8
Analista IA - LLMs e Machine Learning
Analista IA - LLMs e Machine Learning

Instituto de Pesquisas ELDORADO • Campinas

Presencial
BRL 180 000 - 260 000
Analista de Software/Mentor de Tecnologia - Java, Backend e IA
Analista de Software/Mentor de Tecnologia - Java, Backend e IA

Vagas Instituto de Pesquisas Eldorado • Campinas

Presencial
BRL 134 000 - 201 000
Especialista em infraestrutura
Especialista em infraestrutura

Empresa Confidencial • São Paulo

Presencial
BRL 220 000 - 360 000
Vale Refeição no cartão Flash
Vale Alimentação no cartão Flash
Assistência Médica SulAmerica
+9
Pessoa Engenheira de Dados
Pessoa Engenheira de Dados

Instituto de Pesquisas ELDORADO • Manaus

Presencial
BRL 167 000 - 257 000