Na Confederação da Agricultura e Pecuária do Brasil - CNA contamos com um time de tecnologia com profissionais experientes.Profissional responsável por projetar, construir e manter pipelines de dados que alimentam tanto sistemas analíticos tradicionais (BI, relatórios) quanto soluções de Inteligência Artificial (busca semântica, RAG, treinamento e avaliação de modelos).
Requisitos Obrigatórios
- Nível superior completo em Engenharia de Dados, com especialização na área de TI.
- Experiência robusta em Linguagens: SQL avançado; Python (pandas, PySpark); shell scripting.
- Orquestração: Airflow ou similar; versionamento de pipelines.
- Processamento: Batch (Spark) e streaming (Kafka, Logstash); processamento distribuído.
- Armazenamento: Data warehouses (SQL Server, ClickHouse, Fabric); data lakes; formatos colunares (Parquet).
- Bancos de dados: SQL Server, PostgreSQL, bancos NoSQL/, bancos de busca (Elasticsearch/OpenSearch).
- Infraestrutura: Kubernetes, containers, CI/CD para pipelines de dados.
- Modelagem: Modelagem dimensional, Arquitetura Medalhão, qualidade e testes de dados.
- Observabildade e observabilidade de dados.
- Linux.
- API Rest.
- Conhecimento em banco de dados relacionais (DML, DDL, Postgres, SQL Server, Oracle).
- Utilizar ambiente e linguagens para manipulação de dados nos diversos modelos de SGBD.
Principais Atividades e Responsabilidades
- Projetar, monitorar e manter pipelines de ingestão, transformação e carga (ETL/ELT) em lote e streaming em ambiente on-premisses e nuvem (AWS).
- Garantir qualidade, linhagem e governança de dados.
- Modelar dados para consumo analítico e para consumo por sistemas de IA (chunking, embeddings, feature stores).
- Construir e operar pipelines específicos de IA: geração e atualização de embeddings, indexação em bancos vetoriais, preparação de datasets de treinamento/avaliação.
- Monitorar performance, custo e disponibilidade dos pipelines (observabilidade de dados)
- Colaborar com Engenharia de Software e Ciência de Dados na definição de contratos de dados e SLAs.
- Garantir segurança, privacidade e conformidade no uso de dados por modelos de IA (mascaramento, anonimização, controle de acesso).
- Projetar crescimento do ambiente de dados otimizando os recursos de infraestrutura.
Diferenciais Desejáveis
- Conhecimento prático em Apache Airflow para orquestração, monitoramento e automação de alertas de pipelines de ingestão de dados;
- Familiaridade com arquiteturas multiagentes de IA e o desenvolvimento de roteadores dinâmicos de agentes especializados;
- Práticas consolidadas de DevOps / DevSecOps e automação de alertas operacionais integrados com o Microsoft Teams e abertura automática de incidentes via Jira;
- Experiência no ecossistema de dados do agronegócio e alta disponibilidade de sistemas voltados ao produtor rural.
Benefícios
Assistência Médica e Odontológica, vale-transporte, tíquete alimentação/refeição, plano de previdência privada, seguro de vida corporativa e gratificação por desempenho.