AI Data Researcher Python + LLMs + SQL (USD-based pay) - Back-End

Programathor

United States

Remote

BRL 120,000 - 180,000

Full time

14 days+
Application generator

A complete application in a minute — tailored resume and cover letter, ready to send.

Get past ATS filters

Job summary

A ProgramaThor está recrutando para fortalecer sua equipe de avaliação de LLMs e RAG no Brasil. Você irá liderar a qualidade do sistema de avaliação, realizar avaliações estruturadas e identificar falhas em recuperação, ranking e prompts.

Requisitos incluem 4+ anos de experiência, Python, SQL e conhecimento de LLMs. Buscamos alguém proativo, com excelente comunicação em inglês, capaz de manter datasets de alta qualidade e colaborar com Produto e Engenharia.

Qualifications

  • 4+ anos de pesquisa de dados, analytics aplicado ou experiência em avaliação.
  • Proeficiência em Python e SQL.
  • Conhecimento de LLMs, prompting, RAG e conceitos de recuperação.
  • Capacidade de manter conjuntos de dados de avaliação com qualidade e versionamento.
  • Experiência em desenhar experimentos controlados com métricas e critérios de sucesso.

Responsibilities

  • Possuir a qualidade do sistema de avaliação de LLM e RAG.
  • Conduzir avaliações estruturadas de LLM e RAG e análise de causa raiz.
  • Distinguir falhas de recuperação, ranking, fonte, prompt, modelo e citação.
  • Manter datasets de avaliação com qualidade, versionamento e cobertura.
  • Refinar prompts, rubricas e fluxos de avaliação com LLM como juiz.
  • Automatizar análises repetitivas com Python, SQL, notebooks, APIs.
  • Comunicar achados e ações para Produto, Engenharia e liderança.

Skills

Claude Code
Python
SQL

Education

Bacharelado em Engenharia da Computação, Ciência da Computação ou equivalente

Job description

Habilidades
Claude Code, Python, SQL

O que nós buscamos
What they'll work on Own the quality of the LLM and Retrieval-Augmented Generation (RAG) evaluation system Run structured LLM and RAG evaluations and perform root-cause analysis Distinguish between retrieval, ranking, source, prompt, model, and citation failures Maintain evaluation datasets, including quality reviews, versioning, coverage, and new production cases Refine prompts, judge rubrics, and LLM-as-a-judge workflows Design controlled experiments with clear baselines, metrics, and success criteria Investigate practical solutions to recurring RAG challenges Automate repetitive analysis (e.g., Python, SQL, notebooks, APIs) Communicate findings and recommended actions to Product, Engineering, and leadership Nice-to-haves Startup experience Experience with LLM-as-a-judge evaluation Familiarity with (LangSmith, Ragas, DeepEval, Braintrust, Evidently, etc.) Knowledge of embeddings, search, reranking, or hybrid retrieval Experience creating evaluation rubrics, dashboards, or lightweight automation Bachelor's Degree in Computer Engineering, Computer Science, or equivalent

Principais responsabilidades
Must-haves 4+ years of data research, applied analytics, or evaluation experience Experience with LLMs, prompting, RAG, and retrieval concepts Proficiency with Python Proficiency with SQL Experience in maintaining high-quality datasets or evaluation programs Ability to navigate ambiguous problems independently Strong communication skills in both spoken and written English

Descrição da empresa
A ProgramaThor é uma plataforma de recrutamento focada em desenvolvedores. Através do nosso algoritmo, identificamos as melhores combinações entre candidato-vaga, ajudando-os simultaneamente. Para os desenvolvedores, mostramos diversas vagas que combinam com seu perfil e possibilitamos a candidatura através de um clique. Para a empresas, apresentamos diversos programadores interessados e que combinam com sua oportunidade de trabalho.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Full-stack & AI Engineer (USD-based pay) - Full Stack
Full-stack & AI Engineer (USD-based pay) - Full Stack

Programathor • United States

Remote
BRL 67,000 - 112,000
LLM Data Researcher — Python & SQL | RAG Evaluation
LLM Data Researcher — Python & SQL | RAG Evaluation

Programathor • United States

Remote
BRL 120,000 - 180,000
Data Architect SQL + MySQL + NoSQL (USD-based pay) - Back-End
Data Architect SQL + MySQL + NoSQL (USD-based pay) - Back-End

Programathor • United States

Remote
BRL 201,000 - 357,000
Pessoa Cientista de Dados – Sênior (Remoto)
Pessoa Cientista de Dados – Sênior (Remoto)

INSTITUTO ATL NTICO • United States

Remote
USD 120,000 - 180,000
Pessoa Analista de Teste – Sênior
Pessoa Analista de Teste – Sênior

INSTITUTO ATL NTICO • United States

Remote
USD 65,000 - 90,000
Pessoa Engenheira de Dados Sênior
Pessoa Engenheira de Dados Sênior

Vagas Internas • United States

Remote
USD 90,000 - 130,000
RA | Fluent English | Remote | U.S -HIK
RA | Fluent English | Remote | U.S -HIK

bluedotbpo • California City (CA)

Remote
USD 6,400 - 8,700
Remoto 100%
Contrato de longo prazo
Treinamento contínuo
+3
Pessoa Desenvolvedora FullStack – Sênior (Remota)
Pessoa Desenvolvedora FullStack – Sênior (Remota)

INSTITUTO ATL NTICO • United States

Remote
USD 90,000 - 150,000
Analista Programador
Analista Programador

Trabalha Brasil • United States

Remote
USD 100,000 - 150,000
Senior AI Engineer - Remote (LLMs, Data Pipelines)
Senior AI Engineer - Remote (LLMs, Data Pipelines)

Casado • United States

Remote
USD 60,000 - 100,000