ai engineer for clinical trials

HireHi

United States

Remote

USD 120,000 - 180,000

Full time

10 days ago
Application generator

A complete application in a minute — tailored resume and cover letter, ready to send.

Get past ATS filters

Job summary

EPAM ищет инженера по данным для поддержки AI/GenAI в области Risk-Based Quality Management в клинических исследованиях. Ваша задача — строить RAG пайплайны, управлять векторными базами данными на AWS и разворачивать ETL/ELT-обработку неструктурированных клин. данных.

Требуется 5+ лет опыта, владение Python, SQL, Spark SQL и опытом работы с AWS OpenSearch, S3 и другими сервисами. Рассматриваются кандидаты с опытом в биофарме и навыками CI/CD; знание английского не ниже B2+ обязательно.

Qualifications

  • 5+ лет опыта масштабной инженерии данных
  • Эксперт в RAG-пайплайнах загрузки документов, включая чанкинг, встраивания и векторное индексирование
  • Опыт использования AWS OpenSearch в качестве векторной базы данных для RAG-воркфлоу
  • Продвинутый уровень Python, включая SQL и Spark SQL
  • Опыт трансформации неструктурированных данных (PDF, DOCX) для RAG/LLM
  • Знание AWS-сервисов: S3, Lambda, Glue, Athena, Bedrock, Step Functions, API Gateway, CloudWatch, DynamoDB
  • Знакомство с Docker
  • Уровень владения английским не ниже B2+
  • Желательно: биофарм/лабораторные данные, Snowflake, Pinecone, SageMaker processing, CI/CD (Jenkins, Git/Bitbucket), CDK/Terraform, стандарты клин. данных CDISC/ADaM/SDTM

Responsibilities

  • Спроектировать и построить RAG-пайплайны для загрузки документов по клинико-исследовательским данным
  • Управлять векторными базами данных в AWS OpenSearch для RAG-воркфлоу
  • Разрабатывать пакетные и стримовые ETL/ELT-пайплайны для неструктурированных данных
  • Разрабатывать и экспонировать API данных для потребления AI-приложениями
  • Оптимизировать стратегии чанкинга, генерацию встраиваний и производительность поиска
  • Обеспечивать качество данных, трассируемость и управление данными для AI/ML
  • Развертывать и поддерживать AWS-инфраструктуру данных
  • Сотрудничать с Data Scientists и Backend-разработчиками в рамках единой команды

Skills

Python
SQL
Spark SQL
RAG/LLM pipelines
Data pipelines

Tools

AWS OpenSearch
S3
Lambda
Glue
Athena
Bedrock
Step Functions
API Gateway
CloudWatch
DynamoDB
Docker

Job description

Описание: EPAM develops enterprise software products, open source solutions, and accelerators. The role supports AI/GenAI applications for Risk-Based Quality Management in clinical trials.


Задачи:


  • Design and build RAG document ingestion pipelines for clinical trial quality data

  • Build and manage vector databases using AWS OpenSearch for RAG-powered AI workflows

  • Develop batch and streaming ETL/ELT pipelines from scratch for unstructured clinical data

  • Build and expose data APIs for AI application consumption

  • Optimize chunking strategies, embedding generation, and retrieval performance for RAG architectures

  • Manage data quality, lineage, and governance for AI/ML data pipelines

  • Deploy and maintain AWS data infrastructure

  • Collaborate with Data Scientists and Backend Developers in an integrated pod team


Требования:


  • 5+ Years of hands-on data engineering experience at scale

  • Expertise in RAG document ingestion pipelines, including chunking, embedding, and vector indexing

  • Proficiency in AWS OpenSearch as a vector database for RAG workflows

  • Advanced proficiency in Python, including SQL and Spark SQL

  • Experience transforming unstructured data such as PDF and DOCX for RAG/LLM applications

  • Familiarity with AWS Services including S3, Lambda, Glue, Athena, Bedrock, Step Functions, API Gateway, CloudWatch, and DynamoDB

  • Knowledge of containerization with Docker

  • Ability to build custom pipelines from scratch beyond configuring out-of-the-box services

  • English proficiency at B2+ level

  • Nice to have: pharmaceutical or life sciences background, Snowflake, Pinecone, SageMaker processing jobs, CI/CD tools such as Jenkins and Git/Bitbucket, infrastructure tools such as CDK or Terraform, clinical data standards including CDISC, ADaM, and SDTM.


Условия:

No conditions specified

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Senior AI Data Engineer for Clinical Trials & RAG Pipelines
Senior AI Data Engineer for Clinical Trials & RAG Pipelines

HireHi • United States

Remote
USD 120,000 - 180,000
Senior AI Engineer with Spark, AWS Services
Senior AI Engineer with Spark, AWS Services

EPAM Systems Inc • United States

Remote
USD 150,000 - 210,000
Senior AI Engineer: AWS Data Pipelines & RAG (Spark)
Senior AI Engineer: AWS Data Pipelines & RAG (Spark)

EPAM Systems Inc • United States

Remote
USD 150,000 - 210,000
python developer in AI engineering
python developer in AI engineering

HireHi • United States

Remote
USD 38,000 - 67,000
ml engineer for enterprise risk assessment
ml engineer for enterprise risk assessment

HireHi • United States

Remote
USD 120,000 - 160,000
data engineer data integration
data engineer data integration

HireHi • United States

Remote
USD 120,000 - 180,000
data engineer in life sciences
data engineer in life sciences

HireHi • United States

Remote
USD 120,000 - 180,000
ai engineer
ai engineer

HireHi • United States

Remote
USD 140,000 - 190,000
—
ai engineer for internal AI applications
ai engineer for internal AI applications

HireHi • Spain (TX)

Hybrid
USD 120,000 - 180,000
ai engineer industrial diagnostics
ai engineer industrial diagnostics

HireHi • United States

Remote
USD 120,000 - 180,000
Remote work