Cloud Data Engineer: Spark & Hive Data Pipelines

Tata Consultancy Services

Irving (TX)

On-site

USD 90,000 - 110,000

Full time

4 days ago
Be an early applicant
Application generator

A complete application in a minute — tailored resume and cover letter, ready to send.

Get past ATS filters

Job summary

Tata Consultancy Services in Irving, TX is seeking a Data Engineer to design, build, and optimize scalable data pipelines using Spark, PySpark, and Hive on the Cloudera platform. The role focuses on reliability, speed, and efficiency to support BI and advanced analytics initiatives.

You will develop ETL/ELT processes, optimize storage with Hive and cloud data lakes, and collaborate with data scientists and analysts to translate business requirements into robust data solutions.

Qualifications

  • Big Data Frameworks Expertise: Apache Spark architecture, drivers, executors, and DAGs.
  • Advanced Programming: Python and PySpark for complex data transformations.
  • Querying & Schema Management: HiveQL and ANSI SQL with partitioning and schema definition.
  • Optimized Storage Formats: Parquet, ORC, and Avro proficiency.
  • Data Warehousing Fundamentals: Dimensional modeling and Data Lakes concepts.

Responsibilities

  • Data Pipeline Development & Maintenance: Design, build, and maintain scalable ETL/ELT pipelines with PySpark and Spark SQL, Hive.
  • Data Warehousing & Storage Optimization: Manage data layout, partitioning, and indexing in Hive and cloud data lakes.
  • Performance Tuning & Optimization: Identify bottlenecks in Spark jobs, analyze with Spark UI, manage data skew and memory.
  • Diverse Data Integration: Ingest high-volume structured and unstructured data into the data ecosystem.
  • Automated Workflow Orchestration: Use Airflow or platform schedulers to ensure timely data delivery.
  • Strategic Collaboration: Work with data scientists, analysts, and cross-functional teams to translate requirements.

Skills

Apache Spark
PySpark
HiveQL
ANSI SQL
Python

Education

Bachelor's degree in Computer Science

Tools

Git
Jenkins
AWS EMR
Databricks
HBase
MongoDB

Job description

Tata Consultancy Services in Irving, TX is seeking a Data Engineer to design, build, and optimize scalable data pipelines using Spark, PySpark, and Hive on the Cloudera platform. The role focuses on reliability, speed, and efficiency to support BI and advanced analytics initiatives.

You will develop ETL/ELT processes, optimize storage with Hive and cloud data lakes, and collaborate with data scientists and analysts to translate business requirements into robust data solutions.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Data Engineer: Scalable Pipelines with Spark & Hive
Data Engineer: Scalable Pipelines with Spark & Hive

Tata Consultancy Services • Irving (TX)

On-site
USD 125,000 - 140,000
Spark Data Engineer (PySpark) - Cloud ETL & Pipelines
Spark Data Engineer (PySpark) - Cloud ETL & Pipelines

Tata Consultancy Services • Irving (TX)

On-site
USD 90,000 - 120,000
Discretionary Annual Incentive
Medical Coverage (Health, Dental & Vis
401K Plan
+1
Senior Data Engineer: Spark & Cloud Pipelines
Senior Data Engineer: Spark & Cloud Pipelines

Tata Consultancy Services • Irving (TX)

On-site
USD 90,000 - 110,000
Discretionary Annual Incentive.
Comprehensive Medical Coverage
401K Plan
+1
Senior PySpark Engineer | Scalable ETL Pipelines & Cloud
Senior PySpark Engineer | Scalable ETL Pipelines & Cloud

Tata Consultancy Services • Irving (TX)

On-site
USD 90,000 - 150,000
Discretionary Annual Incentive
Comprehensive Medical Coverage
Parental Leaves
+4
Senior Data Engineer: PySpark, Airflow & GCP
Senior Data Engineer: PySpark, Airflow & GCP

Tata Consultancy Services • Sunnyvale (CA)

On-site
USD 110,000 - 150,000
Discretionary Annual Incentive
Comprehensive Medical Coverage
Family Support: Parental Leaves
+4
Teradata Data Engineer: SQL, Spark & Data Pipelines
Teradata Data Engineer: SQL, Spark & Data Pipelines

Tata Consultancy Services • Charlotte (NC)

On-site
USD 100,000 - 105,000
Discretionary Annual Incentive
Comprehensive Medical Coverage
401K Plan
+2
Big Data Engineer: Spark, ETL & Data Quality
Big Data Engineer: Spark, ETL & Data Quality

eNcloud Services LLC • Katy (TX)

On-site
USD 100,000 - 170,000
AWS PySpark Data Engineer: Scalable Data Pipelines
AWS PySpark Data Engineer: Scalable Data Pipelines

LTM • Irving (TX)

On-site
USD 120,000 - 180,000
Medical plan
Disability coverage
401(k) match
+3
Data Engineer
Data Engineer

Tata Consultancy Services • Irving (TX)

On-site
USD 125,000 - 140,000
Senior Data Platform Engineer — Lakehouse & AI Pipelines
Senior Data Platform Engineer — Lakehouse & AI Pipelines

Tata Consultancy Services • San Jose (CA)

On-site
USD 80,000 - 115,000
Discretionary Annual Incentive
Medical Coverage
Parental Leaves
+2