HPC Specialist

Arcadion

Ottawa

On-site

CAD 80,000 - 110,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

Arcadion is seeking an HPC Specialist in Ottawa, Ontario, responsible for designing and optimizing high-performance computing systems for various applications, including scientific research and AI/ML workloads. The ideal candidate will have 3-7 years of relevant experience, familiar with tools like Slurm and NVIDIA GPUs. A degree in Computer Science or Engineering is required, along with certifications in HPC. This role offers opportunities to work on cutting-edge computing projects in a dynamic environment.

Qualifications

  • 3-7 years of experience in HPC environments.
  • Experience supporting AI/ML teams is a major asset.
  • Certifications such as AWS Certified HPC Specialist or Linux+ are preferred.

Responsibilities

  • Design and deploy scalable HPC clusters.
  • Manage Linux-based compute nodes and job schedulers.
  • Optimize performance and manage AI pipelines.

Skills

HPC cluster design
Linux management
Performance tuning
Cloud HPC integration
AI/ML workload support
Security best practices

Education

Bachelor’s or Master’s in Computer Science or related field

Tools

Slurm
PBS
CUDA
TensorFlow
Kubernetes
AWS ParallelCluster

Job description

HPC Specialist – Role Overview

Arca dion is seeking an HPC (High-Performance Computing) Specialist responsible for the design, deployment, optimization, and management of high-performance computing systems, often used in scientific research, engineering simulations, AI/ML workloads, and large-scale data analytics.

Core Responsibilities
  1. Architecture & System Design
    • Design scalable HPC clusters (on-prem, cloud, or hybrid)
    • Choose appropriate CPUs, GPUs, interconnects (e.g., InfiniBand), and storage
    • Configure Slurm, PBS, or OpenHPC job schedulers
  2. Cluster Deployment & Maintenance
    • Install and manage Linux-based compute nodes
    • Maintain job schedulers and resource managers
    • Integrate monitoring tools (Prometheus, Grafana, Nagios)
  3. Performance Tuning & Optimization
    • Benchmark workloads and tune for performance (e.g., MPI, CUDA, OpenMP)
    • Optimize I/O and inter-node communication
    • Ensure efficient job execution and queue handling
  4. Cloud & Hybrid HPC Integration
    • Deploy and manage cloud-based HPC environments (Azure CycleCloud, AWS ParallelCluster, Google Cloud HPC Toolkit)
    • Optimize workload portability and orchestration (e.g., Singularity, Kubernetes with KubeFlow or Volcano)
  5. AI/ML & GPU Workload Support
    • Manage AI pipelines that require HPC acceleration (e.g., LLM training)
    • Optimize GPU usage (NVIDIA A100/H100, AMD MI300)
    • Interface with TensorFlow, PyTorch, and HPCML tools
  6. Security & Compliance
    • Implement security best practices for multi-user environments
    • Support data governance for sensitive or regulated workloads
    • Maintain audit trails and role-based access control
  7. User & Application Support
    • Assist researchers and data scientists with job submissions and optimizationDevelop documentation, training materials, and run code validation sessions
Technical Skills & Tools
  • Schedulers: Slurm, PBS, Torque, LSF
  • HPC OS & Config: RHEL/CentOS, Rocky, Ubuntu Server
  • HPC File Systems: Lustre, BeeGFS, GPFS
  • Parallel Computing: MPI, OpenMP, CUDA
  • Monitoring/Telemetry: Prometheus, Grafana, Ganglia
  • Cloud HPC: AWS HPC, Azure CycleCloud, GCP HPC Toolkit
  • Containers: Singularity, Apptainer, Docker, Kubernetes
  • AI/ML Support: PyTorch, TensorFlow, Horovod, MLFlow
  • DevOps Tools: Ansible, Terraform, Git, Jenkins
Qualifications
  • Bachelor’s or Master’s in Computer Science, Engineering, Physics, or a related technical field
  • 3–7 years of experience in HPC environments
  • Experience supporting AI/ML teams is a major asset
  • Certifications: NVIDIA DLI, AWS Certified HPC Specialist, Linux+ or RHCE
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

System Administrator
System Administrator

MGIS Inc. • Canada

On-site
CAD 80,000 - 100,000
Senior AI Infrastructure Engineer — HPC & Compute Clusters
Senior AI Infrastructure Engineer — HPC & Compute Clusters

Veeda AI • Toronto

On-site
CAD 100,000 - 150,000
Member of Technical Staff - AI Infrastructure
Member of Technical Staff - AI Infrastructure

Veeda AI • Toronto

On-site
CAD 120,000 - 165,000
HPC Specialist
HPC Specialist

DRW Holdings, LLC. • Montreal (administrative region)

On-site
CAD 100,000 - 130,000
Site Reliability Engineer, AI/ML Infrastructure
Site Reliability Engineer, AI/ML Infrastructure

Boson AI • Toronto

On-site
CAD 100,000 - 130,000
HPC Specialist
HPC Specialist

P2P • Montreal (administrative region)

On-site
CAD 90,000 - 120,000
HPC Engineer
HPC Engineer

Wyatt Partners • Toronto

On-site
CAD 90,000 - 130,000
HPC AI Engineer, Frontier, NSCC
HPC AI Engineer, Frontier, NSCC

A*STAR Research • Dartmouth

On-site
CAD 80,000 - 100,000
HPC AI Engineer, Frontier, NSCC
HPC AI Engineer, Frontier, NSCC

A*STAR Research • Canada

On-site
CAD 80,000 - 110,000
Kubernetes & HPC Platform Engineer – Trading
Kubernetes & HPC Platform Engineer – Trading

Hunter Bond • Toronto

On-site
CAD 120,000 - 250,000