Hiring.Camp

Solutions Architect, Inference Deployments

Nvidia

·

Jan 9, 2026

Location
Santa Clara, CA,US, US
Type
Full-time
Department
Engineering
Source
Eightfold

Description

Help customers craft, deploy, and maintain scalable, GPU-accelerated inference pipelines on Kubernetes for large language models (LLMs) and generative AI workloads. Enhance performance tuning using TensorRT/TensorRT-LLM, NVIDIA NIM, and Triton Inference Server to improve GPU utilization and model efficiency. Collaborate with multi-functional teams (engineering, product) and offer technical mentorship to customers implementing AI at scale. Architect zero-downtime deployments, autoscaling (e.g., HPA or equivalent experience with custom metrics), and integration with cloud-native tools (e.g., OpenTelemetry, Prometheus, Grafana). Troubleshoot sophisticated GPU orchestration, optimize with Multi-Instance GPU (MIG), and ensure efficient utilization in Kubernetes environments. Experience architecting GPU allocation using NVIDIA GPU Operator and NVIDIA NIM Operator.

Skills

Kubernetes

Similar Jobs

5

Senior Solutions Architect, Inference Networking ISV Enablement

Nvidia · US, CA, Santa Clara, United States of America

3 months ago

Solutions Architect, Inference Deployments

Nvidia · US, CA, Santa Clara, United States of America

4 months ago

Solutions Architect, Inference Deployments

Nvidia · Santa Clara, CA,US, US

4 months ago

Solutions Architect, Inference Deployments

Nvidia · US, CA, Santa Clara, United States of America

6 months ago

Solutions Architect, Cloud Inference Services

Nvidia · Zürich, ZH,CH, CH +2

2 months ago
Solutions Architect, Inference Deployments at Nvidia | Hiring.Camp