Baseten
Baseten
Baseten 为部署机器学习和人工智能应用的企业提供模型推理基础设施。其平台专为快速、可扩展的服务而构建,结合了高吞吐量推理、快速部署、自动扩缩容、安全的企业级模型服务,以及对开源模型打包的支持。Baseten 帮助工程和机器学习团队应对模型基础设施的运营需求,使其能够专注于开发领域专属模型。公司业务涵盖人工智能、软件即服务和企业技术领域,团队规模为 11 至 50 人。

Baseten GPU 推理性能工程经理

在 AI 基础设施公司 Baseten 负责 GPU 推理性能工程。带领运行时优化、模型效率提升以及专业技术团队的发展。

描述

  • 通过定期一对一沟通、反馈、职业规划和绩效评估,管理、指导并培养推理性能工程师
  • 招聘 GPU 和推理工程师,同时营造协作型团队文化
  • 负责运行时性能路线图及其执行
  • 审查技术设计,指导性能分析与优化工作,并帮助工程师评估时间和内存使用情况
  • 将量化、投机解码、KV 缓存复用、分块预填充和自定义调度投入生产
  • 将性能提升转化为每 GPU 小时生成令牌数、利用率、延迟和成本方面的可量化改进
  • 让新的模型架构运行在新兴硬件上,并调优其性能
  • 与基础设施、推理平台、内核、模型 API 以及面向客户的团队协作,确定工作优先级、协调发布并交付改进
  • 建立有关质量、基准测试、卓越运营和事故响应的工程标准
  • 推进智能体推理优化、智能体内核、投机解码模型训练以及 Baseten Inference Stack 的发展

任职要求

  • 计算机科学、工程、数学或相关学科的学士、硕士或博士学位
  • 具备工程招聘、指导、反馈和绩效评估方面的管理经验
  • 具备在训练、推理或推荐系统中领导或密切支持 GPU 优化团队的经验
  • 深入了解 GPU 工作负载、架构和性能权衡
  • 熟悉 PyTorch、TensorRT 或 TensorRT-LLM 等机器学习库
  • 具备制定路线图并与团队交付复杂技术项目的能力
  • 具备出色的书面和口头沟通能力,能够协调跨团队利益相关者
  • 熟悉 vLLM、SGLang 或 TensorRT-LLM 等推理引擎
  • 具备应用量化、投机解码和连续批处理等大语言模型优化方法的经验
  • 具备使用 CUDA、Triton 或 CUTLASS 开发或处理 GPU 内核的经验
  • 具备在初创企业快速发展期间扩建工程团队的经验
  • 在转入管理岗位前,曾以性能工程师或系统工程师身份亲自参与相关工作

福利待遇

  • 具有竞争力的薪酬方案,并包含有意义的股权
  • 对于美国员工,为员工及其家属提供全面的医疗、牙科和视力保险
  • 灵活的带薪休假,包括全公司冬季休假
  • 带薪育儿假
  • 通过 Carrot 提供生育和家庭组建支持
  • 对于美国员工,提供由公司协助办理的 401(k) 计划
  • 有机会与众多机器学习初创企业合作并建立行业联系

相关职位