

Baseten은 머신러닝 및 AI 애플리케이션을 배포하는 기업을 위해 모델 추론 인프라를 제공합니다. 이 플랫폼은 높은 처리량의 추론, 신속한 배포, 자동 확장, 안전한 엔터프라이즈 모델 서빙, 오픈 소스 모델 패키징 지원을 결합해 빠르고 확장 가능한 서빙을 구현하도록 설계되었습니다. Baseten은 엔지니어링 및 머신러닝 팀이 모델 인프라 운영에 필요한 업무를 관리할 수 있도록 지원하여, 도메인별 모델 개발에 집중할 수 있게 합니다. 회사는 인공지능, SaaS, 엔터프라이즈 기술 분야에서 사업을 운영하며, 직원 수는 11~50명입니다.
Baseten GPU 추론 성능 엔지니어링 매니저
AI 인프라 기업 Baseten에서 GPU 추론 성능 엔지니어링을 이끕니다. 런타임 최적화, 모델 효율성 향상, 전문 기술 팀의 성장을 주도합니다.
설명
- 정기적인 일대일 면담, 피드백, 경력 계획, 성과 평가를 통해 추론 성능 엔지니어를 관리하고 멘토링하며 성장시킵니다
- GPU 및 추론 엔지니어를 채용하고 협업적인 팀 문화를 조성합니다
- 런타임 성능 로드맵과 실행을 총괄합니다
- 기술 설계를 검토하고 프로파일링 및 최적화 작업을 이끌며 엔지니어가 시간과 메모리 사용량을 평가하도록 지원합니다
- 양자화, 추측 디코딩, KV 캐시 재사용, 청크 프리필, 맞춤형 스케줄링을 프로덕션 환경에 적용합니다
- 성능 향상을 GPU 시간당 토큰 수, 사용률, 지연 시간, 비용의 측정 가능한 개선으로 연결합니다
- 새로운 모델 아키텍처를 신흥 하드웨어에 도입하고 성능을 조정합니다
- 인프라, 추론 플랫폼, 커널, 모델 API, 고객 대면 팀과 협업하여 우선순위를 정하고 출시를 조율하며 개선 사항을 제공합니다
- 품질, 벤치마킹, 운영 우수성, 사고 대응을 위한 엔지니어링 표준을 수립합니다
- 에이전틱 추론 최적화, 에이전틱 커널, 추측 디코딩 모델 학습, Baseten Inference Stack을 발전시킵니다
지원 자격
- 컴퓨터 과학, 공학, 수학 또는 관련 분야의 학사, 석사 또는 박사 학위
- 엔지니어 채용, 멘토링, 피드백, 성과 평가를 포함한 관리 경험
- 학습, 추론 또는 추천 시스템 분야에서 GPU 최적화 팀을 이끌거나 긴밀하게 지원한 경험
- GPU 워크로드, 아키텍처, 성능상의 트레이드오프에 대한 깊은 기술 지식
- PyTorch, TensorRT, TensorRT-LLM을 비롯한 머신러닝 라이브러리에 대한 이해
- 로드맵을 수립하고 팀과 함께 복잡한 기술 프로젝트를 제공한 능력
- 팀 간 이해관계자를 조율할 수 있는 뛰어난 문서 및 구두 커뮤니케이션 능력
- vLLM, SGLang, TensorRT-LLM과 같은 추론 엔진에 대한 이해
- 양자화, 추측 디코딩, 연속 배칭과 같은 LLM 최적화 방법을 적용한 경험
- CUDA, Triton 또는 CUTLASS를 사용해 GPU 커널을 개발하거나 다룬 경험
- 스타트업의 빠른 성장 과정에서 엔지니어링 팀을 확장한 경험
- 관리직으로 전환하기 전에 성능 엔지니어 또는 시스템 엔지니어로 직접 실무를 수행한 경험
복리후생
- 경쟁력 있는 보상 패키지와 의미 있는 지분 보상
- 미국 직원에게 직원과 부양가족을 위한 종합 의료·치과·안과 보험 제공
- 전사 겨울 휴가를 포함한 유연한 유급 휴가
- 유급 육아휴직
- Carrot을 통한 난임 및 가족 형성 지원
- 미국 직원에게 회사가 절차를 지원하는 401(k) 플랜 제공
- 다양한 머신러닝 스타트업과 협업하고 업계 인맥을 쌓을 기회








