
推論エンジニア — Adaption(ハイブリッド、ベイエリア)
適応型インテリジェンスシステムを開発するAI企業 Adaption で、推論インフラのスループット、コスト、レイテンシを最適化します。 GPU、推論エンジン、本番ワークロード全体のモデルサービングを改善します。
仕事内容
- 推論スタックのコストとパフォーマンスを主導します。
- KVキャッシュ管理、継続的バッチ処理、投機的デコーディング、量子化により、スループットを向上させ、コストとテールレイテンシを削減します。
- 実際の本番トラフィックに対して、長いコンテキストのプリフィルおよびデコードワークロードを最適化します。
- コスト、キャパシティ、パフォーマンスに応じて、社内インフラと外部プロバイダー間のルーティングを調整します。
- vLLM、SGLang、TensorRT-LLM などのサービングエンジンを使用し、必要に応じてフレームワークの下層まで扱います。
- 時間、メモリ、計算リソースの使用箇所を特定するプロファイリングおよび計測システムを開発します。
- サービングフリートを担当するエンジニアと緊密に連携します。
応募要件
- 機械学習システム、推論インフラ、またはパフォーマンスエンジニアリングで5年以上の経験があり、コストまたはレイテンシを測定可能な形で改善した実績があること。
- プリフィルとデコード、メモリ帯域幅、バッチ処理、並行性を含むモデルサービングに関する深い知識があること。
- vLLM、SGLang、TensorRT-LLM などのサービングエンジンを本番環境で使用した経験があること。
- Pythonを自在に扱い、C++、Rust、またはその他のシステムプログラミング言語に精通していること。
- CUDA、NCCL、混合精度、メモリレイアウト、カーネル、量子化など、GPUパフォーマンスに関する知識があること。
- ハイブリッド勤務体制でベイエリアに出社できること。
福利厚生
- ベイエリアでの対面コラボレーションと、分散型でグローバル志向のチームへの参加、チームオフサイトの両方を経験できます。
- これまで訪れたことのない国を探索するための、年間 Adaption Passport 旅行手当を受け取れます。
- テイクアウトの食事または食料品配達に使える週次手当があります。
- 充実した医療保障と十分な有給休暇を利用できます。







