adaption
adaption
adaption membangunkan sistem dan peralatan AI adaptif yang direka untuk menyesuaikan kecerdasan dengan pengguna individu, bahasa, industri dan kes khusus. Usahanya merangkumi Adaptive Data, Adaptive Intelligence dan Adaptive Interfaces—pendekatan yang membantu model menyesuaikan diri secara berterusan serta menyokong pengalaman pengguna yang lebih responsif tanpa terlalu bergantung pada pemberian gesaan secara manual atau satu model monolitik. Teknologi syarikat ini relevan untuk organisasi yang meneroka penggunaan AI praktikal dalam bidang seperti perundingan, logistik dan pemasaran.

Jurutera Inferens — Adaption (Hibrid, Bay Area)

Optimumkan infrastruktur inferens untuk daya pemprosesan, kos dan kependaman di Adaption, sebuah syarikat AI yang membangunkan sistem kecerdasan adaptif. Tingkatkan penyajian model merentas GPU, enjin inferens dan beban kerja pengeluaran.

Penerangan

  • Memimpin tanggungjawab terhadap kos dan prestasi timbunan inferens.
  • Meningkatkan daya pemprosesan serta mengurangkan kos dan kependaman ekor melalui pengurusan KV-cache, batching berterusan, speculative decoding dan pengkuantuman.
  • Mengoptimumkan beban kerja prefill dan decode konteks panjang berdasarkan trafik pengeluaran sebenar.
  • Melaraskan penghalaan antara infrastruktur dalaman dan penyedia luaran mengikut kos, kapasiti dan prestasi.
  • Menggunakan enjin penyajian termasuk vLLM, SGLang dan TensorRT-LLM, serta bekerja di bawah rangka kerja apabila perlu.
  • Membangunkan sistem pemprofilan dan pengukuran untuk mengenal pasti penggunaan masa, memori dan pengkomputeran.
  • Bekerjasama rapat dengan jurutera yang bertanggungjawab terhadap armada penyajian.

Keperluan

  • Mempunyai sekurang-kurangnya lima tahun pengalaman dalam sistem ML, infrastruktur inferens atau kejuruteraan prestasi, dengan peningkatan kos atau kependaman yang boleh diukur.
  • Menunjukkan pengetahuan mendalam tentang penyajian model, termasuk prefill dan decode, lebar jalur memori, batching dan keserentakan.
  • Mempunyai pengalaman pengeluaran dengan enjin penyajian seperti vLLM, SGLang atau TensorRT-LLM.
  • Menggunakan Python dengan yakin dan mahir dalam C++, Rust atau bahasa pengaturcaraan sistem yang lain.
  • Memahami topik prestasi GPU termasuk CUDA, NCCL, ketepatan campuran, susun atur memori, kernel atau pengkuantuman.
  • Mampu bekerja secara bersemuka di Bay Area dalam susunan hibrid.

Faedah

  • Menggabungkan kerjasama bersemuka di Bay Area dengan pasukan teragih yang mengutamakan perspektif global serta percutian luar pejabat pasukan.
  • Menerima elaun perjalanan tahunan Adaption Passport untuk meneroka negara yang belum pernah anda lawati sebelum ini.
  • Mendapat elaun mingguan untuk makanan bungkus atau penghantaran barangan runcit.
  • Mendapat perlindungan perubatan komprehensif dan cuti berbayar yang lumayan.

Pekerjaan Berkaitan