Baseten
Baseten
Baseten leverer infrastruktur for modellinferens til selskaper som distribuerer maskinlærings- og AI-applikasjoner. Plattformen er utviklet for rask og skalerbar kjøring og kombinerer inferens med høy gjennomstrømning, rask utrulling, autoskalering, sikker modellkjøring for virksomheter samt støtte for pakking av modeller med åpen kildekode. Baseten hjelper utviklings- og maskinlæringsteam med å håndtere de operative kravene til modellinfrastruktur, slik at de kan fokusere på å utvikle domenespesifikke modeller. Selskapet opererer innen kunstig intelligens, SaaS og virksomhetsteknologi og har et team på 11–50 medarbeidere.

Engineering Manager for GPU-inferensytelse hos Baseten

Led arbeidet med GPU-inferensytelse hos Baseten, et selskap innen AI-infrastruktur. Ha ansvar for runtime-optimalisering, modelleffektivitet og utviklingen av et spesialisert teknisk team.

Beskrivelse

  • Lede, veilede og utvikle ingeniører innen inferensytelse gjennom regelmessige én-til-én-samtaler, tilbakemeldinger, karriereplanlegging og resultatvurderinger
  • Rekruttere GPU- og inferensingeniører og samtidig fremme en samarbeidsorientert teamkultur
  • Ha ansvar for veikartet for runtime-ytelse og gjennomføringen av det
  • Gjennomgå tekniske design, lede profilerings- og optimaliseringsarbeid samt hjelpe ingeniører med å vurdere tids- og minnebruk
  • Produksjonssette kvantisering, spekulativ dekoding, gjenbruk av KV-cache, chunked prefill og tilpasset planlegging
  • Omsette ytelsesforbedringer til målbare forbedringer i tokens per GPU-time, utnyttelse, latenstid og kostnad
  • Ta nye modellarkitekturer i bruk på ny maskinvare og finjustere ytelsen deres
  • Samarbeide med Infrastructure, Inference Platform, Kernels, Model APIs og kundevendte team for å prioritere arbeid, koordinere lanseringer og levere forbedringer
  • Etablere tekniske standarder for kvalitet, benchmarking, operasjonell fremragende praksis og hendelseshåndtering
  • Drive utviklingen av agentisk inferensoptimalisering, agentiske kernels, modelltrening for spekulativ dekoding og Baseten Inference Stack

Krav

  • Bachelor-, master- eller doktorgrad i datavitenskap, ingeniørfag, matematikk eller et beslektet fagområde
  • Ledererfaring som omfatter rekruttering av ingeniører, mentoring, tilbakemeldinger og resultatvurderinger
  • Erfaring med å lede eller jobbe tett med GPU-optimaliseringsteam innen trening, inferens eller anbefalingssystemer
  • Dyp teknisk kunnskap om GPU-arbeidslaster, arkitektur og avveininger knyttet til ytelse
  • Kjennskap til maskinlæringsbiblioteker som PyTorch, TensorRT eller TensorRT-LLM
  • Dokumentert evne til å lage veikart og levere komplekse tekniske prosjekter sammen med et team
  • Svært gode skriftlige og muntlige kommunikasjonsevner for å samordne interessenter på tvers av team
  • Kjennskap til inferensmotorer som vLLM, SGLang eller TensorRT-LLM
  • Erfaring med LLM-optimaliseringsmetoder som kvantisering, spekulativ dekoding og kontinuerlig batching
  • Erfaring med å utvikle eller jobbe med GPU-kernels ved hjelp av CUDA, Triton eller CUTLASS
  • Erfaring med å skalere et ingeniørteam under rask oppstartsvekst
  • Tidligere praktisk erfaring som ytelses- eller systemingeniør før overgang til ledelse

Fordeler

  • Konkurransedyktig kompensasjonspakke med betydelig eierandel
  • For ansatte i USA: full medisinsk-, tann- og synsdekning for ansatte og deres pårørende
  • Fleksibel betalt fri, inkludert en felles vinterpause for hele selskapet
  • Betalt foreldrepermisjon
  • Støtte til fertilitet og familiebygging gjennom Carrot
  • For ansatte i USA: en firmatilrettelagt 401(k)-ordning
  • Muligheter til å jobbe med en rekke maskinlæringsstartups og bygge bransjekontakter

Relaterte jobber