Baseten
Baseten
Baseten tillhandahåller infrastruktur för modellinferens åt företag som distribuerar maskininlärnings- och AI-applikationer. Plattformen är byggd för snabb och skalbar drift och kombinerar inferens med hög genomströmning, snabb driftsättning, autoskalning, säker modellservering för företag samt stöd för paketering av modeller med öppen källkod. Baseten hjälper teknik- och maskininlärningsteam att hantera de operativa kraven på modellinfrastruktur, så att de kan fokusera på att utveckla domänspecifika modeller. Företaget verkar inom artificiell intelligens, SaaS och företagsteknik och har ett team på 11–50 medarbetare.

Engineering Manager för GPU-inferensprestanda på Baseten

Led arbetet med GPU-inferensprestanda på Baseten, ett företag inom AI-infrastruktur. Ansvara för runtime-optimering, modelleffektivitet och utvecklingen av ett specialiserat tekniskt team.

Beskrivning

  • Leda, coacha och utveckla ingenjörer inom inferensprestanda genom regelbundna en-till-en-samtal, återkoppling, karriärplanering och prestationsutvärderingar
  • Rekrytera GPU- och inferensingenjörer och samtidigt främja en samarbetsinriktad teamkultur
  • Ansvara för färdplanen för runtime-prestanda och dess genomförande
  • Granska tekniska designförslag, leda profilerings- och optimeringsarbete samt hjälpa ingenjörer att bedöma tids- och minnesanvändning
  • Produktionssätta kvantisering, spekulativ avkodning, återanvändning av KV-cache, chunked prefill och anpassad schemaläggning
  • Omsätta prestandavinster i mätbara förbättringar av tokens per GPU-timme, nyttjandegrad, latenstid och kostnad
  • Ta nya modellarkitekturer till ny hårdvara och finjustera deras prestanda
  • Samarbeta med Infrastructure, Inference Platform, Kernels, Model APIs och kundnära team för att prioritera arbete, samordna lanseringar och leverera förbättringar
  • Etablera tekniska standarder för kvalitet, benchmarking, operativ excellens och incidenthantering
  • Driva utvecklingen av agentisk inferensoptimering, agentiska kernels, modellträning för spekulativ avkodning och Baseten Inference Stack

Krav

  • Kandidat-, master- eller doktorsexamen i datavetenskap, ingenjörsvetenskap, matematik eller ett närliggande område
  • Erfarenhet av personalansvar som omfattar ingenjörsrekrytering, mentorskap, återkoppling och prestationsutvärderingar
  • Erfarenhet av att leda eller arbeta nära GPU-optimeringsteam inom träning, inferens eller rekommendationssystem
  • Djupa tekniska kunskaper om GPU-arbetslaster, arkitektur och prestandamässiga avvägningar
  • Kunskaper i maskininlärningsbibliotek som PyTorch, TensorRT eller TensorRT-LLM
  • Dokumenterad förmåga att ta fram färdplaner och leverera komplexa tekniska projekt tillsammans med ett team
  • Mycket god skriftlig och muntlig kommunikationsförmåga för att samordna intressenter mellan team
  • Kunskaper om inferensmotorer som vLLM, SGLang eller TensorRT-LLM
  • Erfarenhet av LLM-optimeringsmetoder som kvantisering, spekulativ avkodning och kontinuerlig batchning
  • Erfarenhet av att utveckla eller arbeta med GPU-kernels med CUDA, Triton eller CUTLASS
  • Erfarenhet av att skala ett ingenjörsteam under snabb startup-tillväxt
  • Tidigare praktisk erfarenhet som prestanda- eller systemingenjör innan övergång till chefsrollen

Förmåner

  • Konkurrenskraftigt ersättningspaket med betydande aktieinnehav
  • För anställda i USA: fullständig sjuk-, tand- och synförsäkring för anställda och anhöriga
  • Flexibel betald ledighet, inklusive en gemensam vinterpaus för hela företaget
  • Betald föräldraledighet
  • Stöd för fertilitet och familjebildning genom Carrot
  • För anställda i USA: en företagsadministrerad 401(k)-plan
  • Möjlighet att arbeta med flera maskininlärningsstartups och bygga branschkontakter

Relaterade jobb

RecruitGo

Distansbaserad chefsassistent inom outreach och marknadsföring – Filippinerna

RecruitGo

Ansvara för administration, CRM, outreach och marknadsföring åt RecruitGo, en arbetsgivare som erbjuder Employer of Record-tjänster och förmedlar talanger från tillväxtmarknader till globala kunder. Stötta två brittiskt inriktade kunder med löpande administration och kreativa kampanjer.

Öppna
SPERTON - Where Great People Meet

Säljare av hissar och parkeringssystem

SPERTON - Where Great People Meet
51 – 200 Anställda

Driv försäljningen av hissar och parkeringssystem i Mumbais västra region. Bygg relationer med kunder och återförsäljare och hantera affärer från första förfrågan till projektgenomförande.

Öppna