Baseten
Baseten
Baseten biedt bedrijven die machinelearning- en AI-toepassingen ontwikkelen infrastructuur voor modelinference. Het platform is ontworpen voor snelle, schaalbare serving en combineert inference met hoge verwerkingscapaciteit, snelle implementatie, autoscaling, veilige model serving voor ondernemingen en ondersteuning voor het verpakken van opensourcemodellen. Baseten helpt engineering- en machinelearningteams bij het beheren van de operationele vereisten van modelinfrastructuur, zodat zij zich kunnen richten op de ontwikkeling van domeinspecifieke modellen. Het bedrijf is actief op het gebied van kunstmatige intelligentie, SaaS en technologie voor ondernemingen en heeft 11–50 medewerkers.

Software-engineer voor inferentieprestaties bij Baseten (hybride)

Baseten zoekt een software-engineer voor inferentieprestaties die LLM-runtimes, GPU-kernels en systemen voor modelserving optimaliseert. De functie richt zich op hogere inferentiesnelheid in productie, betere hardwarebenutting en kostenefficiëntie.

Beschrijving

  • Geavanceerde inferentiemethoden zoals quantisatie, speculatief decoderen, hergebruik van de KV-cache, chunked prefill, LoRA, guided generation en aangepaste scheduling of routing productierijp maken.
  • De volledige inferentiepijplijn analyseren en kerneloverhead, geheugenplaatsing, requestplanning, de scheiding tussen prefill en decode en cachebewuste routing optimaliseren.
  • Het aantal tokens per GPU-uur en de benuttingsgraad verhogen en daarbij latency, throughput en kosten in balans houden.
  • Nieuwe modelarchitecturen op nieuwe hardwareplatforms implementeren en optimaliseren.
  • Benchmarks opzetten voor verschillende modeltypen, batchgroottes, sequentielengtes en hardwareconfiguraties.
  • Verbeteringen bijdragen aan open-source inferentieprojecten zoals vLLM, SGLang en TensorRT-LLM.
  • Samenwerken met teams voor modellen, infrastructuur en klantcontact om meetbare prestatieverbeteringen te realiseren.

Vereisten

  • Een bachelor-, master- of doctoraatsdiploma in computerwetenschappen, engineering, wiskunde of een verwante studierichting.
  • Professionele ervaring met ten minste één algemene programmeertaal, waaronder Python of C++.
  • Praktische kennis van LLM-optimalisatiemethoden zoals quantisatie, speculatief decoderen en continuous batching.
  • Sterke beheersing van machine-learningbibliotheken, met name PyTorch, TensorRT of TensorRT-LLM.
  • Aantoonbare interesse in en praktische ervaring met grote taalmodellen.
  • Grondig inzicht in GPU-architectuur.

Voordelen

  • Competitief beloningspakket met een betekenisvol aandelenbelang.
  • Voor medewerkers in de VS: volledige medische, tandheelkundige en oogzorgverzekering voor medewerkers en hun gezinsleden.
  • Flexibele betaalde vrije tijd plus een bedrijfsbrede winterbreak.
  • Betaald ouderschapsverlof.
  • Ondersteuning bij vruchtbaarheid en gezinsvorming via een Carrot-toelage.
  • Voor medewerkers in de VS: een door het bedrijf gefaciliteerd 401(k)-plan.
  • Mogelijkheden om samen te werken met verschillende machine-learningstart-ups, met veel kansen om te leren en een professioneel netwerk op te bouwen.

Gerelateerde vacatures