Baseten
Baseten
Baseten leverer infrastruktur for modellinferens til selskaper som distribuerer maskinlærings- og AI-applikasjoner. Plattformen er utviklet for rask og skalerbar kjøring og kombinerer inferens med høy gjennomstrømning, rask utrulling, autoskalering, sikker modellkjøring for virksomheter samt støtte for pakking av modeller med åpen kildekode. Baseten hjelper utviklings- og maskinlæringsteam med å håndtere de operative kravene til modellinfrastruktur, slik at de kan fokusere på å utvikle domenespesifikke modeller. Selskapet opererer innen kunstig intelligens, SaaS og virksomhetsteknologi og har et team på 11–50 medarbeidere.

Programvareingeniør for inferensytelse hos Baseten (hybrid)

Baseten ansetter en ingeniør for inferensytelse som skal optimalisere LLM-kjøremiljøer, GPU-kjerner og systemer for modellservering. Rollen fokuserer på å forbedre inferenshastighet i produksjon, maskinvareutnyttelse og kostnadseffektivitet.

Beskrivelse

  • Sett avanserte inferensmetoder i produksjon, som kvantisering, spekulativ dekoding, gjenbruk av KV-cache, oppdelt prefill, LoRA, styrt generering samt tilpasset planlegging eller ruting.
  • Analyser hele inferenspipelinen og optimaliser kjerneoverhead, minneplassering, planlegging av forespørsler, separasjon av prefill og dekoding samt cache-bevisst ruting.
  • Øk antall token per GPU-time og utnyttelsesgraden samtidig som latenstid, gjennomstrømning og kostnad balanseres.
  • Distribuer og optimaliser nye modellarkitekturer på nye maskinvareplattformer.
  • Lag benchmarktester på tvers av modelltyper, batchstørrelser, sekvenslengder og maskinvareoppsett.
  • Send inn forbedringer til inferensprosjekter med åpen kildekode, inkludert vLLM, SGLang og TensorRT-LLM.
  • Samarbeid med team innen modeller, infrastruktur og kundekontakt for å levere målbare ytelsesforbedringer.

Krav

  • Grad på bachelor-, master- eller doktorgradsnivå innen informatikk, ingeniørfag, matematikk eller et beslektet fagområde.
  • Yrkeserfaring med minst ett generell programmeringsspråk, inkludert Python eller C++.
  • Praktisk kunnskap om optimaliseringsmetoder for LLM-er, som kvantisering, spekulativ dekoding og kontinuerlig batching.
  • Svært gode ferdigheter i maskinlæringsbiblioteker, særlig PyTorch, TensorRT eller TensorRT-LLM.
  • Dokumentert interesse for og praktisk erfaring med store språkmodeller.
  • Grundig forståelse av GPU-arkitektur.

Fordeler

  • Konkurransedyktig lønnspakke med betydelig aksjedeltakelse.
  • For ansatte i USA omfatter full medisinsk-, tann- og synsforsikring de ansatte og deres forsørgede.
  • Fleksibel betalt fri, samt en felles vinterpause for hele selskapet.
  • Betalt foreldrepermisjon.
  • Støtte til fertilitet og familiedannelse gjennom et Carrot-stipend.
  • For ansatte i USA tilbys en 401(k)-ordning tilrettelagt av selskapet.
  • Mulighet til å jobbe med en rekke oppstartsbedrifter innen maskinlæring, med betydelige muligheter for læring og profesjonelt nettverk.

Relaterte jobber

Kreato Global | BPO and Language Solutions

Fjerntolk i engelsk-spansk OPI/VRI

Kreato Global | BPO and Language Solutions

Tolk på avstand mellom engelsk- og spansktalende innen helse, økonomi, sosiale tjenester og kundeservice. Gi språklig støtte til Kreato Global i Latin-Amerika.

Åpne
RecruitGo

Fjernbasert lederassistent innen outreach og markedsføring – Filippinene

RecruitGo

Håndtere administrativ støtte, CRM, outreach og markedsføring for RecruitGo, en Employer of Record-leverandør som kobler globale kunder med talenter fra fremvoksende markeder. Støtte to kunder med fokus på Storbritannia med daglig administrasjon og kreative kampanjer.

Åpne
SPERTON - Where Great People Meet

Selger av heiser og parkeringssystemer

SPERTON - Where Great People Meet
51 – 200 Ansatte

Driv salget av heiser og parkeringssystemer i den vestlige regionen av Mumbai. Bygg relasjoner med kunder og forhandlere, og håndter avtaler fra første forespørsel til prosjektgjennomføring.

Åpne