Cerebras
Cerebras
501 – 1 000 Anställda
Artificiell intelligensHårdvaraSaaS
Cerebras utvecklar AI-hårdvara i waferskala och integrerad programvara för högpresterande modellträning och inferens. Företagets Wafer-Scale Engine driver CS-3-systemet och Cerebras Inference Cloud, som stöder arbetsflöden kompatibla med OpenAI API samt driftsättning i lokala miljöer, molnmiljöer och edge-miljöer. Plattformen är utformad för bland annat modelldistribution, finjustering, förträning, AI-agenter i realtid, genomik, läkemedelsutveckling, cybersäkerhet och företagssökning. Cerebras samlar specialiserade chip, system och programvara för organisationer som utvecklar och driver krävande arbetsbelastningar inom artificiell intelligens, med ett team på 501–1 000 anställda.

Maskininlärningsingenjör, modellimplementering

Ta transformerbaserade modeller till Cerebras AI-acceleratorhårdvara och optimera deras inferensprestanda. Utveckla MLIR-kompilatorvägar samtidigt som modellernas korrekthet, svarstid, genomströmning och minneseffektivitet förbättras.

Beskrivning

  • Ta nya modeller i produktion genom att analysera arkitekturer, konvertera vikter, implementera exekveringsvägar och validera resultat mot referensimplementationer.
  • Sänk modeller till Cerebras-hårdvara med MLIR-dialekter, graftransformationer, sänkningspass och hårdvaruspecifika mappningar.
  • Stöd attention, matrismultiplikation, normalisering, positionsinbäddningar och andra operatorer genom utveckling av kompilatorer och kärnor.
  • Optimera operatorfusion, tensorlayouter, tiling, minnesallokering, dataöverföring och parallell exekvering.
  • Förbättra prefill- och decode-prestanda genom att finjustera hantering av KV-cache, batching och kvantisering för bättre svarstid, genomströmning och minnesanvändning.
  • Analysera numeriska avvikelser och bedöm hur precisionsförändringar och kompilatoroptimeringar påverkar noggrannheten.
  • Använd profileringsverktyg, exekveringsspår och hårdvaruräknare för att lokalisera flaskhalsar i beräkning, minne, kommunikation och runtime.
  • Samarbeta med hårdvaru-, kompilator-, kärn- och runtime-team för att leverera tillförlitligt modellstöd och reproducerbara prestandamätningar.

Krav

  • Goda kunskaper i programmering med C++ och Python.
  • Praktisk erfarenhet av att implementera och felsöka maskininlärningsmodeller i PyTorch eller ett jämförbart ramverk.
  • Praktisk erfarenhet av MLIR, inklusive dialekter, omskrivningsmönster, transformationspass och sänkningspipelines.
  • Kunskaper i grunderna för kompilatorer, inklusive mellanrepresentationer, dataflödesanalys och kodgenerering.
  • Förståelse för transformerarkitekturer, attentionmekanismer, tensoroperationer och numerisk precision.
  • Erfarenhet av profilering och optimering av arbetslaster på GPU:er eller andra AI-acceleratorer.
  • Förmåga att diagnostisera korrekthets- och prestandaproblem i modellkod, kompilatorutdata, kärnor och runtime-exekvering.
  • Erfarenhet av inferens för stora språkmodeller, inklusive GQA, attention med glidande fönster, mixture-of-experts, KV-cachning och spekulativ avkodning.
  • Erfarenhet av FP16, BF16, FP8 eller kvantisering med få bitar samt avvägningarna mellan noggrannhet och prestanda.
  • Bakgrund inom utveckling av acceleratorkärnor eller hårdvaruspecifika kompilatorbackendar.
  • Kännedom om distribuerad exekvering, modellparallellism och acceleratorers minneshierarkier.
  • Bidrag till MLIR, LLVM, inferensramverk eller relaterade projekt med öppen källkod.

Förmåner

  • Trygg anställning i en startuppräglad miljö.
  • Möjlighet att publicera och dela avancerad AI-forskning som öppen källkod.
  • Arbeta med en av världens snabbaste AI-superdatorer.
  • En rak och okorporativ kultur som respekterar individuella övertygelser.
  • Löpande lärande, professionell utveckling och stöd.
  • En jämlik och inkluderande arbetsplats.

Relaterade jobb

Newstel Worldwide

Dansktalande kundtjänstmedarbetare på deltid (Portugal, distansarbete)

Newstel Worldwide

Ge kundsupport på danska på distans åt Newstels flerspråkiga BPO-kunder och nå service- och kvalitetsmålen. Deltidsrollen omfattar frågor via e-post, chatt och telefon från Portugal.

Öppna