Cerebras
Cerebras
501 – 1.000 Mitarbeitende
HardwareKünstliche IntelligenzSaaS
Cerebras entwickelt KI-Hardware im Wafer-Maßstab und integrierte Software für das leistungsstarke Training und die Inferenz von Modellen. Die Wafer-Scale Engine bildet das Herzstück des CS-3-Systems und der Cerebras Inference Cloud, die mit der OpenAI-API kompatible Workflows sowie die Bereitstellung in On-Premises-, Cloud- und Edge-Umgebungen unterstützt. Die Plattform ist für Anwendungen wie das Bereitstellen von Modellen, Fine-Tuning, Pre-Training, KI-Agenten in Echtzeit, Genomik, Wirkstoffforschung, Cybersicherheit und die Unternehmenssuche konzipiert. Cerebras vereint spezialisierte Chips, Systeme und Software für Organisationen, die anspruchsvolle Workloads im Bereich der künstlichen Intelligenz entwickeln und betreiben, und beschäftigt 501–1.000 Mitarbeitende.

Machine-Learning-Ingenieur, Modellimplementierung

Bringen Sie Transformer-Modelle auf Cerebras-KI-Beschleunigerhardware und optimieren Sie deren Inferenzleistung. Entwickeln Sie MLIR-Compilerpfade und verbessern Sie Modellkorrektheit, Latenz, Durchsatz und Speichereffizienz.

Beschreibung

  • Bringen Sie neue Modelle in die Produktion, indem Sie Architekturen analysieren, Gewichte konvertieren, Ausführungspfade implementieren und Ergebnisse anhand von Referenzimplementierungen validieren.
  • Überführen Sie Modelle mit MLIR-Dialekten, Graphtransformationen, Lowering-Pässen und hardwarespezifischen Zuordnungen auf Cerebras-Hardware.
  • Unterstützen Sie Attention, Matrixmultiplikation, Normalisierung, Positions-Embeddings und weitere Operatoren durch Compiler- und Kernel-Entwicklung.
  • Optimieren Sie Operatorfusion, Tensorlayouts, Tiling, Speicherzuweisung, Datenbewegung und parallele Ausführung.
  • Verbessern Sie die Prefill- und Decode-Leistung durch die Optimierung von KV-Cache-Verwaltung, Batching und Quantisierung, um Latenz, Durchsatz und Speichernutzung zu verbessern.
  • Analysieren Sie numerische Abweichungen und bewerten Sie, wie sich Präzisionsänderungen und Compileroptimierungen auf die Genauigkeit auswirken.
  • Nutzen Sie Profiler, Ausführungstraces und Hardwarezähler, um Engpässe bei Berechnung, Speicher, Kommunikation und Laufzeit zu lokalisieren.
  • Arbeiten Sie mit Teams für Hardware, Compiler, Kernel und Laufzeit zusammen, um zuverlässige Modellunterstützung und reproduzierbare Leistungsbenchmarks bereitzustellen.

Anforderungen

  • Sichere Kenntnisse in der Programmierung mit C++ und Python.
  • Praktische Erfahrung beim Bereitstellen und Debuggen von Machine-Learning-Modellen in PyTorch oder einem vergleichbaren Framework.
  • Praktische Erfahrung mit MLIR, einschließlich Dialekten, Rewrite-Patterns, Transformationspässen und Lowering-Pipelines.
  • Kenntnisse der Compilergrundlagen, einschließlich Zwischenrepräsentationen, Datenflussanalyse und Codegenerierung.
  • Verständnis von Transformer-Architekturen, Attention-Mechanismen, Tensoroperationen und numerischer Präzision.
  • Erfahrung beim Profiling und Optimieren von Workloads auf GPUs oder anderen KI-Beschleunigern.
  • Fähigkeit, Korrektheits- und Leistungsprobleme über Modellcode, Compiler-Ausgabe, Kernel und Laufzeitausführung hinweg zu diagnostizieren.
  • Erfahrung mit der Inferenz großer Sprachmodelle, einschließlich GQA, Sliding-Window-Attention, Mixture-of-Experts, KV-Caching und spekulativer Dekodierung.
  • Erfahrung mit FP16, BF16, FP8 oder Low-Bit-Quantisierung sowie deren Abwägungen zwischen Genauigkeit und Leistung.
  • Erfahrung in der Entwicklung von Beschleuniger-Kerneln oder hardwarespezifischen Compiler-Backends.
  • Vertrautheit mit verteilter Ausführung, Modellparallelismus und Speicherhierarchien von Beschleunigern.
  • Beiträge zu MLIR, LLVM, Inferenz-Frameworks oder verwandten Open-Source-Projekten.

Zusatzleistungen

  • Sicherer Arbeitsplatz in einem dynamischen Startup-Umfeld.
  • Möglichkeiten zur Veröffentlichung und Veröffentlichung fortschrittlicher KI-Forschung als Open Source.
  • Arbeiten Sie mit einem der schnellsten KI-Supercomputer der Welt.
  • Eine unkomplizierte, nicht von Konzernstrukturen geprägte Kultur, die individuelle Überzeugungen respektiert.
  • Kontinuierliches Lernen, berufliche Weiterentwicklung und Unterstützung.
  • Ein gerechter und vielfältiger Arbeitsplatz.

Ähnliche Stellen

Pursuit Aerospace

Senior Data Scientist, Supply-Chain-Analytik (Remote, USA)

Pursuit Aerospace
1.001 – 5.000 Mitarbeitende
B2BFertigungLuft- und Raumfahrt

Entwickeln Sie Machine-Learning-, Prognose- und KI-Lösungen für die Lieferkette von Flugzeugkomponenten bei Pursuit Aerospace. Verbessern Sie Bestände, Kundenlieferungen, Produktionsplanung und Kosten.

Öffnen
Avalon Healthcare Solutions

Senior AI Engineer, Florida Remote | Avalon Healthcare Solutions

Avalon Healthcare Solutions

Entwickeln und leiten Sie produktive KI-Systeme – darunter agentische Workflows, Retrieval-Augmented Generation und Automatisierung – für die diagnostische Intelligenzplattform von Avalon Healthcare Solutions. Verbessern Sie mit zuverlässigen, kontrollierten KI-Lösungen die Abläufe im Gesundheitswesen und klinische Ergebnisse.

Öffnen
Bitdeer Group

KI-Ingenieur:in für Hochschulabsolvent:innen

Bitdeer Group
201 – 500 Mitarbeitende
BauwesenBeratungLogistik

Entwickle und skaliere KI-Cloud-Infrastruktur, GPU- und Kubernetes-Dienste, Modellbereitstellungssysteme und KI-Agentenplattformen. Gestalte die Full-Stack-Infrastruktur von Bitdeer AI für globale KI-Workloads mit.

Öffnen
Clipbook

Gründungs-Senior-Softwareentwickler:in, Europa (Remote)

Clipbook
11 – 50 Mitarbeitende
Künstliche IntelligenzMedienSaaS

Entwickle bei Clipbook skalierbare, KI-gestützte Informationssysteme für mehr als 200 Kund:innen. Baue produktive LLM-Workflows, APIs und grundlegende Softwaresysteme.

Öffnen
Jeeves

Senior AI Engineer für LLM-Workflows — Jeeves (Remote, Argentinien)

Jeeves

Leite produktive LLM-Workflows für die Stablecoin-basierte Banking-Plattform von Jeeves. Entwickle zuverlässige KI-Systeme für Finanzautomatisierung, Überwachung und regulierte Finanzentscheidungen.

Öffnen
Avalon Healthcare Solutions

Senior AI Engineer für generative KI und agentische Systeme

Avalon Healthcare Solutions

Entwickle und leite produktive Lösungen für generative KI und agentische Systeme auf Avalons Plattform für diagnostische Intelligenz. Gestalte Bereitstellung, Automatisierung, Evaluierung und technische Ausrichtung mit.

Öffnen
DATAGROUP

Senior Softwareentwickler:in mit KI-Unterstützung

DATAGROUP
1.001 – 5.000 Mitarbeitende
BeratungMarketingSaaS

Entwickle Software für Hyperautomation und Workflow-Management beim deutschen IT-Dienstleister DATAGROUP. Baue sichere Full-Stack-Anwendungen, APIs, CI/CD-Pipelines und Teststrategien.

Öffnen