Baseten
Baseten
Baseten stellt Unternehmen, die maschinelles Lernen und KI-Anwendungen einsetzen, Infrastruktur für die Modellausführung bereit. Die Plattform ist auf eine schnelle und skalierbare Bereitstellung ausgelegt und kombiniert leistungsstarke Inferenz mit schneller Bereitstellung, automatischer Skalierung, sicherem Model Serving für Unternehmen sowie Unterstützung für die Paketierung von Open-Source-Modellen. Baseten unterstützt Engineering- und Machine-Learning-Teams dabei, die betrieblichen Anforderungen ihrer Modellinfrastruktur zu bewältigen, damit sie sich auf die Entwicklung domänenspezifischer Modelle konzentrieren können. Das Unternehmen ist in den Bereichen künstliche Intelligenz, SaaS und Unternehmenstechnologie tätig und beschäftigt 11–50 Mitarbeitende.

Engineering Manager für GPU-Inferenzperformance bei Baseten

Leite das Engineering für GPU-Inferenzperformance bei Baseten, einem Unternehmen für KI-Infrastruktur. Führe die Optimierung von Laufzeiten und Modelleffizienz sowie das Wachstum eines spezialisierten technischen Teams voran.

Beschreibung

  • Verantwortung für die Führung, Betreuung und Entwicklung von Engineers für Inferenzperformance durch regelmäßige Einzelgespräche, Feedback, Karriereplanung und Leistungsbeurteilungen
  • GPU- und Inferenz-Engineers rekrutieren und gleichzeitig eine kollaborative Teamkultur fördern
  • Verantwortung für die Roadmap und Umsetzung der Laufzeitperformance übernehmen
  • Technische Entwürfe prüfen, Profiling- und Optimierungsarbeiten steuern und Engineers dabei unterstützen, Zeit- und Speicherbedarf zu bewerten
  • Quantisierung, spekulatives Dekodieren, KV-Cache-Wiederverwendung, Chunked Prefill und individuelles Scheduling produktionsreif machen
  • Performancegewinne in messbare Verbesserungen bei Tokens pro GPU-Stunde, Auslastung, Latenz und Kosten übersetzen
  • Neue Modellarchitekturen auf moderner Hardware einsetzen und ihre Performance optimieren
  • Mit den Teams für Infrastruktur, Inference Platform, Kernels, Model APIs und kundennahe Bereiche zusammenarbeiten, um Arbeit zu priorisieren, Releases zu koordinieren und Verbesserungen umzusetzen
  • Engineering-Standards für Qualität, Benchmarking, operative Exzellenz und die Reaktion auf Vorfälle etablieren
  • Die Optimierung agentischer Inferenz, agentischer Kernels, das Training von Modellen für spekulatives Dekodieren und den Baseten Inference Stack weiterentwickeln

Anforderungen

  • Bachelor-, Master- oder Doktorgrad in Informatik, Ingenieurwesen, Mathematik oder einer verwandten Fachrichtung
  • Erfahrung im Management mit Schwerpunkt auf Engineering-Recruiting, Mentoring, Feedback und Leistungsbeurteilungen
  • Erfahrung in der Leitung oder engen Begleitung von GPU-Optimierungsteams in den Bereichen Training, Inferenz oder Empfehlungssysteme
  • Fundierte technische Kenntnisse zu GPU-Workloads, Architektur und Performanceabwägungen
  • Vertrautheit mit Machine-Learning-Bibliotheken wie PyTorch, TensorRT oder TensorRT-LLM
  • Nachweisliche Fähigkeit, Roadmaps festzulegen und komplexe technische Projekte gemeinsam mit einem Team umzusetzen
  • Ausgeprägte schriftliche und mündliche Kommunikationsfähigkeiten zur Abstimmung von Stakeholdern über mehrere Teams hinweg
  • Vertrautheit mit Inferenz-Engines wie vLLM, SGLang oder TensorRT-LLM
  • Erfahrung mit LLM-Optimierungsmethoden wie Quantisierung, spekulativem Dekodieren und Continuous Batching
  • Erfahrung in der Entwicklung oder Arbeit mit GPU-Kernels unter Verwendung von CUDA, Triton oder CUTLASS
  • Erfahrung im Aufbau eines Engineering-Teams während schnellen Startup-Wachstums
  • Praktische Erfahrung als Performance- oder Systems Engineer vor dem Wechsel ins Management

Zusatzleistungen

  • Wettbewerbsfähiges Vergütungspaket mit nennenswertem Eigenkapitalanteil
  • Für Beschäftigte in den USA: vollständige Kranken-, Zahn- und Sehkostenversicherung für Beschäftigte und unterhaltsberechtigte Angehörige
  • Flexible bezahlte Auszeit einschließlich einer unternehmensweiten Winterpause
  • Bezahlter Elternurlaub
  • Unterstützung bei Kinderwunsch und Familiengründung durch Carrot
  • Für Beschäftigte in den USA: ein vom Unternehmen unterstützter 401(k)-Plan
  • Möglichkeiten zur Zusammenarbeit mit verschiedenen Machine-Learning-Startups und zum Aufbau von Branchenkontakten

Ähnliche Stellen

Terumo Medical Corporation

Regionalmanager Vertrieb für Terumo Interventional Systems

Terumo Medical Corporation

Leiten Sie den Vertrieb medizinischer Produkte in einer Region im Norden von Zentral-New-Jersey und verantworten Sie Außendienstteams sowie die Beziehungen zu Krankenhäusern. Steigern Sie den regionalen Umsatz und die Vertriebsleistung und sorgen Sie für eine regelkonforme Vermarktung der Produkte von Terumo Interventional Systems.

Öffnen
Claroty

QA-Automatisierungsingenieur

Claroty

Entwickle API- und UI-Automatisierungen sowie Qualitätsprüfungen in CI/CD-Pipelines für Clarotys Plattform für die Sicherheit cyberphysischer Systeme. Mit zuverlässigen Tests trägst du zum Schutz kritischer Infrastrukturen bei.

Öffnen