Baseten
Baseten
Baseten stellt Unternehmen, die maschinelles Lernen und KI-Anwendungen einsetzen, Infrastruktur für die Modellausführung bereit. Die Plattform ist auf eine schnelle und skalierbare Bereitstellung ausgelegt und kombiniert leistungsstarke Inferenz mit schneller Bereitstellung, automatischer Skalierung, sicherem Model Serving für Unternehmen sowie Unterstützung für die Paketierung von Open-Source-Modellen. Baseten unterstützt Engineering- und Machine-Learning-Teams dabei, die betrieblichen Anforderungen ihrer Modellinfrastruktur zu bewältigen, damit sie sich auf die Entwicklung domänenspezifischer Modelle konzentrieren können. Das Unternehmen ist in den Bereichen künstliche Intelligenz, SaaS und Unternehmenstechnologie tätig und beschäftigt 11–50 Mitarbeitende.

Softwareentwickler/in, LLM-Inferenzplattform – Baseten Hybrid

Entwickle Basetens verteilte LLM-Inferenzplattform für KI-Unternehmen. Arbeite an Kubernetes-Orchestrierung, Modell-APIs, Routing, Autoskalierung und Beobachtbarkeit in der Produktion.

Beschreibung

  • Entwickle Infrastruktur und Orchestrierung für groß angelegte verteilte LLM-Inferenz, einschließlich Routing, Autoskalierung, Scheduling und Laufzeitverwaltung.
  • Entwickle und betreibe Modell-APIs mit Unterstützung für strukturierte Ausgaben, Tool- und Funktionsaufrufe sowie multimodales Bereitstellen.
  • Implementiere API-Versionierung, Anfragevalidierung, Nutzungsabrechnung, Kontingente und Authentifizierung.
  • Erstelle Instrumentierung für Metriken, Traces und Logs sowie reproduzierbare Benchmarks für Geschwindigkeit, Zuverlässigkeit und Qualität.
  • Definiere starke Verfahren für Tests, Release-Automatisierung und operative Exzellenz.
  • Diagnostiziere und verbessere Produktionssysteme in den Bereichen Kubernetes, verteilte Laufzeitumgebungen, Netzwerke und GPU-Workloads.
  • Arbeite mit Ingenieurinnen und Ingenieuren für Inferenzleistung sowie Partnerteams zusammen, um kundenorientierte Optimierungen bereitzustellen.
  • Leite Projekte von der Architektur und Bereitstellung über die Überwachung bis zur durch Kundenfeedback geleiteten Weiterentwicklung.
  • Bringe Systemleistung, Zuverlässigkeit, operative Einfachheit und Entwicklererfahrung in Einklang.

Anforderungen

  • Bachelor-, Master- oder Doktorgrad in Informatik, Ingenieurwesen oder einem verwandten Fachgebiet oder gleichwertige praktische Erfahrung.
  • Mindestens drei Jahre Erfahrung in der Entwicklung und dem Betrieb verteilter Systeme, Backend-Infrastruktur oder groß angelegter APIs, bei denen Zuverlässigkeit, Latenz und Skalierung entscheidend sind.
  • Nachgewiesene Verantwortung für latenzarme, zuverlässige Backend-Dienste mit Ratenbegrenzung, Authentifizierung, Kontingenten, Nutzungsabrechnung und Migrationen.
  • Ausgeprägtes Urteilsvermögen im Bereich Infrastruktur, einschließlich Erfahrung mit Profiling, Tracing, Kapazitätsplanung und SLO-Management.
  • Fähigkeit, Leistungs- und Zuverlässigkeitsprobleme über Anwendungs-, Laufzeit- und Infrastrukturebenen hinweg zu diagnostizieren.
  • Starker Fokus auf die Entwicklererfahrung.
  • Bereitschaft, neue Programmiersprachen, Frameworks und Systeme zu erlernen, sowie Interesse an Inferenz-Engineering.
  • Ausgezeichnete schriftliche Kommunikations- und Zusammenarbeitsfähigkeiten, einschließlich klarer Entwurfsdokumentation und effektiver funktionsübergreifender Zusammenarbeit.
  • Erfahrung mit oder Beiträge zu LLM-Inferenz-Engines oder -Frameworks wie vLLM, SGLang, TensorRT-LLM, TGI oder Dynamo sind von Vorteil.
  • Umfassende Kubernetes-Erfahrung, einschließlich Operatoren und benutzerdefinierter Ressourcen; Kenntnisse in Service-Meshes oder API-Gateways sind von Vorteil.
  • Erfahrung mit verteilter Planung, Autoskalierung oder Service-Orchestrierung ist von Vorteil.
  • Erfahrung mit dem Betrieb von GPU-Workloads in der Produktion ist von Vorteil.
  • Erfahrung mit entwicklerorientierter Infrastruktur oder APIs oder Beiträge zu Open-Source-Infrastruktur oder maschinellen Lernsystemen sind von Vorteil.
  • Vertrautheit mit Beobachtbarkeitstools, CI/CD-Systemen oder Release-Automatisierung ist von Vorteil.

Zusatzleistungen

  • Wettbewerbsfähige Vergütung mit maßgeblicher Beteiligung am Unternehmen.
  • Für Beschäftigte und Angehörige in den USA vollständige Übernahme der Kranken-, Zahn- und Sehkostenversicherung.
  • Flexible bezahlte Freistellung einschließlich einer unternehmensweiten Winterpause.
  • Bezahlter Elternurlaub.
  • Unterstützung bei Kinderwunsch und Familiengründung durch ein Carrot-Stipendium.
  • Für Beschäftigte in den USA ein vom Unternehmen unterstützter 401(k)-Plan.
  • Einblicke in eine Vielzahl von ML-Start-ups mit umfangreichen Möglichkeiten zum Lernen und für berufliche Vernetzung.

Ähnliche Stellen

Alignment Health

Senior AI- und Data-Scientist

Alignment Health

Entwickle produktive Machine-Learning-Lösungen für die Versorgungsplattform von Alignment Health für ältere Menschen. Leite Gesundheitsanalysen und Modellbereitstellung und begleite die fachliche Entwicklung des Teams.

Öffnen
CET Logistics

Spezialist/in für Geschäftskontakte – CET-Logistik

CET Logistics
201 – 500 Mitarbeitende
BeratungGesundheitswesenLogistik

Vernetze Unternehmen und Institutionen mit den Programmen von CET zur Abfallvermeidung und Energieeffizienz. Baue Empfehlungsnetzwerke auf, qualifiziere Kontakte, koordiniere Übergaben und unterstütze die CO₂-Reduktion.

Öffnen
FHI 360

Stellvertretende Direktion für Beschaffung, Verwaltung und Logistik

FHI 360

Leitet Beschaffung, Verwaltung, Logistik und Betriebsabläufe im Länderbüro von FHI 360 in der Demokratischen Republik Kongo. Führt die zuständigen Bereichsleitungen und stellt die Einhaltung von Geber-, Regierungs- und Lieferkettenanforderungen sicher.

Öffnen
CaixaBank

Data Scientist für operationelle Risiken

CaixaBank

Werde Data Scientist für operationelle Risiken bei CaixaBank und entwickle Prognosemodelle, um Verluste und ihre Auswirkungen auf das Unternehmen einzuschätzen. Zu deinen Aufgaben gehören fortgeschrittene Analysen und die Migration von Prozessen zu Google Cloud.

Öffnen