NVIDIA
NVIDIA
NVIDIA entwickelt Technologien für beschleunigtes Rechnen und künstliche Intelligenz, die in den Bereichen Gaming, Rechenzentren, Cloud Computing, Gesundheitswesen, Fertigung, Automobilindustrie und Robotik eingesetzt werden. Das Unternehmen arbeitet an Grafikprozessoren, KI-Plattformen, Simulationslösungen und branchenspezifischen Anwendungen, darunter NVIDIA Omniverse für kollaborative 3D-Workflows, NVIDIA DRIVE für die Entwicklung autonomer Fahrzeuge und NVIDIA Clara für Anwendungen im Gesundheitswesen. NVIDIA vereint große technische Teams, die an der Infrastruktur und Software für fortschrittliches Rechnen, Simulationen und KI-gestützte Analysen arbeiten.

Senior Systems Software Engineer, Kubernetes-Skalierung – NVIDIA DGX Cloud

Skalieren und optimieren Sie die Kubernetes-Infrastruktur für NVIDIA DGX Cloud und verteilte KI-Workloads. Entwickeln Sie Systeme für Performance-Tests, Monitoring, Analysen und CI/CD für beschleunigtes Computing im großen Maßstab.

Beschreibung

  • Verantwortung für die durchgängige Analyse von Performance und Skalierbarkeit des NVIDIA-DGX-Cloud-Software-Stacks – einschließlich Kubernetes-Control- und Data-Plane, GPU Operator, Network Operator, DCGM, NIM und verteilter Inferenzbereitstellung.
  • Zusammenarbeit mit KI-Forschenden, Entwicklern und Kunden bei der Erstellung automatisierter Tests, die reale Workloads abbilden.
  • Analyse von Performance- und Skalierbarkeitsproblemen in komplexen verteilten Systemen sowie Ermittlung ihrer Ursachen.
  • Entwicklung von Monitoring-, Reporting- und Analysetools zur Prüfung der Performance und Skalierbarkeit von Software, GPUs und CPUs.
  • Triage, Debugging und Behebung von Problemen beim Betrieb von Kubernetes-Clustern im extrem großen Maßstab.
  • Entwicklung und Pflege kontinuierlicher Performance- und Skalierbarkeitstests über eine moderne CI/CD-Pipeline.
  • Dokumentation von Forschung, Methoden und Ergebnissen sowie Präsentation der Resultate auf internen und externen Veranstaltungen wie KubeCon und GTC.
  • Mitarbeit in den Open-Source-Communities von Kubernetes, CNCF und NVIDIA, um die Performance von KI-Workloads zu bewerten und Designentscheidungen mitzugestalten.

Anforderungen

  • Mindestens acht Jahre Erfahrung mit Computerarchitektur, Netzwerken, Speichersystemen oder Beschleunigern.
  • Bachelor- oder Masterabschluss im Ingenieurwesen – vorzugsweise Elektrotechnik, Computer Engineering oder Informatik – oder gleichwertige Erfahrung.
  • Kubernetes-Kenntnisse auf Expertenniveau und Vertrautheit mit verwandten CNCF-Projekten.
  • Erfahrung mit groß angelegten parallelen und verteilten Systemen auf Basis von Beschleunigern.
  • Expertise in der Optimierung von Performance und KI-Workloads auf groß angelegten Systemen.
  • Erfahrung mit Performance-Modellierung und Benchmarking im großen Maßstab.
  • Sehr gute Kenntnisse in Golang und Python.
  • Erfahrung mit dem NVIDIA-Softwareökosystem für Training und Inferenz.
  • Expertise mit mindestens einem Public-Cloud-Infrastruktur-Anbieter wie GCP, AWS, Azure oder OCI.
  • Ausgeprägte praktische Erfahrung mit einer Kubernetes-Distribution.
  • Erfahrung bei der Skalierung von Kubernetes-Clustern auf extrem hohe Anzahlen von Knoten und Objekten.
  • Nachweisbare Beteiligung an Open-Source-Communities.
  • Eine Promotion in einem relevanten Fachgebiet ist ein herausragendes Qualifikationsmerkmal.
  • Ausgezeichnete Kommunikations- und zwischenmenschliche Fähigkeiten.

Ähnliche Stellen

Knowtion Health

Remote Manager für Talentgewinnung

Knowtion Health

Verantwortet Recruiting-Systeme, Stellenanforderungen, Analysen und die Verwaltung externer Arbeitskräfte bei Knowtion Health. Unterstützt skalierbare Einstellungsprozesse für ein wachsendes Gesundheitsunternehmen.

Öffnen
Napco National

Einkaufskoordinator/in, Saudi-Arabien (Remote)

Napco National

Koordination der Einkaufsabläufe für ein Fertigungsunternehmen in Saudi-Arabien – von Bestellungen und Lieferungen bis zu Zollunterlagen und Materialtransfers. Unterstützung bei der Zollabfertigung, Rechnungsbearbeitung, Lieferantenreklamationen und der Verlängerung von Produktzertifikaten.

Öffnen
4M Analytics

Senior Engineer für Computer-Vision-Algorithmen

4M Analytics

Entwickle Computer-Vision- und Machine-Learning-Systeme für die Plattform zur Kartierung unterirdischer Versorgungsleitungen von 4M Analytics. Verantworte Algorithmen von der Forschung bis zum Produktiveinsatz und arbeite dabei mit Datenengineering- und Produktteams zusammen.

Öffnen
Terumo Medical Corporation

Regionalmanager Vertrieb für Terumo Interventional Systems

Terumo Medical Corporation

Leiten Sie den Vertrieb medizinischer Produkte in einer Region im Norden von Zentral-New-Jersey und verantworten Sie Außendienstteams sowie die Beziehungen zu Krankenhäusern. Steigern Sie den regionalen Umsatz und die Vertriebsleistung und sorgen Sie für eine regelkonforme Vermarktung der Produkte von Terumo Interventional Systems.

Öffnen
Claroty

QA-Automatisierungsingenieur

Claroty

Entwickle API- und UI-Automatisierungen sowie Qualitätsprüfungen in CI/CD-Pipelines für Clarotys Plattform für die Sicherheit cyberphysischer Systeme. Mit zuverlässigen Tests trägst du zum Schutz kritischer Infrastrukturen bei.

Öffnen