NVIDIA
NVIDIA
NVIDIA entwickelt Technologien für beschleunigtes Rechnen und künstliche Intelligenz, die in den Bereichen Gaming, Rechenzentren, Cloud Computing, Gesundheitswesen, Fertigung, Automobilindustrie und Robotik eingesetzt werden. Das Unternehmen arbeitet an Grafikprozessoren, KI-Plattformen, Simulationslösungen und branchenspezifischen Anwendungen, darunter NVIDIA Omniverse für kollaborative 3D-Workflows, NVIDIA DRIVE für die Entwicklung autonomer Fahrzeuge und NVIDIA Clara für Anwendungen im Gesundheitswesen. NVIDIA vereint große technische Teams, die an der Infrastruktur und Software für fortschrittliches Rechnen, Simulationen und KI-gestützte Analysen arbeiten.

Senior Softwareentwickler Storage – DGX Cloud

Leiten Sie die Storage-Software für die KI-Infrastruktur von NVIDIA mit Schwerpunkt auf quelloffenen verteilten Dateisystemen und Objektspeicher. Diagnostizieren Sie Probleme in groß angelegten GPU-Clustern und etablieren Sie Standards für Leistung, Ausfallsicherheit und Tuning.

Beschreibung

  • Entwickeln Sie quelloffene parallele und verteilte Dateisysteme sowie verteilten Objektspeicher.
  • Tragen Sie Fixes und Funktionen in die Upstream-Projekte ein und arbeiten Sie dabei mit Projektgemeinschaften und Maintainerinnen und Maintainer zusammen.
  • Schreiben und prüfen Sie produktiven Code als praxisorientierte Leitung für Storage-Software.
  • Untersuchen Sie Kernel-, NFS-, NVMe-oF- und SPDK-Code, um Softwarefehler zu diagnostizieren.
  • Treffen Sie abschließende technische Entscheidungen zu Storage-Lieferungen anhand messbarer Ziele.
  • Priorisieren, beheben und analysieren Sie die Ursachen komplexer Storage-Probleme in sehr großen GPU-Clustern.
  • Analysieren Sie die I/O- und Metadatenleistung, Datenbeschädigungen und das Wiederherstellungsverhalten.
  • Bewerten Sie Storage-Architektur, Funktionen, Leistung und Ausfallsicherheit.
  • Führen Sie Skalierungstests, Benchmarking und Wiederherstellungsübungen durch.
  • Qualifizieren Sie neue Builds anhand festgelegter Ziele für Leistung und Ausfallsicherheit.
  • Etablieren und empfehlen Sie Konfigurations-, Tuning- und Betriebspraktiken für leistungsstarke Dateisysteme auf GPU-Infrastrukturen.
  • Unterstützen Sie Betreiber und interne Kundinnen und Kunden bei der Umsetzung von Storage-Richtlinien.
  • Arbeiten Sie mit Teams für Training, Inferenz, beschleunigte Datenverarbeitung, SRE, Betrieb, Netzwerke und Sicherheit zusammen.
  • Arbeiten Sie mit Cloud-Anbietern, Neocloud-Betreibern und Storage-Anbietern an gemeinsamer Architektur.
  • Setzen Sie moderne KI-Coding- und agentische Tools ein, um Entwicklung, Fehlersuche, Validierung und Betrieb zu beschleunigen.

Anforderungen

  • Bachelor-, Master- oder Doktorgrad in Informatik, Elektrotechnik oder einer verwandten Fachrichtung oder gleichwertige Erfahrung.
  • Mehr als 12 Jahre direkte Erfahrung in der Entwicklung von Storage-Software.
  • Umfangreiche Erfahrung mit einem leistungsstarken parallelen oder verteilten Dateisystem im Petabyte-Mehrfachmaßstab.
  • Nachweisbare Beiträge zu quelloffenen Projekten für verteilte oder parallele Dateisysteme.
  • Praktische Erfahrung in der Entwicklung und Prüfung von produktivem Code, der Untersuchung von Dateisystem-, Kernel-, NVMe-oF- oder SPDK-Quellcode sowie der Durchführung von Skalierungstests oder Wiederherstellungsübungen.
  • Erfahrung bei der Diagnose und Behebung von Storage-Problemen in großen GPU- oder HPC-Clustern, einschließlich der Analyse von I/O- und Metadatenleistung.
  • Sichere Beherrschung mindestens einer Systemsprache: C, C++, Rust oder Go.
  • Gute Kenntnisse in Python.
  • Arbeitskenntnisse der Linux-Kernel-Stacks für Storage und Netzwerke, einschließlich Blockschicht, RDMA, RoCE, InfiniBand, NVMe, Page Cache, VFS und Multipathing.
  • Ausgeprägtes Verständnis von Objektspeichertechnologien wie S3 und Swift.
  • Ausgeprägtes Verständnis von Block-Storage-Technologien wie NVMe-oF und iSCSI.
  • Ausgezeichnete schriftliche und mündliche Kommunikationsfähigkeiten.
  • Fähigkeit, in einer rund um die Uhr betriebenen Produktionsumgebung zu arbeiten.
  • Ein sicherheitsorientierter Ansatz für Entwicklung und Betrieb.
  • Erfahrung in der Pflege oder bei kontinuierlichen Beiträgen zu weit verbreiteten öffentlichen Projekten.
  • Erfahrung im Entwurf oder Betrieb von Storage für KI-Training oder Inferenz im sehr großen GPU-Maßstab.
  • Erfahrung mit Kernel- oder Dateisystementwicklung, Metadatenskalierbarkeit, Datenplatzierung, Fehlerwiederherstellung oder HSM beziehungsweise vergleichbaren Systemen.
  • Erfahrung mit Kubernetes und der Entwicklung von CSI-Treibern für Storage.
  • Praktische Erfahrung in der Leistungsoptimierung mit SPDK, libfabric oder FUSE.

Zusatzleistungen

  • Vergütung in Form von Beteiligungen
  • Mitarbeitervorteile

Ähnliche Stellen

Napco National

Einkaufskoordinator/in, Saudi-Arabien (Remote)

Napco National

Koordination der Einkaufsabläufe für ein Fertigungsunternehmen in Saudi-Arabien – von Bestellungen und Lieferungen bis zu Zollunterlagen und Materialtransfers. Unterstützung bei der Zollabfertigung, Rechnungsbearbeitung, Lieferantenreklamationen und der Verlängerung von Produktzertifikaten.

Öffnen
4M Analytics

Senior Engineer für Computer-Vision-Algorithmen

4M Analytics

Entwickle Computer-Vision- und Machine-Learning-Systeme für die Plattform zur Kartierung unterirdischer Versorgungsleitungen von 4M Analytics. Verantworte Algorithmen von der Forschung bis zum Produktiveinsatz und arbeite dabei mit Datenengineering- und Produktteams zusammen.

Öffnen
Terumo Medical Corporation

Regionalmanager Vertrieb für Terumo Interventional Systems

Terumo Medical Corporation

Leiten Sie den Vertrieb medizinischer Produkte in einer Region im Norden von Zentral-New-Jersey und verantworten Sie Außendienstteams sowie die Beziehungen zu Krankenhäusern. Steigern Sie den regionalen Umsatz und die Vertriebsleistung und sorgen Sie für eine regelkonforme Vermarktung der Produkte von Terumo Interventional Systems.

Öffnen
Claroty

QA-Automatisierungsingenieur

Claroty

Entwickle API- und UI-Automatisierungen sowie Qualitätsprüfungen in CI/CD-Pipelines für Clarotys Plattform für die Sicherheit cyberphysischer Systeme. Mit zuverlässigen Tests trägst du zum Schutz kritischer Infrastrukturen bei.

Öffnen