NVIDIA
NVIDIA
NVIDIA ontwikkelt technologieën voor versnelde computing en kunstmatige intelligentie die worden gebruikt in gaming, datacenters, cloudcomputing, de gezondheidszorg, productie, de auto-industrie en robotica. Het bedrijf richt zich op grafische verwerkingseenheden, AI-platforms, simulatie en branchespecifieke oplossingen, waaronder NVIDIA Omniverse voor collaboratieve 3D-workflows, NVIDIA DRIVE voor de ontwikkeling van autonome voertuigen en NVIDIA Clara voor toepassingen in de gezondheidszorg. NVIDIA brengt grote technische teams samen die werken aan de infrastructuur en software voor geavanceerde computing, simulatie en AI-gestuurde analyses.

Senior Software Engineer Storage – DGX Cloud

Leid storage-software voor NVIDIA’s AI-infrastructuur, met focus op open-source gedistribueerde bestandssystemen en objectopslag. Diagnoseer problemen in grootschalige GPU-clusters en stel standaarden vast voor prestaties, duurzaamheid en tuning.

Beschrijving

  • Ontwikkel open-source parallelle en gedistribueerde bestandssystemen en gedistribueerde objectopslag.
  • Draag fixes en functies bij aan upstream-projecten en werk samen met projectgemeenschappen en maintainers.
  • Schrijf en review productiecode als hands-on lead voor storage-software.
  • Inspecteer kernel-, NFS-, NVMe-oF- en SPDK-code om softwaredefecten te diagnosticeren.
  • Neem de uiteindelijke technische beslissingen over storageopleveringen op basis van meetbare doelstellingen.
  • Prioriteer, los op en achterhaal de oorzaken van complexe storageproblemen in zeer grote GPU-clusters.
  • Analyseer I/O- en metadataprestaties, datacorruptie en herstelgedrag.
  • Beoordeel storagearchitectuur, mogelijkheden, prestaties en duurzaamheid.
  • Voer schaaltests, benchmarking en hersteloefeningen uit.
  • Kwalificeer nieuwe builds aan de hand van vastgestelde prestatie- en duurzaamheidsdoelen.
  • Stel configuratie-, tuning- en operationele werkwijzen vast en adviseer daarover voor hoogwaardige bestandssystemen op GPU-infrastructuur.
  • Help operators en interne klanten om storage-richtlijnen te implementeren.
  • Werk samen met teams voor training, inference, versnelde computing, SRE, operations, networking en security.
  • Werk samen met cloudproviders, neocloudoperators en storageleveranciers aan een gedeelde architectuur.
  • Gebruik moderne AI-codeer- en agentische tools om ontwikkeling, debugging, validatie en operations te versnellen.

Vereisten

  • Bachelor-, master- of doctoraatsdiploma in computerwetenschappen, elektrotechniek of een verwante richting, of gelijkwaardige ervaring.
  • Meer dan 12 jaar directe ervaring met de ontwikkeling van storage-software.
  • Uitgebreide ervaring met een performant parallel of gedistribueerd bestandssysteem op schaal van meerdere petabytes.
  • Aantoonbare bijdragen aan open-sourceprojecten voor gedistribueerde of parallelle bestandssystemen.
  • Hands-on ervaring met het ontwikkelen en reviewen van productiecode, het inspecteren van broncode voor bestandssystemen, kernels, NVMe-oF of SPDK, en het uitvoeren van schaaltests of hersteloefeningen.
  • Ervaring met het diagnosticeren en oplossen van storageproblemen in grote GPU- of HPC-clusters, inclusief analyse van I/O- en metadataprestaties.
  • Sterke beheersing van ten minste één systeemtaal: C, C++, Rust of Go.
  • Goede beheersing van Python.
  • Werkkennis van Linux-kernelstacks voor storage en networking, waaronder de block layer, RDMA, RoCE, InfiniBand, NVMe, page cache, VFS en multipathing.
  • Sterk begrip van objectopslagtechnologieën zoals S3 en Swift.
  • Sterk begrip van block-storagetechnologieën zoals NVMe-oF en iSCSI.
  • Uitstekende schriftelijke en mondelinge communicatievaardigheden.
  • Vermogen om te werken in een 24/7-productieomgeving.
  • Een security-first benadering van engineering en operations.
  • Ervaring met het onderhouden van of langdurig bijdragen aan veelgebruikte publieke projecten.
  • Ervaring met het ontwerpen of beheren van storage voor AI-training of inference op zeer grote GPU-schaal.
  • Ervaring met kernel- of bestandssysteemontwikkeling, metadataschaalbaarheid, dataplacering, fout- en herstelbeheer of HSM of vergelijkbare systemen.
  • Ervaring met Kubernetes en de ontwikkeling van CSI-drivers voor storage.
  • Hands-on ervaring met prestatieoptimalisatie met SPDK, libfabric of FUSE.

Voordelen

  • Aandelencompensatie
  • Arbeidsvoorwaarden voor medewerkers

Gerelateerde vacatures

Curtiss-Wright Corporation

Senior Manager Business Capture, defensiecontracten

Curtiss-Wright Corporation
5.001 – 10.000 Medewerkers
AdviesLucht- en ruimtevaartMaakindustrie

Leid complexe, waardevolle aanbestedingen van het Amerikaanse ministerie van Defensie en federale overheden voor Curtiss-Wright Defense Solutions. Bepaal capturestrategieën, technische oplossingen, teams en offertes om effectief mee te dingen.

Openen