Hewlett Packard Enterprise
Hewlett Packard Enterprise
Hewlett Packard Enterprise sviluppa tecnologie aziendali per le organizzazioni che gestiscono ambienti di cloud ibrido e operazioni basate sull’intelligenza artificiale. Il suo portafoglio comprende i server HPE ProLiant e il calcolo ad alte prestazioni HPE Cray, lo storage HPE Alletra, le reti HPE Aruba, piattaforme di IA e fabbriche di IA chiavi in mano, oltre alle soluzioni as-a-service GreenLake. HPE offre inoltre funzionalità di sicurezza come Zero Trust e SASE, insieme a servizi professionali, di consulenza e di supporto che aiutano le grandi organizzazioni a modernizzare l’infrastruttura, gestire gli ambienti dei data center e implementare l’IA su larga scala.

Senior Software Engineer per l'inferenza presso HPE Hybrid

Guida lo sviluppo del runtime aziendale per l'inferenza LLM di HPE AI Essentials destinato alle infrastrutture dei clienti. Migliora il serving efficiente su GPU, l'esecuzione distribuita e l'orchestrazione Kubernetes.

Descrizione

  • Gestisci i componenti fondamentali del deployment per il serving LLM, inclusi l'integrazione del motore, il batching continuo, la gestione e il riutilizzo della cache KV e l'esecuzione quantizzata.
  • Collabora con i team di ingegneria dell'inferenza per ridurre il tempo al primo token, la latenza tra i token, il throughput della GPU e la latenza di coda P95/P99.
  • Sviluppa e gestisci funzionalità di esecuzione distribuita come prefill e decode disaggregati, parallelismo tensoriale e di pipeline e offload della cache KV tra la memoria della GPU, la memoria host e lo storage connesso tramite RDMA.
  • Valuta runtime emergenti, metodi di quantizzazione, decodifica speculativa e serving di modelli mixture-of-experts, quindi raccomanda le tecnologie da adottare.
  • Contribuisci alla realizzazione del livello di orchestrazione che comprende l'ammissione dei modelli, la pianificazione e il partizionamento delle GPU, il routing delle richieste basato sulla cache e l'autoscaling.
  • Risolvi i problemi dei clienti dall'inizio alla fine, individua le cause radice e rafforza i sistemi e i processi correlati.
  • Esamina codice e progetti, fai da mentor ai colleghi e promuovi solide pratiche di ingegneria.

Requisiti

  • Almeno 8 anni di esperienza nell'ingegneria del software.
  • Uno o due anni o più di esperienza diretta con runtime per l'inferenza LLM o il serving di modelli in produzione.
  • Laurea in informatica o in una disciplina correlata.
  • Familiarità con motori di inferenza LLM come vLLM, SGLang, TensorRT-LLM, TGI o NVIDIA NIM, inclusa esperienza nella modifica degli elementi interni del motore.
  • Solida conoscenza di batching continuo, paged attention, riutilizzo della cache KV e caching dei prefissi, prefill a blocchi, quantizzazione e decodifica speculativa.
  • Conoscenza pratica del parallelismo tensoriale e di pipeline, delle operazioni collettive NCCL, della gerarchia della memoria GPU e del comportamento delle interconnessioni.
  • Padronanza avanzata dell'architettura delle piattaforme Kubernetes, inclusi operatori, risorse personalizzate, controller e scheduling.
  • Solide competenze di programmazione in Go e Python.
  • Capacità di leggere, eseguire il debug e profilare C++ e CUDA con strumenti come Nsight.
  • Familiarità con il debugging e il profiling di carichi di lavoro multilivello, incluse applicazioni RAG e agentiche.
  • Eccellenti capacità analitiche, di debugging e di problem solving.
  • Preferibile: contributi a vLLM, SGLang, TensorRT-LLM, llm-d, LMCache o KServe.
  • Preferibile: esperienza con serving di prefill e decode disaggregati oppure con offload e riutilizzo della cache KV su larga scala.
  • Preferibile: esperienza con RDMA, GPUDirect Storage, InfiniBand o RoCE.
  • Preferibile: esperienza con MIG, allocazione frazionata delle GPU e isolamento delle GPU in ambienti multi-tenant.
  • Preferibile: esperienza nella realizzazione di software per ambienti aziendali on-premises, air-gapped o regolamentati.

Benefit

  • Benefit completi a sostegno della salute fisica, della sicurezza finanziaria e del benessere emotivo.
  • Programmi a sostegno della crescita personale e professionale.
  • Flessibilità nelle modalità di lavoro e nelle esigenze personali.
  • Una cultura aziendale inclusiva.
  • Adattamenti ragionevoli durante il processo di candidatura o di colloquio per i candidati qualificati con disabilità.

Offerte correlate

MÜNZING CHEMIE GmbH

Responsabile vendite di prodotti chimici speciali nel Medio Atlantico

MÜNZING CHEMIE GmbH
501 – 1000 Dipendenti
ChimicaIndustria manifatturiera

Guida le vendite tecniche di additivi chimici speciali nella regione del Medio Atlantico, servendo clienti nei settori dei rivestimenti, degli adesivi, degli inchiostri e delle costruzioni. Gestisce i clienti esistenti e sviluppa nuove opportunità commerciali attraverso visite ai clienti e vendite basate su progetti.

Apri
MÜNZING

Responsabile vendite MÜNZING per il Mid-Atlantic, prodotti chimici speciali

MÜNZING

Guidare le vendite territoriali degli additivi chimici speciali MÜNZING nel Mid-Atlantic, usando la vendita tecnica per progetto per sviluppare relazioni con i clienti e concludere contratti. Gestire un territorio da 3–5 milioni di dollari e sviluppare un potenziale commerciale a breve termine da 1–2 milioni nei mercati di rivestimenti, adesivi, inchiostri e costruzioni.

Apri
ERM

Consulente specialista in amianto

ERM

Contribuisci alle attività di consulenza sulla sostenibilità di ERM occupandoti di campionamenti di amianto, sicurezza sul sito e conformità normativa. Gestisci progetti relativi all’amianto in siti industriali e cantieri nel sud della California.

Apri
Proofpoint

Responsabile clienti nominativi per la cybersicurezza, mercato medio — Proofpoint

Proofpoint

Vendi la piattaforma di cybersicurezza di Proofpoint ai clienti del mercato medio nello Stato di Washington o in Oregon. Il ruolo comprende gestione dei clienti, vendite tramite partner, prospezione e soluzioni complesse pluriennali.

Apri