Cerebras
Cerebras
Cerebras sviluppa hardware per l’IA su scala wafer e software integrato per l’addestramento e l’inferenza di modelli ad alte prestazioni. Il suo Wafer-Scale Engine alimenta il sistema CS-3 e Cerebras Inference Cloud, che supporta flussi di lavoro compatibili con l’API di OpenAI e l’implementazione in ambienti locali, cloud ed edge. La piattaforma dell’azienda è progettata per applicazioni quali il serving dei modelli, il fine-tuning, il pre-addestramento, gli agenti di IA in tempo reale, la genomica, la scoperta di farmaci, la cybersicurezza e la ricerca aziendale. Cerebras riunisce chip, sistemi e software specializzati per le organizzazioni che sviluppano e gestiscono carichi di lavoro impegnativi di intelligenza artificiale, con un team di 501-1.000 dipendenti.

Ingegnere di Machine Learning, Avvio dei Modelli

Porta i modelli transformer sull’hardware acceleratore per l’IA di Cerebras e ottimizza le loro prestazioni di inferenza. Sviluppa percorsi del compilatore MLIR migliorando al contempo correttezza, latenza, throughput ed efficienza della memoria dei modelli.

Descrizione

  • Porta nuovi modelli in produzione analizzando le architetture, convertendo i pesi, implementando i percorsi di esecuzione e convalidando i risultati rispetto alle implementazioni di riferimento.
  • Esegui il lowering dei modelli sull’hardware Cerebras con dialetti MLIR, trasformazioni dei grafi, pass di lowering e mappature specifiche dell’hardware.
  • Supporta attenzione, moltiplicazione di matrici, normalizzazione, embedding posizionali e altri operatori attraverso lo sviluppo di compilatori e kernel.
  • Ottimizza la fusione degli operatori, i layout dei tensori, il tiling, l’allocazione della memoria, lo spostamento dei dati e l’esecuzione parallela.
  • Migliora le prestazioni di prefill e decode regolando la gestione della KV-cache, il batching e la quantizzazione per ottenere latenza, throughput e utilizzo della memoria migliori.
  • Analizza le discrepanze numeriche e valuta l’impatto dei cambiamenti di precisione e delle ottimizzazioni del compilatore sull’accuratezza.
  • Utilizza profiler, tracce di esecuzione e contatori hardware per individuare i colli di bottiglia di calcolo, memoria, comunicazione e runtime.
  • Collabora con i team hardware, compilatore, kernel e runtime per fornire un supporto affidabile ai modelli e benchmark delle prestazioni riproducibili.

Requisiti

  • Padronanza della programmazione in C++ e Python.
  • Esperienza pratica nell’avvio e nel debug di modelli di machine learning in PyTorch o in un framework comparabile.
  • Esperienza pratica con MLIR, inclusi dialetti, pattern di riscrittura, pass di trasformazione e pipeline di lowering.
  • Conoscenza dei fondamenti dei compilatori, comprese rappresentazioni intermedie, analisi del flusso di dati e generazione del codice.
  • Comprensione delle architetture transformer, dei meccanismi di attenzione, delle operazioni sui tensori e della precisione numerica.
  • Esperienza nella profilazione e nell’ottimizzazione di carichi di lavoro su GPU o altri acceleratori per l’IA.
  • Capacità di diagnosticare problemi di correttezza e prestazioni nel codice del modello, nell’output del compilatore, nei kernel e nell’esecuzione del runtime.
  • Esperienza con l’inferenza di modelli linguistici di grandi dimensioni, inclusi GQA, attenzione a finestra scorrevole, mixture-of-experts, caching KV e decodifica speculativa.
  • Esperienza con FP16, BF16, FP8 o quantizzazione a pochi bit e con i relativi compromessi tra accuratezza e prestazioni.
  • Esperienza nello sviluppo di kernel per acceleratori o backend di compilatori specifici dell’hardware.
  • Familiarità con l’esecuzione distribuita, il parallelismo dei modelli e le gerarchie di memoria degli acceleratori.
  • Contributi a MLIR, LLVM, framework di inferenza o progetti open source correlati.

Benefit

  • Impiego stabile in un ambiente dal ritmo di una startup.
  • Opportunità di pubblicare e rendere open source ricerche avanzate sull’IA.
  • Lavorare con uno dei supercomputer per l’IA più veloci al mondo.
  • Una cultura diretta e non aziendalista che rispetta le convinzioni individuali.
  • Apprendimento continuo, crescita professionale e supporto.
  • Un ambiente di lavoro equo e diversificato.

Offerte correlate

GFN

Ingegnere senior del software per l’apprendimento automatico

GFN
201 – 500 Dipendenti
Commercio elettronicoFintechSaaS

Sviluppa infrastrutture backend e prodotti didattici basati sull’IA per GFN, un ente tedesco che opera nel settore dell’istruzione. Crea piattaforme didattiche scalabili, puntando su un’architettura software solida e sull’apprendimento automatico applicato.

Apri
TEKsystems

Responsabile di progetto per programmi dati da remoto — Washington

TEKsystems

Coordina iniziative aziendali sui dati, migrazioni dei report e l’adozione di nuovi processi e soluzioni di reporting per TEKsystems. Monitora l’avanzamento dei progetti, i rischi, i risultati da consegnare e le comunicazioni con gli stakeholder aziendali e tecnici.

Apri
OPENLANE

Ingegnere iOS senior, con l’IA al primo posto

OPENLANE
1001 – 5000 Dipendenti
AutomotiveB2BMarketplace

Sviluppa app iOS con il supporto dell’IA per acquirenti e venditori nel marketplace digitale di veicoli di OPENLANE. Guida l’architettura SwiftUI e UIKit, i test, i rilasci e la collaborazione con Android e gli altri team.

Apri
Ambush

Senior Data Scientist / Ingegnere ML

Ambush

Crea soluzioni di previsione, ottimizzazione e IA in Ambush, una società di consulenza in ingegneria e strategia. Sviluppa servizi Python sicuri e porta i sistemi di apprendimento automatico in produzione.

Apri
Endeavors

Analista finanziario da remoto – Texas

Endeavors

Gestisci budget, previsioni e finanziamenti tramite sovvenzioni presso Endeavors, un’organizzazione di servizi sociali. Fornisci rendiconti finanziari e raccomandazioni all’alta dirigenza e ai responsabili dei programmi.

Apri