Baseten
Baseten
Baseten fournit une infrastructure d’inférence de modèles aux entreprises qui déploient des applications d’apprentissage automatique et d’intelligence artificielle. Sa plateforme est conçue pour un service rapide et évolutif, en combinant une inférence à haut débit, un déploiement rapide, une mise à l’échelle automatique, un service sécurisé des modèles pour les entreprises et la prise en charge du conditionnement de modèles open source. Baseten aide les équipes d’ingénierie et d’apprentissage automatique à gérer les exigences opérationnelles liées à l’infrastructure des modèles afin qu’elles puissent se concentrer sur le développement de modèles propres à leur domaine. L’entreprise intervient dans les secteurs de l’intelligence artificielle, du logiciel en tant que service et des technologies d’entreprise, avec une équipe de 11 à 50 employés.

Responsable ingénierie, performances d’inférence GPU chez Baseten

Pilotez l’ingénierie des performances d’inférence GPU chez Baseten, une entreprise d’infrastructure d’IA. Orientez l’optimisation du runtime, l’efficacité des modèles et la croissance d’une équipe technique spécialisée.

Description

  • Gérer, accompagner et développer les ingénieurs en performances d’inférence grâce à des entretiens individuels réguliers, des retours, une planification de carrière et des évaluations de performance
  • Recruter des ingénieurs GPU et inférence tout en favorisant une culture d’équipe collaborative
  • Piloter la feuille de route et l’exécution des performances du runtime
  • Examiner les conceptions techniques, diriger les travaux de profilage et d’optimisation et aider les ingénieurs à évaluer l’utilisation du temps et de la mémoire
  • Mettre en production la quantification, le décodage spéculatif, la réutilisation du cache KV, le préremplissage par blocs et l’ordonnancement personnalisé
  • Traduire les gains de performance en améliorations mesurables du nombre de tokens par heure de GPU, de l’utilisation, de la latence et des coûts
  • Intégrer de nouvelles architectures de modèles sur du matériel émergent et en optimiser les performances
  • Collaborer avec les équipes Infrastructure, Plateforme d’inférence, Kernels, API de modèles et équipes en contact avec les clients afin de prioriser le travail, coordonner les lancements et fournir des améliorations
  • Établir des standards d’ingénierie pour la qualité, le benchmarking, l’excellence opérationnelle et la réponse aux incidents
  • Faire progresser l’optimisation de l’inférence agentique, les kernels agentiques, l’entraînement de modèles par décodage spéculatif et la Baseten Inference Stack

Exigences

  • Diplôme de licence, de master ou de doctorat en informatique, en ingénierie, en mathématiques ou dans une discipline connexe
  • Expérience en management couvrant le recrutement d’ingénieurs, l’accompagnement, les retours et les évaluations de performance
  • Expérience dans la direction ou le soutien étroit d’équipes d’optimisation GPU dans l’entraînement, l’inférence ou les systèmes de recommandation
  • Solides connaissances techniques des charges de travail GPU, de l’architecture et des compromis de performance
  • Familiarité avec les bibliothèques de machine learning, notamment PyTorch, TensorRT ou TensorRT-LLM
  • Capacité démontrée à définir des feuilles de route et à mener à bien des projets techniques complexes en équipe
  • Excellentes compétences en communication écrite et orale pour aligner les parties prenantes entre les équipes
  • Familiarité avec des moteurs d’inférence tels que vLLM, SGLang ou TensorRT-LLM
  • Expérience dans l’application de méthodes d’optimisation des LLM telles que la quantification, le décodage spéculatif et le traitement par lots continu
  • Expérience du développement ou de l’utilisation de kernels GPU avec CUDA, Triton ou CUTLASS
  • Expérience dans la croissance d’une équipe d’ingénierie pendant une phase de forte croissance d’une startup
  • Expérience pratique préalable en tant qu’ingénieur performances ou systèmes avant de passer au management

Avantages

  • Package de rémunération compétitif avec une participation au capital significative
  • Pour les employés aux États-Unis, couverture médicale, dentaire et optique complète pour les employés et leurs ayants droit
  • Congés payés flexibles, avec notamment une pause hivernale pour toute l’entreprise
  • Congé parental payé
  • Soutien à la fertilité et à la construction familiale grâce à Carrot
  • Pour les employés aux États-Unis, plan 401(k) facilité par l’entreprise
  • Possibilités de travailler avec diverses startups de machine learning et de développer son réseau dans le secteur

Offres similaires

Red Hat

Architecte cloud conseil, OpenShift

Red Hat

Conçoit et déploie des solutions Red Hat OpenShift, Kubernetes et de cloud hybride pour des entreprises clientes. Pilote des missions axées sur l’infrastructure, l’automatisation et la livraison d’applications.

Ouvrir
Kreato Global | BPO and Language Solutions

Interprète à distance anglais-espagnol OPI/VRI

Kreato Global | BPO and Language Solutions

Interprétez à distance entre des personnes anglophones et hispanophones dans les domaines médical, financier, des services sociaux et du service client. Fournissez un soutien linguistique à Kreato Global dans toute l’Amérique latine.

Ouvrir
Taurus SA

Technicien informatique et spécialiste du support client

Taurus SA

Assurez le support des utilisateurs internes et des clients externes de Taurus au sein d’une fintech réglementée spécialisée dans les actifs numériques. Gérez l’infrastructure Azure, le support des postes de travail, le tri des tickets et la résolution des problèmes clients.

Ouvrir
RecruitGo

Assistant exécutif à distance, prospection et marketing — Philippines

RecruitGo
51 – 200 Employés
ConseilLogistiqueMarketing

Assure le soutien administratif, la gestion du CRM, la prospection et le marketing pour RecruitGo, une entreprise d’Employer of Record qui met en relation des clients internationaux avec des talents issus de marchés émergents. Accompagne deux clients tournés vers le Royaume-Uni dans leurs tâches administratives quotidiennes et leurs campagnes créatives.

Ouvrir
SPERTON - Where Great People Meet

Responsable commercial des ascenseurs et des systèmes de stationnement

SPERTON - Where Great People Meet
51 – 200 Employés

Développez les ventes d’ascenseurs et de systèmes de stationnement dans la région ouest de Mumbai. Nouez des relations avec les clients et les distributeurs, et gérez les affaires de la première demande à la réalisation du projet.

Ouvrir
Salonkee

Commercial·e en logiciel pour salons — Göttingen

Salonkee
51 – 200 Employés
BeautéPlace de marchéSaaS

Développez l’activité de Salonkee dans le domaine des logiciels pour salons à Göttingen grâce à la prospection locale, aux démonstrations du produit et à la gestion complète des ventes. Nouez des relations avec les propriétaires de salons et accompagnez-les du premier contact jusqu’à la conclusion de la vente.

Ouvrir
Salonkee

Commercial hybride, Lindau

Salonkee
51 – 200 Employés
BeautéPlace de marchéSaaS

Développez l’activité de Salonkee dans les logiciels pour salons à Lindau et Friedrichshafen grâce à la prospection, aux démonstrations du produit et à la gestion complète des ventes. Créez des relations avec les propriétaires de salons locaux et accompagnez chaque opportunité jusqu’à sa conclusion.

Ouvrir