Mirantis
Mirantis
Mirantis entwickelt cloudnative Infrastruktur- und Container-Management-Software für Organisationen, die Kubernetes-Umgebungen in großem Maßstab aufbauen, absichern und betreiben. Das Portfolio umfasst Mirantis Kubernetes Engine, Mirantis OpenStack for Kubernetes, Mirantis Container Cloud, Mirantis Container Runtime und Mirantis Secure Registry und unterstützt den Clusterbetrieb sowie die Sicherheit der Software-Lieferkette. Darüber hinaus trägt das Unternehmen mit Projekten und Tools wie Lens Desktop, einer Kubernetes-IDE, zum Open-Source-Ökosystem bei und bietet technischen Support für Unternehmen. Mirantis arbeitet mit Organisationen aus den Bereichen Beratung, Gesundheitswesen, Logistik, öffentliche Dienstleistungen, Finanzdienstleistungen und technologieorientierte Branchen zusammen, die moderne Cloud-Infrastrukturen einsetzen.

Senior Site Reliability Engineer (SRE)

Senior-SRE-Position mit Schwerpunkt auf der Bereitstellung von NVIDIA-gestützter Kubernetes- und Cloud-KI-Infrastruktur für Mirantis. Die Position umfasst Zuverlässigkeit, Sicherheit, Automatisierung und Kundenbetreuung in weltweit verteilten Teams.

Beschreibung

  • Entwurf, Entwicklung, Bereitstellung, Betrieb, Wartung und Fehlerbehebung von Open-Source-Lösungen für Cloud- und KI-Infrastrukturen
  • Bereitstellung von KI-Infrastrukturen auf NVIDIA-zertifizierter Hardware gemäß genehmigten Architektur- und Implementierungsentwürfen
  • Sicherstellung der Zuverlässigkeit, Sicherheit und Leistungsfähigkeit der Container-Infrastruktur
  • Zusammenarbeit mit geografisch verteilten internationalen Teams bei technischen Herausforderungen und Prozessverbesserungen
  • Erfassung und Präzisierung technischer Anforderungen gemeinsam mit Stakeholdern
  • Verbesserung der Systemleistung, Zuverlässigkeit und Skalierbarkeit
  • Untersuchung, Fehleranalyse und Behebung komplexer technischer Probleme
  • Mitwirkung an Code-Reviews
  • Entwurf und Implementierung KI-gestützter Automatisierung über den gesamten DevOps-Lebenszyklus hinweg
  • Wissensvermittlung an Kunden während der Bereitstellungsphasen
  • Mentoring von Teammitgliedern und Mirantis-Kunden
  • Festlegung technischer Strategien und nahtlose Integration von Cloud- und Softwarediensten

Anforderungen

  • Mindestens fünf Jahre Berufserfahrung im DevOps-Bereich mit Schwerpunkt auf Cloud- und Infrastrukturtechnologien wie Kubernetes oder OpenStack
  • Erfahrung mit Hochleistungsdatenverarbeitung, Netzwerken und Speicherlösungen in Rechenzentren
  • Erfahrung mit Golang sowie gute Kenntnisse in Python und JavaScript
  • Ausgeprägtes Verständnis für verteilte Systeme, Microservices-Architekturen und CI/CD-Pipelines
  • Fortgeschrittene Fähigkeiten zur Problemlösung und Fehleranalyse in den Bereichen Netzwerke, Speicher, Linux und Kubernetes
  • Kenntnisse in Leistungsoptimierung und Sicherheit
  • Fähigkeit, technische Aufgaben zu leiten und effektiv mit vielfältigen Teams zusammenzuarbeiten
  • Fähigkeit, bei der direkten Arbeit mit Kunden eigenständig fundierte Entscheidungen zu treffen
  • Sehr gute schriftliche und mündliche Englischkenntnisse
  • Ausgeprägte Kommunikationsfähigkeiten im Kundenkontakt
  • Engagement für Innovation, kontinuierliches Lernen und qualitativ hochwertige Ergebnisse
  • Bereitschaft zu internationalen und nationalen Dienstreisen von bis zu 25 %
  • Bachelorabschluss in Informatik oder einem verwandten Fachgebiet oder gleichwertige Berufserfahrung
  • Mindestens fünf Jahre Erfahrung in DevOps, Softwareentwicklung oder einer vergleichbaren Position
  • Wünschenswert: Erfahrung mit Netzwerk- oder Speicherarchitekturen
  • Wünschenswert: Erfahrung mit High-Performance-Computing oder GPU-Infrastrukturen, einschließlich GPU-Scheduling, MIG/vGPU, RDMA/RoCE oder InfiniBand, NVLink, DCGM-Zustandsprüfungen, Lebenszyklus von GPU-Treibern und Firmware oder NVIDIA AI Enterprise
  • Wünschenswert: Mitwirkung in Open-Source-Communities durch Beiträge zu Upstream-Projekten oder Konferenzvorträge
  • Wünschenswert: Erfahrung mit Rancher, OpenShift und VMware

Zusatzleistungen

  • Möglichkeiten zur beruflichen Weiterentwicklung und Weiterbildung
  • Teilnahme an Konferenzen und Arbeitsgruppen
  • Unternehmensevents, Happy Hours, Hackathons und Technologievorträge
  • Wettbewerbsfähiges Vergütungspaket mit umfassendem Leistungspaket
  • Zusammenarbeit mit engagierten, talentierten und inspirierenden Kolleginnen und Kollegen
  • Arbeit mit Fortune-500- und Global-2000-Kunden an Cloud-Technologien der nächsten Generation
  • Mitwirkung an Open-Source-Innovationen
  • Dynamische Unternehmenskultur, geprägt von Offenheit, Zusammenarbeit, kalkuliertem Risikobewusstsein und kontinuierlichem Wachstum

Ähnliche Stellen

Terumo Medical Corporation

Gebietsleiter Interventionssysteme – Philadelphia

Terumo Medical Corporation

Verantwortung für den Vertrieb von Terumo-Interventionssystemen an Krankenhäuser und ambulante Einrichtungen im Raum Philadelphia. Kundenbeziehungen ausbauen, Eingriffe begleiten, Fachpersonal schulen und Vertriebsziele erreichen.

Öffnen
Cross River

Engineering Manager Cloud und verteilte Systeme – Cross River, Jerusalem

Cross River

Führe und unterstütze Engineers beim Aufbau von Fintech-Diensten und Infrastruktur für Zahlungen, Karten, Kredite und Krypto. In dieser hybriden Rolle in Jerusalem liegt der Schwerpunkt auf cloudnativen Systemen und zuverlässiger Engineering-Umsetzung.

Öffnen
Aleph Alpha

Senior AI Researcher für das Pre-Training von Foundation Models — Aleph Alpha, Heidelberg

Aleph Alpha
51 – 200 Mitarbeitende
B2BKünstliche Intelligenz

Leite Architektur- und Pre-Training-Arbeiten im großen Maßstab für Aleph Alphas europäische Foundation Models und gestalte Trainingsmethoden für Tausende GPUs. Entwickle und verfeinere PyTorch-Trainingsrezepte im hybriden Team in Heidelberg.

Öffnen