Mirantis
Mirantis
Mirantis entwickelt cloudnative Infrastruktur- und Container-Management-Software für Organisationen, die Kubernetes-Umgebungen in großem Maßstab aufbauen, absichern und betreiben. Das Portfolio umfasst Mirantis Kubernetes Engine, Mirantis OpenStack for Kubernetes, Mirantis Container Cloud, Mirantis Container Runtime und Mirantis Secure Registry und unterstützt den Clusterbetrieb sowie die Sicherheit der Software-Lieferkette. Darüber hinaus trägt das Unternehmen mit Projekten und Tools wie Lens Desktop, einer Kubernetes-IDE, zum Open-Source-Ökosystem bei und bietet technischen Support für Unternehmen. Mirantis arbeitet mit Organisationen aus den Bereichen Beratung, Gesundheitswesen, Logistik, öffentliche Dienstleistungen, Finanzdienstleistungen und technologieorientierte Branchen zusammen, die moderne Cloud-Infrastrukturen einsetzen.

Senior Site Reliability Engineer (SRE) – Remote

Werden Sie Teil von Mirantis als Senior SRE mit Schwerpunkt auf zuverlässiger Kubernetes- und NVIDIA-basierter KI-Infrastruktur. Automatisieren Sie DevOps-Abläufe und unterstützen Sie verteilte Kunden und Engineering-Teams.

Beschreibung

  • Entwerfen, entwickeln und betreiben Sie fortschrittliche Cloud-KI-Lösungen auf Basis von CNCF-Technologien, einschließlich Kubernetes
  • Implementieren Sie KI-Infrastrukturen auf NVIDIA-zertifizierter Hardware gemäß genehmigten Architektur- und Implementierungsplänen
  • Stellen Sie Zuverlässigkeit, Sicherheit und Leistung von Containerplattformen sicher
  • Betreuen und entwickeln Sie Mirantis-Kolleginnen und -Kollegen sowie Kunden weiter
  • Arbeiten Sie bei technischen Themen und Prozessverbesserungen mit geografisch verteilten internationalen Teams zusammen
  • Entwickeln, implementieren, warten und beheben Sie Fehler in Open-Source-Cloud- und KI-Infrastrukturen
  • Arbeiten Sie mit Stakeholdern zusammen, um technische Anforderungen zu erfassen und zu präzisieren
  • Verbessern Sie Systemleistung, Zuverlässigkeit und Skalierbarkeit
  • Untersuchen, analysieren und beheben Sie komplexe technische Probleme
  • Beteiligen Sie sich an Code-Reviews
  • Verfolgen Sie Entwicklungen und Best Practices im Cloud-Betrieb und in der Softwareentwicklung
  • Erstellen Sie KI-gestützte Automatisierungen über den gesamten DevOps-Lebenszyklus hinweg
  • Vermitteln Sie Kunden während Delivery-Projekten Wissen
  • Unterstützen Sie Stakeholder beim Erarbeiten technischer Strategien und bei der Bewältigung komplexer Herausforderungen
  • Stellen Sie eine zuverlässige Integration zwischen Cloud- und Softwarediensten sicher

Anforderungen

  • Mindestens fünf Jahre Berufserfahrung im DevOps-Bereich, insbesondere mit Cloud- und Infrastrukturplattformen wie Kubernetes und/oder OpenStack
  • Erfahrung mit Hochleistungsrechnern, Netzwerken und Speichersystemen in Rechenzentren
  • Erfahrung mit Go sowie praktische Kenntnisse zusätzlicher Sprachen wie Python und JavaScript
  • Ausgeprägtes Verständnis für verteilte Systeme, Microservices und CI/CD-Pipelines
  • Ausgeprägte Fähigkeiten zur Fehlersuche und Fehlerbehebung in den Bereichen Netzwerk, Speicher, Linux und Kubernetes
  • Kenntnisse in der Optimierung von Systemleistung und in Sicherheitspraktiken
  • Fähigkeit, technische Arbeiten zu leiten und effektiv mit unterschiedlichen Teams zusammenzuarbeiten
  • Ausgeprägtes eigenständiges Urteilsvermögen bei der direkten Arbeit mit Kunden, häufig mit begrenzter täglicher Betreuung
  • Sehr gute schriftliche und mündliche Englischkenntnisse
  • Ausgeprägte Kommunikationsfähigkeiten im direkten Kundenkontakt
  • Nachweisliches Engagement für Innovation, kontinuierliches Lernen und hochwertige Arbeitsergebnisse
  • Bereitschaft zu internationalen Reisen von bis zu 25 % bei Bedarf
  • Bachelorabschluss in Informatik oder einem verwandten Fachgebiet oder gleichwertige Erfahrung
  • Mindestens fünf Jahre Erfahrung in DevOps, Softwareentwicklung oder einer vergleichbaren Rolle
  • Von Vorteil: umfangreiche Erfahrung mit Netzwerk- und/oder Speicherarchitekturen
  • Von Vorteil: Hintergrund in Hochleistungsrechnen oder GPU-Infrastruktur, einschließlich GPU-Scheduling, MIG/vGPU, RDMA/RoCE oder InfiniBand, NVLink, DCGM-Zustandsprüfungen, Lebenszyklen von GPU-Treibern und Firmware oder NVIDIA AI Enterprise
  • Von Vorteil: Engagement in Open-Source-Communities durch Beiträge zu Upstream-Projekten oder Konferenzvorträge
  • Von Vorteil: Erfahrung mit Rancher, OpenShift und VMware

Zusatzleistungen

  • Möglichkeiten zur beruflichen Weiterbildung und Schulungen
  • Teilnahme an Konferenzen und Arbeitsgruppen
  • Unternehmensveranstaltungen, informelle Treffen, Hackathons und technische Vorträge
  • Wettbewerbsfähige Vergütung und ein umfassendes Leistungspaket
  • Zusammenarbeit mit kompetenten und motivierten Kolleginnen und Kollegen
  • Arbeit mit aktuellen Open-Source-Technologien und Innovationen
  • Dynamische Kultur, die von Offenheit, Zusammenarbeit, kalkulierter Risikobereitschaft und kontinuierlicher Weiterentwicklung geprägt ist

Ähnliche Stellen

Terumo Medical Corporation

Gebietsleiter Interventionssysteme – Philadelphia

Terumo Medical Corporation

Verantwortung für den Vertrieb von Terumo-Interventionssystemen an Krankenhäuser und ambulante Einrichtungen im Raum Philadelphia. Kundenbeziehungen ausbauen, Eingriffe begleiten, Fachpersonal schulen und Vertriebsziele erreichen.

Öffnen
Cross River

Engineering Manager Cloud und verteilte Systeme – Cross River, Jerusalem

Cross River

Führe und unterstütze Engineers beim Aufbau von Fintech-Diensten und Infrastruktur für Zahlungen, Karten, Kredite und Krypto. In dieser hybriden Rolle in Jerusalem liegt der Schwerpunkt auf cloudnativen Systemen und zuverlässiger Engineering-Umsetzung.

Öffnen
Aleph Alpha

Senior AI Researcher für das Pre-Training von Foundation Models — Aleph Alpha, Heidelberg

Aleph Alpha
51 – 200 Mitarbeitende
B2BKünstliche Intelligenz

Leite Architektur- und Pre-Training-Arbeiten im großen Maßstab für Aleph Alphas europäische Foundation Models und gestalte Trainingsmethoden für Tausende GPUs. Entwickle und verfeinere PyTorch-Trainingsrezepte im hybriden Team in Heidelberg.

Öffnen