Pragmatike
Pragmatike
Pragmatike ist ein remote arbeitendes IT-Rekrutierungs- und Personaldienstleistungsunternehmen, das Start-ups und Unternehmen dabei unterstützt, internationale Fachkräfte im Technologiebereich zu finden. Die Dienstleistungen verbinden eine manuell kuratierte Kandidatenvermittlung mit technischen Assessments und decken Rollen wie Softwareentwicklung, Data Engineering, Mobile- und Spieleentwicklung, Produktmanagement sowie weitere Fachpositionen ab. Pragmatike unterstützt außerdem die operative Seite der internationalen Personalbeschaffung, einschließlich Onboarding, Rechnungsstellung und Lohnabrechnung, und ist in mehr als 60 Ländern tätig. Nach eigenen Angaben kann das geprüfte Talentnetzwerk schnelle Besetzungen ermöglichen, wobei qualifizierte Fachkräfte potenziell innerhalb von 48 Stunden vorgestellt werden.

Senior Site Reliability Engineer MAAS Armenien Remote

Senior SRE für Pragmatiques verteilte Cloud- und GPU-Infrastruktur. Die Rolle umfasst MAAS, Kubernetes, Netzwerke, Automatisierung, Observability und Hardware-Zuverlässigkeit.

Beschreibung

  • Betreiben und warten groß angelegte Linux-Systeme in Debian- und Ubuntu-Umgebungen auf Bare Metal und in virtualisierten Umgebungen
  • Verwalten der MAAS-Bereitstellung auf Bare Metal einschließlich Region- und Rack-Controllern, PXE, Commissioning, cloud-init, Node-Lebenszyklen sowie API- oder CLI-Automatisierung
  • Betreiben von Kubernetes-Clustern in der Produktion einschließlich Upgrades, Node-Pools, Netzwerk, Storage, Security-Hardening und Fehlerbehebung
  • Entwerfen und unterstützen von standortübergreifenden Netzwerken mit VLANs, Layer-2- und Layer-3-Routing, gebündelten Schnittstellen, VPNs, Firewalls und DNS
  • Automatisieren der Infrastruktur-Bereitstellung und des Betriebs mit Ansible, Bash oder Python, OpenTofu oder Terraform sowie Git-basierten Workflows
  • Erstellen und Warten automatisierter Deployment-Prozesse mit PXE, Preseed und cloud-init
  • Betreiben von Observability-Systemen mit Prometheus, Grafana, Alertmanager, VictoriaMetrics oder VictoriaLogs beziehungsweise vergleichbaren Tools
  • Etablieren und Weiterentwickeln von SLIs, SLOs, Alerting und Zuverlässigkeitspraktiken für Infrastruktur- und Plattformdienste
  • Leiten der Reaktion auf Infrastrukturvorfälle, ihrer Untersuchung und Eskalation sowie der Verbesserungen nach Vorfällen
  • Pflegen von Bereitschaftsdiensten und der operativen Abdeckung verteilter Umgebungen
  • Arbeiten auf Hardware-Ebene mit IPMI oder Redfish, BMCs, RAID, Storage, Diagnostik und GPU-Infrastruktur
  • Verwalten von Virtualisierungsplattformen wie Proxmox, KVM/libvirt, OpenStack oder VMware einschließlich GPU-Passthrough bei Bedarf
  • Entwickeln interner Infrastrukturtools für Host-Erkennung, Konfiguration, IPAM, Hardwarezustand und operative Automatisierung
  • Verwalten des Infrastruktur-Lebenszyklus einschließlich Standortanbindung, Wartung, Außerbetriebnahme, Drift-Erkennung und Runbooks
  • Zusammenarbeiten mit Engineering- und bereichsübergreifenden Teams zur Verbesserung von Zuverlässigkeit, Ressourcennutzung und betrieblicher Effizienz

Anforderungen

  • Mindestens fünf Jahre praktische Erfahrung in SRE, Infrastruktur-, System- oder Plattform-Engineering
  • Fortgeschrittene Kenntnisse in der Linux-Administration, insbesondere mit Debian und Ubuntu
  • Nachgewiesene Erfahrung mit MAAS und der Bereitstellung auf Bare Metal in Produktionsumgebungen
  • Umfangreiche praktische Erfahrung mit dem Betrieb von Kubernetes in der Produktion einschließlich Cluster-Lebenszyklen, Netzwerk, Storage, Upgrades und Fehlerbehebung
  • Fundierte Kenntnisse in Netzwerktechnik mit VLANs, Layer-2- und Layer-3-Routing, Bonding, VPNs, Firewalls und DNS
  • Ausgeprägte Automatisierungskenntnisse mit Ansible, Bash und/oder Python
  • Erfahrung mit Terraform oder OpenTofu sowie Git-basierten Infrastruktur-Workflows
  • Erfahrung mit Prometheus, Grafana oder vergleichbaren Observability-Plattformen in Produktionsumgebungen
  • Erfahrung mit Incident Response, Bereitschaftsdiensten, Monitoring, Alerting und Zuverlässigkeitspraktiken
  • Erfahrung mit Proxmox, KVM/libvirt, OpenStack, VMware oder vergleichbaren Virtualisierungsplattformen
  • Erfahrung in der Verwaltung von Bare-Metal-Hardware, BMCs, IPMI oder Redfish, Storage und Hardware-Fehlerbehebung
  • Gute Kenntnisse verteilter Systeme, der Container-Orchestrierung und der Zuverlässigkeit von Infrastrukturen
  • Erfahrung bei der Absicherung von Infrastrukturen durch RBAC, Firewalls, Netzwerk-Richtlinien, Secrets Management und Hardening
  • Fähigkeit, SOPs, Runbooks und operative Prozesse von Grund auf zu entwickeln
  • Fähigkeit, selbstständig in einem dynamischen, engineering-orientierten Umfeld zu arbeiten
  • Fließende Englischkenntnisse sind erforderlich

Zusatzleistungen

  • Vollständig remote mit flexiblen Arbeitszeiten
  • Eine wirkungsvolle Position mit umfangreicher technischer Verantwortung und Autonomie
  • Direkte Arbeit mit Bare-Metal-Systemen, Kubernetes, Netzwerken und GPU-Infrastruktur
  • Zusammenarbeit mit einem internationalen, engineering-orientierten Team
  • Starker Fokus auf Automatisierung, Zuverlässigkeit und Infrastruktur im großen Maßstab
  • Die Möglichkeit, die Architektur und betrieblichen Grundlagen einer wachsenden Cloud-Plattform mitzugestalten

Ähnliche Stellen

4M Analytics

Senior Engineer für Computer-Vision-Algorithmen

4M Analytics

Entwickle Computer-Vision- und Machine-Learning-Systeme für die Plattform zur Kartierung unterirdischer Versorgungsleitungen von 4M Analytics. Verantworte Algorithmen von der Forschung bis zum Produktiveinsatz und arbeite dabei mit Datenengineering- und Produktteams zusammen.

Öffnen
Terumo Medical Corporation

Regionalmanager Vertrieb für Terumo Interventional Systems

Terumo Medical Corporation

Leiten Sie den Vertrieb medizinischer Produkte in einer Region im Norden von Zentral-New-Jersey und verantworten Sie Außendienstteams sowie die Beziehungen zu Krankenhäusern. Steigern Sie den regionalen Umsatz und die Vertriebsleistung und sorgen Sie für eine regelkonforme Vermarktung der Produkte von Terumo Interventional Systems.

Öffnen
Claroty

QA-Automatisierungsingenieur

Claroty

Entwickle API- und UI-Automatisierungen sowie Qualitätsprüfungen in CI/CD-Pipelines für Clarotys Plattform für die Sicherheit cyberphysischer Systeme. Mit zuverlässigen Tests trägst du zum Schutz kritischer Infrastrukturen bei.

Öffnen