JumpCloud
JumpCloud
JumpCloud entwickelt eine einheitliche Plattform für Identitäts-, Geräte- und Zugriffsmanagement für Unternehmen mit dezentralen IT-Umgebungen. Die SaaS-Produkte verbinden Cloud-Verzeichnisdienste, plattformübergreifendes Gerätemanagement, die Modernisierung von Active Directory, Kontrollen für den Identitätslebenszyklus, bedingten Zugriff, passwortlose Authentifizierung, Multifaktor-Authentifizierung und Zero-Trust-Sicherheit. Die Plattform unterstützt außerdem automatisiertes Onboarding und Offboarding, Compliance-Workflows, SaaS-Management und Integrationen mit HR-Systemen. So können Unternehmen Benutzer und Geräte über verschiedene Betriebssysteme hinweg verwalten und gleichzeitig die betriebliche Komplexität reduzieren.

Site Reliability Engineer – Remote in Indien

Verbessere die Zuverlässigkeit der KI-gestützten IT-Management-Plattform von JumpCloud in AWS und GCP. Arbeite an Observability, Kubernetes, Disaster Recovery, Automatisierung und Incident Response.

Beschreibung

  • Entwirf, implementiere und pflege die Zuverlässigkeit, Verfügbarkeit und Performance kritischer JumpCloud-Systeme und -APIs in AWS und GCP
  • Arbeite mit Anwendungsteams zusammen, um SLI, SLO und Error Budgets in den operativen Betrieb zu integrieren
  • Baue eine durchgängige Observability für Microservices und Cloud-Infrastruktur auf und verbessere sie mit Tools wie Datadog
  • Erstelle Monitoring rund um die Golden Signals: Latenz, Traffic, Fehler und Sättigung
  • Nimm an Bereitschaftsdiensten teil, reagiere auf Incidents und leite blameless Post-Incident-Reviews
  • Betreibe produktive Kubernetes-EKS-Cluster über GitOps-Workflows einschließlich Argo CD und Kargo
  • Stelle Multi-Cloud-Infrastruktur mit modularen Terraform-Konfigurationen bereit und sichere sie ab
  • Pflege Disaster-Recovery-Dashboards und Runbooks sowie die Automatisierung und Validierungstests für Multi-Region-Failover im Einklang mit RTO- und RPO-Zielen
  • Entwickle produktionsreife Python- oder Go-Skripte und Automatisierungen, die den operativen Aufwand reduzieren
  • Setze KI-gestützte Tools wie Cursor, Claude Code und GitHub Copilot für Skripte, die Erstellung von Runbooks und die Incident-Triage ein

Anforderungen

  • Mindestens fünf Jahre Berufserfahrung in der Softwareentwicklung in den Bereichen SRE, DevOps oder Platform Engineering für geschäftskritische Systeme im 24/7-Betrieb
  • Sehr gute Kenntnisse in Python oder Go für SRE-Tools, individuelle Automatisierungen und Cloud-Integrationen
  • Erfahrung mit Kubernetes im Produktivbetrieb, Container-Orchestrierung und GitOps-Pipelines wie Argo CD
  • Erfahrung mit der Erstellung, Pflege und Modularisierung von Terraform-Konfigurationen
  • Erfahrung im Betrieb von AWS-Workloads, einschließlich EKS, IAM, VPC-Netzwerken, Route 53 und ALB/NLB, oder vergleichbarer GCP-Workloads
  • Praktische Kenntnisse in FinOps, Kostenstellen-Tags, der bedarfsgerechten Dimensionierung von Ressourcen und Cloud-Ausgaben-Dashboards
  • Erfahrung mit der Erstellung von Disaster-Recovery-Dashboards, der Durchführung von Failover-Übungen und der Überwachung von Systemzustand sowie Wiederherstellungsmetriken
  • Praktische Erfahrung mit Datadog oder einer vergleichbaren Plattform, PagerDuty, Alarmierungspraktiken und SLI/SLO-Frameworks
  • Operative Erfahrung bei der Konfiguration und Fehlerbehebung produktiver Service Meshes wie Istio sowie hochverfügbarer Proxys wie HAProxy oder NGINX
  • Ausgeprägte Fähigkeiten bei der Fehlerbehebung und nachweisliche Erfolge bei der Verbesserung der Betriebseffizienz durch Code
  • Teamorientierte und kooperative Arbeitsweise sowie Übereinstimmung mit den Unternehmenswerten
  • Verfügbarkeit und Bereitschaft zur Teilnahme an Bereitschaftsdiensten
  • Fließende mündliche und schriftliche Englischkenntnisse
  • Von Vorteil: Erfahrung mit GitHub Actions oder GitLab Pipelines
  • Von Vorteil: Grundkenntnisse in Chaos Engineering oder Resilienztests
  • Von Vorteil: Vertrautheit mit HashiCorp Vault, AWS Secrets Manager oder External Secrets Operator
  • Von Vorteil: Grundkenntnisse in DevSecOps-Tools und der Behebung von Schwachstellen in Infrastructure as Code

Zusatzleistungen

  • Remote-First-Arbeit mit Sitz in Indien
  • Arbeit in einem dynamischen SaaS-Umfeld
  • Möglichkeiten zur beruflichen Weiterentwicklung und zum Wissensaustausch
  • Zusammenarbeit mit talentierten Teams auf der ganzen Welt
  • Einbringen von Mitarbeitendenperspektiven in die Entwicklung von Produkten und Funktionen
  • Zusammenarbeit mit einem unterstützenden Führungsteam und Vorstand
  • Chancengleichheit im Beschäftigungsverhältnis
  • Bewerbungen von Drittanbietern für Lebensläufe werden nicht akzeptiert

Ähnliche Stellen

Terumo Medical Corporation

Regionalmanager Vertrieb für Terumo Interventional Systems

Terumo Medical Corporation

Leiten Sie den Vertrieb medizinischer Produkte in einer Region im Norden von Zentral-New-Jersey und verantworten Sie Außendienstteams sowie die Beziehungen zu Krankenhäusern. Steigern Sie den regionalen Umsatz und die Vertriebsleistung und sorgen Sie für eine regelkonforme Vermarktung der Produkte von Terumo Interventional Systems.

Öffnen
Claroty

QA-Automatisierungsingenieur

Claroty

Entwickle API- und UI-Automatisierungen sowie Qualitätsprüfungen in CI/CD-Pipelines für Clarotys Plattform für die Sicherheit cyberphysischer Systeme. Mit zuverlässigen Tests trägst du zum Schutz kritischer Infrastrukturen bei.

Öffnen