Betfair Romania Development
Betfair Romania Development
1.001 – 5.000 Mitarbeitende
BeratungGesundheitswesenMarketing
Betfair Romania Development ist das Technologiezentrum von Flutter Entertainment in Cluj-Napoca. Dort arbeiten mehr als 1.900 Menschen, die einige der globalen Wett- und Gaming-Marken der Gruppe unterstützen. Die Teams sind in den Bereichen Softwareentwicklung, Online-Gaming und Kundenservice für Produkte wie Betfair, PokerStars und Paddy Power tätig und betreuen Kundinnen und Kunden in Märkten auf der ganzen Welt. Im Mittelpunkt der Arbeit stehen ansprechende Sport- und Casino-Wetterlebnisse, wobei Sicherheit eine zentrale Rolle spielt.

Senior Reliability Engineer, Rumänien (Remote)

Verbessere die Zuverlässigkeit der Sporttechnologieplattform von FanDuel durch SLOs, Observability, Incident-Lernen und Automatisierung. Arbeite mit Anwendungs- und Plattformteams in Cluj-Napoca zusammen.

Beschreibung

  • Arbeite mit Anwendungs- und Plattformteams zusammen, um Servicearchitektur, Abhängigkeiten, kritische Kundenprozesse und Zuverlässigkeitsrisiken abzubilden
  • Definiere aussagekräftige SLIs und SLOs, die Serviceleistung mit Kunden- und Geschäftsergebnissen verknüpfen
  • Unterstütze Teams bei der Einführung von Error Budgets und nutze Zuverlässigkeitsdaten zur Steuerung technischer Prioritäten
  • Bewerte Services hinsichtlich ihrer Produktionsreife in den Bereichen Observability, Alarmierung, SLOs, Runbooks, Abhängigkeiten, Kapazität und Wiederherstellung
  • Wende Reifegradbewertungen und Scorecards für Zuverlässigkeit an, um Verbesserungsmaßnahmen auf die Bereiche mit der größten Wirkung zu konzentrieren
  • Beteilige dich an der Incident-Reaktion und diagnostiziere komplexe Produktionsprobleme mithilfe von Logs, Metriken, Traces, Abhängigkeiten und Deployment-Daten
  • Analysiere Incidents und wiederkehrende Betriebsprobleme, um systemische Risiken und nachhaltige Lösungen aufzudecken
  • Verbessere Runbooks, Alarmierungen, Eskalationsverfahren und die täglichen Betriebspraktiken
  • Erstelle Automatisierungen und Self-Service-Tools, die den manuellen Aufwand für Engineering-Teams reduzieren
  • Entwickle Werkzeuge für Zuverlässigkeitsprozesse, betriebliche Bereitschaft, Untersuchungen und Fehlerbehebung
  • Arbeite mit dem Observability Engineering zusammen, um die für Zuverlässigkeitsmessung und Fehleranalyse erforderlichen Telemetriedaten zu etablieren
  • Überführe Performance-Tests, Kapazitätsanalysen, Gamedays, Chaos-Experimente und Failover-Übungen in konkrete Verbesserungen der Zuverlässigkeit
  • Unterstütze die Vorbereitung auf Spitzenereignisse, indem du Servicezustand, SLOs, Abhängigkeiten, Kapazitätsrisiken und Zuverlässigkeitserkenntnisse bewertest
  • Erhöhe die Resilienz kritischer Kundenprozesse durch Monitoring, Abhängigkeitsanalysen, Fehlerbehandlung und Wiederherstellungspraktiken
  • Trage Standards, Muster, Dokumentation und wiederverwendbare Golden Paths für Reliability Engineering bei
  • Verankere Zuverlässigkeitspraktiken in CI/CD und Entwickler-Workflows durch SLO-as-Code, Telemetrievalidierung, Produktionsreifeprüfungen und automatisierte Kontrollen
  • Setze KI-gestützte Untersuchungen und Automatisierungen ein, um die Fehleranalyse zu beschleunigen und manuelle Arbeit zu reduzieren
  • Teile dein Fachwissen und unterstütze Engineers dabei, stärkere SRE- und Produktions-Engineering-Praktiken aufzubauen

Anforderungen

  • Nachgewiesene praktische Erfahrung in Site Reliability Engineering, Reliability Engineering, Platform Engineering, DevOps oder Production Engineering
  • Fundierte Kenntnisse der SRE-Grundlagen, einschließlich SLIs, SLOs, Error Budgets, Incident Management, betrieblicher Bereitschaft, Reduzierung manueller Aufwände und Automatisierung
  • Praktische Erfahrung bei der Definition oder Nutzung von SLIs und SLOs für Produktionsservices
  • Ausgeprägte Fähigkeiten bei der Fehlersuche in Anwendungen, Infrastruktur, Netzwerken, Datenbanken und Serviceabhängigkeiten
  • Gute Kenntnisse verteilter Systeme und Zuverlässigkeitsmuster wie Wiederholungsversuche, Timeouts, Circuit Breaker, kontrollierte Degradierung, Redundanz, Backpressure und Fehlerisolierung
  • Erfahrung mit Datadog oder einer vergleichbaren Observability-Plattform für Logs, Metriken, Traces, APM, Dashboards, Monitore und synthetisches Monitoring
  • Erfahrung in der Incident-Reaktion, bei Post-Incident-Reviews und bei wirksamen Folgemaßnahmen
  • Praktische Erfahrung mit Kubernetes und Cloud-Infrastruktur, vorzugsweise AWS
  • Erfahrung mit Infrastructure-as-Code-Tools wie Terraform in modernen CI/CD-Umgebungen
  • Ausgeprägte Fähigkeiten in Automatisierung und Software Engineering sowie Kenntnisse einer modernen Sprache wie Go, Java, Python oder JavaScript
  • Nachweis, wiederkehrende Betriebsarbeiten durch Automatisierung oder Self-Service ersetzt zu haben
  • Kenntnisse in Performance Engineering, Kapazitätsmanagement, Resilienztests, Failover oder Chaos Engineering
  • Fähigkeit, Anwendungsarchitekturen zu verstehen und Zuverlässigkeitsrisiken über Service- und Infrastrukturabhängigkeiten hinweg zu erkennen
  • Ausgeprägtes analytisches Denken und Problemlösungskompetenz
  • Klare Kommunikationsfähigkeiten, einschließlich der Fähigkeit, Zuverlässigkeitskonzepte und Empfehlungen gegenüber Engineers und technischen Führungskräften zu erläutern
  • Fähigkeit, teamübergreifend zu arbeiten, konkurrierende Prioritäten zu steuern und messbare Ergebnisse zu liefern
  • Eine Arbeitsweise mit Fokus auf Automatisierung, kontinuierliche Verbesserung, Wissensaustausch und systemische Problemlösung

Zusatzleistungen

  • Wahl zwischen hybrider oder vollständig remote Arbeit
  • Jährliches Budget von 1.000 € für persönliche Weiterentwicklung
  • Mitarbeiteraktienprogramm
  • 25 Urlaubstage pro Jahr
  • Bis zu 20 Arbeitstage pro Jahr im Ausland
  • Fünf persönliche freie Tage pro Jahr
  • Flexible Leistungen für Reisen, Sport und Hobbys
  • Erweiterte Kranken-, Zahn- und Reiseversicherung
  • Individuell abgestimmte Programme für das Wohlbefinden
  • Sitzungen zur Karriereentwicklung
  • Zugang zu Tausenden von Online-Kursen auf Udemy
  • Eine Reihe abwechslungsreicher Veranstaltungen im Büro

Ähnliche Stellen

Sikla GmbH

Spezialist für Kunden- und Vertriebsunterstützung

Sikla GmbH
501 – 1.000 Mitarbeitende
BeratungFertigungLogistik

Unterstützung des Geschäftsbereichs für modulare technische Systeme von Sikla UK in Milton Keynes und Bearbeitung von Kunden- und Vertriebsanfragen von der Angebotserstellung bis zur Lieferung. Koordination von Bestellungen, Dokumentation, Logistik und ERP-Verwaltung mit Kunden und internen Teams.

Öffnen
Newstel Worldwide

Teilzeit-Kundenservicekraft mit Dänischkenntnissen (Portugal, remote)

Newstel Worldwide
201 – 500 Mitarbeitende
BeratungLogistikMarketing

Betreue die mehrsprachigen BPO-Kunden von Newstel remote auf Dänisch und erfülle dabei Service- und Qualitätsziele. In dieser Teilzeitstelle bearbeitest du E-Mail-, Chat- und Telefonanfragen aus Portugal.

Öffnen
Thermo Fisher Scientific

Senior-Entwickler für Clarity-PPM-Systeme

Thermo Fisher Scientific

Leiten Sie die Clarity-PPM-Entwicklung und den Support für Unternehmensanwendungen, einschließlich Integrationen, Upgrades und Fehlerbehebung im Produktivbetrieb. Unterstützen Sie SOX-Kontrollen, Bereitschaftsdienste, Deployments und den technischen Wissenstransfer.

Öffnen