Betfair Romania Development
Betfair Romania Development
Betfair Romania Development är Flutter Entertainments teknikhubb i Cluj-Napoca, där fler än 1 900 personer samlas för att stödja några av koncernens globala betting- och spelvarumärken. Teamen arbetar med mjukvaruutveckling, onlinespel och kundsupport för produkter som Betfair, PokerStars och Paddy Power och betjänar kunder på marknader runt om i världen. Företagets arbete fokuserar på att skapa engagerande sport- och casinospelupplevelser, med säkerhet som en central aspekt.

Senior Reliability Engineer, Rumänien (distans)

Förbättra tillförlitligheten i FanDuels sportteknikplattform genom SLO:er, observability, incidentlärande och automatisering. Samarbeta med applikations- och plattformsteamen i Cluj-Napoca.

Beskrivning

  • Samarbeta med applikations- och plattformsteam för att kartlägga tjänstearkitektur, beroenden, kritiska kundresor och tillförlitlighetsrisker
  • Etablera meningsfulla SLI:er och SLO:er som kopplar tjänsteprestanda till kund- och affärsresultat
  • Hjälp team att införa felbudgetar och använda tillförlitlighetsdata för att styra tekniska prioriteringar
  • Utvärdera tjänsters produktionsberedskap utifrån observability, larm, SLO:er, runbooks, beroenden, kapacitet och återställning
  • Använd bedömningar och poängkort för tillförlitlighetsmognad för att fokusera förbättringsinsatser där de ger störst effekt
  • Delta i incidenthantering och diagnostisera komplexa produktionsproblem med hjälp av loggar, mätvärden, spårningar, beroenden och driftsättningsdata
  • Analysera incidenter och återkommande operativa problem för att upptäcka systemiska risker och varaktiga lösningar
  • Förbättra runbooks, larm, eskaleringsrutiner och dagliga operativa arbetssätt
  • Skapa automatisering och självbetjäningsverktyg som minskar utvecklarnas manuella arbete
  • Utveckla verktyg för tillförlitlighetsprocesser, operativ beredskap, utredning och åtgärder
  • Samarbeta med Observability Engineering för att etablera den telemetri som krävs för att mäta tillförlitlighet och felsöka problem
  • Omsätt prestandatester, kapacitetsanalyser, Gamedays, kaosexperiment och redundansövningar i konkreta förbättringar av tillförlitligheten
  • Hjälp till att förbereda inför perioder med hög belastning genom att bedöma tjänsternas hälsa, SLO:er, beroenden, kapacitetsrisker och tillförlitlighetsresultat
  • Öka motståndskraften i kritiska kundresor genom övervakning, beroendeanalys, felhantering och återställningsrutiner
  • Bidra med standarder, mönster, dokumentation och återanvändbara golden paths för Reliability Engineering
  • Integrera tillförlitlighetsrutiner i CI/CD och utvecklararbetsflöden genom SLO-as-Code, validering av telemetri, kontroller av produktionsberedskap och automatiserade kontroller
  • Använd AI-stödd utredning och automatisering för att påskynda felsökning och minska manuellt arbete
  • Dela med dig av din expertis och hjälp ingenjörer att bygga starkare arbetssätt inom SRE och produktionsteknik

Krav

  • Dokumenterad praktisk erfarenhet av Site Reliability Engineering, Reliability Engineering, plattformsteknik, DevOps eller produktionsteknik
  • Goda kunskaper i SRE-grunder, inklusive SLI:er, SLO:er, felbudgetar, incidenthantering, operativ beredskap, minskning av manuellt arbete och automatisering
  • Praktisk erfarenhet av att definiera eller arbeta med SLI:er och SLO:er för produktionstjänster
  • God felsökningsförmåga inom applikationer, infrastruktur, nätverk, databaser och tjänsteberoenden
  • Arbetskunskap om distribuerade system och tillförlitlighetsmönster, inklusive retries, timeouts, circuit breakers, graceful degradation, redundans, backpressure och felisolering
  • Erfarenhet av Datadog eller en jämförbar observability-plattform som omfattar loggar, mätvärden, spårningar, APM, dashboards, monitorer och syntetisk övervakning
  • Erfarenhet av att bidra till incidenthantering, efterincidentgranskningar och effektivt uppföljningsarbete
  • Praktisk erfarenhet av Kubernetes och molninfrastruktur, helst AWS
  • Erfarenhet av infrastruktur som kod, exempelvis Terraform, i moderna CI/CD-miljöer
  • Stark förmåga inom automatisering och mjukvaruutveckling, med goda kunskaper i ett modernt språk som Go, Java, Python eller JavaScript
  • Dokumenterad erfarenhet av att ersätta repetitivt operativt arbete med automatisering eller självbetjäning
  • Arbetskunskap om prestandateknik, kapacitetshantering, resiliensprovning, redundans eller kaosteknik
  • Förmåga att tolka applikationsarkitektur och identifiera tillförlitlighetsrisker i tjänste- och infrastrukturberoenden
  • Stark analytisk förmåga och god problemlösningsförmåga
  • Tydlig kommunikationsförmåga, inklusive att kunna förklara tillförlitlighetskoncept och rekommendationer för ingenjörer och tekniska ledare
  • Förmåga att arbeta tvärfunktionellt, hantera konkurrerande prioriteringar och leverera mätbara resultat
  • Ett arbetssätt med fokus på automatisering, kontinuerliga förbättringar, kunskapsdelning och systemisk problemlösning

Förmåner

  • Möjlighet att välja hybrid- eller distansarbete
  • 1 000 euro per år för egen kompetensutveckling
  • Aktieprogram
  • 25 semesterdagar per år
  • Upp till 20 dagar per år med arbete från utlandet
  • Fem personliga dagar per år
  • Flexibla förmåner för resor, sport och fritidsintressen
  • Utökad sjuk-, tand- och reseförsäkring
  • Anpassade välmåendesprogram
  • Sessioner för karriärutveckling
  • Tillgång till tusentals onlinekurser på Udemy
  • Ett urval av engagerande kontorsevenemang

Relaterade jobb

Newstel Worldwide

Dansktalande kundtjänstmedarbetare på deltid (Portugal, distansarbete)

Newstel Worldwide

Ge kundsupport på danska på distans åt Newstels flerspråkiga BPO-kunder och nå service- och kvalitetsmålen. Deltidsrollen omfattar frågor via e-post, chatt och telefon från Portugal.

Öppna