Stratus
Stratus
Stratus er en B2B-teknologi- og konsulentvirksomhed med fokus på at modernisere forsikringsdriften for skadeforsikringsselskaber og Managing General Agents. Virksomhedens teams hjælper organisationer med at erstatte eller optimere ældre kernesystemer, implementere Guidewire- og Insurity-platforme, planlægge og gennemføre Azure-cloudmigreringer samt opbygge stærkere datastrategier og datastyring. Stratus understøtter også AI-parathed, applikationsvedligeholdelse, kvalitetssikring, platformudvælgelse og indlejret IT-leverance gennem talentteams efter behov. Virksomhedens arbejde kombinerer forsikringsfaglig ekspertise med praktisk teknologisk transformation for at hjælpe kunder med at forbedre analyser, strømline driften og bringe nye produkter hurtigere på markedet.

Senior Site Reliability Engineer – fjernarbejde i USA

Senior SRE, der har ansvar for at omsætte pålidelighed til praksis hos Stratus, hvis software digitaliserer MEP-entreprenørers arbejdsgange. Rollen omfatter SLO'er, observability, incidenthåndtering og performance engineering på Azure-baserede produktionssystemer.

Beskrivelse

  • Have ansvar for serviceindikatorer, mål og fejlbudgetter for kundevendte tjenester
  • Udvikle målepipelines, der rapporterer tilgængelighed og svartider op mod definerede mål
  • Administrere observability i produktion gennem standarder for instrumentering, dashboards og handlingsrettede alarmer
  • Drive observability-værktøjer på tværs af Azure AKS, Prometheus, Loki, Tempo, Grafana, Istio og Flux
  • Etablere processer for incidenthåndtering, der omfatter vagtrotationer, alarmering, alvorlighedsgrad, ejerskab, eskalering og blame-free post-mortems
  • Fastlægge standarder for rollback og recovery og validere dem gennem tilbagevendende øvelser
  • Lede performance- og kapacitetsarbejde gennem optimering af forespørgsler og indeks, dimensionering af connection pools, kapacitetsmodellering og design til kontrolleret degradering
  • Samarbejde med teamet om k6-tests af belastning, stress, spidsbelastning og langvarig belastning
  • Definere SLO-baserede tærskler for endpoint-latens og bruge testresultater som leverancegates
  • Lede reviews af produktionsparathed for instrumentering, alarmering, fejltilstande, ressourcegrænser og rollback-planer
  • Følge op på afhjælpning efter post-mortems, indtil ændringerne i produktion er verificeret
  • Understøtte planlægning af forretningskontinuitet og disaster recovery, herunder validering af backup og restore, design af failover og recovery-mål
  • Coache engineeringteams i instrumentering og drift af deres tjenester
  • Skabe værktøjer, automatisering, instrumenteringsbiblioteker og kodefixes til produktion
  • Samarbejde på tværs af engineering-pods, platform- og sikkerhedsteams samt kundevendte grupper
  • Referere til Senior Director of Platform Engineering

Krav

  • Mindst seks års professionel erfaring med engineering
  • Tre eller flere år i en dedikeret SRE- eller produktionsteknisk rolle i en B2B SaaS-virksomhed
  • Dokumenteret ansvar for SLO'er og fejlbudgetter i produktion
  • Avanceret praktisk erfaring med observability ved hjælp af Prometheus, Loki, Tempo, Grafana eller tilsvarende værktøjer
  • Praktisk erfaring som incident commander ved større hændelser
  • Erfaring med at opbygge vagt- og eskaleringsprocesser fra bunden
  • Stærk ekspertise i databaseperformance, herunder profilering af forespørgsler, indeksdesign, connection pooling og diagnosticering af mætning under belastning
  • Erfaring med MongoDB foretrækkes; tilsvarende dybde med dokument- eller relationsdatabaser accepteres
  • Produktionserfaring med Kubernetes, gerne AKS
  • Evne til at fejlfinde pod-planlægning, ressourcegrænser, netværk og service mesh-adfærd; erfaring med Istio foretrækkes
  • Kompetencer i mindst ét af Go, Python, C# eller TypeScript
  • Tryg ved at arbejde i en C#/.NET-kodebase
  • Erfaring med belastnings- og performanceværktøjer som k6, JMeter eller Gatling
  • Produktionserfaring med Azure eller AWS og forståelse af fejltilstande i administrerede tjenester
  • Fortrolighed med AI-assisterede engineeringværktøjer og erfaring med at designe AI-understøttede arbejdsgange
  • Fremragende skriftlige kommunikationsevner til post-mortems, runbooks og pålidelighedsrapporter
  • God dømmekraft og ro under pres
  • Erfaring med at etablere eller modne en SRE-praksis foretrækkes
  • Erfaring med Sentry eller en tilsvarende platform til overvågning af applikationsfejl foretrækkes
  • Erfaring med drift af hændelsesdrevne systemer og realtidssystemer foretrækkes
  • Erfaring med at drive MongoDB Atlas i produktionsskala foretrækkes
  • Erfaring med platforme til orkestrering af holdbare workflows, såsom Temporal, foretrækkes
  • Baggrund med multi-region- eller multi-zone-arkitektur og design af disaster recovery foretrækkes
  • Erfaring med incident.io, PagerDuty eller tilsvarende platforme til incidenthåndtering foretrækkes
  • Kendskab til DORA-målinger og pålidelighedsarbejde i SOC 2- eller NIST 800-171-miljøer foretrækkes
  • Erfaring med at forbedre pålideligheden i ældre monolitter foretrækkes
  • Interesse for MEP, BIM, AEC eller byggeteknologi foretrækkes
  • Tidligere erfaring fra en Series B-virksomhed eller en virksomhed i vækstfase foretrækkes

Fordele

  • Omfattende og konkurrencedygtige sundhedsordninger
  • 401(k)-bidrag med arbejdsgivermatch
  • Tyve dages årlig betalt frihed
  • Primært fjernbaseret arbejdsordning
  • Lejlighedsvise årlige teamarrangementer på stedet

Relaterede job

Sikla GmbH

Specialist i kunde- og salgssupport

Sikla GmbH
501 – 1.000 Medarbejdere
FremstillingLogistikRådgivning

Understøt Sikla UK’s forretning med tekniske modulære støttesystemer i Milton Keynes, og håndter kunde- og salgshenvendelser fra tilbud til levering. Koordinér ordrer, dokumentation, logistik og ERP-administration med kunder og interne teams.

Åbn
Newstel Worldwide

Dansktalende kundeservicemedarbejder på deltid (Portugal, fjernarbejde)

Newstel Worldwide
201 – 500 Medarbejdere
LogistikMarkedsføringRådgivning

Yd kundesupport på dansk på afstand for Newstels flersprogede BPO-kunder, og nå service- og kvalitetsmålene. Deltidsstillingen omfatter henvendelser via e-mail, chat og telefon fra Portugal.

Åbn