Cisco
Cisco
Cisco ist ein Technologieunternehmen für Geschäftskunden mit Schwerpunkt auf Netzwerken, Sicherheit und digitaler Infrastruktur. Das Portfolio umfasst Router, Switches, optische Transceiver, programmierbare Chips, Edge-Computing-Plattformen, Webex-Kollaborationstools, Lösungen für Observability, KI-gestützte Software und cloudverwaltete Dienste. Cisco unterstützt Unternehmen, Dienstanbieter und Regierungen bei der Planung, dem Betrieb und der Absicherung großer Netzwerke und Rechenzentren durch Technologie, professionelle Dienstleistungen, Schulungen und fortlaufenden Support.

Senior Site Reliability Engineer, Observability bei Cisco (Hybrid)

Leiten Sie das Observability Engineering für Ciscos Cloud-Infrastruktur mit Schwerpunkt auf Splunk, Elasticsearch, Distributed Tracing, Telemetrie und Produktionszuverlässigkeit. Entwickeln und betreiben Sie Systeme, die Service-Transparenz, Incident Response und Plattformresilienz verbessern.

Beschreibung

  • Entwickeln, implementieren, betreiben und verbessern Sie unternehmensweite Observability-Plattformen
  • Verwalten Sie Splunk-Enterprise- und Splunk-Cloud-Infrastrukturen einschließlich Indexern, Search-Head-Clustern, Heavy Forwardern, Deployment-Servern und Integrationen
  • Betreiben Sie groß angelegte Elasticsearch-Cluster für Log-Analysen, Suche und die operative Fehlerbehebung
  • Entwickeln und unterstützen Sie Plattformen für Distributed Tracing auf Basis von Grafana Tempo und OpenTelemetry
  • Entwickeln und pflegen Sie vollständige Telemetrie-Pipelines für Logs, Metriken und Traces
  • Legen Sie Instrumentierungsstandards, Praktiken zur Datenqualität, Aufbewahrungsrichtlinien und Observability-Muster fest
  • Skalieren und optimieren Sie Prometheus, Grafana, Kafka, Tempo, OpenTelemetry und verwandte Monitoring-Plattformen
  • Erstellen Sie Dashboards, Alarme, Analysen und Trace-Visualisierungen mit Splunk SPL, Grafana, Kibana und Tempo
  • Definieren Sie Monitoring- und Alarmierungsstandards, die die Service-Transparenz verbessern und die Zeiten für Incident-Erkennung und -Behebung verkürzen
  • Automatisieren Sie die Bereitstellung, Konfiguration und Aktualisierung der Infrastruktur sowie operative Workflows mit Terraform und Tools für das Konfigurationsmanagement
  • Tragen Sie zu Kapazitätsplanung, Performance-Tuning, Upgrades, Patching, Disaster Recovery und Reviews zur Produktionsreife bei
  • Diagnostizieren Sie komplexe Probleme verteilter Systeme und leiten oder unterstützen Sie Incident Response und Ursachenanalysen
  • Arbeiten Sie mit Teams aus Plattform-, Anwendungs-, Sicherheits-, Datenbank- und Netzwerk-Engineering zusammen, um Zuverlässigkeit und operative Konsistenz zu verbessern
  • Unterstützen Sie die Pflege gemeinsamer SRE-Standards, Dokumentation, Runbooks und Engineering-Praktiken
  • Nehmen Sie am gemeinsamen SRE-Pager und an der Produktionsbereitschaftsrotation teil
  • Unterstützen Sie kundenorientierte Produktionsservices und Kubernetes-Plattform-Workloads wie Nextunnel
  • Verbessern Sie die Service-Transparenz, beschleunigen Sie Incident-Erkennung und -Behebung, stärken Sie die Plattformzuverlässigkeit und fördern Sie operative Exzellenz in Ciscos Cloud-Umgebung

Anforderungen

  • Mindestens 7 Jahre Erfahrung in Site Reliability Engineering, Platform Engineering, DevOps oder einem verwandten Bereich
  • Produktionserfahrung in der Verwaltung von Splunk Enterprise oder Splunk Cloud
  • Sehr gute Kenntnisse in Splunk SPL einschließlich produktiver Dashboards, Alarme und Analysen
  • Erfahrung mit dem Entwurf, der Implementierung und dem Betrieb von Elasticsearch- oder ELK-Plattformen
  • Praktische Erfahrung mit Prometheus, Grafana, Grafana Tempo, OpenTelemetry, Distributed Tracing und Kafka
  • Nachweisliche Fähigkeit, Observability-Strategien für Logs, Metriken und Traces zu implementieren und zu betreiben
  • Erfahrung mit Terraform und Infrastructure-as-Code-Praktiken
  • Sehr gute Kenntnisse in Linux, Netzwerken, verteilten Systemen, Hochverfügbarkeit und Produktionsbetrieb
  • Programmier- oder Scripting-Erfahrung mit Python, Go, Ruby, Bash oder einer vergleichbaren Sprache
  • Erfahrung in der Behebung von Produktionsvorfällen im Rahmen eines Bereitschafts- oder operativen Supportmodells
  • Ausgeprägte Kommunikations-, Kollaborations- und Problemlösungsfähigkeiten
  • Muss eine U.S. Person sein, definiert als U.S.-Bürger oder U.S.-Staatsangehöriger
  • Die Arbeit muss innerhalb der Vereinigten Staaten ausgeführt werden
  • Splunk-Zertifizierung von Vorteil
  • Erfahrung mit Kubernetes und containerisierten Produktions-Workloads von Vorteil
  • Erfahrung im Betrieb von AWS-, Azure- oder GCP-Cloud-Infrastrukturen von Vorteil
  • Erfahrung mit Ansible, Consul, CI/CD-Pipelines oder Service-Mesh-Technologien von Vorteil
  • Erfahrung mit SLOs, SLIs, Error Budgets, Kapazitätsplanung und Incident Management von Vorteil
  • Erfahrung in der Unterstützung von FedRAMP-, Regierungs- oder anderen regulierten Umgebungen von Vorteil
  • Erfahrung im Aufbau sicherer, hochverfügbarer und konformer Observability-Plattformen von Vorteil
  • Erfahrung in der Leitung funktionsübergreifender technischer Initiativen von der Konzeption bis zur Umsetzung von Vorteil

Zusatzleistungen

  • Kranken-, Zahn- und Augenversicherung
  • 401(k)-Plan mit einem Matching-Beitrag von Cisco
  • Bezahlte Elternzeit
  • Kurz- und langfristige Berufsunfähigkeitsversicherung
  • Grundlegende Lebensversicherung
  • Gewährung von Restricted Stock Units von Cisco kann möglich sein
  • 10 bezahlte Feiertage pro vollständigem Kalenderjahr
  • Ein zusätzlicher beweglicher Feiertag für nicht freigestellte Beschäftigte
  • Ein bezahlter freier Tag zum Geburtstag der beschäftigten Person
  • Bezahlte Betriebsschließung zum Jahresende
  • Vier bezahlte freie Tage für persönliches Wohlbefinden
  • 16 bezahlte Urlaubstage pro vollständigem Kalenderjahr für nicht freigestellte Beschäftigte
  • Flexible Urlaubstage ohne festgelegtes Limit für berechtigte freigestellte Beschäftigte
  • 80 Stunden Krankheitszeit am Einstellungstag und danach jeweils am 1. Januar
  • Bis zu 80 Stunden ungenutzter Krankheitszeit können jährlich übertragen werden
  • Zusätzliche bezahlte Abwesenheit bei schwerwiegenden oder dringenden familiären Angelegenheiten
  • Optional 10 bezahlte Freiwilligentage pro vollständigem Kalenderjahr
  • Jährliche Boni für Positionen außerhalb des Vertriebs gemäß den Richtlinien von Cisco

Ähnliche Stellen

Salonkee

Salonkee-Vertriebsmitarbeiter (Quereinstieg) – Hannover

Salonkee
51 – 200 Mitarbeitende
MarktplatzSaaSSchönheit

Baue Salonkees Salonsoftware-Geschäft in Hannover aus, indem du Beziehungen zu Saloninhaberinnen und -inhabern aufbaust und sie durch Produktvorführungen führst. Betreue den gesamten Verkaufsprozess von der Akquise bis zum Abschluss und plane deine Woche selbstständig.

Öffnen
Red Hat

Consulting-Cloud-Architekt für OpenShift

Red Hat

Entwirf und implementiere Lösungen mit Red Hat OpenShift, Kubernetes und Hybrid-Cloud für Unternehmenskunden. Leite Kundenprojekte mit Schwerpunkt auf Infrastruktur, Automatisierung und Anwendungsbereitstellung.

Öffnen