Cisco
Cisco
Cisco è un'azienda di tecnologia per le imprese specializzata in reti, sicurezza e infrastruttura digitale. Il suo portafoglio comprende router, switch, ricetrasmettitori ottici, silicio programmabile, piattaforme di edge computing, strumenti di collaborazione Webex, prodotti per l'osservabilità, software con funzionalità di IA e servizi gestiti nel cloud. Cisco serve aziende, fornitori di servizi e governi, supportando la progettazione, la gestione e la sicurezza di reti e data center su larga scala attraverso tecnologie, servizi professionali, formazione e assistenza continua.

Senior Site Reliability Engineer, osservabilità presso Cisco (ibrido)

Guida l’ingegneria dell’osservabilità per l’infrastruttura cloud di Cisco, includendo Splunk, Elasticsearch, tracing distribuito, telemetria e affidabilità della produzione. Crea e gestisci sistemi che migliorano la visibilità dei servizi, la risposta agli incidenti e la resilienza della piattaforma.

Descrizione

  • Progettare, implementare, gestire e migliorare piattaforme aziendali di osservabilità
  • Amministrare l’infrastruttura Splunk Enterprise e Splunk Cloud, inclusi indicizzatori, cluster Search Head, heavy forwarder, server di distribuzione e integrazioni
  • Gestire cluster Elasticsearch su larga scala per analisi dei log, ricerca e risoluzione dei problemi operativi
  • Progettare e supportare piattaforme di tracing distribuito basate su Grafana Tempo e OpenTelemetry
  • Sviluppare e mantenere pipeline complete di telemetria per log, metriche e trace
  • Definire standard di strumentazione, pratiche di qualità dei dati, policy di conservazione e modelli di osservabilità
  • Scalare e ottimizzare Prometheus, Grafana, Kafka, Tempo, OpenTelemetry e le piattaforme di monitoraggio correlate
  • Creare dashboard, alert, analisi e visualizzazioni dei trace con Splunk SPL, Grafana, Kibana e Tempo
  • Definire standard di monitoraggio e alerting che migliorino la visibilità dei servizi e riducano i tempi di rilevamento e risoluzione degli incidenti
  • Automatizzare il provisioning, la configurazione, gli aggiornamenti e i flussi di lavoro operativi dell’infrastruttura con Terraform e strumenti di gestione della configurazione
  • Contribuire alla pianificazione della capacità, all’ottimizzazione delle prestazioni, agli aggiornamenti, all’applicazione di patch, al disaster recovery e alle revisioni di preparazione alla produzione
  • Diagnosticare problemi complessi dei sistemi distribuiti e guidare o supportare la risposta agli incidenti e l’analisi delle cause principali
  • Collaborare con i team di ingegneria delle piattaforme, delle applicazioni, della sicurezza, dei database e delle reti per migliorare l’affidabilità e la coerenza operativa
  • Contribuire al mantenimento degli standard SRE condivisi, della documentazione, dei runbook e delle pratiche di ingegneria
  • Partecipare al pager SRE condiviso e alla rotazione di reperibilità per la produzione
  • Supportare servizi di produzione rivolti ai clienti e carichi di lavoro delle piattaforme Kubernetes come Nextunnel
  • Migliorare la visibilità dei servizi, accelerare il rilevamento e la risoluzione degli incidenti, rafforzare l’affidabilità della piattaforma e promuovere l’eccellenza operativa nell’ambiente cloud di Cisco

Requisiti

  • Almeno 7 anni di esperienza nell’ingegneria dell’affidabilità dei siti, nell’ingegneria delle piattaforme, nel DevOps o in una disciplina correlata
  • Esperienza in produzione nell’amministrazione di Splunk Enterprise o Splunk Cloud
  • Solida padronanza di Splunk SPL, inclusi dashboard, alert e analisi di produzione
  • Esperienza nella progettazione, implementazione e gestione di piattaforme Elasticsearch o ELK
  • Esperienza pratica con Prometheus, Grafana, Grafana Tempo, OpenTelemetry, tracing distribuito e Kafka
  • Comprovata capacità di implementare e gestire strategie di osservabilità che coprano log, metriche e trace
  • Esperienza nell’uso di Terraform e delle pratiche di infrastruttura come codice
  • Conoscenza approfondita di Linux, reti, sistemi distribuiti, alta disponibilità e operazioni di produzione
  • Esperienza di programmazione o scripting con Python, Go, Ruby, Bash o un linguaggio comparabile
  • Esperienza nella risoluzione di incidenti di produzione in un modello di reperibilità o supporto operativo
  • Ottime capacità di comunicazione, collaborazione e risoluzione dei problemi
  • Deve essere una persona statunitense, definita come cittadino o nazionale degli Stati Uniti
  • Il lavoro deve essere svolto negli Stati Uniti
  • La certificazione Splunk è preferibile
  • È preferibile esperienza con Kubernetes e carichi di lavoro di produzione containerizzati
  • È preferibile esperienza nella gestione di infrastrutture cloud AWS, Azure o GCP
  • È preferibile esperienza con Ansible, Consul, pipeline CI/CD o tecnologie di service mesh
  • È preferibile esperienza con SLO, SLI, budget di errore, pianificazione della capacità e gestione degli incidenti
  • È preferibile esperienza in ambienti FedRAMP, governativi o altrimenti regolamentati
  • È preferibile esperienza nella creazione di piattaforme di osservabilità sicure, altamente disponibili e conformi
  • È preferibile esperienza nella guida di iniziative tecniche interfunzionali dalla proposta all’implementazione

Benefit

  • Assicurazione medica, dentistica e oculistica
  • Piano 401(k) con contributo integrativo di Cisco
  • Congedo parentale retribuito
  • Copertura per invalidità a breve e lungo termine
  • Assicurazione sulla vita di base
  • Potrebbero essere disponibili assegnazioni di unità azionarie vincolate Cisco
  • 10 festività retribuite per ogni anno solare completo
  • Una festività flessibile per i dipendenti non esenti
  • Un giorno libero retribuito per il compleanno del dipendente
  • Chiusura festiva di fine anno retribuita
  • Quattro giorni liberi retribuiti per il benessere personale
  • 16 giorni di ferie retribuiti per ogni anno solare completo per i dipendenti non esenti
  • Ferie flessibili senza limite definito per i dipendenti esenti idonei
  • 80 ore di congedo per malattia fornite alla data di assunzione e ogni 1° gennaio successivo
  • Fino a 80 ore di congedo per malattia non utilizzate possono essere riportate ogni anno
  • Ulteriore tempo libero retribuito per questioni familiari critiche o emergenziali
  • Facoltativamente, 10 giorni di volontariato retribuiti per ogni anno solare completo
  • Bonus annuali per ruoli non commerciali, soggetti alle policy di Cisco

Offerte correlate

Knowtion Health

Responsabile dell’acquisizione dei talenti da remoto

Knowtion Health

Supervisiona i sistemi di selezione, le richieste di assunzione, le analisi e la gestione della forza lavoro a tempo determinato presso Knowtion Health. Contribuisce a sviluppare processi di assunzione scalabili per un’azienda sanitaria in crescita.

Apri
Napco National

Coordinatore acquisti, Arabia Saudita (da remoto)

Napco National

Coordina le operazioni di acquisto per un’azienda manifatturiera in Arabia Saudita: dagli ordini di acquisto e dalle consegne dei fornitori alle pratiche doganali e ai trasferimenti di materiali. Supporta lo sdoganamento delle spedizioni, l’elaborazione delle fatture, i reclami ai fornitori e il rinnovo dei certificati di prodotto.

Apri
Terumo Medical Corporation

Responsabile regionale vendite, Terumo Interventional Systems

Terumo Medical Corporation

Gestisci le vendite di dispositivi medici in un’area del North Central New Jersey, coordinando i team sul territorio e i rapporti con gli ospedali. Sviluppa i ricavi regionali, i risultati di vendita e la promozione conforme dei prodotti Terumo Interventional Systems.

Apri
Claroty

Ingegnere di automazione QA

Claroty

Sviluppa l’automazione di API e interfaccia utente e i controlli di qualità CI/CD per la piattaforma di sicurezza ciberfisica di Claroty. Contribuisci a proteggere le infrastrutture critiche con test affidabili.

Apri