FluidStack
FluidStack
FluidStack furnizează infrastructură de supercalcul bazată pe GPU pentru laboratoare și companii de inteligență artificială. Platforma sa cloud administrată oferă acces la cerere la o capacitate mare de GPU-uri Nvidia pentru antrenarea și rularea modelelor, împreună cu suport pentru implementarea și operarea clusterelor care folosesc tehnologii precum Kubernetes și Slurm. Prin gestionarea hardware-ului și a infrastructurii de bază, FluidStack ajută echipele de inteligență artificială să își scaleze sarcinile de lucru, concentrându-se în același timp pe dezvoltarea modelelor, performanță și eficiență operațională.

Inginer software, ontologie (Lucru la sediu)

Construiește sisteme de ontologie, CMDB, DCIM, observabilitate și automatizare pentru infrastructura cloud de inteligență artificială a FluidStack. Dezvoltă platforme scalabile pentru active de infrastructură, operațiuni ale centrelor de date și administrarea flotei globale.

Descriere

  • Proiectează și implementează un CMDB de nouă generație care să fie sursa unică de adevăr pentru activele de infrastructură, topologia rețelei și datele de configurare
  • Dezvoltă software DCIM pentru operațiuni cu rackuri, implementarea serverelor și GPU-urilor, instalarea sistemelor de operare, asigurarea calității și operațiuni cu ecran alb
  • Creează platforme pentru ciclul de viață al activelor, de la recepție, montare în rack și inventariere până la depanare și dezafectare
  • Proiectează sisteme de monitorizare și observabilitate care combină telemetria BMS, EPMS și a dispozitivelor IT cu alerte inteligente și gestionarea incidentelor
  • Construiește portaluri de autoservire și automatizări pentru inițializarea regională, operațiunile din a doua zi și administrarea flotei la scară largă
  • Redu efortul operațional prin înlocuirea proceselor manuale cu automatizarea fluxurilor de lucru și instrumente de autoservire
  • Implementează sisteme de orchestrare pentru fluxurile de lucru de gestionare a incidentelor, problemelor și schimbărilor
  • Realizează vizualizări ale gemenilor digitali și tablouri de bord operaționale în colaborare cu echipele de date
  • Dezvoltă straturi de integrare între platformele interne, furnizori și sisteme externe
  • Colaborează cu echipele de operațiuni ale centrelor de date, sisteme, inginerie de rețea, securitate, produs, business, suport și operațiuni
  • Evaluează dacă elementele platformei ar trebui dezvoltate intern sau achiziționate
  • Promovează CI/CD, infrastructura ca cod, testarea automatizată și ingineria axată pe observabilitate
  • Contribuie la revizuiri de arhitectură și decizii tehnice de proiectare
  • Îmbunătățește calitatea ingineriei prin revizuiri de cod, documentație și schimb de cunoștințe
  • Proiectează sisteme reziliente și performante, capabile să proceseze mii de interogări pe secundă
  • Implementează funcții de monitorizare, jurnalizare, depanare și gestionare cuprinzătoare a erorilor
  • Planifică migrări de date și menține dependențele platformei
  • Condu proiecte de la conceptul inițial până la implementare și pregătirea pentru producție

Cerințe

  • Cel puțin trei ani de experiență profesională în dezvoltarea sistemelor software pentru producție
  • Capacitate solidă de programare în Python, Go sau un limbaj comparabil
  • Cunoștințe practice despre tiparele de proiectare a sistemelor
  • Experiență în proiectarea API-urilor REST, a modelelor de date și a sistemelor distribuite
  • Competență în baze de date relaționale și NoSQL, inclusiv PostgreSQL și Redis
  • Experiență practică în utilizarea Docker și a instrumentelor de infrastructură ca cod, precum Terraform și Ansible
  • Înțelegerea fluxurilor CI/CD și a practicilor moderne de dezvoltare software
  • Cunoștințe solide despre TCP/IP, DNS, HTTP și mediile Linux sau Unix
  • Abilități demonstrate de rezolvare a problemelor, cu atenție la scalabilitate, fiabilitate și nevoile operaționale
  • Abilități clare de comunicare în colaborarea cu părți interesate tehnice și non-tehnice
  • Experiență cu produse CMDB precum NetBox sau Device42 ori cu platforme de gestionare a activelor
  • Experiență în automatizarea infrastructurii, DevOps sau ingineria platformelor
  • Familiaritate cu instrumente de orchestrare a fluxurilor de lucru precum Temporal, Airflow sau Camunda
  • Cunoștințe despre tehnologii de monitorizare și observabilitate, inclusiv Prometheus, Grafana sau OpenTelemetry
  • Experiență cu baze de date de serii temporale și vizualizarea datelor
  • Înțelegerea cadrelor ITSM precum ITIL și a practicilor de gestionare a serviciilor
  • Experiență în operațiuni de centre de date, administrarea facilităților sau infrastructură fizică
  • Contribuții la proiecte de infrastructură open-source
  • Diplomă de licență în informatică sau experiență practică echivalentă
  • Cerințele privind dreptul de muncă în SUA sunt abordate în timpul procesului de aplicare

Beneficii

  • Participația la capital este disponibilă pentru toate posturile cu normă întreagă și poate include unități de acțiuni restricționate
  • Beneficiile de pensionare sau pensie sunt oferite conform normelor locale
  • Asigurare medicală, stomatologică și oftalmologică
  • Concediu plătit generos, aliniat normelor locale
  • Pachet competitiv de compensații totale
  • Angajament față de echitatea și transparența salarială

Locuri de muncă similare

Kreato Global | BPO and Language Solutions

Remote English-Spanish OPI/VRI Interpreter

Kreato Global | BPO and Language Solutions

Interpret remotely between English- and Spanish-speaking people in medical, financial, social service, and customer care settings. Provide language support for Kreato Global across Latin America.

Deschide
RecruitGo

Remote Executive Assistant, Outreach and Marketing — Philippines

RecruitGo

Handle administrative support, CRM, outreach, and marketing for RecruitGo, an Employer of Record serving global clients with talent from emerging markets. Support two UK-facing clients with day-to-day administration and creative campaigns.

Deschide