
BigDataCorp 高级 DevOps 与 SRE 技术负责人——可观测性(巴西远程)
负责 BigDataCorp(拉丁美洲领先的数据技术公司)的 DevOps 与 SRE 可观测性工作。 负责 AWS 与 Kubernetes 上的基础设施、自动化和工程师指导。
描述
- 设计、部署和维护涵盖 OpenTelemetry Collector、指标、日志、链路追踪代理、聚合器及可视化工具的遥测基础设施
- 维护可观测性平台的高可用性
- 设置应用和基础设施数据采集,并制定可执行的 Alertmanager 与 Incident.io 规则
- 运营可观测性即服务模式,减少开发团队收到的告警噪声
- 通过基础设施即代码设计、运行和改进 AWS 基础设施
- 管理生产 Kubernetes 集群,关注可扩展性、安全性和成本效率
- 构建和优化持续交付流水线,同时消除重复性的运维任务
- 领导基础设施与平台团队,管理待办事项、分配工作并指导工程师
- 通过与开发和产品团队协商,对齐技术优先级
任职要求
- 拥有丰富的公有云平台经验,最好是 AWS
- 深入掌握 Kubernetes 和 Docker、containerd 等容器技术
- 拥有运营和支持分布式、高可用生产系统的丰富经验
- 能够通过代码、基础设施即代码和 Helm 部署及配置可观测性平台
- 精通 Prometheus Operator、OpenTelemetry Collector、Loki、Tempo、Mimir 等 Grafana Stack 工具,或 Datadog、New Relic、Dynatrace 等平台
- 拥有管理遥测数据保留策略及相关成本的经验
- 能够设计具备韧性和可扩展性的云架构
- 从系统层面理解软件开发生命周期,并能改善开发者体验
- 深入了解可观测性数据的生成、采集、处理和存储方式
- 拥有事件响应流程经验
- 拥有推动敏捷仪式和管理小型技术团队交付的经验,或具备较强的相关能力
- 熟练使用 Terraform、Pulumi 或同类基础设施即代码工具
- 能够使用 Python、Go 或高级 Bash 自动化运维工作
- 拥有使用 GitLab CI、GitHub Actions 或 Jenkins 等工具构建和维护 CI/CD 流水线的经验
- 能够用业务语言解释技术债务和基础设施风险,并协商确定优先级
- 在事件期间快速决策时保持冷静和韧性
- 以指导和服务型领导为重点的领导方式
- 在架构质量与业务需求之间取得平衡时保持务实
- 加分项:Argo CD、Flux、Istio 或 Linkerd;FinOps;Cilium 或 Pixie 等 eBPF 工具;日志采样及聚合或丢弃;DevSecOps、OPA/Gatekeeper 和软件供应链安全;CKA 或 AWS Solutions Architect 认证,或同等资质
- 具备高级技术英语能力,能够阅读、交流并主持供应商和全球团队论坛
福利待遇
- 可在任何地点全职远程工作
- 可选择使用里约热内卢和圣保罗的轻松办公场所
- 提供职业成长与发展机会
- 工作时间灵活,包括居家办公安排
- 除法定 CLT 休假外,还提供灵活年假
- Bradesco 医疗和牙科保险
- 团体人寿保险
- 通过 Caju 卡提供餐补
- 每月提供家具和网络居家办公津贴
- 居家办公福利
- OrienteMe 心理支持
- Conexa Saúde 心理和营养支持
- Wellhub 会员
- 生日假
- 六个月产假
- 一个月陪产假
- 托儿津贴
- SESC 会员
- 在里约热内卢办公室线下及通过 Discord 线上举办游戏之夜
- BDC Learning 和 BDC Decola 职业发展项目,为课程、讲座、书籍及其他培训提供补贴
- 团队关系紧密,成员乐于互相帮助






