
SREエンジニア - リモート
デジタルトランスフォーメーションとエンジニアリングのコンサルティング会社、Verity Groupで信頼性、可観測性、レジリエンスを高めます。 リモート環境全体で、クラウド、Kubernetes、インシデント管理の運用を自動化します。
仕事内容
- SLI、SLO、SLA、MTTR、MTTDを定義し、監視する。
- 可観測性、モニタリング、アラート、APMの機能を構築する。
- レイテンシ、トラフィック、エラー、飽和度、可用性、システム性能を追跡する。
- 運用インシデントを予防、検知、解決する。
- 根本原因分析を実施し、問題の再発を防ぐ対策を策定する。
- 運用上のリスク、ボトルネック、単一障害点を評価する。
- レジリエントでスケーラブルかつ高可用性のソリューション設計を支援する。
- 定常運用を自動化し、手作業を最小限にする。
- KubernetesおよびDocker環境を管理・改善する。
- キャパシティプランニング、事業継続、ディザスタリカバリ戦略に貢献する。
- デプロイとアプリケーションの安定化に取り組む。
- チームと連携し、ソリューション設計段階から信頼性を組み込む。
- ダッシュボード、アラート、手順、運用ドキュメントを開発・維持する。
- 組織全体で信頼性、可観測性、継続的改善を推進する。
応募要件
- SRE、サイトリライアビリティエンジニア、または同等の職務での実務経験。
- GCP、AWS、Azureなどのクラウドプラットフォームの実務経験。
- KubernetesおよびDockerの実務知識。
- 可観測性、モニタリング、アラート、APMソリューションの導入経験。
- SLI、SLO、SLA、MTTR、MTTDを含むSREの指標と実践に関する理解。
- インシデントの管理、調査、解決経験。
- アプリケーションおよびインフラストラクチャのトラブルシューティング技術に関する知識。
- Linux環境の管理経験。
- ネットワーク、セキュリティ、性能、高可用性の原則に関する知識。
- 自動化およびInfrastructure as Codeの経験。
- CI/CDパイプラインの実務経験。
- 優れたコミュニケーション能力と、部門横断で協働する能力。
- 分析的、主体的、協調的で、予防を重視する姿勢。
- GKE、EKS、AKSのいずれかの経験。
- Dynatrace、Datadog、Grafana、Prometheusなどのツールに関する知識。
- ELK Stack、Elasticsearch、Kibanaの経験。
- TerraformおよびAnsibleの知識。
- クリティカルな環境および分散システムのサポート経験。
- 金融機関または規制対象環境での経験。
- キャパシティ管理およびクラウドコスト最適化の経験。
- ディザスタリカバリおよび事業継続の実践に関する知識。
- エラーバジェットの定義・管理経験。
- クラウド、Kubernetes、またはSREの認定資格。
福利厚生
- 食事手当。
- 食品手当。
- 在宅勤務手当。
- 医療保険。
- 歯科保険。
- 生命保険。
- 誕生日休暇。
- Total Pass / Wellhubの利用。
- Boon Saúdeアプリの利用。
- 提携先の割引。
- 提携施設および教育機関の割引。
- ウェルカムキット。
- オンボーディングプログラム。
- Verity Learning。
- Verity Break。
- #VerityComVocê。
- 専門能力開発コースの利用。
- Great Place to Work認定の職場。









