DatadogGitHubGoKubernetesPythonTerraform
業務内容
- Google Cloud上の数百規模の本番マイクロサービスをSLO/SLI目標のもと運用(オンコール対応を含む)。
- 設計から監視、リリース、リリース後の改善まで、信頼性向上のエピックを自律的にリード。
- 重要なユーザージャーニーのSLI/SLOを定義・運用し、エラーバジェットを用いた優先順位付けを実施。
- インシデント対応を主導し、ポストモーテム文化を発展させ再発防止のフォローアップを推進。
- AIエージェント(検知・トリアージ・復旧)を構築し、安全性を担保した運用を実現。
- TerraformによるIaCと自動化で運用をスケールし、トイル削減に貢献。
- 監視・アラート・トレーシングをDatadog中心に整備し、検知から緩和までの時間を短縮。
- 本番リソース設計・オートスケール・依存先強化を通じて信頼性と性能を継続的に改善。
- プロダクト/プラットフォームと連携し、新機能の安全な本番投入と新プラットフォーム整備を推進。
- リスク評価・監査対応・運用ルールのコード化・自動検証を通じて安全な本番環境を維持・向上。
技術スタック
必須スキル
- Production SREとしてSLO/SLI運用、可用性向上の実績
- 大規模サービス運用経験(10K QPS以上)または複数本番マイクロサービスの運用
- Google CloudとKubernetesでの本番運用経験
- Infrastructure as Code(Terraform)とGo/Python/Shellによるスクリプト作成
- 監視と観測性(Datadog等)とアラート設計、アラート疲労の軽減経験
- インシデント対応・ポストモーテム・オンコール体制の運用経験
- 自律的にエピックを推進できるリーダーシップとコミュニケーション能力
- AIを運用業務へ適用する意欲
歓迎スキル(該当する場合)
- 全社横断のSLOプログラム設計/運用経験
- AIを活用した運用業務(ログ分析、アラート要約、RCA、復旧)と評価経験
- 大規模Kubernetes基盤の運用、分散システム内部の知識
- 複数チームを跨ぐ信頼性/プラットフォーム改善のリード経験
- リスク評価・監査証跡の自動化、運用ルールのコード化・自動検証経験
- 日本語CEFR C1または英語CEFR C1のいずれかでの高度な業務遂行能力
キャリア成長観点
- 大規模なマーケットプレイス/フィンテック領域での信頼性設計と運用自動化の深掘りが可能。
- 全社横断のSLOプログラム推進やガバナンス強化を通じたリーダーシップ領域の成長。
- AIを活用した運用ワークフローの構築により、開発速度と安定性を両立するスキルを習得。
- バイリンガル環境での日本語/英語コミュニケーション力とグローバル視点の向上。
- プラットフォーム横断の取り組みを通じ、SREの専門性だけでなく組織全体の信頼性文化形成へ影響する機会が得られる。
企業についての所感
シリコンバレー企業に近い文化の日本企業。年収レベルも他のメガベンと比べて高い。まともに昇進すれば1000万円超。テックなイメージはあるが、プロダクト指向が強い企業で選考でアプリの使用経験なども聞いてくる。システムデザインの面接があり対策推奨。
データ取得日: 2026/9/10
面接に向けて、考え方と伝え方を学習コンテンツで整理しましょう。
面接対策コンテンツを見る