説明
Lambdaは、GPUクラスター、ネットワーク、ストレージ、クラウドプラットフォームを含むAIデータセンターインフラ全体で、重大インシデントへの対応を主導するシニアインシデントマネージャーを募集しています。この職務では、大規模障害時にインシデントコマンダーを務め、エンジニアリング、ネットワーク、施設、ベンダーの各チームを調整し、インシデントのライフサイクル管理と事後分析を行い、ランブック、自動化、可観測性、信頼性フレームワークを通じて運用レジリエンスを向上させます。応募者には、インシデント管理、サイト信頼性エンジニアリング、またはインフラ運用における8年以上の経験に加え、大規模分散インフラおよびインシデント管理フレームワークに関する専門知識が必要です。この職務にはオンコールのローテーションが含まれ、健康保険、歯科保険、眼科保険、対象職種向けのウェルネス手当および通勤手当、ならびに米国従業員向けの会社が2%を拠出する401(k)プランが提供されます。
