Description
Omilia is seeking a Senior Site Reliability Engineer to join their team. The role involves operating and maintaining production clusters, developing observability solutions, and collaborating with team members to create automation strategies and ensure platform reliability. Responsibilities include incident response, contributing to problem management, supporting development efforts toward reliability, documenting troubleshooting guides, optimizing runbooks, embedding reliability into the software delivery lifecycle, designing and implementing observability solutions using tools like Prometheus, Grafana, and ELK, participating in on-call rotations, and championing a culture of continuous improvement.
