Description
Omilia is seeking a Senior Site Reliability Engineer to join a team focused on operating and maintaining production clusters and developing observability solutions. The role involves collaborating with team members to create automation strategies, monitor and alert systems, and ensure platform reliability. Responsibilities include incident response, contributing to problem management, supporting development efforts toward reliability, documenting troubleshooting, optimizing runbooks, embedding reliability into the software delivery lifecycle, designing and implementing observability solutions using tools like Prometheus, Grafana, and ELK, participating in on-call rotations, and championing a culture of continuous improvement.
