Description
The Site Reliability Engineer will ensure the reliability, availability, scalability, observability, and resilience of critical business platforms. Responsibilities include monitoring, incident management, root-cause analysis, operational automation, capacity planning, performance analysis, recovery procedures, and collaboration with engineering, architecture, security, infrastructure, product, and operations teams. The role requires 5+ years of experience in relevant engineering or production-support environments, strong scripting and Linux, networking, distributed systems, CI/CD, containerisation, observability, database, and integration knowledge, and support for 24x7 production environments with on-call rotations. The position offers hybrid working and requires Australian permanent work authorization.
