Description
Firmus Technologies is hiring a Senior AI Infrastructure Engineer, Observability, to establish GPU and host health standards, service-readiness criteria, dashboards, alerts, queries, diagnostic checks, and operational runbooks for customer and internal AI workloads. The role covers GPU fault diagnosis, telemetry analysis, failure detection, incident response, commissioning support, and knowledge publication, with a Singapore location, full-time employment, and occasional overseas travel.
