Responsibilities
- Design and implement a managed Slurm service on Kubernetes
- Write clean, reliable, and maintainable Go code
- Develop scheduling and orchestration capabilities for GPU-intensive and distributed workloads
- Build observability and automated remediation for GPU, node, network, and control-plane failures using VictoriaMetrics, Grafana, and DCGM