岗位描述
岗位描述:参与 GLM 机器学习平台开发,构建面向大模型训练、评测与强化学习(RL)的下一代 Agent 基础设施;支撑大规模 Agent 训练、评测和迭代流程,与算法、训练、数据和平台团队紧密合作;参与将前沿模型能力转化为可规模化训练与验证系统的过程。 岗位要求:具备良好的编程能力和工程素养,能够独立设计并实现高质量、可维护的系统模块;至少熟练掌握 Golang、Rust、TypeScript 中一种语言;熟悉后端服务开发,理解并发编程、网络通信、RPC、任务调度、数据一致性、故障恢复等基础概念;具备良好的系统设计能力,能够在性能、稳定性、可扩展性和开发效率之间做出合理权衡;熟悉 Linux 开发环境,具备问题定位、性能分析和线上排障能力;对大模型、Agent、强化学习或 AI 基础设施方向有兴趣,愿意深入理解模型研发流程并参与关键基础设施建设;具备良好的沟通协作能力。加分项包括:有 Kubernetes 使用、开发或运维经验,熟悉 Pod、Deployment、Job、CRD、Operator、调度、存储、网络等机制;有大规模分布式系统、任务调度系统、训练平台、推理平台或数据平台建设经验;熟悉 Ray、Slurm 等任务编排或分布式计算框架;具备云原生、容器化、服务治理、可观测性、弹性伸缩、高可用架构经验;熟悉模型训练或推理流程,理解 GPU 资源管理、训练任务调度、分布式训练基础概念;熟悉 OCI 镜像仓库开发和优化。