独角兽

RL基础设施研究工程师

月之暗面

北京人工智能社会招聘

岗位描述

岗位描述:主要负责维护和开发 Moonshot 内部的强化学习后训练框架,支持万亿参数模型在 reasoning、agentic 等方向的文本与多模态 RL 后训练;与训练推理引擎团队合作,探索算法、框架与硬件的协同设计,提升大规模强化学习训练的稳定性和效率。 岗位要求:具备扎实的工程算法基础和工程实现能力,熟悉 Python 等编程语言,熟练掌握 PyTorch 等深度学习框架及常见性能调试与分析工具;对 Megatron-LM、vLLM 等主流训练与推理引擎有深入理解,具备排查和解决大模型 RL 训练实际问题的经验,如训练与推理不一致、Rollout 长尾等;具备扎实的强化学习算法基础和实际 RL 训练经验。加分项包括:有出色的开源项目经历,如为 vLLM、VeRL 等框架提交过重要 PR;在 RL 稳定性、环境 scaling、长尾问题解决等相关方向有顶会论文发表;具备业界知名 RL 框架经验,如 verl、roll、slime 等。