岗位描述
岗位描述:负责大模型后训练相关系统建设,包括训练与推理引擎效率优化、大规模 RL 训练效率优化、系统稳定性优化、算法与工程协同设计以及前沿方向自动化研究等。具体包括基础训练/推理引擎构建、精度保障与效率优化;低精度训练与推理效率优化及训推一致性建设;大规模 RL 框架设计与优化,面向下一代长程任务训练进行深度优化;稳定性建设,提升大规模训练过程中的容错定位及恢复效率;与算法团队协同优化系统易用性与算法效果;提升系统可观测性,支持细粒度指标建设与生命周期追溯管理。 岗位要求:熟悉 PyTorch 分布式训练与推理原理,熟悉 Megatron、FSDP、vLLM、Sglang 者优先。熟悉 PPO 原理及各类 RL 变种算法,熟悉 verl、slime 等框架者优先。熟悉性能分析、问题排查相关工具,具备独立定位和解决复杂问题的能力。熟悉 AI Coding,有使用或建设代码助手、自动化研发工具、Coding Agent 的经验。