岗位描述
岗位描述:负责打造支撑下一代大模型自我进化的 RL 基础设施,面向大规模 Agentic RL 场景设计训练与采样的混合调度策略,优化多模型(Policy、Reference、Reward、Value)的并行协同与显存共享;深度定制 vLLM,优化 Rollout 阶段的 KV Cache 复用、量化和投机方法,尽可能降低 Token 生成延迟;深入理解硬件,针对 RL 的不同算法负载和不同硬件设施定制最优并行策略,最大化 MFU,并与算法团队深度协同,持续推进下一代 RL 训练框架演进。 岗位要求:至少熟悉以下一个或多个方向:通用训练与推理方面,精通 Megatron-LM 分布式并行(TP/PP/CP/EP),能够针对 RL 多模型场景定制调度策略;熟悉 vLLM、SGLang 核心机制,如 PageAttention、Prefix Caching、FlashAttention、MTP,并具备二次开发能力;具备扎实的 CUDA、Triton、Cutlass 编程能力,有算子开发经验,能够编写贴合 SM 调度与内存层次的高性能 Kernel;熟练使用 Nsight 工具链进行全链路性能分析,用数据驱动优化。强化学习方面,深入理解 RLHF / RL 推理的数据流,包括 Policy 采样、Reward 评估、优势估计、策略更新,能针对各环节负载特征做针对性优化;熟悉 PPO、GRPO、DPO 等算法的工程实现细节,理解其稳定性挑战与优化技巧;具备大规模 RL 训练(千卡以上)实战经验,处理过训练崩溃、奖励 Hack、方差爆炸等典型问题。希望候选人具备第一性原理思维和精益求精的工程追求,不满足于“跑通 RL”,而是持续压榨硬件效率上限。