独角兽

大模型强化学习系统工程师

阶跃星辰

北京 / 上海 / 其他人工智能社会招聘

岗位描述

岗位描述:负责大模型 RL 训练与推理系统建设,持续提升训练效率、系统稳定性和工程迭代速度。工作内容覆盖分布式训练、推理链路、性能优化、稳定性治理,以及 Agent RL 相关能力建设。具体包括:负责 RL 训练与推理基础设施的设计、开发与优化;建设分布式训练、任务调度、权重同步、热更新等核心链路;持续优化系统吞吐、时延、GPU 利用率、训练效率等指标;建设稳定性与可观测能力,定位并解决 OOM、超时、通信瓶颈、一致性问题;参与 Agent RL 相关训练与系统支持,推动训练框架适配更复杂的 Agent 场景。 岗位要求:熟悉 PyTorch、CUDA、NCCL、Linux,理解分布式训练与推理系统基本原理;了解 RLHF 或相关训练方法,对 PPO、DPO、GRPO、Agent RL 等方向有实际经验或较强理解;具备性能分析、问题排查和系统优化经验,能独立定位复杂问题;熟悉 AI Coding,有使用或建设代码助手、自动化研发工具、Coding Agent 的经验;有良好的代码质量意识和工程质量要求,乐于学习新技术、新工具和新方法。加分项包括:有大模型训练或推理系统相关经验;有多机多卡、集群训练或在线服务稳定性治理经验;对 Agent、推理优化、系统架构演进有持续兴趣。