岗位描述
岗位描述:参与通用推理大模型对齐(Alignment)方向的研发工作,涵盖数据循环体系构建,以及在监督微调(SFT)与强化学习(RL)阶段对数据使用策略的系统性研究;深入探索对齐阶段数据与算法在大规模训练中的可扩展性与优化路径;参与构建世界领先的高性能通用推理大模型,并在多项客观评测指标中保持行业领先。 岗位要求:计算机、数学、人工智能等相关专业博士或优秀研究生;对数据有敏感度,熟悉开源社区各类数据来源,具备数据处理经验和认知;熟悉大模型相关研究前沿进展,如 Reasoning RL、Agent RL 等,有大模型研发经验者优先;有相关研究经历并发表过 ICLR、NeurIPS、ICML 等顶级会议论文者优先;具备扎实的编程基础和优秀的工程能力,NOI、ACM/ICPC 等编程竞赛金牌获得者优先;具备良好的团队协作能力和沟通能力。