独角兽

代码大模型算法工程师/研究员

阶跃星辰

北京 / 上海 / 其他人工智能社会招聘

岗位描述

岗位描述:负责代码预训练数据的合成、清洗、权重分配、来源扩充等工作,持续提升代码预训练、中程训练等阶段的数据质量;研究预训练小领域数据配比与最终效果之间的关系,开发数据合成链路,解决代码模型中的关键问题。负责探索深度推理技术,研究 Test-time Compute 与模型效果的 Scaling Laws,参与后训练奖励模型与强化学习算法的优化流程,探索线上代码补全数据到 RL 过程的数据飞轮。专注于代码强化学习中的奖励模型(Reward Model)优化与创新,包括与 SFT 阶段协同解决判别能力较差的场景,探索使用合成数据进行代码奖励模型预训练,组织标注人员开展代码奖励模型标注,研究 Critic 前沿方向,以及强化学习过程中可执行代码与单元测试的质量过滤和扩充。 岗位要求:本科及以上学历,计算机、物理、数学、神经科学或相关专业。具备扎实的计算机科学基础和编程能力,熟悉常见算法与数据结构,具有良好的编程习惯。熟悉语言模型的基本技术和模型结构,对 AI 发展有热情。工作认真细致,计划性强,具备刨根问底的研究精神,对研发工作坚持实事求是、追求最终效果,并对工作内容有较强责任感。有 NOI、ACM 竞赛经历者优先;有推荐、搜索领域优秀数据驱动经验者优先。熟悉强化学习相关技术和细节,曾深度参与强化学习项目或语言模型项目者优先。具备较强工程能力,能快速熟悉公司内外部平台工具,并具备主动提升效率的意识。