独角兽

大模型评测工程师

阶跃星辰

北京人工智能社会招聘

岗位描述

岗位描述:跟进学术界和企业界前沿的大模型评测基准,持续完善世界级 SOTA 模型的观测榜单,关注如 OpenAI、Anthropic 等发布的先进模型主要通过哪些榜单证明能力,涉及 AIME、GPQA、HLE、Codeforces、SWE、MultiChallenge、BrowseComp、Tau-Bench、Aider、MMMU、MathVista 等。开发评测基础设施,联合模型训练框架共同建设评测体系,保证评测体系能够与开源社区及头部闭源模型进行可比对评测,具备完善的点对点机制,保障评测结果可靠。日常维护评测榜单,完善评测工程体系,提高评测效率。发现模型迭代过程中在榜单中反映出的能力短板,分析主流 SOTA 模型之间在评测中体现的差异点。 岗位要求:熟悉大模型相关研究前沿进展,了解市面主流 benchmarks,并具备大模型评测经验。对数据有较强敏感度,熟悉开源社区各类数据渠道来源,具备数据处理经验与认知。具有大模型部分流程或全流程研发经验,具备客观指标评测、Agent 指标评测、模型训练或推理框架工程经验者优先。具备扎实的编程基础和优秀的工程能力,获得 NOI、ACM/ICPC 等编程竞赛金牌者优先。有相关研究经历、发表过顶级会议论文者优先。