岗位描述
岗位描述:设计、搭建并持续迭代大模型多维度评测框架,让模型能力可衡量、可对比、可解释;与算法团队协作,将评测结论转化为数据需求,寻找能够提升模型智能的关键数据并推动落地;跟踪前沿论文与开源社区,及时将新的评测维度和数据策略应用到业务中;以产品思维发现问题并推动解决,持续提升模型能力。 岗位要求:具备 Python、Go、Java、C++ 中任意一种语言的使用经验,能够独立编写脚本、调用 API、搭建小工具;逻辑思维强,注重用数据说话,熟悉 SQL、Pandas、Jupyter 等分析工具;对大模型有基础认知,使用过 GPT、Claude 等产品,并能快速理解 SFT、RL 等概念;有参与大模型 benchmark、evaluation 等方向工作经验;有创业经验、开源项目贡献,或具备研发背景并希望转产品者优先;英语读写流畅。