独角兽

Coding评测工程师

阶跃星辰

北京 / 上海 / 其他人工智能社会招聘

岗位描述

岗位描述:负责大模型代码能力的评测体系建设与持续演进,定义模型在软件工程场景下的能力发展方向和质量标准,构建可抵御刷分的评测体系。为模型在特定方向上构建完整的任务完成环境,将真实软件开发流程抽象为可复现、可扩展的评测用例;设计模拟真实软件工程场景的评测环境,覆盖需求分析、架构设计、多文件编辑、Debug、测试覆盖等完整链路。制定覆盖多语言的代码能力评测标准,包括正确性、代码质量、复杂度处理、工程规范等,建立能力基线并持续追踪;设计超越简单 Pass/Fail 的多维评估维度,涵盖正确性、安全性、鲁棒性、可读性、执行效率等指标,并基于评测结果进行结构化分析,持续迭代优化 Rubric 标准。完成评测数据的全流程处理,包括数据清洗、过滤、去重与质量校验,构建高质量评测数据集;负责评测数据、评测样本与 Benchmark 的建设与治理,保障评测结果的客观性与可复现性;建立评测—训练闭环迭代机制,使能力提升可量化。 岗位要求:计算机科学、人工智能、软件工程等相关专业,本科及以上学历。精通 Python,熟练掌握至少一种其他编程语言(如 Java、Go、C++、TypeScript 等),具备跨语言工程实践经验。熟悉 Linux、容器技术(Docker)及编排工具;熟悉主流 LLM 评测基准与方法论,如 HumanEval、SWE-bench 等。具备复杂系统或产品的核心研发经验,能够清晰阐述关键设计决策与权衡。熟悉评测集、指标体系、Rubric 设计及自动化评测流程,有评测平台、数据流水线或实验系统建设经验。对主流大模型的原理、能力边界及典型应用场景有较深入理解,熟悉大模型与 Agent 的常见评测方法。加分项包括:有安全隔离的代码执行沙箱环境构建经验;有桌面沙盒与虚拟机环境相关构建经验,支持桌面端代码编译打包、应用启动、进程健康、UI 渲染、跨平台一致性等验证;熟悉容器技术及编排工具,支持大规模并发调度的评测执行;有 Browser Use、自动化测试等相关项目经验。