独角兽

大模型评测基建工程师

阶跃星辰

北京 / 上海 / 其他人工智能社会招聘

岗位描述

岗位描述:构建真实工作场景与代码任务 Benchmark,包括基于 Docker 的任务设计;设计 Agent 执行环境,涵盖代码运行、测试与结果验证;研发 CodeAgent 框架,实现任务规划、代码生成、执行与迭代闭环;构建 Agent Runtime,包括工具调用、环境管理与执行状态控制;搭建可扩展的多模型对比评测系统,优化 Agent 执行稳定性、可复现性与评测效率;推动研究能力向工程系统转化,支持模型与 Agent 的快速迭代。 岗位要求:具备扎实的软件工程能力,熟练掌握 Python、Go、TypeScript 等开发语言;熟悉 Docker/Linux 环境与自动化执行流程;理解 LLM Agent 工作机制与工具调用模式;具备复杂系统设计与工程落地经验;熟悉测试体系、任务执行与自动化 workflow 设计。优先考虑具备 LLM evaluation/benchmark 构建经验、熟悉 SWE-bench 或类似代码任务评测框架、开发过 CodeAgent 或自动化编程系统、熟悉 Agent orchestration / multi-agent framework,或有模型比较及大规模实验平台经验者。