大模型评测基建工程师
岗位描述:构建真实工作场景与代码任务 Benchmark,包括基于 Docker 的任务设计;设计 Agent 执行环境,涵盖代码运行、测试与结果验证;研发 CodeAgent 框架,实现任务规划、代码生成、执行与迭代闭环;构建 Agent Runtime,包括工具调用、环境管理与执行状态控制;搭建可扩展的多模型对比评测系统,优化 Agent 执行稳定性、可复现性与评测效率;推动研究能力向工程系统转化,支持模型与 Agent 的快速迭代...
第 24 页,共 113 页
岗位描述:构建真实工作场景与代码任务 Benchmark,包括基于 Docker 的任务设计;设计 Agent 执行环境,涵盖代码运行、测试与结果验证;研发 CodeAgent 框架,实现任务规划、代码生成、执行与迭代闭环;构建 Agent Runtime,包括工具调用、环境管理与执行状态控制;搭建可扩展的多模型对比评测系统,优化 Agent 执行稳定性、可复现性与评测效率;推动研究能力向工程系统转化,支持模型与 Agent 的快速迭代...
岗位描述:负责深度学习训练框架研发,包括框架内核开发、算子适配、功能迭代及性能优化,定位并修复框架底层问题;负责大模型分布式训练系统研发,设计并优化数据并行(DP)、张量并行(TP)、流水线并行(PP)、序列并行(SP)、专家并行(MoE)、ZeRO/FSDP 等并行策略,提升超大规模模型训练效率;负责大模型训练性能优化,包括 CUDA Kernel 优化、通信优化、显存优化、低精度训练、激活重计算(Checkpoint)等,持续提升训...
岗位描述:参与分布式大模型推理框架的开发与优化,提升推理性能与吞吐量;针对不同场景的 LLM 请求特点,优化 GPU 计算流程,打造业内领先的高效 LLM 推理引擎;调研并引入前沿机器学习系统技术,推动系统架构的持续优化升级;与算法团队深度合作,探索算法-系统协同优化方案,提升整体推理效率。团队技术氛围浓厚,提供充足的 GPU 计算资源和具有挑战性的技术场景,可深入参与大模型推理优化及前沿技术研究。 岗位要求:计算机、电子、自动化、软件...
岗位描述:负责大模型 RL 训练与推理系统建设,持续提升训练效率、系统稳定性和工程迭代速度。工作内容覆盖分布式训练、推理链路、性能优化、稳定性治理,以及 Agent RL 相关能力建设。具体包括:负责 RL 训练与推理基础设施的设计、开发与优化;建设分布式训练、任务调度、权重同步、热更新等核心链路;持续优化系统吞吐、时延、GPU 利用率、训练效率等指标;建设稳定性与可观测能力,定位并解决 OOM、超时、通信瓶颈、一致性问题;参与 Age...