大规模推理系统工程师
岗位描述:设计稳健运行的分布式服务架构;优化超大规模线上推理集群的运行效率。 岗位要求:985/211 高校研究生及以上学历或优秀本科生;热爱编程,熟悉编译原理、操作系统、计算机网络等计算机基础知识;熟练掌握一种编程语言,Python、Golang、Rust、TypeScript 优先;对 AI 技术和分布式系统有强烈学习热情;具备良好的团队协作能力和沟通能力;有自己精心维护或参与的 GitHub 开源项目者优先;熟练使用各类 AI 编...
第 82 页,共 415 页
岗位描述:设计稳健运行的分布式服务架构;优化超大规模线上推理集群的运行效率。 岗位要求:985/211 高校研究生及以上学历或优秀本科生;热爱编程,熟悉编译原理、操作系统、计算机网络等计算机基础知识;熟练掌握一种编程语言,Python、Golang、Rust、TypeScript 优先;对 AI 技术和分布式系统有强烈学习热情;具备良好的团队协作能力和沟通能力;有自己精心维护或参与的 GitHub 开源项目者优先;熟练使用各类 AI 编...
岗位描述:设计、搭建并持续迭代大模型多维度评测框架,让模型能力可衡量、可对比、可解释;与算法团队协作,将评测结论转化为数据需求,寻找能够提升模型智能的关键数据并推动落地;跟踪前沿论文与开源社区,及时将新的评测维度和数据策略应用到业务中;以产品思维发现问题并推动解决,持续提升模型能力。 岗位要求:具备 Python、Go、Java、C++ 中任意一种语言的使用经验,能够独立编写脚本、调用 API、搭建小工具;逻辑思维强,注重用数据说话,熟...
岗位描述:负责大语言模型预训练数据算法的设计与实现,包括数据选择、质量建模、去重、过滤、数据配比、合成数据与课程学习等方向;将数据算法落地到大规模数据处理流程中,基于 Ray、Spark 等分布式框架处理海量训练数据;设计并执行数据消融实验,评估不同数据源、质量过滤策略、去重策略、配比方案和采样策略对模型能力的影响;建设从数据到模型效果的实验闭环,结合训练 loss、benchmark、能力维度评测、训练动态和样本分析,定位数据问题并持...
岗位描述:负责制作 Coding Agent 的 Benchmark,覆盖从基建到数据的全链路建设;探索并寻找 SWE Bench 之外的各类 Coding Agent 衡量指标;打造属于 Moonshot 自己的 Coding 工具,但目标不是成为另一个 Claude Code;需要具备敏锐的问题识别能力,能够发现工具、模型和工程实现中的低质量问题,并能在高强度反馈环境中有效协作。 岗位要求:熟悉 Claude Code、Cursor...
岗位描述:参与 Kimi-VL 等视觉语言模型的预训练和 post-training 工作,优化模型在长视频理解、长文档阅读等任务中的表现,提升模型准确性与效率;研究和探索在大语言模型上学习视频的方向,结合 Kimi 产品特点和优势,探索新的算法与架构,提升模型在视频场景下的泛化能力;负责数据优化与质量提升,满足模型训练与优化需求,深入分析数据特征和模型输出结果,为模型改进提供依据;设计并实施视频相关强化学习模型的评估指标和方法,对模型...
岗位描述:在 Agentic 与多智能体强化学习的算法、环境和基础设施方向取得突破,推动 Kimi K2 及后续模型在真实世界中的自主能力提升,欢迎在相关某一方向具备 SOTA 能力的候选人加入。 岗位要求:精通强化学习核心方法,包括策略梯度、Actor-Critic、Self-Play、Meta-RL、MARL;具备大规模训练与服务系统落地经验,能够支持千卡级训练和低延迟 Rollout;具备专家级系统编程能力和分布式基础设施设计能力...
岗位描述:在 Agentic 与多智能体强化学习的算法、环境和基础设施方向取得突破,推动 Kimi K2 及后续模型在真实世界中的自主能力提升。 岗位要求:精通强化学习核心方法,包括策略梯度、Actor-Critic、Self-Play、Meta-RL、MARL;具备大规模训练与服务系统落地经验,能够支持千卡级训练和低延迟 Rollout;具备专家级系统编程能力和分布式基础设施设计能力,熟悉 Python、C++、Rust;在 Agen...
岗位描述:负责打造支撑下一代大模型自我进化的 RL 基础设施,面向大规模 Agentic RL 场景设计训练与采样的混合调度策略,优化多模型(Policy、Reference、Reward、Value)的并行协同与显存共享;深度定制 vLLM,优化 Rollout 阶段的 KV Cache 复用、量化和投机方法,尽可能降低 Token 生成延迟;深入理解硬件,针对 RL 的不同算法负载和不同硬件设施定制最优并行策略,最大化 MFU,并与...
岗位描述:主要负责维护和开发 Moonshot 内部的强化学习后训练框架,支持万亿参数模型在 reasoning、agentic 等方向的文本与多模态 RL 后训练;与训练推理引擎团队合作,探索算法、框架与硬件的协同设计,提升大规模强化学习训练的稳定性和效率。 岗位要求:具备扎实的工程算法基础和工程实现能力,熟悉 Python 等编程语言,熟练掌握 PyTorch 等深度学习框架及常见性能调试与分析工具;对 Megatron-LM、vL...
岗位描述:深度参与 CodeLLM 的数据处理、清洗与优化,科学地改进、筛选和平衡用于大模型预训练与对齐训练的数据质量,提升模型在 Pretrain 和 SFT 阶段的代码能力与智能体能力;通过 SFT(监督微调)、RL(强化学习)以及工具、Docker 环境和任务的构建与扩展,积极提升 Coding/SWE Agent 能力,并沉淀有效训练智能体模型的实践方法;深入探索增强模型问题求解能力的方法,目标是在简单和中等难度算法题上接近 1...