强化学习基础设施研究工程师
主要负责维护和开发公司内部强化学习后训练框架,支持万亿参数模型在 reasoning、agentic 等方向的文本与多模态 RL 后训练;与训练推理引擎团队协作,探索算法、框架、硬件的协同设计,提升大规模强化学习训练的稳定性和效率。要求具备扎实的工程算法基础和工程实现能力,熟悉 Python 等语言,熟练掌握 PyTorch 等深度学习框架及常见性能调试分析工具;深入了解 Megatron-LM、vLLM 等主流训练与推理引擎,并对大模...
第 276 页,共 415 页
主要负责维护和开发公司内部强化学习后训练框架,支持万亿参数模型在 reasoning、agentic 等方向的文本与多模态 RL 后训练;与训练推理引擎团队协作,探索算法、框架、硬件的协同设计,提升大规模强化学习训练的稳定性和效率。要求具备扎实的工程算法基础和工程实现能力,熟悉 Python 等语言,熟练掌握 PyTorch 等深度学习框架及常见性能调试分析工具;深入了解 Megatron-LM、vLLM 等主流训练与推理引擎,并对大模...
负责打造支撑下一代大模型自我进化的强化学习基础设施,围绕大规模 Agentic RL 场景设计训练与采样的混合调度策略,优化 Policy、Reference、Reward、Value 等多模型的并行协同与显存共享;深度定制 vLLM,优化 Rollout 阶段的 KV Cache 复用、量化与投机方法,尽可能降低 Token 生成延迟;结合算法、框架与硬件进行协同优化,为不同强化学习算法负载和硬件设施制定最优并行策略,最大化训练效率。...
负责探索并落地大规模语言和多模态 Agent 模型,推进全链路系统优化;主导数据建设,包括采集、清洗、标注、质检,以及指令微调、偏好对齐、RLHF/RLAIF 与模型持续优化,提升模型效果与用户体验;与产品和标注团队深度协同,持续优化模型能力。要求计算机相关专业本科及以上学历,熟练掌握至少两种后端语言,如 Python、Go、Java、C++,具备优秀代码能力、工程能力、数据结构和算法基础;熟悉 NLP、CV、RL 相关算法与技术,有大...
熟悉主流模型开放平台(如 Kimi、DeepSeek、Anthropic、OpenAI 等),精通 OpenAI API 标准;推动大模型技术落地,将 Function Call、MCP、Agent 等能力融入产品功能,支持多场景高效应用;持续优化 Prompt 设计,提升用户与大模型交互的流畅性、准确性和智能性;设计并维护 LLM 生产管线,包括网关、任务流和后台页面,确保系统稳定、高效、可观测;一线对接开发者或客户,深入理解用户痛点...
负责优化超大规模线上推理集群的运行效率和稳定性;跟踪最新模型进展,设计技术架构并将模型应用到产品中;设计和优化工作流,通过自动化手段加速模型到产品的迭代效率;需要具备良好的代码开发习惯,熟练掌握至少一种编程语言,如 Python、Go、Rust;具备分布式系统、API 设计、模型部署或 DevOps 相关经验者优先;能够独立思考并解决生产系统中的实际性能问题,熟悉 Kubernetes、容器化技术及主流大模型推理框架者优先。
负责从零搭建并运营高密度、高技术品味的开发者社区,沉淀真实有价值的开发者生态;将硬核的 LLM 能力转化为优雅、直观的开发者体验,撰写文档、教程和最佳实践,降低接入门槛;发掘社区中的优秀开发者与高价值用例,通过黑客松、技术沙龙等活动放大在极客与行业圈层中的影响力;作为开发者在公司内部的代言人,将社区反馈、真实痛点和前线问题转化为产品迭代与 API 优化建议;在 X、GitHub、LinkedIn、Telegram、Discord 等平台...