职位列表
第 9 页,共 161 页
大模型训练框架工程师(预训练方向)
岗位描述:负责深度学习训练框架研发,包括框架内核开发、算子适配、功能迭代及性能优化,定位并修复框架底层问题;负责大模型分布式训练系统研发,设计并优化数据并行(DP)、张量并行(TP)、流水线并行(PP)、序列并行(SP)、专家并行(MoE)、ZeRO/FSDP 等并行策略,提升超大规模模型训练效率;负责大模型训练性能优化,包括 CUDA Kernel 优化、通信优化、显存优化、低精度训练、激活重计算(Checkpoint)等,持续提升训...
大模型推理优化系统工程师
岗位描述:参与分布式大模型推理框架的开发与优化,提升推理性能与吞吐量;针对不同场景的 LLM 请求特点,优化 GPU 计算流程,打造业内领先的高效 LLM 推理引擎;调研并引入前沿机器学习系统技术,推动系统架构的持续优化升级;与算法团队深度合作,探索算法-系统协同优化方案,提升整体推理效率。团队技术氛围浓厚,提供充足的 GPU 计算资源和具有挑战性的技术场景,可深入参与大模型推理优化及前沿技术研究。 岗位要求:计算机、电子、自动化、软件...
大模型强化学习系统工程师
岗位描述:负责大模型 RL 训练与推理系统建设,持续提升训练效率、系统稳定性和工程迭代速度。工作内容覆盖分布式训练、推理链路、性能优化、稳定性治理,以及 Agent RL 相关能力建设。具体包括:负责 RL 训练与推理基础设施的设计、开发与优化;建设分布式训练、任务调度、权重同步、热更新等核心链路;持续优化系统吞吐、时延、GPU 利用率、训练效率等指标;建设稳定性与可观测能力,定位并解决 OOM、超时、通信瓶颈、一致性问题;参与 Age...
大模型预训练算法研究员/工程师
岗位描述:负责模型架构(Model Architecture)的研发、优化和创新,包括Attention、MoE等架构改进,以及全新架构探索;负责下一代预训练范式的研究和创新,推动相关技术的规模化发展;从算法角度推动大模型训练和推理的低成本化,包括优化器改进、量化、投机采样等技术;研究通用智能的本质,设计并迭代通用智能的评估和观测方法,以指导下一代范式演进;负责提升大语言基座模型的代码、数学、Reasoning能力,系统性增强模型能力,...
大模型AI Coding工程师/专家
岗位描述:深入探索LLM在编程场景中的应用,参与Coding Agent开发,并探索顶尖AI Coding模型与框架的能力边界;持续探索创新的评测方法,提出更优的Benchmark,定义模型能力,对大模型应用效果进行持续调优,通过数据分析与算法改进提升应用性能和体验;跟踪数据变更对模型效果的影响,与算法团队配合进行数据实验,形成可量化的反馈机制;构建大规模高质量数据,包括数据建设、数据抓取与解析、数据合成等;关注行业动态与技术趋势,及时...