独角兽

大模型训练框架工程师(预训练方向)

阶跃星辰

北京 / 上海 / 其他人工智能社会招聘

岗位描述

岗位描述:负责深度学习训练框架研发,包括框架内核开发、算子适配、功能迭代及性能优化,定位并修复框架底层问题;负责大模型分布式训练系统研发,设计并优化数据并行(DP)、张量并行(TP)、流水线并行(PP)、序列并行(SP)、专家并行(MoE)、ZeRO/FSDP 等并行策略,提升超大规模模型训练效率;负责大模型训练性能优化,包括 CUDA Kernel 优化、通信优化、显存优化、低精度训练、激活重计算(Checkpoint)等,持续提升训练吞吐;负责大模型训练稳定性建设,包括训练指标监控与分析、Loss/Grad 异常定位、性能瓶颈分析及故障排查,保障大规模训练稳定运行;协同算法团队推进大模型训练方案落地,对公司内部及业界开源的新结构、新算法进行实现和优化,支撑新模型与新算法快速迭代。 岗位要求:熟练掌握 C++、Python,具备扎实的计算机体系结构、操作系统、Linux 及并发编程基础;熟悉 CUDA 编程及 GPU 架构,具备 CUDA Kernel 开发与性能优化经验;熟悉 PyTorch 深度学习框架,了解 Autograd、ATen、Dispatcher 等核心机制,具备框架开发或自定义算子开发经验;熟悉分布式训练原理,掌握至少一种大模型训练框架或并行方案,如 Megatron-LM、DeepSpeed 等;具备大规模模型训练、训练性能优化或训练稳定性问题定位经验,有 Loss 不收敛、通信瓶颈、显存优化等问题解决经验者优先。加分项包括:有千亿参数大模型、千卡及以上规模全流程训练经验;有 PyTorch、DeepSpeed、Megatron-LM 等开源项目贡献经验;有 OSDI、SOSP、NSDI、MLSys 等 AI 系统相关顶会论文发表经验。