岗位描述
岗位描述:参与下一代多模态大模型(Vision-Language Model,VLM)的系统研发,与团队共同探索大模型从训练到推理部署的完整技术链路。具体包括:参与基于 PyTorch、Megatron 等框架的大规模分布式训练系统研发与优化,深入理解并优化 TP、PP、CP、SP、EP、MoE 等并行训练策略,并参与多模态数据 pipeline(图像、视频、文本)的构建与优化;参与设计与实现大模型推理系统,基于 vLLM、SGLang 等推理框架构建高性能推理服务,探索 KV Cache、batching、scheduling 等关键推理技术,支持多模态模型推理部署,并研究 FP8、INT8、AWQ、GPTQ 等量化推理与性能优化;参与 RLHF、RLAIF、GRPO 等大模型对齐算法的工程实现,构建训推分离的 RL 训练系统,参考 slime、verl 等开源框架搭建 RL pipeline,并优化 rollout、sampling、reward、trainer 等核心模块;参与大模型系统工程研发,进行 CUDA、NCCL、GPU 计算性能优化,通过 profiling 与性能分析工具定位瓶颈,提升训练与推理系统稳定性和性能。 岗位要求:熟练使用 Python,具备良好的代码习惯与工程能力;熟悉 PyTorch 或深度学习基础;熟悉 Linux 开发环境;对大模型系统技术有浓厚兴趣。加分项包括:熟悉 Megatron、DeepSpeed、FSDP 等训练框架;熟悉 vLLM、SGLang、TensorRT-LLM 等推理框架;熟悉 RLHF、PPO、GRPO 等强化学习算法;使用过 slime、verl 或类似 RL 框架;有大模型训练或推理系统开发经验;熟悉 CUDA、GPU 编程或性能优化;熟悉分布式系统或分布式训练;有开源项目经验(如 GitHub、技术博客等)。同时希望候选人对大模型系统技术充满热情,喜欢研究系统底层原理与性能优化,具备较强自驱力与工程能力,并能稳定实习 3 至 6 个月及以上。