岗位描述
岗位描述:负责构建稳健、高效的软件组件,以支持大语言模型和多模态模型在多GPU系统上的高性能运行;与内部GPU库团队及开源维护者协作,开发可提升吞吐、时延和可扩展性的功能;围绕AI推理系统开展全栈开发,重点关注模型行为理解与框架集成;优化主流深度学习/LLM框架(如PyTorch、vLLM、SGLang)在AMD GPU上的表现,并推动优化成果向上游贡献;开发与Llama、Qwen-VL、Wan等LLM及多模态架构紧密交互的功能,涵盖注意力机制、跨模态融合、KV Cache和量化等;在多GPU环境中编写兼顾内存占用、并发性和瓶颈控制的高效可扩展代码;使用性能分析工具评估改动效果、识别性能回退并验证优化收益;对多GPU及多节点系统进行端到端性能工程分析,定位并优化系统、内存和通信瓶颈;利用编译器技术和图编译器加速完整深度学习与推理流水线;研究、原型验证并集成推测解码、仅权重量化等新兴优化方法;采用稳健的软件工程实践,交付可维护、可靠、可用于生产环境的性能优化方案。 岗位要求:熟悉Python,具备C++或异步编程经验者优先;理解LLM或多模态模型相关概念,掌握Transformer架构、注意力机制、视觉语言对齐及推理流程(如图文输入处理);具备Transformer、Attention、MoE、KV Cache及量化(FP8/FP4)的理论基础;熟悉Linux开发环境,能够使用命令行、Git以及常见调试和性能分析工具;具备多GPU、多节点环境下LLM端到端性能分析与计算、内存、通信瓶颈定位经验;具备扎实的Python/C++编码能力、调试与测试实践,有交付可维护性能关键型软件的能力,具备开源贡献记录者优先;了解基于HIP、CUDA、ASM以及CK、CUTLASS、Triton等工具进行AMD GPU高性能内核调优者优先;了解LLVM、ROCm及编译器驱动的内核与系统优化方法者优先;熟悉多模态模型(如Qwen-VL、Qwen-Image-Edit、Wan)或扩散生成模型者优先;接触过ROCm、CUDA或PyTorch Profiler等GPU计算/性能分析工具;具备大规模模型分布式推理经验(如张量并行、流水并行)者优先;本科及以上学历,计算机科学、计算机工程、电气工程或相关专业。