外企

高性能 AI 软件工程师

超威半导体(AMD)

上海人工智能社会招聘

岗位描述

岗位描述:你将加入 GPU 网络与推理基础设施团队,负责 MORI(Modular RDMA Interface)在大规模 LLM 推理场景中的框架集成与性能优化工作。MORI 是一个面向 AMD GPU 通信的开源框架,为 SGLang 和 vLLM 中的 MoE 专家并行、Prefill/Decode 解耦提供 RDMA 与 GPU-Direct 网络层,并通过 MORI-UMBP 管理 KVCache 存储。你将负责将 MORI 原语端到端集成到 SGLang 和 vLLM,包括 Python 算子 API、MoE 前向过程中的 MORI-EP dispatch/combine,以及 KVCache 传输链路中的 MORI-IO;集成分层 KVCache 存储和分布式键值访问能力到推理服务栈;将 MORI-IO 集成到 Prefill/Decode 路径以实现基于 GPU-Direct RDMA 的高吞吐 KVCache 传输;在 SGLang 和 vLLM 中落地并维护 MORI-EP,覆盖调度、路由以及针对 DeepSeek V3 等 MoE 模型在 8 至 64 张 GPU 上的 EPLB;集成并维护 MORI-SHMEM 对称内存运行时,包括对称 GPU 内存分配、RDMA 传输初始化(IB、AINIC、Thor2)、P2P/XGMI 地址转换以及通过 MORI-IR bitcode 为 GPU Kernel 提供设备端状态;同时设计并执行端到端性能基准测试(如吞吐、TTFT、ITL),并依据性能剖析结果持续优化系统。 岗位要求:需深入熟悉至少一种主流 LLM 推理框架,如 SGLang、vLLM、TensorRT-LLM 或同类框架,理解其调度器、attention backend、KVCache 管理器和分布式执行引擎。需深入理解 LLM 服务化关键机制,包括 MoE 专家并行、Prefill/Decode 解耦、KVCache 复用,以及 tensor/pipeline/sequence 并行。具备扎实的 C++ 与 Python 能力,能够在 C++/HIP/Python 混合代码库中工作,并熟悉 PyTorch 自定义算子扩展。需有参与大型开源项目的经验,包括上游 PR、代码评审和跨团队协作。加分项包括:理解 RDMA 相关概念,如 verbs API、队列对、完成队列、内存注册、GPUDirect Async(IBGDA);熟悉 NCCL、RCCL、MPI 等集合通信库及其在分布式系统中的集成;了解 GPU 集群网络拓扑,如节点内 XGMI/NVLink、节点间 InfiniBand/RoCE 及其对 MoE all-to-all 模式的影响;熟悉 Mellanox ConnectX、AMD Pollara/AINIC、Broadcom Thor2 等网卡生态和用户态驱动库;具备使用 rocprofv3、Perfetto、ibstat/perfquery 对网络瓶颈负载进行性能分析的经验;了解 ROCm、hipcc 或 AMD GPU 架构。该岗位将直接连接底层 GPU 网络层与万亿参数模型推理框架,相关成果将直接进入开源与生产环境。