岗位描述
岗位描述:参与大模型推理框架的设计与开发,协助团队研发支撑大语言模型、图像生成等复杂模型推理的高性能框架,推动算法到产品落地的全链路优化,确保推理高效、稳定、低延迟;在资深工程师指导下参与内存管理、计算资源分配与调度策略优化,提升模型推理速度和资源利用率,并学习使用性能分析工具(如 Nvidia Nsight)进行瓶颈定位和优化;学习并应用业界前沿的模型推理加速技术,包括 KV Cache 优化、模型量化、剪枝及跨机分布式推理优化等。 岗位要求:熟练掌握 C++ 和 Python,具备扎实的数据结构、算法和操作系统基础;熟悉至少一种主流深度学习框架,如 PyTorch、TensorFlow,并了解其基本实现原理;了解 GPU 编程(如 CUDA)或并行计算,具备相关课程项目或实验经验;对 Transformer 架构及主流大模型(如 GPT、Llama、Qwen 等)的推理特性有基本理解,了解大模型推理的基本流程及延迟、吞吐、内存占用等常见挑战。加分项包括:有 vLLM、TensorRT-LLM、SGLang、llama.cpp 等大模型推理框架的使用或初步研究经验;对 TVM、MLIR、Triton 等 AI 编译器技术有初步接触或浓厚兴趣;了解 FlashAttention、PageAttention、量化、LoRA 微调等推理优化技术;在 MLSys、ASPLOS 等相关顶会或开源项目中有贡献或论文者优先。