岗位描述
岗位描述:负责端侧大模型在手机、驾舱及智能硬件等终端的压缩部署;负责端侧大模型的前沿压缩算法研究,推动剪枝、量化、蒸馏、稀疏化等技术的创新与应用;探索与攻关端侧大模型的低精度训练技术,从训练阶段优化模型对低精度计算的适应性;研究与设计硬件友好的低精度量化算法,协同底层算子团队,实现在异构硬件上的极致性能优化。 岗位要求:精通模型压缩理论,深刻理解剪枝、量化、知识蒸馏、稀疏化、低秩分解等技术的数学原理与工程权衡,具备独立的技术选型与改进能力;具备顶尖的大模型量化研究与工程经验,深入理解 LLM 量化前沿,如 SmoothQuant、AWQ、GPTQ、QuaRot,并具备丰富的实战调优经验,能针对不同架构与任务进行算法创新;拥有系统级的问题解决能力,能系统性定位低精度部署中的性能与精度瓶颈,建立从量化误差分析、调试到验证的完整方法论;具备硬件感知的优化思维,熟悉主流端侧硬件(ARM CPU、Adreno/Mali GPU、Qualcomm/MTK NPU)的计算单元、内存架构与低精度指令集,能据此进行算法与协同设计。优先条件:在 CVPR、ICLR、NeurIPS、ICML、ACL 等顶级会议以第一作者发表过模型压缩、计算加速或相关领域论文,或拥有公认的同等技术影响力(如主流开源项目核心贡献)。