岗位描述
岗位描述:负责主流大模型训练框架在壁仞芯片平台上的适配、功能验证、问题排查与性能调优;支撑预训练、微调等核心训练链路建设,落地MoE、多模态、智能驾驶等业务场景;定位并解决精度、显存、通信、算子等训练问题,搭建自动化工程体系;搭建自动化体系,借助AI Agent赋能适配工作与训练生态。 岗位要求:熟悉PyTorch核心训练流程与分布式并行策略(DP、TP、PP、ZeRO、FSDP等);掌握Megatron、DeepSpeed等一种或多种主流训练框架;熟练使用Linux、Python,具备较强的工程调试、问题定位和性能分析能力;有大模型预训练、全参微调、LoRA或大规模集群训练经验者优先;熟悉CUDA、算子开发、通信库、编译器优化或AI芯片软件栈者优先;有国产AI芯片适配、自动化平台建设、AI Agent工具使用经验者优先;有主流开源社区贡献经验者优先。