模型训练优化开发工程师
1. 负责多种不同硬件平台的极致性能优化,结合编译优化、并行计算优化、图融合和高效CUDA算子开发,实现行业领先的车端推理性能;2. 针对特定NPU硬件计算平台,基于对硬件体系结构的深入理解,实现对硬件的高效利用;3. 针对PyTorch、CUDA相关GPU计算任务,进行算子和系统优化,提升训练与推理效率;4. 优化训练框架,尽可能高效发挥硬件和系统软件性能。任职要求:2年以上工作经验,计算机、数学、物理、电子工程、自动控制等相关专业本...
第 32 页,共 43 页
1. 负责多种不同硬件平台的极致性能优化,结合编译优化、并行计算优化、图融合和高效CUDA算子开发,实现行业领先的车端推理性能;2. 针对特定NPU硬件计算平台,基于对硬件体系结构的深入理解,实现对硬件的高效利用;3. 针对PyTorch、CUDA相关GPU计算任务,进行算子和系统优化,提升训练与推理效率;4. 优化训练框架,尽可能高效发挥硬件和系统软件性能。任职要求:2年以上工作经验,计算机、数学、物理、电子工程、自动控制等相关专业本...
负责分析和优化大模型分布式训练的全链路过程,提升训练性能和效率。要求本科及以上学历,计算机、深度学习等相关专业,3年及以上工作经验;熟练掌握 Linux 环境下的 C/C++ 与 Python 语言;熟练使用至少一种训练框架(TensorFlow、PyTorch 或其他自研框架);熟练使用至少一种大规模训练优化框架(Megatron、DeepSpeed、LightSeq 或其他自研框架)。有百亿级以上 GPT 或 MoE 等大型预训练模...
研发基于深度学习的自动驾驶感知与预测前沿技术;根据应用场景和客户需求,提供模型压缩、训练优化及推理优化相关方案(包含算法与工程);跟踪、分析、评估主流深度学习框架。要求计算机、数学、物理、电子工程、自动控制等相关专业硕士及以上学历,AI相关研究方向;精通 C++,熟悉典型计算机体系结构,具备分布式性能优化经验和优秀编程能力;熟悉至少一种深度学习框架,具有2年以上深度学习框架开发经验,了解分布式训练和模型并行技术;熟悉 CUDA、Tens...
负责数据挖掘平台核心工程架构的设计与开发实现,保障平台高可用、高并发和高性能运行;主导数据处理流水线、分布式计算引擎、存储系统等核心模块的开发与优化,支撑海量数据高效处理;负责平台工程化能力建设,包括自动化部署、监控告警、故障排查、版本迭代等,提升研发与运维效率;对接数据挖掘算法团队,将算法模型高效工程化落地,解决算法与工程结合中的性能和兼容性问题;优化平台资源利用率与处理延迟,推动技术架构持续迭代,保障平台稳定可靠地服务业务场景。
1. 负责自动驾驶深度学习数据和模型自动化生产流程的架构设计与优化。2. 负责自动驾驶数据架构自动化工具和可视化工具的设计与优化。任职要求包括:熟练使用Python,掌握基本数据结构与算法;具备MySQL、Mongo等数据库使用和优化实践;优先考虑具备MapReduce及大数据系统原理、机器学习/深度学习框架实践经验,以及HDFS、Hive、Spark、Flink、HBase、Kafka等分布式计算系统使用经验者;有Django等后端W...
研发基于深度学习的自动驾驶感知前沿技术;根据应用场景和客户需求定义,提供深度学习解决方案;挖掘海量数据,构建高效的数据自动标注系统。要求计算机、数学、物理、电子工程、自动控制等相关专业硕士及以上学历,AI 相关研究方向;具有 3-4 年深度学习平台研发经验;熟悉至少一种深度学习框架,如 TensorFlow、PyTorch、PaddlePaddle;具备 CUDA、TensorRT 或其他 AI 加速库开发经验;熟练掌握 Linux 应...