独角兽

语音大模型数据工程师

阶跃星辰

北京 / 上海 / 其他数据开发社会招聘

岗位描述

岗位描述:设计、搭建并持续迭代语音大模型数据处理与生产管线,覆盖数据采集、清洗、标注、质检与版本管理,持续产出高质量训练数据;构建并维护大规模语音数据的自动化处理与质量控制流程,保障数据的稳定性、一致性和可追溯性;与算法团队紧密合作,理解模型训练需求,将模型问题转化为可执行的数据生产与优化方案;推动数据生产流程的工程化与平台化,提高数据处理效率与数据复用能力;跟踪语音大模型及多模态方向的最新数据构建方法,并将有效的数据策略快速落地到实际训练中。 岗位要求:本科及以上学历,计算机、人工智能、电子信息或相关专业。熟练掌握 Python、Java、Go、C++ 中至少一门语言,具备独立编写数据处理脚本和构建工具的能力;熟悉常见数据处理与分析工具,如 SQL、Pandas、Spark、Hadoop 等,有大规模数据处理经验者优先。对语音相关任务有较深入认知,了解大模型训练流程,对数据在模型效果中的作用有清晰理解。具备良好的工程意识、问题拆解能力和跨团队沟通协作能力。