岗位描述
岗位描述:深度参与语音模型的数据全链路工作,围绕语音模型能力提升及业务场景落地,与算法、研发、产品、数据基地紧密合作,深入理解模型训练及评测需求,提供数据采集、标注、评测、数据构建等专业数据解决方案,助力语音基座模型能力持续提升。结合语音语言学特点及模型发展需求,负责语音数据标准、标注规范、质量评价体系的设计与优化,探索高效的数据生产及评测方法,推动数据质量提升和模型效果优化。深入分析语音交互、语音合成、语音识别等场景中的数据问题,基于语言学、语音学知识进行问题定位和数据策略优化,协同算法团队探索数据构建、数据增强及评测方法迭代。持续跟踪语音技术及大模型发展趋势,参与语音数据能力建设,包括数据体系规划、数据闭环建设、评测体系优化等,不断提升语音数据交付能力及数据价值。 岗位要求:本科及以上学历,语言学、应用语言学、计算语言学、语音学、自然语言处理等相关专业。具备语音相关领域专业知识,熟悉语音识别(ASR)、语音合成(TTS)、语音交互等相关技术及应用场景,有语音模型数据、语言数据处理或相关项目经验者优先。具备较强的语言分析能力,能够理解语音数据中的发音、韵律、多音字、语义理解、语言表达等问题,并将专业判断转化为数据标准、标注规范及优化方案。熟悉 AI 模型训练数据及评测方法,具备数据采集、标注、评测等全流程经验,能够独立推进复杂数据项目或跨团队协作项目。具备优秀的逻辑分析、沟通协作和问题解决能力,能够在快速变化、高挑战环境下推动项目落地。加分项包括:有语音识别、语音合成、语音助手交互等项目经验;有语言数据分析、语料库建设、语言质量评估经验;有方言、多语言、口语化表达、自然语言交互相关研究或项目经验;会粤语或具备小语种能力。