岗位描述
岗位描述:从事音频算法的研究、训练与应用,具体包括 Omni 音频理解、同声传译、视频与音频联合生成等业务;探索语音与音频技术前沿,研究音频理解、音频表征、音视频联合生成的新范式;负责模型的多机多卡训练、高性能推理、数据集构建及评测系统搭建等工作。 岗位要求:自然语言处理、机器学习、人工智能、软件工程等相关专业,硕士及以上学历;具备较强的算法开发能力,熟悉常用机器学习、深度学习算法;熟练使用 Python 及 Pytorch/Tensorflow 深度学习框架;熟悉至少一种大模型相关框架或理论并有相应研发经验者优先,如 Diffusion、Vall-E、SpearTTS、AudioLM、MusicLM 等;具备优秀的代码能力和基础算法功底,拥有较丰富的工程经验,具备大规模训练或大规模数据处理经验。加分项包括:在 ACL、NeurIPS、ICLR、EMNLP、ICML 等顶级会议或期刊发表过论文;熟悉并行训练框架,有多机多卡训练经验。