岗位描述
岗位描述:负责多模态大数据处理链路的开发与优化;设计、开发和维护基于 Spark、Ray 的大规模自动化 ETL Pipeline,处理 PB 级多模态图文数据;优化图文数据的准确性与丰富度,以提升多模态模型能力上限;参与 VLM 数据管理与处理基础设施的开发与设计。 岗位要求:计算机、大数据相关专业,本科及以上学历;具备扎实的代码能力,熟悉 Python,熟悉多线程编程、分布式计算、网络通信、内存管理;熟悉 Linux 环境,能编写 Shell/Python 脚本自动化日常任务;熟练掌握 Spark、Hive、Hadoop 等大数据处理工具或框架;了解深度学习基础原理以及多模态大模型基础原理。加分项包括:有丰富的多模态数据处理或挖掘经验者优先;有大规模数据处理基础设施 Pipeline 设计开发经验者优先;有深度学习 CV/NLP、多模态大模型训练经验者优先。