岗位描述
岗位描述:负责大语言模型预训练数据算法的设计与实现,包括数据选择、质量建模、去重、过滤、数据配比、合成数据与课程学习等方向;将数据算法落地到大规模数据处理流程中,基于 Ray、Spark 等分布式框架处理海量训练数据;设计并执行数据消融实验,评估不同数据源、质量过滤策略、去重策略、配比方案和采样策略对模型能力的影响;建设从数据到模型效果的实验闭环,结合训练 loss、benchmark、能力维度评测、训练动态和样本分析,定位数据问题并持续迭代数据策略。 岗位要求:计算机、人工智能、数学、统计学等相关专业,本科及以上学历;熟悉大语言模型预训练范式,理解预训练数据对模型能力、训练稳定性和 scaling behavior 的影响;具备扎实的机器学习、NLP 或大模型算法基础,能够独立完成算法设计、实验设计、结果分析和策略迭代;熟练使用 Python,熟悉 PyTorch、TensorFlow、JAX 等至少一种深度学习框架;熟悉大规模数据处理,有 Ray、Spark 等分布式计算框架使用经验;具备良好的工程实现能力,能够将数据算法实现为稳定、高效、可复用的大规模处理 pipeline;具备较强的数据分析能力,能从 loss 曲线、评测结果、数据分布和样本案例中定位问题;具备良好的论文阅读、问题拆解和跨团队协作能力。加分项包括:有 LLM pretrain 或 midtrain 数据实验经验,或参与过基础模型训练项目;有数据消融、数据配比、数据选择、质量建模、合成数据、课程学习相关经验;熟悉 MinHash、SimHash、LSH、基于 embedding 的过滤、基于分类器的过滤、perplexity filtering 等方法;有 benchmark contamination 或 leakage 检测、评测集去污染经验;有代码、数学、多语、多模态等专项数据算法经验;有 PB 级文本数据处理经验,或熟悉云上、K8s、集群计算环境;在 NLP、机器学习、数据挖掘、大模型训练等方向有论文、竞赛、开源或工业落地成果。