机器学习平台SRE工程师
岗位描述:负责大规模 GPU 训练与推理集群的稳定性保障,支撑业务 7×24 高可用运行;负责 Kubernetes 及云原生周边系统(监控、日志、镜像分发、存储)的运维保障、平台化工具开发以及疑难问题排查解决;负责 GPU 节点硬件故障的自动化巡检、自愈体系与告警治理;参与 OnCall 值班,响应集群级突发事件,如网络拥塞、调度热点、训练任务失败等。 岗位要求:具备 3 年以上大规模分布式系统或云原生基础设施 SRE 经验,有 10...
第 152 页,共 829 页
岗位描述:负责大规模 GPU 训练与推理集群的稳定性保障,支撑业务 7×24 高可用运行;负责 Kubernetes 及云原生周边系统(监控、日志、镜像分发、存储)的运维保障、平台化工具开发以及疑难问题排查解决;负责 GPU 节点硬件故障的自动化巡检、自愈体系与告警治理;参与 OnCall 值班,响应集群级突发事件,如网络拥塞、调度热点、训练任务失败等。 岗位要求:具备 3 年以上大规模分布式系统或云原生基础设施 SRE 经验,有 10...
岗位描述:全面参与标注项目的需求分析、规则制定、生产交付工作,确保交付质量与时效;准确理解大模型标注业务需求,撰写相关配套文档,对标注人员、验收人员进行培训答疑;搭建标注与验收团队,监控标注项目执行情况,解决过程风险;基于对标注业务的理解,主动优化流程与工具,以提升标注效率和质量、降低成本。 岗位要求:本科及以上学历,具备 3 年及以上标注相关工作经验,大模型标注经验者优先;具备 Python/Go/Java/C++ 任意一种语言使用经...
岗位描述:负责大模型数据项目的整体规划、执行、监控与交付,确保项目在范围、时间、质量目标内完成;制定并持续优化标注规范、评估标准和质量管控体系,输出清晰可执行的标注文档和 SOP;主动探索并落地 AI Agent、Prompt 工程、自动化脚本等工具,系统性提升项目交付效率与质量;分析项目数据与 badcase,识别效率瓶颈和体验问题,将数据洞察转化为流程改进建议;识别和管理项目风险,及时制定应对方案,确保项目平稳推进;与算法、研发团队...
岗位描述:负责数据平台架构设计与开发,设计与开发全链路血缘、自助打标平台、指标管理等工具平台;基于对数据链路的理解,优化和改善现有流程与性能,提升数据稳定性与时效性;负责业务数仓建设,独立完成数据各层级建模,构建成熟稳定的数据仓库;构建流批一体架构,基于 Flink、Kafka、数据湖等技术实现实时与离线数据 Pipeline;主动思考并推动数据价值发掘,为模型迭代、产品决策、用户增长提供高质量数据支撑。 岗位要求:计算机、数学、统计学...
岗位描述:负责数据平台架构设计与开发;设计与开发全链路血缘、自助打标平台、指标管理等工具平台;基于对数据链路的理解,优化与改善现有流程与性能,提升数据的稳定性和及时性;负责业务数仓建设,独立完成数据各层级建模,构建成熟、稳定的数据仓库;构建流批一体架构,基于 Flink、Kafka、数据湖等技术实现实时与离线数据 Pipeline;主动思考并推动数据价值发掘,为模型迭代、产品决策、用户增长提供高质量数据支撑。 岗位要求:计算机、数学、统...
岗位描述:负责数据安全核心系统的研发与架构设计,围绕数据分类分级、敏感数据扫描、动态/静态脱敏、加解密服务、访问控制网关、DLP 引擎、UEBA 行为审计等场景,构建高性能、可扩展的数据安全中台与治理平台;负责将数据安全策略产品化、工程化落地,协同产品、研发、算法团队,将用户隐私保护、模型训练/推理数据安全、Prompt 及模型输出管控等安全需求转化为系统能力,研发数据防泄漏、反爬虫等安全防护系统;负责数据安全基础设施的研发与迭代,包括...
岗位描述:研究基于 Long CoT 的大模型强化学习相关技术,包括算法或系统方向,推动技术突破,重点涉及推理能力(Reasoning)与智能体(Agent)方向;研究其他通往 AGI/ASI 的前沿技术。 岗位要求:985/211 高校研究生及以上学历或优秀本科生,计算机科学、人工智能、机器学习等相关专业;熟悉强化学习和大模型相关技术,具有相关实践和研究经验者优先;有大模型基础设施(Infra)相关研发经验者优先;有大模型与 Agen...
岗位描述:负责开放平台整体产品规划与建设,承接商业化战略需求,推动AI能力产品化与平台化落地,并具备在资源有限情况下独立从0到1搭建产品体系的能力。具体包括:负责开放平台整体产品架构设计;负责Agents API商业化产品从0到1规划设计,构建AI Agent能力体系,支撑B端客户快速构建和部署智能体应用;负责MaaS API产品能力建设,设计覆盖模型推理、评估、监控等全生命周期的API体系,打造面向开发者的标准化AI能力输出平台;深入...
岗位描述:从0到1搭建面向AI开发者的社区生态,制定开发者增长策略,推动开发者在产品内的使用、反馈与共创;结合行业趋势和公司产品核心能力,通过活动、任务、黑客松等形式,促进开发者真实使用与验证,形成高质量示例与应用案例;策划并组织线上线下技术活动,与内部技术团队和外部专家合作,提升开发者参与度及产品知名度;发现并维护核心开发者群体,建立激励与支持机制,推动社区知识与实践的持续沉淀;拓展与开源社区、AI工具平台及应用开发团队的合作,联合推...