数据安全专家
岗位描述:主导Kimi产品数据全生命周期安全能力的设计、落地与持续迭代,建立敏感数据识别与分级分类体系,推动自动化识别、标签化、策略化能力在生产环境落地。负责设计并实施数据加密、静态与动态脱敏、数据最小化使用等技术方案,平衡数据在存储、计算、流转和使用过程中的安全与效率,并构建数据血缘、访问路径及使用行为的可视化能力。结合Zero Trust、最小授权、按需授权、Just-in-Time等理念,推动覆盖多云环境的精细化、自动化数据访问控...
第 22 页,共 161 页
岗位描述:主导Kimi产品数据全生命周期安全能力的设计、落地与持续迭代,建立敏感数据识别与分级分类体系,推动自动化识别、标签化、策略化能力在生产环境落地。负责设计并实施数据加密、静态与动态脱敏、数据最小化使用等技术方案,平衡数据在存储、计算、流转和使用过程中的安全与效率,并构建数据血缘、访问路径及使用行为的可视化能力。结合Zero Trust、最小授权、按需授权、Just-in-Time等理念,推动覆盖多云环境的精细化、自动化数据访问控...
岗位描述:负责公司下一阶段 AI 基础设施网络底座建设,支撑 AI 模型训练、开放平台与 Kimi 等业务场景;统筹公司所有网络相关部分的管理、运维、优化与方案制定,包括云到云、云到 IDC、IDC 到 IDC 的专线与互联架构,以及训练推理集群中的 RDMA/RoCE 网络、Kubernetes Service/Pod 网络、DNS、LB、DDoS 防护等基础组件;负责跨云、云到 IDC、IDC 到 IDC 的专线与互联网络规划、建设...
岗位描述:参与 Kimi 跨模态通用模型开发,设计并构建高效的数据流转、训练和测试系统,通过合理的工程化与系统抽象大幅加速研发过程;基于对深度学习的扎实理解,发掘研发过程中呈现的共性模式,通过合理抽象与良好设计构建便捷、鲁棒、可复用的 library 和 service。 岗位要求:计算机科学或相关领域本科及以上学历;对机器学习或大模型底层原理有扎实理解,具备大模型训练、计算机视觉或强化学习相关方向的工程经验;熟悉 Python 和 C...
岗位描述:负责推动公司可靠性体系从“事后救火”转向“事前设计”,建立可预测的发布工程、信号清晰的观测体系和持续进化的应急响应机制;构建可持续的On-call与应急响应体系,重构现有报警体系,建立分级降噪机制,实现故障的分钟级发现与精准定位;建立标准化On-call手册与应急流程,引入混沌工程主动暴露系统脆弱点;主导故障复盘,推动根因修复与改进措施落地,避免同类故障重复发生;针对高频上线场景设计并落地安全变更框架,包括灰度发布、自动回滚、...
岗位描述:设计和优化大规模Web爬虫的URL发现与调度系统,持续扩大数据覆盖面;建设多因子抓取优先级体系,在有限资源下最大化高质量页面的获取效率;主导反爬对抗和动态渲染方案,提升核心站点的抓取成功率;建立数据质量评估闭环,实现从域名到页面的多层级质量管控;优化大规模数据处理管线的性能和稳定性。 岗位要求:具备大规模搜索引擎或Web爬虫系统实战经验,做过百亿级以上URL池的全链路;深入理解全网URL发现的多种手段;熟悉主流反爬机制及对抗方...
岗位描述:负责主导商业化内核与支付适配的总体设计、开发、落地及演进,支撑跨市场、高可用的会员订阅式商业化平台的管理与优化;依据公司与部门战略以及业务实际需求,制定研发路线图并把控各子系统优先级;构建数据口径、对账与审计、运营管理后台等系统,提升 ARR;与其他研发、业务运营、后台支持团队紧密协作,制定并达成 SLO/SLI,保障关键业务零中断和卓越用户体验。 岗位要求:具备 5 年以上会员商业化领域(订阅、支付、订单等)的后端开发经验,...
岗位描述:设计稳健运行的分布式服务架构;优化超大规模线上推理集群的运行效率,支撑大模型推理系统稳定、高效运行。 岗位要求:985/211 高校研究生及以上学历,或优秀本科生;热爱写代码,熟悉编译原理、操作系统、计算机网络等计算机基础知识;熟练掌握至少一种编程语言,Python、Golang、Rust、TypeScript 优先;对 AI 技术和分布式系统有强烈的学习热情;具备良好的团队协作能力和沟通能力。加分项包括:有自己精心维护或参与...
岗位描述:设计并维护支撑大模型训练与推理的 Kubernetes 平台,负责集群生命周期管理、节点治理、网络/存储 CSI 插件及自动化运维体系;深度优化容器镜像分发,将千节点集群的 Pod 启动时间压缩到秒级;研发平台化工具链(CLI/SDK/Web Console),覆盖实验管理、模型管理、数据集编排、工作流流水线(MLOps),降低算法工程师的使用门槛;建设集群可观测性与成本治理体系,通过 eBPF/Prometheus 实现训练...
岗位描述:负责大规模 GPU 训练与推理集群的稳定性保障,支撑业务 7×24 高可用运行;负责 Kubernetes 及云原生周边系统(监控、日志、镜像分发、存储)的运维保障、平台化工具开发以及疑难问题排查解决;负责 GPU 节点硬件故障的自动化巡检、自愈体系与告警治理;参与 OnCall 值班,响应集群级突发事件,如网络拥塞、调度热点、训练任务失败等。 岗位要求:具备 3 年以上大规模分布式系统或云原生基础设施 SRE 经验,有 10...
岗位描述:全面参与标注项目的需求分析、规则制定、生产交付工作,确保交付质量与时效;准确理解大模型标注业务需求,撰写相关配套文档,对标注人员、验收人员进行培训答疑;搭建标注与验收团队,监控标注项目执行情况,解决过程风险;基于对标注业务的理解,主动优化流程与工具,以提升标注效率和质量、降低成本。 岗位要求:本科及以上学历,具备 3 年及以上标注相关工作经验,大模型标注经验者优先;具备 Python/Go/Java/C++ 任意一种语言使用经...