岗位描述
岗位描述:参与建设面向大模型场景的新一代推理云平台,持续打造覆盖服务控制面、资源调度、云上基础设施、网络架构与存储接入的核心平台能力。负责推理云平台核心系统的架构设计与关键模块开发,建设服务控制面、配置管理、发布变更、运行治理等平台能力;面向大规模IDC与云上环境,设计和演进平台基础设施架构,提升系统在复杂部署场景下的稳定性、扩展性与可运维性;基于Kubernetes持续建设和优化平台能力,支持服务编排、资源管理、弹性扩缩容、集群治理与多环境交付;推动云上网络、服务接入与存储系统的对接整合,支撑模型服务高可用访问与高效运行;建设监控、日志、性能分析等可观测性体系,提升平台运行效率与问题定位能力;主导复杂技术问题攻关,与模型、推理引擎、基础设施等上下游团队协作,推动平台能力标准化、工程化与规模化落地。 岗位要求:计算机相关专业本科及以上学历,具备扎实的数据结构、算法、操作系统、网络与分布式系统基础;熟悉Python、Go、Java、C++中至少一种,具备良好的工程能力与系统设计能力;具备较强的后端平台、分布式系统或云原生基础设施研发经验,能够独立负责复杂模块设计与落地;深入理解Kubernetes及云原生技术体系,具备生产环境下的平台建设经验;对大规模IDC、云上基础设施、云上网络架构、存储系统对接有较深理解和实践经验;熟悉主流公有云产品,了解计算、网络、存储、负载均衡、容器服务等核心能力;热爱AI技术,对大模型方向有持续关注,了解模型基础原理、推理服务基本机制及行业发展趋势;能够主动将AI能力应用到日常研发、运维或协作流程中,提升工程效率与问题分析能力;具备良好的沟通协作能力,能够跨团队推动平台能力建设与技术方案落地。加分项包括:有大模型推理平台、模型服务平台或AI Infra相关经验;有混合云、多集群、跨地域基础设施或大规模资源平台建设经验;熟悉云上网络、服务访问链路、流量治理或高可用架构设计;有存储接入、数据平台、模型分发或大规模文件/对象存储相关经验;有开源项目贡献经验,活跃开源贡献者优先。