岗位描述
岗位描述:协助设计、构建和维护可扩展且可靠的云基础设施;与开发、运维和安全团队协作,确保基础设施具备良好的性能与安全性;参与建设和维护云基础设施、应用及服务的监控与告警系统;监控系统性能,主动识别并解决问题,并在故障发生时进行排查处理;开发和实施自动化工具,简化流程并提升运营效率;参与灾难恢复和业务连续性方案的制定;编写基础设施与流程文档,保障知识传承与团队沉淀;持续关注云原生计算和 SRE 实践的新趋势与新技术。你将加入站点可靠性工程(SRE)团队,聚焦 Docker、Kubernetes 等云原生技术,协助团队维护和扩展云基础设施,保障服务的高可用与高性能,并与开发、支持、安全等团队合作,确保云应用具备韧性、可扩展性和安全性。 岗位要求:计算机科学、信息技术或相关专业在读;了解 Docker、Kubernetes 等云原生技术;熟悉基础设施即代码及自动化工具,如 Terraform;熟练掌握 Python、Go 或 Java 中的一种或多种编程语言;理解 Linux 操作系统及命令行工具;具备较强的分析和问题解决能力;能够独立工作并良好融入团队协作;具备优秀的沟通与协作能力;有 Prometheus、Grafana 或 Alertmanager 等监控告警系统经验者优先。实习期为 6-12 个月。