岗位描述
岗位描述:负责为亚马逊 Rest-of-World(RoW)业务运营构建并运营中央数据基础设施,服务于 5000+ 日活用户、14000+ 仪表盘和 70000+ 每日数据任务运行。与资深工程师和技术经理合作,设计、开发并维护生产级数据系统,支持 RoW 国家、印度及其他新兴市场的运营决策。具体包括:设计和构建批处理、日内及近实时 ETL/ELT 数据管道,从 EDX、SNS、Andes、REST API、S3 等多种来源稳定接入数据至 Redshift 和 Aurora;负责 Redshift 基础设施,编写、优化和调优 SQL 与 ETL 工作负载,管理 WLM 队列、分发键/排序键、物化视图和查询性能,主动识别并解决性能瓶颈;设计数据模型与模式(星型/雪花模型),落实数据分区与保留策略,实施数据质量校验,确保数据准确性与时效性 SLA;将模糊的业务需求拆解为明确的技术交付项,定义范围、里程碑和验收标准,独立推进从需求到上线;通过 Lambda、ECS、Step Functions、CloudWatch 告警等自动化手段减少人工操作,参与服务器自动维护计划和 ETL 清理优化;使用 AWS 服务(Redshift、Aurora RDS、S3、Lambda、ECS Fargate、SQS、SNS、CDK/CloudFormation、Secrets Manager、EventBridge)构建可扩展、成本高效、易维护的数据基础设施;推动成本优化,识别 SQL 工作负载、集群利用率及数据管道设计中的低效点并实施改进;与业务分析师、BI 工程师、数据科学家和产品经理协作,理解数据需求并交付清晰、可文档化的原始数据管道;参与值班,快速响应生产事故,进行结构化根因分析并推动永久性修复。日常工作包括监控数据管道/基础设施/服务运行状态,排查失败任务或数据新鲜度告警;完成冲刺任务,如编写 CDK 基础设施代码、开发 Redshift SQL 模型、新建 EDX 接入管道或排查 WLM 资源争用问题;与利益相关方沟通新数据接入需求,控制范围蔓延并沉淀设计文档;独立处理复杂任务,如慢查询调优、基础设施升级、重构 Lambda 触发逻辑或编写新的 ECS 数据任务栈;更新任务状态、参与代码评审并沉淀团队知识。该岗位要求较强的自我管理与责任心,需主动暴露阻塞并持续推进工作。