职位详情
微信扫码分享
举报
5-10年本科GolangC++ClickHouseELKPrometheusOpenTelemetryPythonC/C++
职位描述:
1、参与阿里云核心可观测平台(Metrics/Logs/Traces)的架构规划与技术突破,推进AIOPS在故障预判、根因定位、容量评估等场景的实际应用。
2、参与阿里云核心可观测平台运维自动化体系及工具链的构建与研发,提升SRE运维平台的运作效率与智能程度,确保生产环境7x24小时稳定运行。
3、牵头全链路稳定性防护机制建设,通过主动式监控、容量管控与性能优化,识别并清除潜在隐患,增强系统承载能力;主导重大线上事件的应急处置与问题溯源。
4、以用户需求为导向,快速响应并协助解决用户问题;高效处理系统稳定性与性能瓶颈,推动改进措施实施,保障关键业务场景的可用性与服务体验。
职位要求:
1、本科及以上学历,计算机相关专业,5年以上SRE/运维开发/系统架构经验,具备大型分布式系统稳定性支撑背景,有devops、效能平台实践经历者优先。
2、掌握主流可观测性技术栈(Prometheus、OpenTelemetry、ClickHouse、ELK等),具备大规模监控系统设计与开发实践经验。
3、熟练掌握至少一门编程语言如C++/python/go等,了解软件研发与运维流程,具备全栈开发能力者更佳。
4、具备扎实的计算机基础,熟悉操作系统机制、网络编程、高并发处理及性能调优,具有架构设计能力,有大流量、高性能、分布式系统开发经验者优先。
5、具备较强的系统问题定位能力,善于主动交流、归纳总结,对技术有持续热情,并关注业界前沿技术发展动态。
6、具备良好的协作沟通意识和团队精神,具备自主驱动力与学习能力者优先。
职位总结围绕职位描述,归纳工作内容、招聘要求

张先生IP:北京
阿里云
·人事经理杭州
相同职位推荐
企业招聘
职位大全

