职位详情
微信扫码分享
举报
3-5年本科机器学习分布式训练大模型算法pytorchPyTorch Profilerdeepseed大数据处理工具(Spark/Hadoop/Hive)模型加速/性能优化深度学习
1. 负责灵骏集群AI系统性能的分析与优化,支撑客户在多种AI作业场景下,于不同芯片平台及各类规模集群中的适配与性能提升,能够高效地通过工具化或产品化手段识别性能瓶颈,并提出切实可行的优化方案;
2. 面向主流深度学习框架、分布式训练及模型部署等典型场景,开展算子性能、通信效率、内存使用率等核心指标的调优工作,持续提升集群整体运行效能;
3. 构建AI系统性能模型并实施仿真,开发包括Roofline模型在内的性能分析工具,利用仿真结果指导系统架构设计和资源调度策略,为集群建设提供数据依据,同时推荐最优训练与部署配置,帮助用户实现高性能实践;
4. 主导性能分析工具的研发与迭代,实现系统级性能监控、瓶颈诊断和优化效果验证,输出专业性能分析报告,为团队及客户提供技术建议与支持。
职位要求
1. 熟悉深度学习框架(如PyTorch)以及分布式训练与推理框架(如DeepSpeed、FSDP、Megatron、vLLM、SGLang);
2. 掌握常用AI系统性能分析工具(如Nsight、PyTorch Profiler等);
3. 具备性能建模与仿真能力,了解Roofline模型等典型性能分析方法;
4. 有参与多模态生成式AI场景性能优化经验,或具备国产化芯片平台性能调优经历者优先。
职位总结围绕职位描述,归纳工作内容、招聘要求

张先生IP:北京
阿里云
·人事经理朝阳区
相同职位推荐
企业招聘

