职位详情
微信扫码分享
举报
3-5年本科C/C++机器学习算法工程化经验并行计算模型加速/性能优化Python深度学习
职位描述
针对 DeepSeek, 通义,LLaMA 等主流模型,通过模型优化、框架优化与算子优化,提升大模型在单机及集群环境下不同GPU/NPU设备上的性能表现与运行效率
职位要求
1. 主导大模型推理全流程优化:涵盖计算图优化、算子融合与显存管理,打造面向Transformer架构的高性能优化方案
2. 搭建分布式推理引擎:设计模型并行、流水线并行与张量并行的混合调度机制,实现千卡规模集群的高效线性扩展
3. 具备计算机体系结构与算法优化复合能力:熟练掌握CUDA/Triton编程,可开展kernel层级优化;了解TVM/MLIR/XLA等编译框架
4. 实战背景:拥有百亿参数级模型如LLaMA、GPT、GLM的优化经历,熟悉FlashAttention/PagedAttention等核心加速技术
5. 全栈技术能力:贯通算法改进(MoE/混合专家系统)、框架调优(vLLM/DeepSpeed)至硬件协同设计的技术路径
6. 性能分析与调优:能使用nsight systems等工具进行端到端性能剖析,具备将理论算力转化为实际吞吐量的关键落地能力
职位总结围绕职位描述,归纳工作内容、招聘要求

张先生IP:北京
阿里云
·人事经理杭州
相同职位推荐
企业招聘

