鱼泡网首页职位公司校园意外险下载APP

登录注册后可以:

直接与老板/牛人联系

更精准匹配求职意向

获取更多的求职信息

通义实验室-音频理解与生成AI算法研发专员

2.5-5万元/月
职位详情
微信扫码分享
举报
3-5年硕士语音算法
团队介绍:我们是阿里巴巴通义实验室语音团队(原达摩院语音实验室),长期致力于音频AI领域的技术创新与实际应用推进。我们的核心贡献涵盖: 1. ModelScope平台语音/音频模块关键算法研发团队 2. FunASR、KAN-TTS、3D-Speaker等开源项目发起方及主要维护团队 3. 通义听悟(tingwu.aliyun.com)系统中音频处理与语义分析技术支撑团队 4. 阿里云智能语音交互服务及灵积语音模型背后的核心算法支持力量 岗位职责: 1. 主导音频理解与生成方向的先进算法研究,并推动其在产业场景中的落地应用,以语音为核心,拓展至音乐、环境声等多类型音频模态 2. 音频理解方向: • 研究语音识别、语音翻译和音频内容分析等相关理解技术 • 构建融合语音、文本与视觉信息的跨模态语义理解系统 3. 音频生成方向: • 推动TTS、语音克隆、音色转换、音乐与环境声合成等技术演进 • 探索少样本/零样本生成、可调控音频生成以及数字人语音驱动等前沿课题 4. 研发多模态语音交互系统,实现语音驱动虚拟形象、智能配音、实时语音到语音翻译(S2TT/S2ST)等创新功能 5. 参与音频大模型架构设计,协同通义千问大模型团队共建多模态认知智能体系 6. 推进技术成果落地转化:通过ModelScope开源生态释放科研价值,或依托阿里云产品体系实现商业化输出 7. 持续关注国际前沿动态(如ICASSP/Interspeech/NeurIPS/ICLR等会议),积极参与学术交流,与全球领先研究团队开展合作 职位要求: 1. 硕士及以上学历,专业方向包括计算机科学、信号处理、语音处理、人工智能等相关领域 2. 具备2年以上音频AI相关研发经验,涉及方向包括但不限于音频识别与理解、音频生成、数字人构建、多模态交互系统等 3. 具有扎实的深度学习理论基础,熟练使用PyTorch或TensorFlow等主流框架 4. 编程能力突出(Python/C++优先),拥有处理大规模音频数据的实际经验 5. 具备良好的协作沟通素养,对技术成果落地抱有高度热情 加分项: 1. 在音频、多模态或机器学习领域顶级会议或期刊发表过研究成果 2. 对生成式语音AI在不同业务场景中的落地难点有深入理解 3. 拥有多模态(语音+视觉+文本)交互系统的设计与实施经验

职位总结围绕职位描述,归纳工作内容、招聘要求

张先生IP:北京

阿里云

·人事经理
工商信息

法定代表人:

罗伟

成立日期:

2008-04-08

查看全部

工作地址
北京朝阳区阿里巴巴·北京朝阳科技园1
点击查看地图

朝阳区

搜索

各大行业职位任你选

首次验证通过即注册鱼泡直聘账号

获取验证码
已阅读并同意
《隐私政策》《服务协议》
登录/注册
请选择城市
热门城市ABCDEFGHJKLMNPQRSTWXYZ
全国