职位详情
微信扫码分享
举报
3-5年硕士语音算法
团队介绍:我们是阿里巴巴通义实验室语音团队(原达摩院语音实验室),长期致力于音频AI领域的技术创新与实际应用推进。我们的核心贡献涵盖:
1. ModelScope平台语音/音频模块关键算法研发团队
2. FunASR、KAN-TTS、3D-Speaker等开源项目发起方及主要维护团队
3. 通义听悟(tingwu.aliyun.com)系统中音频处理与语义分析技术支撑团队
4. 阿里云智能语音交互服务及灵积语音模型背后的核心算法支持力量
岗位职责:
1. 主导音频理解与生成方向的先进算法研究,并推动其在产业场景中的落地应用,以语音为核心,拓展至音乐、环境声等多类型音频模态
2. 音频理解方向:
• 研究语音识别、语音翻译和音频内容分析等相关理解技术
• 构建融合语音、文本与视觉信息的跨模态语义理解系统
3. 音频生成方向:
• 推动TTS、语音克隆、音色转换、音乐与环境声合成等技术演进
• 探索少样本/零样本生成、可调控音频生成以及数字人语音驱动等前沿课题
4. 研发多模态语音交互系统,实现语音驱动虚拟形象、智能配音、实时语音到语音翻译(S2TT/S2ST)等创新功能
5. 参与音频大模型架构设计,协同通义千问大模型团队共建多模态认知智能体系
6. 推进技术成果落地转化:通过ModelScope开源生态释放科研价值,或依托阿里云产品体系实现商业化输出
7. 持续关注国际前沿动态(如ICASSP/Interspeech/NeurIPS/ICLR等会议),积极参与学术交流,与全球领先研究团队开展合作
职位要求:
1. 硕士及以上学历,专业方向包括计算机科学、信号处理、语音处理、人工智能等相关领域
2. 具备2年以上音频AI相关研发经验,涉及方向包括但不限于音频识别与理解、音频生成、数字人构建、多模态交互系统等
3. 具有扎实的深度学习理论基础,熟练使用PyTorch或TensorFlow等主流框架
4. 编程能力突出(Python/C++优先),拥有处理大规模音频数据的实际经验
5. 具备良好的协作沟通素养,对技术成果落地抱有高度热情
加分项:
1. 在音频、多模态或机器学习领域顶级会议或期刊发表过研究成果
2. 对生成式语音AI在不同业务场景中的落地难点有深入理解
3. 拥有多模态(语音+视觉+文本)交互系统的设计与实施经验
职位总结围绕职位描述,归纳工作内容、招聘要求

张先生IP:北京
阿里云
·人事经理朝阳区
相同职位推荐
企业招聘

