鱼泡网首页职位公司校园意外险下载APP

登录注册后可以:

直接与老板/牛人联系

更精准匹配求职意向

获取更多的求职信息

算法工程师(语音方向)

5-10万/月
职位详情
微信扫码分享
举报
10年以上硕士语音信号处理语音处理声纹识别或语音克隆PyTorchMNNncnnTENSORRT-LLMPython算法工程师
岗位职责: 1、交互架构迭代与开发:协助优化对话系统全链路的交互流程,重点推进流式(Streaming)数据处理模块的研发,减少首字响应延迟,增强人机交互的实时表现。 2、语音交互与打断机制改进:参与“全双工”通信功能实现,优化VAD(语音活动检测)策略,提升用户自然打断(Barge-in)及自动唤醒的准确性和响应速度。 3、声纹识别与语音生成技术:配合开展声纹验证(Speaker Verification)算法的研究与集成,用于身份确认;探索零样本或少样本条件下的语音复刻(Voice Cloning)方法,支持个性化TTS输出。 4、多语言支持能力建设:参与英语、阿拉伯语及其他小语种ASR与TTS模型的选型、微调与整合,实现语种自动识别(LID)和对话中语种的平滑切换。 5、模型压缩与边缘部署:协助完成大模型或语音模型的轻量化工作(如量化、剪枝、知识蒸馏),并推动其在Linux边缘设备上的高效推理落地。 6、前沿方向技术探索:围绕语音大模型(Audio-LLM)、端到端语音到语音交互(Speech-to-Speech)等新兴领域开展调研,输出可行性分析与技术验证文档。 任职要求: 1、专业背景:计算机科学、信号处理、电子工程、人工智能等相关方向,硕士及以上在读学历; 2、编程能力:熟练掌握Python,具备C++基础者优先(适用于端侧部署场景),熟悉Linux操作系统及Shell脚本使用; 3、算法基础:了解语音信号处理基本方法(如STFT、Mel谱图等),掌握PyTorch深度学习框架; 4、领域经验(加分项): - 熟悉主流语音开源工具(如WeNet, FunASR, Espnet, VITS, CosyVoice等); - 理解流式ASR/TTS架构,了解WebSocket/gRPC通信机制; - 有声纹识别或语音克隆实际项目经历; - 掌握模型量化技术(Int8/FP16)及边缘端推理框架(MNN, NCNN, TensorRT-LLM)者优先; 5、综合素养:具备良好的工程实践与论文复现能力,可保证连续3个月以上的稳定实习周期。

职位总结围绕职位描述,归纳工作内容、招聘要求

刘先生IP:天津

中维星图(天津)信息技术有限公司

·人事经理
工商信息

法定代表人:

刘艳波

成立日期:

2025-02-25

查看全部

工作地址
广州天河区珠吉
点击查看地图

广州

搜索

各大行业职位任你选

首次验证通过即注册鱼泡直聘账号

获取验证码
已阅读并同意
《隐私政策》《服务协议》
登录/注册
请选择城市
热门城市ABCDEFGHJKLMNPQRSTWXYZ
全国