阿里发布 Qwen-Audio-3.1,对 ASR、TTS 和 Realtime 全面升级,并新增 TTS-Next 与 ASR-Next 两款模型,共五款模型覆盖理解、生成、交互与创作。
官方一次性给出五款音频模型的能力分工与降价幅度,可据此判断语音链路的选型与成本变化。
⚡ 认识 Qwen-Audio-3.1!ASR、TTS 和 Realtime 全面升级,还有两个新模型加入:用于音频创作的 TTS-Next 和用于音频理解的 ASR-Next。
五个模型,一套完整的音频技术栈:理解、生成、交互与创作。
此外全线大幅降价:TTS 约 7 折,Realtime 约 85% 折扣,ASR 最高可享 95% 折扣。
亮点:🥳
- ASR:更强的多语言与方言识别,加上原生润色功能,可自动去除填充词与重复内容,生成更干净、更有逻辑的转录文本。
- ASR-Next:支持带说话人标签、时间戳与对齐转录文本的多说话人 ASR,并能理解情绪、环境音与机器声,用于声音描述、事件定位、音频问答与推理。
- TTS:多语言与方言合成,具备自然的跨语言音色迁移;通过简单指令控制情绪、语速与风格。
- TTS-Next:统一的 LM + 扩散框架,一次生成人声、音效与背景音频,适用于有声书、播客、游戏与广告。
- Realtime:可同时说与听,随时打断,就像真实通话一样;当它察觉到情绪低落时,甚至会放慢语速并富有同理心地回应。
释放 Qwen-Audio-3.1 的全部潜力!👇
- 博客:https://fun-resource-shanghai.oss-cn-shanghai.aliyuncs.com/cuijiayan.cjy/tmp/exp/qwen_audio_3_tts_blog_review_260918/index.shtml?Expires=2105366399&OSSAccessKeyId=LTAI5tQrCBwj82sVMCWoSmzE&Signature=9ZaZIEahoN41Zb9MFJjf34G%2BSCM%3D
- Qwen-Audio-3.1-ASR:
https://www.qwencloud.com/models/qwen-audio-3.1-asr-flash-filetrans
- Qwen-Audio-3.1-Realtime:
https://www.qwencloud.com/models/qwen-audio-3.1-realtime-plus
- 更多 API:即将推出 @qwen_cloud
来源:Qwen · x.com