- 类型
- 模型
- 来源
- AIHOT · X / 公众号精选
- 发布
- 2026年7月23日 12:33
- 状态
- 单一信源
发生了什么
阿里通义千问推出最新文本转语音模型Qwen-Audio-3.0-TTS,提供Flash(实时交互)和Plus(高质量生成)两个版本。新功能包括细粒度内联标签控制(如【whisper】、【angry】)、自然语言风格控制、支持16种语言,以及一次生成长达3分钟的长文本。该模型目前在Artificial Analysis TTS排行榜上排名第一。
为什么重要
相比此前TTS模型,Qwen-Audio-3.0-TTS首次同时支持实时与高质量双版本,引入细粒度情感/动作标签(如耳语、生气)和自然语言风格控制,可一次生成3分钟长文本,并覆盖16种语言,综合能力获得第三方排行榜第一,显著降低了语音合成的使用门槛。
底层逻辑
内联标签允许用户在文本中嵌入情感或动作指令,模型据此调整语调与语速;自然语言风格控制则通过指令式输入(如“用欢快的语气”)实现风格适配。Flash版本优化推理延迟以支持实时交互,Plus版本牺牲速度换取更高音质,两者覆盖不同场景。多语言能力通过统一语言模型实现。
产品与商业机会
集成该模型的语音产品可立即获得情感可控、多语言、长文本的TTS能力,提升用户体验。Flash版本适合语音助手、实时对话场景;Plus版本适合有声书、视频配音等离线高质量生成。开发者无需自行训练,可直接调用API或模型,降低开发成本。
- 在客服机器人中集成Flash版本,实现带情感反馈的实时语音回复
- 使用Plus版本为有声书平台自动生成多语言长音频,支持角色内联标签区分对话角色
- 开发视频配音工具,通过内联标签控制语气与动作,匹配画面情绪
- 为教育产品提供多语言TTS,利用自然语言风格控制调整朗读节奏(如慢速、鼓励语气)
仍待确认
- Qwen-Audio-3.0-TTS的模型参数量与部署门槛如何?
- 排行榜Artificial Analysis TTS的评测指标具体包括哪些维度?
- 该模型是否开源或提供免费API额度?
- 与其他主流TTS(如VoiceBox、NaturalSpeech 3)相比,在延迟和自然度上差异多大?