AAILore Sift

内容

情报流日报主题

工作台

脱水提炼文章与视频

我的

收藏知识库私人设置
AILore Sift事实、判断与机会,保持边界清晰。
返回主题地图

TOPIC · CURATED VIEW

语音与音频

覆盖语音识别、合成、实时对话与音乐生成,关注延迟、自然度和可用性。

全部 Story
25
近 7 天
1
当前结果
4
全部新闻论文产品模型

主题情报

#Story为什么值得看类别评分
01

模型小红书开源连续自回归语音合成模型 dots.tts,定位可扩展 TTS 基座

筛选线索开源模型与生态语音与音频模型雷达1 个独立信源

此前 TTS 模型多采用离散 token 或非自回归架构,dots.tts 以连续端到端自回归方式实现更高准确度,且开源 20 亿参数模型,为行业提供可扩展的 TTS 基座,有望降低语音合成应用的门槛。

AIHOT · X / 公众号精选/8月13日 09:59
64
02

模型腾讯混元发布 Hy ASR 3.0 preview:上下文感知的语音识别

筛选线索开源模型与生态大模型与推理开发者平台模型雷达1 个独立信源

腾讯混元推出 Hy ASR 3.0 preview,将语音识别与语义理解结合,支持上下文纠错和热词注入,相比传统 ASR 在准确性和场景适应性上有实质提升,尤其在粤语和高噪环境下表现突出,已落地腾讯云和元宝 App。

AIHOT · X / 公众号精选/8月4日 08:12
63
03

模型通义千问发布Qwen-Audio-3.0-TTS,登顶TTS排行榜

筛选线索语音与音频模型雷达1 个独立信源

相比此前TTS模型,Qwen-Audio-3.0-TTS首次同时支持实时与高质量双版本,引入细粒度情感/动作标签(如耳语、生气)和自然语言风格控制,可一次生成3分钟长文本,并覆盖16种语言,综合能力获得第三方排行榜第一,显著降低了语音合成的使用门槛。

AIHOT · X / 公众号精选/7月23日 12:33
55
04

模型通义实验室发布Qwen-Audio-3.0-TTS实时语音合成模型

筛选线索语音与音频模型家族模型雷达1 个独立信源

相比此前TTS模型,Flash版本实现了约300毫秒的首包延迟,大幅降低实时交互的等待时间;Plus版本在客观指标上达到行业领先水平,且支持多语言与方言,显著扩展了应用边界。

AIHOT · X / 公众号精选/7月20日 08:53
55