400 128 6709

行业新闻

MOSS-TTSD— 清华实验室开源的口语对话语音生成模型

发布时间:2025-07-09点击次数:

moss-ttsd(text to spoken dialogue)是一款开源的对话语音生成模型,由清华大学语音与语言实验室(tencent ai lab)研发。该模型能够将文本对话脚本转化为自然、富有表现力的口语化语音,并支持中英文双语输出。其基于先进的语义-音学神经网络音频编解码器以及大规模预训练语言模型,利用超过100万小时的单人语音和40万小时的对话语音数据进行训练。具备零样本语音克隆能力,可自动识别并切换对话者角色,适用于ai播客、访谈、新闻播报等多种应用场合。

Moshi Chat Moshi Chat

法国AI实验室Kyutai推出的端到端实时多模态AI语音模型,具备听、说、看的能力,不仅可以实时收听,还能进行自然对话。

Moshi Chat 160 查看详情 Moshi Chat

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

MOSS-TTSD— 清华实验室开源的口语对话语音生成模型MOSS-TTSD的主要功能

  • 高表现力对话语音生成:将对话文本转换为自然流畅、富有情感的语音,准确还原对话中的语气、节奏等细节。
  • 零样本多说话人音色克隆:可根据对话内容自动生成不同说话人的语音,无需额外提供声音样本即可实现两位说话者的音色模拟。
  • 中英双语支持:能够在中文和英文之间自由切换,生成高质量的双语对话语音。
  • 长篇语音生成:借助低比特率编解码器及优化后的训练架构,可一次性生成超长语音内容,避免传统拼接方式带来的不连贯问题。
  • 完全开源且适合商业应用:模型参数、推理代码及API均已公开,允许免费用于商业用途。

MOSS-TTSD的技术原理

  • 基础模型架构:MOSS-TTSD 在 Qwen3-1.7B-base 模型基础上进行持续训练,采用离散语音序列建模方法。通过八层 RVQ(Residual Vector Quantization)码本对语音信号进行离散化处理,将其转化为一系列 token。这些 token 通过自回归结合 Delay Pattern 的方式生成,最终由 Tokenizer 解码器还原为语音波形。
  • 语音离散化与编码器创新:核心组件 XY-Tokenizer 是专为语音设计的离散编码器,采用两阶段多任务学习策略:
    • 第一阶段:通过 ASR 和重建任务联合训练,使编码器在提取语义信息的同时保留粗略的声学特征。
    • 第二阶段:固定编码器和量化层,仅训练解码器部分,通过重建损失与 GAN 损失补充更精细的声学信息。XY-Tokenizer 在 1kbps 比特率和 12.5Hz 帧率下表现出优于其他 Codec 的综合性能。
  • 数据处理与预训练:训练数据包括约100万小时的单人语音和40万小时的对话语音。团队构建了高效的数据流水线,从海量原始音频中筛选出高质量样本并进行标注。此外,还使用110万小时的中英文 TTS 数据对模型进行预训练,显著提升语音的表现力和韵律。
  • 长语音生成能力:得益于超低比特率的 Codec 架构,MOSS-TTSD 可以生成最长960秒的连续语音,实现无缝输出,避免语音片段拼接带来的断续感。

MOSS-TTSD的项目地址

  • 项目官网:https://www.php.cn/link/ebd83293e15f358a34de4f3e805d8469
  • Github仓库:https://www.php.cn/link/f51cf26546d2015352cabae5d9b01b81
  • HuggingFace模型库:https://www.php.cn/link/647eb61673d5e4df8a069bde0d77fff5
  • 在线体验Demo:https://www.php.cn/link/197728ce327b582d7ccd6adb5f2d4f7a

MOSS-TTSD的应用场景

  • AI 播客制作:可生成逼真的对话式语音,广泛应用于AI播客内容创作,模拟真实访谈氛围。
  • *配音:支持中英文双语语音生成,具备零样本音色克隆能力,可用于电影、电视剧等作品的对白配音。
  • 长篇访谈语音合成:支持最长960秒的语音连续生成,避免拼接导致的不自然过渡,非常适合用于访谈类节目。
  • 新闻报道:可生成自然流畅的对话式语音,用于新闻播报,增强听众的沉浸感和吸引力。
  • 电商|直播|:适用于数字人对话带货等电商|直播|场景,通过生成自然的对话语音吸引用户关注与互动。

以上就是MOSS-TTSD— 清华实验室开源的口语对话语音生成模型的详细内容,更多请关注其它相关文章!


# ai  # 安装包  # 一键  # 转化为  # 高质量  # 比特率  # 播客  # 清华  # 开源  # qwen  # git  # 适用于  # 辽源网站建设公司价格  # 金牛区网站推广优化方案  # 网站建站与优化的区别  # 冠县网站推广优化建设  # 小红书营销推广文案  # 玉林网站建设教程  # 网站介绍优化怎么写文案  # 网站直播推广方案模板  # 安顺seo是什么业务公司  # 古交网站建设企业  # 清华大学 


相关栏目: 【 行业新闻62819 】 【 科技资讯67470


相关推荐: 对Hugging Face开源模型精准投毒!LLM切脑后变身PoisonGPT,用虚假事实洗脑60亿人  边喷火边跳踢踏舞,机器狗最新技能爆火全网!网友直呼真·热狗  微盟宣布联合腾讯云共建行业大模型:加快激活AI大模型智能应用  剧透!蜜小豆@2025世界人工智能大会多个亮点曝光  人工智能在商业中的风险和局限性  GPT-4成功战胜AI-Guardian审核系统:谷歌研究团队的人工智能抵抗人工智能  行业首发「超级智绘」AI故事集,TCL实业推进AI技术应用  普林斯顿大学推出Infinigen AI模型 可生成真实自然环境 3D场景  Spotify计划推出AI驱动的音乐播放器功能  华为盘古AI模型实现秒级全球气象预报时间缩短  以分布式网络串联闲置GPU,这家创企称可将AI模型训练成本降低90%  25个AI智能体源码现已公开,灵感来自斯坦福的「虚拟小镇」和《西部世界》  鉴智机器人发布基于地平线征程5的标准视觉感知产品  图像生成过程中遭「截胡」:稳定扩散的失败案例受四大因素影响  如何获得元宇宙的第一个属于自己的空间  跑不动的元宇宙,虚拟世界比现实更冷酷  华为4G5G通信物联网收费标准公布,多年研发成果,十年花费近万亿  美版贴吧8000小组自爆停摆!拒绝数据被谷歌OpenAI白嫖,CEO被网友骂翻:背刺第三方应用  OpenAI大神Karpathy最新分享:为什么OpenAI内部对AI Agents最感兴趣  人工智能时代 数字文明对话向“尼”走来  北京公司实施AI技术,推行4.5天工作制,抵制996文化,提升员工工作幸福感  ChatGPT会成为你家新的语音助手吗?  闪电快讯|京东推出言犀AI大模型 面向零售、医疗、物流等产业场景  Xbox游戏工作室负责人:VR/AR领域的用户规模还不足够  如何利用物联网技术提高企业生产线智能化水平,提升生产效率  学而思推出AI第一课:基于自研大模型的AIGC课程  人工智能赋能广西自然资源领域监测监管  13 个提高生产力的 AI 工具  无人机在电力巡检中的应用:全面解析高效巡检流程  世界人工智能大会中西部县域数字就业中心组团亮相  马斯克称未来机器人数量将多于人类,特斯拉愿共享自动驾驶技术  周鸿祎:用超级AI实现室温超导和核聚变,实现能源自由  百度文心一言App上架苹果商店,人工智能创作引发热议  直击上影节 | 光线传媒董事长王长田谈新技术:未来VR放映效果可能媲美影院  用AI升级会议体验!思必驰多款会议产品亮相全球智博会!  「电子果蝇」惊动马斯克!背后是13万神经元全脑图谱,可在电脑上运行  普林斯顿Infinigen矩阵开启!AI造物主100%创造大自然,逼真到炸裂  时隔 4 年:谷歌更新安卓机器人 LOGO,形象更立体  阿里云AI绘画创作大模型通义万相发布 已开启定向邀测  对话式论文阅读工具PaperMate上线,综述细节AI告诉你  微软向美国政府提供GPT的大模型,安全性如何保证?  智能机器人正在彻底改变客户服务  乐天派AI桌面机器人提供的正能量情绪价值直接拉满,妥妥的治愈系  扎克伯格吐槽苹果Vision Pro:社交落后Meta太多,无法建设元宇宙  张朝阳陆川谈AI:大数据模型大幅提升工作效率,ChatGPT冲击最大的是内容创作领域  工业机器人及非标自动化设备集成服务提供商  “技术+实践+生态”三箭齐发,京东方抢占物联网高地  马斯克回应“人工智能让一切变得更好”:我们已经是半机器人了  亲身体验鸿蒙4:AI大模型带来的便利,告别单纯的旁观者状态  为了避免人工智能可能带来的灾难,我们要向核安全学习 

400 128 6709
E-mail

contact@tlftec.cn

扫一扫,添加微信

©  云南淘乐房科技有限公司 版权所有  滇ICP备2025071560号  

云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司