文本转语音

拒绝高价订阅!Resemble AI 全面开源旗舰级 TTS 模型，自带防伪水印剑指商业应用

拒绝高价订阅!Resemble AI 全面开源旗舰级 TTS 模型，自带防伪水印剑指商业应用

人工智能语音领域迎来强力竞争者，初创公司 Resemble AI 正式发布了名为“Chatterbox Turbo”的开源文本转语音模型，其矛头直指 ElevenLabs 和 Cartesia 等行业巨头。这款模型在性能上实现了显著突破，仅需五秒钟的参考音频即可精准克隆目标语音，并在短短150毫秒内输出首个音频片段。这种极致的低延迟表现，使其成为构建实时 AI 代理、自动化客户支持、动态游戏角色、虚拟形象以及社交平台交互的理想选择。

12/29/2025 10:56:45 AM AI在线

B站开源IndexTTS-2.0：突破自回归TTS时长与情感控制瓶颈

B站开源IndexTTS-2.0：突破自回归TTS时长与情感控制瓶颈

近日，哔哩哔哩（B站）Index团队正式宣布，其自主研发的情感可控、时长可调的自回归零样本文本转语音（TTS）系统——IndexTTS-2.0，已全面开源。该系统的发布被广泛视为零样本TTS技术迈向实用化阶段的关键里程碑。在语音合成领域，精准的时长控制与自然的情感表达一直是长期存在的技术难题。

9/11/2025 10:28:33 AM 量子位的朋友们

ElevenLabs 发布 v3 Alpha API：支持超过 70 种语言和无限数量的虚拟角色

ElevenLabs 发布 v3 Alpha API：支持超过 70 种语言和无限数量的虚拟角色

2025 年 8 月 20 日，全球领先的 AI 语音技术公司 ElevenLabs 正式宣布推出其最新的 Eleven v3 Alpha API，为开发者提供了一个突破性的文本转语音（Text-to-Speech， TTS）工具。 Eleven v3 Alpha API 被誉为“地球上最具表现力的文本转语音模型”，其核心优势在于支持超过 70 种语言，能够生成自然、流畅且富有情感的语音输出。该 API 引入了全新的对话模式（Dialogue Mode），允许开发者创建多角色对话场景，支持无限数量的虚拟角色，并能处理语气变化、情感波动和对话中的自然中断。

8/21/2025 11:42:00 AM AI在线

Kyutai Labs 开源 Kyutai TTS:低延迟流式文本转语音技术

Kyutai Labs 开源 Kyutai TTS:低延迟流式文本转语音技术

7月3日，法国AI研究机构Kyutai Labs宣布开源其最新文本转语音（TTS）技术——Kyutai TTS，为开发者与AI爱好者带来高效、实时的语音生成解决方案。 Kyutai TTS以低延迟与高保真声音为亮点，支持文本流式传输，无需完整文本即可开始生成音频，特别适合实时交互场景。 Kyutai TTS在性能上表现卓越。

7/5/2025 7:46:46 AM AI在线

Qwen-TTS重磅发布：方言语音合成新突破，真实感媲美真人

Qwen-TTS重磅发布：方言语音合成新突破，真实感媲美真人

昨日，阿里巴巴通义团队正式推出了Qwen-TTS模型，这款文本转语音（TTS）模型以其超高真实感和多方言支持引发行业热议。 AIbase编辑团队整理最新信息，为您深入解析这款通过Qwen API提供服务的语音合成利器，及其在AI语音技术领域的突破性意义。 Qwen-TTS:超真实语音合成Qwen-TTS是通义团队基于大规模语音数据集研发的最新文本转语音模型，通过数百万小时的语音训练，生成的声音在自然度、韵律、节奏和情感表达上达到了极高水平。

7/1/2025 12:00:51 PM AI在线

AI 语音公司 ElevenLabs 推出独立移动应用：免费用户享 10 分钟文本转语音额度

AI 语音公司 ElevenLabs 推出独立移动应用：免费用户享 10 分钟文本转语音额度

语音AI公司ElevenLabs推出独立移动应用，支持iOS和Android用户随时随地生成语音片段。免费套餐提供10分钟音频生成时间，并支持情感表达控制。#AI语音##科技前沿#

6/25/2025 8:19:58 AM 远洋

OpenAudio 发布开源 TTS 模型 S1-Mini：0.5B 参数打造超自然 AI 语音

OpenAudio 发布开源 TTS 模型 S1-Mini：0.5B 参数打造超自然 AI 语音

AI 语音技术领域迎来重要进展，Fish Audio 宣布开源其全新文本转语音（TTS）模型 OpenAudio S1-Mini。作为广受好评的 S1模型的精简版，S1-Mini 以其轻量化设计、高表现力和多语言支持引发行业热议。技术亮点:轻量化与高性能兼得OpenAudio S1-Mini 是从4B 参数的 S1模型蒸馏而来的轻量化版本，仅包含0.5B 参数，大幅降低计算需求，适合在资源受限的环境中部署，如边缘设备或本地化应用。

6/6/2025 3:01:06 PM AI在线

ElevenLabs推出V3声音模型:支持70多种语言，可通过标签控制情感、语气

ElevenLabs推出V3声音模型:支持70多种语言，可通过标签控制情感、语气

全球领先的 AI 语音技术公司 ElevenLabs 正式发布了其最新文本转语音模型 Eleven v3（Alpha 版），被誉为迄今最具表现力的 AI 语音模型。这一突破性进展不仅提升了语音合成的自然度和情感表达能力，还为内容创作者和开发者提供了更强大的工具，助力视频、音频书和多媒体工具的开发。技术突破:更自然的对话与情感表达Eleven v3引入了全新的架构，能够更深入地理解文本语义，显著提升语音的表现力。

6/6/2025 12:01:06 PM AI在线

地表最强AI语音来了！Eleven v3 Alpha版震撼发布，会说话还能“演戏”

地表最强AI语音来了！Eleven v3 Alpha版震撼发布，会说话还能“演戏”

随着人工智能技术的飞速发展，文本转语音（TTS）领域迎来了新的里程碑。 2025年6月5日，ElevenLabs正式推出其最新文本转语音模型 Eleven v3(Alpha版)，被誉为“地表最强”的TTS模型。这款模型不仅能将文本转化为自然流畅的语音，还能通过精准的情感控制和多语言支持，模拟真实对话中的语气变化与非语言表达，为创作者和开发者提供了前所未有的语音生成体验。

6/6/2025 10:01:06 AM AI在线

开源免费语音克隆模型ChatterBox AI，性能测试超ElevenLabs

开源免费语音克隆模型ChatterBox AI，性能测试超ElevenLabs

人工智能语音技术领域迎来重大突破!加拿大初创公司Resemble AI近日发布其首款开源文本转语音（TTS）模型ChatterBox，采用MIT许可证。这一模型以其卓越的语音克隆能力、情绪控制功能和超低延迟特性，迅速成为行业焦点，甚至在盲测中超越了知名闭源模型ElevenLabs。 ChatterBox的发布背景ChatterBox是Resemble AI在语音合成领域的最新成果，基于0.5亿参数的Llama架构，训练数据高达50万小时的精选音频。

6/4/2025 10:01:29 AM AI在线

Resemble AI开源TTS Chatterbox ，性能直逼超越ElevenLabs

Resemble AI开源TTS Chatterbox ，性能直逼超越ElevenLabs

近年来，文本转语音（TTS）技术在人工智能领域的应用日益广泛，从智能助手到内容创作，TTS正在重塑我们与声音交互的方式。一款名为Chatterbox的开源TTS模型横空出世，凭借其卓越的性能和创新功能，迅速成为行业焦点。 Chatterbox:开源TTS的革命性突破Chatterbox由Resemble AI开发，基于MIT许可证完全开源，允许开发者自由使用和修改。

5/29/2025 11:01:23 AM AI在线

Kyutai Unmute 发布！10秒定制语音，AI对话进入超低延迟时代！

Kyutai Unmute 发布！10秒定制语音，AI对话进入超低延迟时代！

法国 AI 实验室 Kyutai 近日推出了一款革命性的语音 AI 系统 Unmute，为文本大语言模型（LLM）赋予了强大的语音交互能力。这款高度模块化的语音模型以其智能对话、超低延迟和个性化定制功能引发业界热议。 AIbase 综合整理最新信息，带您深入了解 Unmute 的技术突破与应用前景。

5/27/2025 11:01:20 AM AI在线

Spark-TTS：用AI让声音“克隆”和“定制”成为现实！

Spark-TTS：用AI让声音“克隆”和“定制”成为现实！

在科技飞速发展的今天，人工智能已经渗透到我们生活的方方面面，从智能语音助手到各种自动化服务，AI正在以一种前所未有的方式改变我们的生活。今天，我要给大家介绍一项超级酷炫的技术——Spark-TTS，一个基于Qwen2.5模型的高效文本转语音系统。它不仅能“克隆”你的声音，还能根据你的需求“定制”出全新的声音!是不是听起来很神奇?什么是Spark-TTS?Spark-TTS是一种新型的文本转语音（TTS）系统，它的核心是BiCodec——一种单流语音编解码器。

3/7/2025 2:54:00 PM AI在线

HYBE旗下AI 声音工具Supertone Play上线：10秒搞定声音克隆

HYBE旗下AI 声音工具Supertone Play上线：10秒搞定声音克隆

近日，HYBE 旗下的人工智能语音公司 Supertone 宣布推出了一款名为 “Supertone Play” 的文本转语音工具，旨在生成高质量、富有表现力的音频内容。这款新工具目前支持英语、韩语和日语，预计在今年内将扩展至西班牙语和中文。 Supertone Play 提供了150种声音角色，适用于多种内容创作需求，包括自然对话、专业播报新闻和有声读物，以及潮流驱动的搞笑声音。

2/18/2025 10:00:23 AM AI在线

资讯热榜

免费！让图片放大不失真的位图转矢量图神器 Tmttool AI应用新纪元：2025中国AI应用排行榜榜单揭晓丨2025年1月 6秒视频10秒生成！全新AI视频神器 Grok Imagine 深度体验+元提示词分享最火、最全的Agent记忆综述，NUS、人大、复旦、北大等联合出品后悔没早发现！教你用谷歌Gemini生成精美PPT（附提示词） GGUF 是什么？一文看懂大模型里最火的模型格式 Sora、可灵、即梦哪家强？AI视频软件深度测评！ Mac也能跑Qwen3，一文看懂本地部署qwen 3配置要求

标签云

AI 人工智能 OpenAI AIGC 模型 ChatGPT 谷歌 DeepSeek AI新词 AI绘画大模型机器人数据 Midjourney 开源 Meta 微软智能用户 GPT 学习英伟达 Gemini 智能体技术马斯克 Anthropic 图像 AI创作训练 LLM 论文 AI for Science 代码腾讯苹果算法 Agent Claude 芯片具身智能 Stable Diffusion xAI 蛋白质人形机器人开发者生成式神经网络机器学习 AI视频 3D 字节跳动大语言模型 RAG Sora 百度研究 GPU 生成华为工具 AGI 计算生成式AI AI设计大型语言模型搜索亚马逊 AI模型视频生成特斯拉 DeepMind 场景 Copilot 深度学习 Transformer 架构 MCP 编程视觉