今天我们发布了 AI Voice Generation v2 ——基于跨平台 AI Suite v2 技术栈的文本转语音和语音克隆工作室。输入任意文本,即可听到自然语音朗读,或录制一段短音频,打造一个听起来像您的自定义声音,随时重复使用。核心理念很简单: 将文本转换为语音——并克隆您自己的声音——无需将脚本或语音样本上传到云端。
功能介绍
粘贴一句话、一段文字或整篇稿件;选择一个声音;点击生成;即可播放自然流畅的语音。内置的 Amy 声音在首次下载其小型模型后, 完全离线 运行于您的设备——关闭网络依然可用。可调节语速范围为 0.5× 到 2.0×,且不改变音调,支持多种输出格式,并可通过可寻址波形播放器即时重放上一次音频。当您满意结果时,可保存为 WAV 或 MP3 文件。
想要特定声音?录制或导入一段短参考音频,应用即可构建自定义 克隆声音 ——无需训练步骤,无需录音棚。您的克隆声音会显示在声音选择器顶部,方便即时复用,让每段音频都保持一致的声音风格。
v2 新功能
- 真正的语音库。 一个可搜索的选择器包含离线内置语音、高级云端语音、高质量设备端神经语音以及您自己的克隆语音。输入时快速筛选可按名称或语言缩小列表,下载徽章显示首次使用时需要获取文件的语音。
- 语音克隆,首个克隆免费。 录制6至15秒的清晰语音(或导入音频片段),命名语音,使用免费 Chatterbox 引擎创建克隆。它会出现在选择器顶部且无 Pro 徽章——真正的自定义语音,而非试用版。
- 适用于各种场景的引擎。 离线 Piper 引擎为默认引擎,完全在您的设备上运行。Pro 版解锁更多 Piper 语音、兼容 OpenAI 的云端语音(自带密钥)以及本地设备神经语音——Kokoro(轻量快速)和 Parler-TTS。保持模型加载选项意味着重复生成时无需加载等待。
- 无需重新合成即可重放。 波形播放器可即时重放您最后生成的音频片段和克隆参考片段,无需每次都重新合成。您可自行决定缓存多少最近的片段。
- 需要时可卸载重负载。 克隆计算量大;如果此设备无快速 GPU,您可将任务卸载到网络中的 AI Server。即便如此,您的参考音频仍加密保存在设备上——仅一次性复制发送以合成每次请求,服务器绝不存储。
- 支持16种语言。 整个界面遵循操作系统语言,设置中一键切换,且支持多语言语音合成与克隆。
- 可脚本化。 无头命令行工具可从终端生成语音,适合批量配音和在您自有基础设施上的自动化。
免费版与专业版
免费版本身即可真正使用——它为您提供真实语音 和 真实克隆语音。免费版包含离线 Amy 语音 和 您的第一个克隆声音,使用免费的克隆引擎制作,无使用上限且无按词计费。专业版约为 更多选择:每个其他内置语音、高级云端语音、高质量的本地神经语音、先进的克隆引擎,以及超出首次的无限克隆次数。语音克隆本身是 否 专业版专属功能——基础引擎免费,免费套餐可使用一个克隆;专业版则增加更多克隆和更多引擎。
为什么设备端很重要
脚本、旁白、听起来像你的声音——人们最想合作的文本和声音样本往往正是不能上传到第三方云端的内容。AI Voice Generation 将 AI 带到你的设备上:离线的 Amy 声音和你设备上的克隆声音不会将任何数据发送出设备,你的克隆参考片段和生成历史在静态时均经过加密,只有你的 AI Suite 应用可以读取密钥,而且没有按角色计费。只有可选的云端声音和可选的克隆卸载功能会将数据发送到线上,且两者均为明确的自愿选择。这是 Software Tailor 所构建的一切背后的同一原则:本地部署,隐私优先。 [1]。
立即获取
AI Voice Generation v2 现已在 Microsoft Store 适用于 Windows,免费下载,专业版提供完整语音库和无限克隆功能,按需购买 [2]. 其他平台版本在未确认有公开获取途径前不会显示为可用。完整功能介绍请参阅 产品页面。