今天我们发布了 AI Dictation v2 ——一款基于跨平台AI Suite v2架构的语音转文本应用。说话时即可看到文字出现,捕捉电脑播放的会议内容,或导入录音——获得干净、可编辑的文本。核心理念很简单: 在不将您的语音发送到云端的情况下,将语音转换为文本。

功能介绍

AI Dictation支持三种来源的转录:您的 麦克风 (实时口述并观看文本流入),您的 电脑音频 (电脑上播放的会议、视频、播客),或您已有的 音频文件 。借助免费的本地引擎,整个转录过程均在您的设备上完成——关闭网络依然可用。

首次录音时,应用会为您选择并下载一款功能强大的本地语音模型,随后在您讲话时生成字幕。您可以选择语音语言或让其自动检测,按需开启时间戳,并将结果保存为纯文本,作为 SubRip(.srt)WebVTT(.vtt) 字幕用于为视频添加字幕,或以包含每个片段时间的JSON格式导出,供您自定义工具使用。

v2版本新功能

  • 三种捕获方式。 麦克风、电脑系统音频或文件——一键切换音源,实时计量器显示输入正在被接收。
  • 重放并重新转录。 每次录音都会保存,您可以使用波形滑块回放,并在播放时观看每个单词高亮。随时使用更精准的模型重新转录录音——新结果会另存为独立条目,原始内容永不被覆盖。
  • 字幕和干净导出。 导出带有精准时间点的SubRip和WebVTT字幕,供工具使用的JSON格式,或纯文本。清理控制可决定如何处理非语音声音,如[音乐]或(笑声),原始模型输出仅需一面板之遥。
  • 您掌控的历史记录。 每份转录文本均本地保存并 静态加密存储,随时可重新打开、复制或继续编辑。通过查找功能搜索任何转录文本——同时过滤最近列表,仅显示包含您输入内容的录音。
  • 引擎任您选择。 免费开始,使用设备上的Whisper模型。专业版解锁更大模型、OpenAI云引擎及支持GPU的本地引擎,适用于最复杂的音频——内置GPU安全限制及保持模型加载选项,确保重复任务瞬间启动。
  • 支持16种语言。 整个界面遵循操作系统语言,设置中一键切换,支持转录数十种口语语言。
  • 支持脚本化。 一个无界面的命令行工具,可从终端进行转录,同时兼作MCP服务器,方便AI代理和其他工具在您自己的基础设施上调用。

所有功能均免费

与套件的其他部分一样, 没有功能被锁定在专业版后面。 实时听写、系统音频和文件转录、字幕导出、播放、重新转录、加密历史记录、查找以及命令行工具全部包含在免费应用中,配备功能强大的本地模型,无时间限制或弹窗提示。专业版仅仅是关于 引擎选择 ——更大规模的本地模型、OpenAI云引擎,以及当您需要更高准确度时的GPU加速本地引擎。保持免费状态,您永远不会失去任何功能。

为什么本地运行很重要

访谈、会议、医疗记录、法律口述——人们最想转录的音频往往是不能上传到云端的音频。AI Dictation 将 AI 带到您的录音中:借助设备端引擎,音频不会离开设备,您的转录文本和录音在静态时均被加密,且无需按分钟计费。Software Tailor 所有产品背后的原则都是相同的本地部署、隐私优先理念。 [1]

获取它

AI Dictation v2 现已在 Microsoft Store 上提供Windows免费下载安装,专业版可选,支持高级和云端引擎 [2]。macOS、Linux、浏览器和移动端版本正在规划中。完整功能介绍请见 产品页面