v0.1.5 · Windows x64 · 安装包约 7 MB

把稿子丢进来,
剩下的交给 Flash_TTS

录一句、错一句、返工一整段的时代结束了。
文本自动按句拆分、批量合成、逐句试听、一键合并完整音频——
全在你自己的电脑上跑,文本不上传,拔网线照样用。

3合一的工具模块
本地显卡算力合成
100%数据不出电脑
OTA自动更新升级

一个工具,三种生产力

配音合成 · 字幕识别 · 图片识别,顶部导航一键切换

TTS 配音合成界面截图
TTS

文本配音合成

粘贴或导入 txt / md / doc / docx,自动按句拆分任务;批量合成、逐句试听、单独重做,完成后一键合并完整 WAV。

  • 自动拆句
  • 逐句试听
  • 描述生成音色
  • 声音复刻
  • 合并 WAV
ASR 字幕识别界面截图
ASR

音视频转字幕

批量扫描文件夹里的音视频,自动识别语音内容,导出 SRT 字幕或 TXT 文本;识别语言自动检测,分段长度可调。

  • 批量识别
  • SRT 字幕
  • TXT 文本
  • 语言自动检测
OCR 图片识别界面截图
OCR

图片文字识别

批量扫描 jpg / png / webp / bmp 图片,支持选区裁切只识别指定区域;导出 Markdown 或 Word,表格自动转排版,合并输出。

  • 选区裁切
  • Markdown
  • Word 导出
  • 表格转排版
  • 合并文档

音色工坊:想用什么声音,就有什么声音

29 种预置音色任选;还不够?描述一句生成,录一段复刻

音色管理界面截图
音色库

29 种预置音色

从 5 岁女童、软萌萝莉到慵懒烟嗓、古风公子,再到孙悟空、秦始皇、李白——角色音色齐备,一键试听、随时编辑管理。

  • 角色音色
  • 一键试听
  • 编辑管理
  • 合成测试
复刻音色界面截图
复刻

声音复刻

直接录音,或选一段参考音视频,自动识别文本后训练复刻——出来的音色,像那个人在帮你配音。

  • 录音复刻
  • 音视频参考
  • 自动识别文本
  • 试听后保存
描述音色界面截图
描述

描述生成音色

选快捷案例、加情绪标签,再写一句描述——"温润古风公子音""慵懒烟嗓深夜电台",想要什么声音直接生成,满意再暂存。

  • 快捷案例
  • 情绪标签
  • 描述生成
  • 满意再暂存

为什么用 Flash_TTS

本地算力优先,把数据留在自己的电脑里

文本不上传

吃的是你自己电脑的算力,稿子内容不经过任何云端。拔了网线,照样合成。

音色随便换

温柔的少女音、低沉的旁白、稳重的男主播——描述一句,就能生成对应的音色。

声音复刻

录一小段你想要的声音,Flash_TTS 就能复刻出来——像那个人在帮你配音。

自动拆句

全文按句末标点自动拆成任务,短句自动合并,分段都不用你动手。

逐句重来

哪句不满意,单独试听、单独重新生成,不用整段返工,进度一目了然。

一键合并

全部任务完成后,自动合并成一段完整音频,试听、下载、打开目录,点开就能用。

开源模型,本地推理

合成、识别、对齐、图片识别——全部基于 Qwen3 开源系列模型,在你的电脑上本地运行

Qwen3-TTS-1.7B语音合成

批量配音与逐句合成的核心引擎,普通话自然流畅,语速、语气可控。

Qwen3-TTS-1.7B-VoiceDesign音色设计

根据文字描述生成指定风格的音色——"描述音色"功能的模型底座。

Qwen3-TTS-Tokenizer-12Hz语音分词

12Hz 语音 Token 分词器,为 TTS 合成提供统一的语音表征基础。

Qwen3-ASR-0.6B语音识别

音视频批量转文字,驱动 ASR 字幕识别模块,语言自动检测。

Qwen3-ForcedAligner-0.6B强制对齐

字级时间轴对齐,让生成的字幕逐句卡点,与语音精确同步。

OvisOCR2图片识别

文档、试卷图片转 Markdown,保留表格与公式排版,驱动 OCR 模块。

所有模型随 QwenSpeak 本地语音服务包运行,接口地址 http://127.0.0.1:1203,不依赖云端 API,数据不出电脑。

三步出成品

从稿子到完整音频,全程不用手动拼接

1

导入文本

粘贴,或导入 txt / md / doc / docx 文件,选好音色与语速。

2

自动拆分 · 批量合成

长文本按句自动拆任务,队列批量合成,进度实时可见。

3

试听微调 · 合并导出

逐句试听,不满意的单独重来;全部完成后一键合并 WAV。

下载 Flash_TTS

双击安装,开箱即用

Windows 桌面版

最新版 v0.1.5 · 支持 Windows 10 / 11 x64 · 安装包约 7 MB

下载安装包

安装包精简体积,FFmpeg 组件首次使用时按需一键下载(约 79 MB);后续版本通过 OTA 自动更新,增量升级。

运行要求

  • 系统Windows 10 / 11(64 位)
  • 显卡建议 NVIDIA RTX 2060 及以上(本地语音合成需要)
  • 内存建议 8 GB 及以上
  • 网络首次使用需下载 FFmpeg 组件;之后可离线合成
  • Word 导出需在系统安装 pandoc(OCR 模块使用)

激活说明

使用卡密激活,与 FlashASR / FlashCodec 同系列工具共享激活体系;激活状态保存在本机,更换设备需重新激活。

常见问题

合成必须联网吗?

核心合成走本机算力(本地语音服务),文本内容不会上传到任何云端,拔掉网线也能正常合成。仅首次使用需要联网下载 FFmpeg 组件包。

我的稿子内容安全吗?

安全。Flash_TTS 的语音合成在你的电脑本地完成,输入文本、音频文件都不经过云端服务器,适合处理未发布的稿件和敏感内容。

音色怎么换?能复刻自己的声音吗?

在设置里管理音色:可以描述想要的音色风格(如"温柔的少女音")让系统生成;也可以录一小段声音,一键复刻成专属音色。

OCR 导出 Word 提示找不到 pandoc 怎么办?

Word 导出依赖开源工具 pandoc。请在系统安装 pandoc(程序会自动在系统安装位置、PATH 中查找),下载地址:github.com/jgm/pandoc/releases/latest

新版本怎么更新?

应用内置 OTA 自动更新:有新版本时启动会收到提示,一键下载安装。也可以随时在官网重新下载最新安装包。