
文本配音合成
粘贴或导入 txt / md / doc / docx,自动按句拆分任务;批量合成、逐句试听、单独重做,完成后一键合并完整 WAV。
录一句、错一句、返工一整段的时代结束了。
文本自动按句拆分、批量合成、逐句试听、一键合并完整音频——
全在你自己的电脑上跑,文本不上传,拔网线照样用。
配音合成 · 字幕识别 · 图片识别,顶部导航一键切换

粘贴或导入 txt / md / doc / docx,自动按句拆分任务;批量合成、逐句试听、单独重做,完成后一键合并完整 WAV。

批量扫描文件夹里的音视频,自动识别语音内容,导出 SRT 字幕或 TXT 文本;识别语言自动检测,分段长度可调。

批量扫描 jpg / png / webp / bmp 图片,支持选区裁切只识别指定区域;导出 Markdown 或 Word,表格自动转排版,合并输出。
29 种预置音色任选;还不够?描述一句生成,录一段复刻

从 5 岁女童、软萌萝莉到慵懒烟嗓、古风公子,再到孙悟空、秦始皇、李白——角色音色齐备,一键试听、随时编辑管理。

直接录音,或选一段参考音视频,自动识别文本后训练复刻——出来的音色,像那个人在帮你配音。

选快捷案例、加情绪标签,再写一句描述——"温润古风公子音""慵懒烟嗓深夜电台",想要什么声音直接生成,满意再暂存。
本地算力优先,把数据留在自己的电脑里
吃的是你自己电脑的算力,稿子内容不经过任何云端。拔了网线,照样合成。
温柔的少女音、低沉的旁白、稳重的男主播——描述一句,就能生成对应的音色。
录一小段你想要的声音,Flash_TTS 就能复刻出来——像那个人在帮你配音。
全文按句末标点自动拆成任务,短句自动合并,分段都不用你动手。
哪句不满意,单独试听、单独重新生成,不用整段返工,进度一目了然。
全部任务完成后,自动合并成一段完整音频,试听、下载、打开目录,点开就能用。
合成、识别、对齐、图片识别——全部基于 Qwen3 开源系列模型,在你的电脑上本地运行
批量配音与逐句合成的核心引擎,普通话自然流畅,语速、语气可控。
根据文字描述生成指定风格的音色——"描述音色"功能的模型底座。
12Hz 语音 Token 分词器,为 TTS 合成提供统一的语音表征基础。
音视频批量转文字,驱动 ASR 字幕识别模块,语言自动检测。
字级时间轴对齐,让生成的字幕逐句卡点,与语音精确同步。
文档、试卷图片转 Markdown,保留表格与公式排版,驱动 OCR 模块。
所有模型随 QwenSpeak 本地语音服务包运行,接口地址 http://127.0.0.1:1203,不依赖云端 API,数据不出电脑。
从稿子到完整音频,全程不用手动拼接
粘贴,或导入 txt / md / doc / docx 文件,选好音色与语速。
长文本按句自动拆任务,队列批量合成,进度实时可见。
逐句试听,不满意的单独重来;全部完成后一键合并 WAV。
双击安装,开箱即用
使用卡密激活,与 FlashASR / FlashCodec 同系列工具共享激活体系;激活状态保存在本机,更换设备需重新激活。
核心合成走本机算力(本地语音服务),文本内容不会上传到任何云端,拔掉网线也能正常合成。仅首次使用需要联网下载 FFmpeg 组件包。
安全。Flash_TTS 的语音合成在你的电脑本地完成,输入文本、音频文件都不经过云端服务器,适合处理未发布的稿件和敏感内容。
在设置里管理音色:可以描述想要的音色风格(如"温柔的少女音")让系统生成;也可以录一小段声音,一键复刻成专属音色。
Word 导出依赖开源工具 pandoc。请在系统安装 pandoc(程序会自动在系统安装位置、PATH 中查找),下载地址:github.com/jgm/pandoc/releases/latest。
应用内置 OTA 自动更新:有新版本时启动会收到提示,一键下载安装。也可以随时在官网重新下载最新安装包。