Buzz 本地语音转文字完整指南4 步免费离线转录音视频【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz一小时会议录音人工整理要花掉大半天把录音交给在线工具又总担心音频被别人看走。这是很多职场人和创作者对语音转文字既期待又犹豫的真实原因。Buzz 是一款完全在本机运行的本地语音转文字工具它把 OpenAI 的 Whisper 模型装进你的电脑离线就能把音频、视频里的对话转成文字和字幕甚至直接翻译成其他语言。接下来我用 4 步带你完成从安装到导出的完整闭环。一句话认识它Buzz 就像一位住进你电脑里的速记员把录音丢给它它逐句听写还自动带上时间轴。它擅长三件事离线转录音频文件不出本机隐私安全无需联网多源输入本地音视频、YouTube 链接、实时录音都能处理多模型可选从 Tiny 到 Large-v3按需平衡速度与准确率它和在线转录服务的本质区别一句话就能说清别人把文件传上服务器Buzz 让模型来你家。对比维度Buzz本地转录在线语音转文字网络要求完全离线可用必须联网隐私安全音频不出本机上传第三方服务器使用费用免费开源按分钟或订阅计费处理速度取决于电脑性能取决于排队与带宽动手前准备安装 Buzz 需要什么环境环境要求清单操作系统Windows 10/11、macOS 11 或主流 Linux 发行版内存建议 8GB 起步使用 Large 系列模型建议 16GB 以上磁盘空间模型文件从 70MBTiny到约 3GBLarge-v3不等另留少量缓存安装步骤macOS / Windows 用户从项目官方发布页下载.dmg或.exe安装包双击按提示完成安装即可。Linux 用户Flatpak 与 Snap 任选其一# 方式一Flatpak flatpak install flathub io.github.chidiwilliams.Buzz # 方式二Snap需先安装音频相关依赖 sudo apt-get install libportaudio2 libcanberra-gtk-module libcanberra-gtk3-module sudo snap install buzzPython 开发者需要 Python 3.12pip install buzz-captions python -m buzz从源码运行想尝鲜最新功能或参与开发时git clone https://gitcode.com/GitHub_Trending/buz/buzz cd buzz python -m buzz 安装完成后在终端输入buzz或在应用列表中找到 Buzz 图标即可启动。第一次运行本地语音转文字的 4 步最小示例第 1 步导入音频启动 Buzz点击工具栏的按钮快捷键 Ctrl/Cmd O选择任意音频或视频文件也可以直接把文件拖进窗口。它还支持粘贴 YouTube 链接一键导入在线视频。下图是 Buzz 的主界面你可以看到每条任务对应的模型、任务类型、状态和实时进度第 2 步配置参数导入后为任务选择三样东西参数说明新手推荐Model模型决定速度与准确率WhisperBaseTask任务Transcribe 转录 / Translate 翻译TranscribeLanguage语言手动指定或自动检测自动检测第 3 步点击运行点击任务行的Run按钮状态会依次变为 In Progress 并显示进度百分比。完成后变为 Completed耗时一目了然。第 4 步查看与导出双击已完成的任务行打开转录结果窗口逐段查看带时间轴的文字通过 Export 菜单导出为 TXT、SRT、VTT 或 JSON 格式。命令行同样 4 步如果你更喜欢脚本化操作一条命令就能完成从导入到导出# 用 tiny 模型转录中文音频并直接导出 SRT 字幕 buzz add --task transcribe --language zh --model-type whisper --model-size tiny --srt 会议录音.mp3运行后你会在原文件旁边看到会议录音.srt——第一个转录成果就这么完成了。核心功能手册掌握基础流程后下面四个功能是你日常最常用的主力技能。功能一实时录音转文字 它是什么点工具栏的麦克风图标进入录音模式边录边出字适合会议、讲座、采访等无法提前准备音频的场景。怎么用点击麦克风图标选择输入设备内置或外接麦克风将延迟参数设为 20–30 秒平衡实时性与准确率开始录制讲完一段后暂停确认已生成的文字参数建议值作用Delay延迟20–30 秒越大越准越小越实时静音阈值视环境调高过滤背景噪声转录步长保持默认控制系统负载最佳实践需要给观众看时开启演示窗口全屏实时显示转录内容可自定义字号与颜色非常适合讲座和线下分享。功能二模型下载与选型 它是什么Whisper 模型有不同尺寸模型越大越准也越慢。Buzz 支持多种后端Whisper、Whisper.cpp、Faster Whisper、Hugging Face 模型与 OpenAI API。怎么用进入首选项 → Models可以查看已下载的模型、下载新模型、甚至填入自定义模型链接模型选型速查表文件大小为项目源码实测值模型文件大小速度准确率典型场景tiny~73MB⚡最快中等实时转录、快速试听base~139MB快良好日常会议记录small~462MB中等优秀播客、采访medium~1.5GB较慢极佳专业内容large-v3~2.9GB慢顶级学术研究large-v3-turbo~1.6GB较快接近 large速度与质量平衡最佳实践先 tiny 试听、再大模型精转GPU 用户可以优先选 Whisper.cppVulkan 加速或 Faster WhisperCUDA 加速。功能三字幕生成与智能调整 ✂️它是什么转录结果天然带时间轴Buzz 还提供字幕再加工能力让字幕可直接用于视频剪辑。怎么用转录完成后双击任务打开查看窗口底部播放器支持同步高亮定位方便逐句校对点击 Resize 打开调整面板三招搞定字幕排版选项说明推荐值Desired subtitle length每行字幕的目标长度42 字符Merge by gap按时间间隙自动合并短句0.2 秒Split by punctuation按标点智能分割长句开启最佳实践快速对白把目标长度调小演讲内容调大先按间隙合并再按标点分割字幕节奏最自然。功能四文件夹监控与插件自动化 它是什么把新录音放进监控目录Buzz 自动转录并导出无需手动点选适合定期批量场景。怎么用进入首选项 → Folder Watch添加监控目录、选择导出格式SRT/TXT 等、勾选递归监控子目录保存即可生效插件系统从 1.4.5 版本起提供通过帮助 → 插件菜单启用几个常用插件值得一试AI 摘要转录完成后用 OpenAI 兼容 API 自动生成摘要增强语言检测转录前先用 tiny 模型自动识别语言导出 DOCX一键导出 Word 文档可带时间戳DeepFilterNet 降噪转录前自动去除背景噪音最佳实践把每周的会议录音统一丢进监控目录周五下班前自动收获一整套 SRT TXT。完整实战30 分钟播客转成中文字幕把前面学的串起来完成一个真实产出为一段 30 分钟的中文播客生成可发布的字幕文件。第 1 步准备音频放入podcast/目录。第 2 步用 small 模型转录并同时导出三种格式buzz add --task transcribe --language zh --model-type whisper --model-size small \ --srt --vtt --txt podcast/第12期.mp3第 3 步双击任务打开查看窗口用播放器抽查时间轴是否对齐顺手改掉个别错字。第 4 步用 Resize 调整字幕按间隙合并0.2 秒 按标点分割每行不超过 42 字符。第 5 步导出.srt拖入剪辑软件如需给文字做二次加工再导出.txt存档。到这里一期播客从录音到可发布的字幕全程离线、全程本机完成。进阶与调优面向有经验的用户四个方向可以明显提升体验1. 硬件加速NVIDIA GPU 推荐 Faster Whisper CUDA多数显卡含核显可以用 Whisper.cpp 的 Vulkan 加速。命令行示例# 使用 whispercpp 后端 Vulkan 加速 buzz add --task transcribe --model-type whispercpp --model-size large-v3-turbo 采访.wav2. 提升准确率的三板斧# 提供专业术语模型会优先听懂这些词 buzz add --task transcribe --prompt 专业术语神经网络、深度学习、Transformer 讲座.mp3 # 嘈杂音频先提取人声再转录 buzz add --task transcribe --extract-speech 嘈杂录音.m4a # 需要逐词对齐时开启单词级时间戳 buzz add --task transcribe --word-timestamps 访谈.wav3. 批量与后台化写一个循环脚本配合--hide-gui让转录在后台排队执行for f in audio/*.mp3; do buzz add --task transcribe --language zh --model-size medium \ --srt --output-dir transcripts $f done4. 自动化落地把上面的命令交给系统定时任务配合文件夹监控形成录音进、字幕出的完整流水线。常见问题速查Q1转录速度太慢怎么办换小模型tiny/base或开启 GPU 加速关闭后台占用大的程序确保内存充足。Q2中文识别不准手动指定--language zh避免自动检测误判用初始提示补充术语必要时升级到 medium 或 large-v3。Q3模型下载一直失败检查网络是否能访问模型托管站点或在首选项 Models 页配置自定义模型链接指向可访问的镜像地址。Q4实时录音延迟明显把延迟参数调到 20–30 秒换外接麦克风关闭系统提示音减少环境干扰。Q5字幕时间轴对不齐在查看窗口用播放器定位修正转录前保证音频质量超长文件建议分段转录。资源与社区想深入探索这些路径都在项目仓库里使用指南docs/docs/usage/命令行完整参考docs/docs/cli.md常见问题汇总docs/docs/faq.md中文文档docs/i18n/zh/插件开发指南buzz/plugins/AGENTS.md代码贡献规范CONTRIBUTING.md可直接测试的样例音频testdata/下一步从一次转录开始 今天装好 Buzz用 4 步流程转录一段 5 分钟录音 本周体验实时录音 演示窗口试试文件夹监控 本月为常用场景固定模型与参数把转录做成自动化流水线Buzz 的价值在于隐私留在本机能力就在手边。现在打开一个音频文件让它为你听写第一段话吧。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考