Buzz 离线音频转录实测积压的 200 小时录音我用一个本地工具全部转成了文字【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz年初整理去年的访谈素材时我发现自己手头攒了大约 200 小时的录音——有的采访对象讲方言有的会议里两个人同时说话还有一批是很早以前从各处收藏的播客节目。云端转录服务我试用过几款速度不错但客户访谈里全是内部信息往服务器上传这件事我始终过不了自己那关。后来我找到一款叫 Buzz 的开源软件它把 OpenAI 的 Whisper 模型整个搬进了个人电脑让离线音频转录从云端专属变成了谁都能用的本地功能。这篇文章是我从安装、翻车到最终跑完全部素材的真实记录坑和心得都会写。第一次转录我把语言检测交给了运气安装环节几乎没有卡点。Windows 直接下载安装包macOS 有 DMGLinux 走 Flatpak 或 Snap想折腾的还能用pip install buzz-captions从 PyPI 装。我用的 Mac 一路点下一步就完成了打开后界面干净得不像一个 AI 工具——就一张任务列表加几个按钮。第一次转录我犯了一个新手都会犯的错误把语言设置留在自动检测模型选了默认的 tiny。结果一段普通话访谈被识别出一堆莫名其妙的内容关键人名全都拼错。后来把语言手动指定成 Chinese同样的音频立刻变了个样。第一次看到中文一行一行蹦出来的时候那种感觉很难形容——等了十几秒屏幕上出现了完整、通顺、还带着时间戳的句子。 现在回头看这条建议值得写进所有使用指南能手动指定语言就别让程序猜自动检测在嘈杂音频上的翻车率比我预期高得多。任务列表把每个文件的转录状态、进度和耗时都摆在明面上双击结果行就能打开完整文稿还能直接改字、删段改动会自动同步到导出文件里。换对模型相当于把电脑免费升了一次级第一版转录能看但准确率还差口气。我开始折腾模型设置这才发现 Buzz 在模型选择上的自由度比一般工具大不少tiny、base、small、medium、large 五种规格对应从 75MB 到近 3GB 的体积后端也有好几种可选Whisper、whisper.cpp、faster-whisper甚至能指定 Hugging Face 上任意一个 Whisper 家族的模型。我分别跑了几轮对比用同一段 42 分钟的中文访谈tiny 只要 4 分钟但错字明显base 用了 9 分钟日常够用small 花了大约 12 分钟术语和口音的还原度明显上了一个台阶。而到了 large速度快不起来但对那种带方言口音的采访几乎没掉链子。我的结论很朴素日常素材用 base 或 small重要内容才上 medium至于 large留给最难啃的音频。如果你的电脑有 NVIDIA 显卡Buzz 支持 CUDA 加速whisper.cpp 后端还能用 Vulkan 加速连集成显卡都能沾光。我在 M 系列芯片上跑 small 模型速度接近实时的两三倍1 小时会议录音大约 20 分钟就能出稿。对这种换模型换体验的设计我只能说选对模型带来的提升比折腾硬件配置来得直接得多。开会那天我把转录框放到了屏幕上真正让我离不开 Buzz 的是它处理会议录音的方式。以前开会只能傻听现在我会在会议开始前点开实时录音让文字跟着说话人一行行刷出来。它有个演示窗口模式可以把转录内容全屏投到会议室屏幕上参会的人抬头就能看到自己被记录了什么省掉了事后这段谁说的的争论。遇到多人的圆桌访谈我会打开说话人识别转录结果会自动标注发言人。还有一个我私心很喜欢的设置叫提取语音先从前置音乐、掌声等噪声里把纯语音抽出来再转录。我在一期带背景音乐播客上对比过打开这个选项后准确率肉眼可见地涨了一截。再往后我把监视文件夹用了起来。往指定文件夹里丢一个音频它就开始自动转录完全不用管。现在我的工作流是这样的录音笔导出的文件直接扔进监视文件夹第二天醒来文稿已经在桌面上等我了。️从能看到能用的字幕差在细节里视频字幕是我另外一个高频需求。Buzz 支持导出 TXT、SRT、VTT 三种格式其中 SRT 和 VTT 是字幕圈的通用格式导进剪映、Premiere 或 b 站投稿后台都能直接用。真正拉开差距的是两个细节功能。第一个是词级时间戳转录时开启后每个词都有自己的时间位置。第二个是配套的字幕重排工具可以把零碎的字幕按标点合并、按目标长度分割还能给每条字幕延长停留时间避免一闪而过。配合着用一段演讲的字幕能从每个字都蹦一行整理成每行都是完整的一句话。这中间我调整了几次参数最终导出的字幕几乎不需要手动返工。还有一个常被忽略的初始提示功能。处理人名、产品名密集的音频时在高级设置里把专有名词提前写好转录时就不会再乱拼。我把客户公司的几个外文品牌名填进去之后相关词汇的准确率从七成左右直接提到了九成以上这个投入产出比相当划算。命令行和文件夹把转录变成了流水线当批量处理的录音越来越多我开始用它的命令行接口。一条命令就能完成之前要在界面上点半天的事情buzz add --task transcribe --model-type whispercpp --model-size small --srt --vtt 会议录音.mp4配合脚本我可以一次把整个目录的音频全部转成 SRT 字幕再批量套进视频工程里。加上前面说的监视文件夹Buzz 对我来说已经从一个软件变成了一条流水线音频进去文字出来中间不需要我动手。想自己研究实现细节的话核心逻辑都集中在buzz/transcriber/目录里模型加载、任务调度、导出格式的代码都写得挺清楚读起来不费劲。隐私不是卖点是底线最后说说我最看重的部分。Buzz 的转录计算全程在本机完成唯一的联网场景是首次使用时下载模型文件之后的每一次语音转文字数据都没有离开过我的电脑。对于一个要处理保密访谈的人来说这一点比任何功能都重要。当然它也有局限模型下载需要一定的网络带宽第一次拉 large 模型要等一会儿纯 CPU 的老机器跑大模型会比较慢。但如果你对离线运行有硬性要求或者只是不想把录音交出去这个工具基本没有替代品。这半年下来200 小时录音全部变成了可搜索、可引用、可整理的文稿很多本来要烂在硬盘里的素材都重新派上了用场。如果你也在跟成堆的录音打交道不妨从一段短音频开始试试看看它的转录结果是否符合你的预期。也欢迎分享你是拿它处理会议、访谈还是做字幕的——也许你的用法能帮到更多人。官方文档docs/ 核心模块buzz/transcriber/【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考