这两年开源社区出了两个特别典型的工具:一个让普通人也能用上 AI 语音转文字,一个让普通人也能用上全网最强视频下载引擎。它们就是 Buzz 和 Stacher。它们本身不一定都开源,但都站在巨人的肩膀上,把开源界最硬核的命令行工具包上了一层好看的"皮"。
—— 一个管"听",一个管"下",堪称自媒体、老师和普通用户的两大效率利器。
一、Buzz:把你的电脑变成离线转写机
项目主页:https://github.com/chidiwilliams/buzz 协议:MIT(完全开源、免费、可商用) 热度:GitHub 2 万 + star,Windows / macOS / Linux 三平台
1.1 它解决什么问题
Buzz 是 OpenAI Whisper 的桌面图形界面(GUI)。Whisper 是 OpenAI 开源的语音识别模型,官方宣称支持近百种语言,即使音频嘈杂、带口音也能转写。但 Whisper 原版是 Python 命令行工具——要装 Python、配环境、敲一长串参数,对普通人来说门槛太高。
Buzz 做的事情就是:安装一个 App,导入音频/视频,点几下鼠标,字幕就出来了。
而且 全程离线运行——音频数据不离开你的电脑,对隐私敏感的用户(会议录音、医疗记录、访谈素材)非常友好。
1.2 核心功能清单
| 功能 | 说明 |
|---|---|
| 文件转写 | 导入音频/视频文件,甚至直接粘贴 YouTube 链接 |
| 实时转写 | 从麦克风实时转写/翻译,开会、听课可当"同传字幕机" |
| 导出格式 | TXT / SRT / VTT,做视频字幕直接可用 |
| 翻译任务 | 一键把任意语言译成英文(translate 任务) |
| 说话人识别 | 区分"谁说了什么",适合访谈、会议整理 |
| 监视文件夹 | 丢文件进指定文件夹即自动转写,适合批量处理 |
| 演示窗口 | 单独投影窗口显示实时字幕,演讲/直播可用 |
| 命令行界面 | 支持 buzz add 等命令,可写脚本自动化 |
| 插件系统 | AI 摘要生成、字幕自动缩放等 |
1.3 模型怎么选(关键!)
Buzz 支持多种推理引擎,这是它最核心的设置项:
引擎对比:
| 引擎 | 特点 | 适用 |
|---|---|---|
| Whisper(默认) | 官方 Python 实现,兼容性最好 | 没有特殊需求的默认选择 |
| Whisper.cpp | C/C++ 重写,支持 Vulkan 加速,核显笔记本也能跑;大模型也能近乎实时 | 低配电脑、笔记本 |
| Faster Whisper | CTranslate2 加速,速度提升数倍 | 追求速度、批量处理 |
| Hugging Face 模型 | 可加载社区模型(Parakeet、Qwen3-ASR、MMS 等) | 需要特定语言或更大模型 |
| OpenAI Whisper API | 走云端 API,本地不用跑模型 | Mac 老机型、极短音频 |
模型大小选择(Whisper 系列,从大到小):
| 模型 | 转写质量 | 速度 | 显存/内存 | 建议 |
|---|---|---|---|---|
large | 最优,多语言强 | 慢 | 约 10GB RAM | 精确核对、多语言内容 |
medium | 好 | 中 | 约 5GB | 台式机/独显 |
small | 良好 | 快 | 约 2GB | 日常首选(平衡点) |
base | 一般 | 很快 | 约 1GB | 快速草稿 |
tiny | 一般 | 极快 | 约 1GB | 低配机器、尝鲜 |
实操建议:先拿
small跑一遍看效果,不满意再升medium。中文音频如果带方言口音,可以升到medium/large并在"提示词(Prompt)"栏填上诸如"以下为中文普通话访谈"之类的上下文提示,能明显提升准确率。
硬件加速:
- NVIDIA 显卡 → CUDA 加速(可用
large近实时) - Apple Silicon(M 系列)→ Core ML / Metal 加速
- 任意显卡(含核显)→ Vulkan 加速(Whisper.cpp)
1.4 三步上手实战
- 安装:去 GitHub Releases 页下载对应平台的安装包(macOS 可
brew install --cask buzz;Windows 走安装器或便携版;Linux 有 AppImage / Snap)。 - 开始转写:打开 App → 把音频文件拖进窗口(或粘贴 YouTube 链接)→ 选择任务(转写/翻译)、引擎、模型大小 → 点击运行。
- 导出:转写完成后,在结果上右键 → 导出 SRT/VTT,直接拖进剪映、Premiere 或 B站投稿页用。
批量场景:把"监视文件夹"设为某个目录,扔进去的每一条录音转完会自动出现在列表中,无需手工操作。
进阶脚本:装了 CLI 后可以直接在终端批量跑:
# 用 whisper.cpp 的 small 模型转写并同时导出 SRT 和 VTT
buzz add --task transcribe --model-type whispercpp --model-size small --srt --vtt 访谈.mp41.5 常见问题
- 中文显示乱码/标点问题:Whisper 对中文标点不敏感,导出后建议用正则批处理把英文标点替换为中文标点。
- 人名、专有名词总错:Prompt 里先写上"涉及的人名:xx、xx",或者用 Whisper 的
--initial-prompt指定术语表。 - 背景音乐/噪声影响准确率:Buzz 有"提取语音轨道"选项,转写前先把人声和 BGM 分离,能显著提升准确率。
- 老 Mac 跑不动:改用 OpenAI API 引擎(按量计费,极便宜),或者升 Whisper.cpp + Vulkan。
二、Stacher:yt-dlp 的"傻瓜模式"
官网:https://stacher.io 当前版本:Stacher 7(v7.1.x,滚动更新) 支持平台:Windows / macOS(Intel 与 Apple Silicon)/ Linux(64 位) 价格:免费无广告;Premium 为可选项(解锁媒体库、自定义主题等,含 30 天试用)
2.1 它解决什么问题
yt-dlp 是目前公认最强大的开源视频下载引擎:支持上千个网站(YouTube、B站、Twitter/X、Instagram、TikTok、Facebook、Twitch……),能下 4K/8K、整串播放列表、只抽音轨、抓字幕,还紧跟平台改版(YouTube 一改版它几天内就更新)。
问题只有一个:它是纯命令行工具。参数几百个,yt-dlp -f "bestvideo+bestaudio" --merge-output-format mp4 网址 这类指令直接劝退 99% 的用户。
Stacher 就是给 yt-dlp 套的图形外壳:粘贴链接 → 选画质 → 点下载,三步完成。底层依赖两大开源组件:yt-dlp(下载引擎)和 ffmpeg(音视频合并/转码)。
⚠️ 关于开源与否:Stacher 本身是免费软件但闭源(作者多次确认暂不开放源码)。开源的是它底层的 yt-dlp 和 ffmpeg。如果你坚持"全程开源",第二节末尾有开源替代品清单。
2.2 核心功能清单
| 功能 | 说明 |
|---|---|
| 多任务队列 | 同时并行/排队下载多个任务,显示缩略图、速度、进度、剩余时间 |
| 画质与格式选择 | 支持 4K、8K;视频 MP4/WEBM/M4A/FLV/3GP,音频 MP3/FLAC/OPUS/WAV/M4A 等 |
| 播放列表 | 粘贴播放列表/频道/博主主页链接,自动展开成下载队列批量下载 |
| 只抽音频 | 一键转 MP3(走 ffmpeg),播客、音乐、演讲均可 |
| 字幕下载 | 自动抓取并下载字幕轨 |
| 视频裁剪 | 滑杆标记起止时间,只下载片段,还能生成 GIF |
| 订阅自动下载 | 监控频道/播放列表,按设定自动追更新内容 |
| 多配置(Profile) | 多套 yt-dlp 参数配置(如"最佳画质""仅音频""存档"),一键切换 |
| 剪贴板监听 | 复制到有效链接自动弹下载(出于安全每次启动需手动开启) |
| Cookie/账号支持 | 为需登录的网站提供账号密码或浏览器 Cookie |
| 命令行构建器 | 按 Ctrl+Enter 直接查看/编辑实际执行的 yt-dlp 命令 |
| 自动更新引擎 | 一键把 yt-dlp 更新到最新版,平台改版后仍能下载 |
2.3 安装与首次启动
- 去 stacher.io 下载对应平台安装包(Windows:Setup.exe;macOS:dmg,Intel 与 Apple Silicon 均有;Linux:Debian 系 .deb)。
- 首次启动向导会自动检测并帮你装好 yt-dlp(存放在用户目录如
~/.stacher/yt-dlp),全程零命令。 - ffmpeg 需要手动配置:Stacher 不捆绑也不自动安装 ffmpeg,但会检测缺失并给出下载引导。下载 1080p 以上视频时必须靠它合并"分离的影像流 + 音轨",建议首次使用就装好。
2.4 三个最常用场景
场景一:下载单个高画质视频
复制链接 → 粘贴到顶部网址栏 → 点 Fetch/Get Info 拉取可用画质列表 → 选 1080p/4K(2160p)→ 下载。默认输出兼容性最好的 MP4。
场景二:收藏整张播放列表 / 整个频道
直接把"播放列表"或频道主页链接贴进去,Stacher 自动把列表展开为下载队列,可勾选需要的集数,一次抓完整个系列。
场景三:把演讲/音乐抽成 MP3 放进手机
在输出设置里选择"仅音频(Audio)"并指定 MP3 格式,Stacher 通过 ffmpeg 抽轨转码。适合整理播客、白噪音、公开课。
2.5 进阶技巧与避坑
- 按 Ctrl+Enter 调出命令构建器:Stacher 界面没有的 yt-dlp 参数,都可以在这里直接手写追加,等于"高级模式开关"。
- 4K 下完没声音?:高画质下 YouTube 把影像和声音分成两条流,必须 ffmpeg 合并。确认 ffmpeg 已正确安装;另外部分高画质源是 VP9/AV1 编码(.webm),老播放器不支持,换 PotPlayer、K-Lite 解码包即可。
- 网站需要登录?:在网址栏右侧设置账号密码,或从浏览器导出 Cookie 填入。
- 下载失败的第一反应:平台改版了 → 设置里一键更新 yt-dlp 到最新版。这是 Stacher 比传统下载软件"耐用"的核心原因。
- Stacher 7 是 6 代的彻底重写(多配置系统、新式媒体库、内部架构焕然一新),网上老文章里关于旧版设置界面的描述已不适用。
三、它们背后的开源功臣
这两款工具真正的灵魂是各自的开源底座:
| 工具 | 作用 | 项目地址 |
|---|---|---|
| Whisper | OpenAI 开源语音识别模型(9 万 + star) | github.com/openai/whisper |
| Whisper.cpp | 纯 C/C++ 重写,低配电脑/核显也能跑 | github.com/ggerganov/whisper.cpp |
| Faster Whisper | CTranslate2 加速版,速度数倍提升 | github.com/SYSTRAN/faster-whisper |
| yt-dlp | 全能视频下载引擎(支持上千网站) | github.com/yt-dlp/yt-dlp |
| ffmpeg | 音视频合并/转码的"幕后英雄" | ffmpeg.org |
Buzz 官方文档还支持 Hugging Face 上的各种 Whisper 衍生模型(Parakeet、Qwen3-ASR、MMS 千语言模型等),生态非常活跃。
四、怎么选?一张图看懂
我想把录音/视频变成文字 ─▶ Buzz(默认选 small 模型)→ this
├─ 要字幕成品 → Subtitle Edit 校对
└─ 苹果用户嫌界面糙 → MacWhisper
我想下载视频/音频 ──────▶ Stacher(免命令行,免费)
├─ 坚持全开源 → Seal(安卓)/ Hitomi Downloader(Win)
├─ 有服务器 → MeTube + Tube Archivist
└─ 高阶玩家 → 直接用 yt-dlp 命令行 + 脚本终极工作流示例(某 UP 主的一天):
- 采访录音丢进 Buzz 监视文件夹 → 自动转写,导出 SRT;
- 素材视频用 Stacher 从 B站/YouTube 下载 1080p 原声素材;
- ffmpeg 混音剪辑 → Subtitle Edit 校对字幕 → 投稿。
全程零命令行,全部基于开源生态。
五、结语与合规提醒
Buzz 让"AI 转写"从极客玩具变成普通人的日常工具;Stacher 让"全网最强下载引擎"变成双击可用的 App。它们代表了开源世界的一种普遍模式:强大的底层引擎 + 友好的图形外壳 = 普通人也能用上顶级能力。
最后提醒:下载工具请尊重版权,只下载自己有权限/已获授权的内容;转写工具涉及他人隐私时请先征得同意。