这几个月一直在做一个叫 OpenASR 的项目,今天来 V2EX 聊聊。
起因很简单。
平时会议录音、视频素材、语音笔记需要转文字,也经常要给 Agent 口述比较长的需求。
试了不少语音服务,要么要上传云端,要么只支持 Whisper ,要么需要自己搭 Python 环境装 CUDA 下权重改参数。
其实本地 ASR 模型这两年发展得很快。
Whisper 之外,Qwen3-ASR 、SenseVoice 、FireRed 、Dolphin 、X-ASR 都是非常优秀的模型,但普通用户想体验它们的门槛还是太高了——每个模型一套推理框架、一套依赖、一套配置方式。
模型越来越多,使用体验还停留在开发者工具阶段。
所以我想做一个统一的本地 ASR 工具。
音频不上传服务器,模型下完可以断网跑。
支持本地音频视频转文字、实时字幕、全局语音输入、CLI 和本地 API ,多种模型一键切换。
为什么不只做 Whisper GUI ?
一方面,不同 ASR 模型各有强项。
有些中文场景强,有些方言覆盖广,有些适合实时流式,有些对低配设备友好。
一个好的本地 ASR 工具不应该绑死在一个模型上。
另一方面,现在各家模型的 runtime 其实很割裂。
有的跑在 ggml 上,有的用 ONNX ,有的要 PyTorch ,开放的推理接口也不统一。
如果你想同时用 Whisper 和 FireRed 和 Dolphin ,实际上要装三套环境、学三套用法。
OpenASR 想把这层差异吃掉——统一成一个引擎、一套模型格式、一个入口,用户不需要关心底层跑的是什么。
而且统一引擎不只是方便,同模型同参数下我们实测比 whisper.cpp 快约 8%,这个指标是 CI 门禁锁住的,每次提交都跑,不允许回归。
目前已经接入了 Whisper 、Qwen3-ASR 、SenseVoice 、FireRed 、Dolphin 、X-ASR 、Moonshine 、Parakeet 等十几个模型族,做了一个模型市场,打开就能搜索、下载、切换,不用碰命令行。
聊几个我觉得比较有意思的: FireRedASR2 来自小红书团队,在公开中文测试集上表现非常强,很多场景可以到 SOTA 级别。
不过 benchmark 只是参考,真实会议、噪声、口音环境下到底怎么样,我自己也没完全摸清,希望有人帮忙测。
🔗 原始来源
如果你要核对细节,可以再看原文: V2EX原文链接
AI热榜