按住快捷键说话,松开自动转文字进当前输入框,全程离线。中文转写选 Whisper 模型,写口播稿比打字快。
按住快捷键说话,松开出字,文字直接进当前输入框——不挑应用,全程离线。三种模型(Whisper、Parakeet、Moonshine)全在本地跑,Silero VAD 负责把静音段剔掉,识别更稳。Win、macOS、Linux 三平台通吃,无账号、无订阅、无上传。
语音输入工具的信任门槛其实只有一道:你说的话去没去云端。Handy 把这条焊死了——模型和音频都不出本机,断网照用。单人开发者维护,靠赞助续命,作者把定位明明白白写在「最可 fork 的语音输入」上。
02仓库健康度
32.9k star 摊在一个维护者身上,本身就是个风险敞口——好在他主动把「可 fork」当卖点,这不是姿态,是逃生通道。
03核心能力
- 按住说话松开出字:转写直接落进当前输入框,微信、编辑器、终端通吃
- 三模型全本地:Whisper / Parakeet / Moonshine 按需切换,离线可用
- Silero VAD 降噪:静音段自动剔除,长停顿不进识别,结果更干净
- 零门槛三平台:Win/macOS/Linux 装上就用,无账号无订阅
04同类对比
云端语音输入(各家输入法自带那种)识别快、白送,代价是每一句话都要过一遍别人的服务器。本地转写方案一直存在,但「装环境、下模型、配路径」这三步拦掉了九成普通用户。
Handy 把「本地」做到了无感:装上、选模型、按快捷键。说句实在的,代价也有——本地推理慢半拍,停说后 2-5 秒才出字。拿隐私换这半拍值不值,你自己称。
05亮点
- 全程离线:模型和音频都不出本机,这是它和云端输入法之间不可谈判的差异
- 定位诚实:「最可 fork 的语音输入」——单人项目把可维护性当功能卖,少见
- 没有商业模式就没有套路:无账号无订阅,捐不赞助都一样用
06谁在生产用它
天天写东西的人是主力:写文档、回长消息、口述初稿的内容工作者;其次是对隐私敏感、不接受语音上云的用户;中文用户选对模型后,它是口播稿加速器。
说句实在的:它的角色是「输入加速器」,不是「写作助手」——没有 AI 润色,转出来是什么就是什么,指望它帮你组织语言的会失望。
07怎么装
普通用户走官网 handy.computer 下载对应平台安装包;想看代码或 fork 的进仓库。
$ git clone https://github.com/cjpais/Handy # 首次使用选好模型,中文用户切 Whisper(见注意事项)
首次启动会拉取模型文件,之后全程离线。快捷键一按就能录音。
先纠偏:视频里说它「支持机器翻译」是错误说法——Handy 没有翻译功能,只做转写。它也没有手机端,Windows 和 Linux 只有 x64 架构。Whisper 在部分配置下会崩溃,遇到就换模型。中文用户务必先把模型切到 Whisper 或 SenseVoice——默认的 Parakeet 是英文模型,直接用中文效果没法看。最后,本地推理有代价:停说后约 2-5 秒出字,急脾气先掂量。
09适合谁
写口播稿、文档、长消息的内容工作者;不接受语音上云的隐私敏感用户;macOS 用户(体验最省心)。
需要翻译功能的(没有);要手机端的(只有桌面);Win/Linux 上 ARM 架构的(仅 x64);指望 AI 帮忙润色的。