>>> Shuo <<<
前阵子右手骨折 💔 无法顺畅打字以后,我不得不开始认真使用市面上的语音输入;也很感谢今年 AI 的光速发展,让我在这段时间能真的 “Vibe Coding”。

而且,这段时间才发现,平时回消息、发表情包、写代码,甚至只是和 AI 交流一轮,都有多依赖鼠标和键盘。现在语音实实在在帮上了忙,但在真正的 Vibe Coding 过程中,还是会因为各种原因不断 fallback 到键盘。最明显的是中英文混合、标点,项目名称、术语、代码和人名。
另一件我意识到的事是:我不断说、不断改,最后才得到想要的结果。这些数据也许对我很有价值;如果它们全都随着一次次输入结束而消失,就有些可惜。
我希望这段语音输入不是一次性的「输出」,而是一条能回放、比较和修订的完整记录,存储在本地。这样我就可以方便地回顾历史输入;未来也可能用来训练个人语音识别的专属模型,甚至直接用作个人声音生成的材料。
所以我开始做 Shuo:一个常驻菜单栏、尽量轻便小巧的 macOS 语音输入工具。
按住右 Command 或右 Option → 说话 → 松开。
文字会写进当前 App 。转写结束后,悬浮栏会保留刚刚那一句;可以直接修改,按 ⌘↩ 确认。
其实这个赛道已经有不少做得很好的工具;所以我更想做一个相对小而完整,但是能被长期调整的“起点”。它覆盖日常需要的核心流程,然后把整个路径拆成明确的阶段:录音、音频处理、上下文、推理、后处理、人工修订和最终输出。这样每个阶段都可以独立加增删模块、替换或关闭,做到尽可能 flexible 和 extensible 。

另外整个 app 没有服务器,完全不收集任何用户资料和信息,也没有广告。如果选择使用本地模型时,甚至完全不需要网络;使用云端 AI 的时候,音频或文本也会直接发送给配置的服务。
我觉得有了 AI 后,每个人都能拥有最适合自己的,且独属于自己的,产品。从今天来看,开源的意义不只是“可以看代码”,现在每个人都可以直接在任何现有代码和产品上修改出适合,甚至“只适合”,自己的产品。
我让身边几位朋友试了试,反馈整体不错。不过一个人搓轮子最大的问题就是看不到其他人的使用场景,问题,和需求,所以特此发布在这里,欢迎试用,提交 Issues 和 PRs 。
当前是 macOS 直装,已签名、公证。
下载和完整说明:
https://stcheng.github.io/shuo/
GitHub:
https://github.com/stcheng/shuo
