Mac 离线语音转文字:音频不离开电脑的本地模型
有些对话不应传送到任何地方:一次问诊、一次法律咨询、公告发布前的董事会。对这些对话来说,问题不在于云端模型有多好,而在于音频是否需要离开这台电脑。在搭载 Apple silicon 的 Mac 上,不需要。
在本地运行的是什么
在搭载 Apple silicon 的 Mac 上,App 可以下载两个模型并在本机运行:用于转录的 Whisper Large v3 Turbo,以及用于回答的 Qwen 3 8B。下载一次后,它们就在 Mac 本身上运行,适用于音频不应离开房间的会话。
云端处理还是本地模型,按用途逐一决定。每周的站会和与律师的咨询不需要同样的处理方式,你也不必所有场景都只选一种。
不同模式下,什么去了哪里
“私密”这个词常被含糊地使用,所以值得说清楚。
- 云端会话:麦克风音频——在 Mac 上还可选系统音频和截取的屏幕——会传送到 OpenAI 的 Realtime API 以生成转录文本和回答。附件会作为上下文发送。
- Mac 上的本地会话:下载的模型在本机处理音频和文字。
- 两种情况下,转录文本、回答、会话、任务和笔记都保存在设备上,没有云同步。
- App 的后端保存账户、购买、积分余额和使用记录。它不接收也不保存音频、转录文本、回答或附件。
坦白说说取舍
能装进笔记本电脑的模型,比在数据中心运行的模型小。一个 80 亿参数模型的回答足以应付很多事——提炼决定、解释术语、起草跟进邮件——但在广博知识或长链推理上,明显不如大型云端模型。
下载体积有好几 GB,运行时会实打实地占用内存和算力。在较新的 Apple silicon Mac 上没问题;在较旧的机型上会更慢。这也是它是 Mac 功能的原因:手机没有这样的余量。
在 iPhone 和 iPad 上
大型本地模型只限 Mac。在 iPhone 和 iPad 上,转录仍可由设备端的 Apple 语音识别完成,而不是 OpenAI 的模型。此时回答依然来自云端模型——你说的话在手机上转录,帮助则不是。
私密也关乎在场的人
让音频留在本机,是在防范第三方。这并不改变你正在记录别人说话的事实。他们有权知道,而在很多地方法律也有此要求——关于录制和转录他人对话的指南会说明该说什么。
哪些 Mac 可以运行本地模型?
搭载 Apple silicon 的 Mac。模型下载一次后在本机运行,越新的 Mac 越快。
本地模型能在 iPhone 上运行吗?
不能。在 iPhone 和 iPad 上可以用 Apple 设备端语音识别来转录,但本地回答模型只限 Mac。
App 的服务器会看到我的转录文本吗?
不会。后端处理账户、购买和积分;转录文本和回答保存在你的设备上。
