为什么系统听写搞不定中英混说——按住说话如何解决

Mac 和 Windows 自带的听写,开口前先逼你选一种语言;而只要你在一句话里切换语言,它就崩——比如 「把 config 里的 timeout 改成 30 秒」。应声 Voicefall 干脆没有语言选择:按住 右 Option(Mac)或 右 Alt(Windows),想怎么中英混说就怎么说,松开后约一秒,文字就落到光标处。

问题:一句话,两种语言

很多人本来就不是一次只说一种语言。程序员会说 「把 config 里的 timeout 改成 30 秒」,设计师会说「这个 button 的 padding 再加 4 px」。这些不是罕见情况,而是双语者说话的常态——尤其是那些本来就没有自然中文对应词的技术术语和品牌名。

系统自带听写偏偏假设相反。开口前你得先选一种语言:英文中文。选了英文,你的中文就变成一串乱七八糟的音译;选了中文,「config」「timeout」「px」就被硬凑成读音最近的汉字。无论哪种,上面那句话都没法用,你只能手动改掉一半——那听写还有什么意义。

为什么会这样

根源在架构。传统听写引擎加载的是按语言划分的模型:声学模型和语言模型都只针对一种语言训练和调优。这个「单语言」假设一直渗透到底层——音频怎么切分、声音怎么映射成词、系统怎么判断一个词到哪儿结束、下一个词从哪儿开始。

你在句子中途切换语言,就违背了这个假设。英文模型里根本没有中文词可选,于是它把每个音节都硬塞成一个英文形状的猜测(反过来也一样)。没有「两种都要」这个选项,因为引擎从设计之初就没打算同时开着两种语言。切分本身就是错的,所以哪怕把错词表转写得再准,出来的结果也是坏的。

应声 Voicefall 如何解决

应声 Voicefall 从一开始就是围绕中英混说造的。这里没有语言要选。你按住键,把句子照原样说出来——中文、英文,或两者混着——松开,一个专为中英混说调优的转写模型会把整句一起处理,让「config」「timeout」保持英文,周围的中文仍是中文。

落字方式同样关键。应声 Voicefall 是按住说话且全局的:不用切换窗口,也不用点按钮。无论你的光标在哪个应用里——编辑器、终端、聊天框、浏览器输入框——文字就落在那儿,松手后约一秒到位。于是那句你原本要花三十秒去纠正的话,一次就正确地出现了。

想知道确切的手势和屏幕提示?看 如何使用应声 Voicefall

下载 Mac 版 下载 Windows 版