很多人本来就不是一次只说一种语言。程序员会说 「把 config 里的 timeout 改成 30 秒」,设计师会说「这个 button 的 padding 再加 4 px」。这些不是罕见情况,而是双语者说话的常态——尤其是那些本来就没有自然中文对应词的技术术语和品牌名。
系统自带听写偏偏假设相反。开口前你得先选一种语言:英文或中文。选了英文,你的中文就变成一串乱七八糟的音译;选了中文,「config」「timeout」「px」就被硬凑成读音最近的汉字。无论哪种,上面那句话都没法用,你只能手动改掉一半——那听写还有什么意义。
根源在架构。传统听写引擎加载的是按语言划分的模型:声学模型和语言模型都只针对一种语言训练和调优。这个「单语言」假设一直渗透到底层——音频怎么切分、声音怎么映射成词、系统怎么判断一个词到哪儿结束、下一个词从哪儿开始。
你在句子中途切换语言,就违背了这个假设。英文模型里根本没有中文词可选,于是它把每个音节都硬塞成一个英文形状的猜测(反过来也一样)。没有「两种都要」这个选项,因为引擎从设计之初就没打算同时开着两种语言。切分本身就是错的,所以哪怕把错词表转写得再准,出来的结果也是坏的。
应声 Voicefall 从一开始就是围绕中英混说造的。这里没有语言要选。你按住键,把句子照原样说出来——中文、英文,或两者混着——松开,一个专为中英混说调优的转写模型会把整句一起处理,让「config」「timeout」保持英文,周围的中文仍是中文。
落字方式同样关键。应声 Voicefall 是按住说话且全局的:不用切换窗口,也不用点按钮。无论你的光标在哪个应用里——编辑器、终端、聊天框、浏览器输入框——文字就落在那儿,松手后约一秒到位。于是那句你原本要花三十秒去纠正的话,一次就正确地出现了。
想知道确切的手势和屏幕提示?看 如何使用应声 Voicefall。