- 约 1.6 秒
- 从你说完到整理好的文字落在光标处,中位数。只要原文不要整理的话,约 0.5 秒就出。
- 一句话
- 不用切语言、不用换模式。中文英文在同一口气里,英文词按它本来的样子出来。
- ≤ 40 个词
- 你自己的词——人名、型号、行话——每次听写随请求带上,让识别别再猜。词库存在你自己机器上,不在服务器。
中英混说难在哪。
难点不是「支持两种语言」,是「一句话里两种都有」。
识别引擎会二选一
多数引擎先判语种再照着走。你说一句中文,里头有 Kubernetes 和 staging,英文词就被写成谐音汉字——或者整句翻成英文。
专名全靠猜
产品名、客户名、内部黑话,识别引擎一个都没见过。它每次都替换成最接近的常用词,然后你每次都手动改回来。
它是怎么跑的。
四步,你能看见的只有一步。
按住键说话
在任何 App 里按住右 Option 说。按下的瞬间就建连——握手藏在你开口的那几百毫秒里,不会等你说完了再让你干等。
先回原文
流式识别,专门调过一句话中途换语种的情况。说完到原文中位数 0.47 秒。
大模型整理一遍
断句、标点、去掉「呃」「那个」,该分条的分条。就是这一步把「说的话」变成「能发出去的字」。
落在光标处
不是让你去转写窗口里复制。整理好的字直接进你本来在打字的地方——邮件、编辑器、终端,都行。
它跟别的差在哪。
| macOS 自带听写 | 英文优先的 AI 听写 | Voicelna | |
|---|---|---|---|
| 一句话里中英混说 | 勉强 | 弱 | 就是为它做的 |
| 去口头禅、加标点 | 不做 | 做 | 做 |
| 学你的专名 | 不学 | 很少 | 学,每次带 ≤40 个 |
| 文字落在光标处 | 是 | 是 | 是 |
| 词库存在哪 | — | 多在服务端 | 在你自己设备上 |
你的话去了哪。
音频进的是 Aivmelna 自建的推理集群,不经任何第三方语音 API。Voicelna 学到的那些词——你的人名、术语——存在你自己机器上的一个文件里;每次只把跟这次听写相关的那几十个词发给服务端,服务端一个都不存。日志只记条数,不记内容。
常见问题。
Voicelna 能处理一句话里中英混说吗?
能——它就是为这个做的。你不用切语言也不用换模式,一句话里中文英文都有,英文词会按英文出来,不会变成谐音汉字。
有多快?
从说完到整理好的文字落在光标处,中位数 1.6 秒,90 分位 2.5 秒。如果你宁可要快不要整理,原文约 0.5 秒就到,可以跳过整理这一步。
它跟普通听写差在哪?
普通听写给你的是一段转写稿:没标点、没分段、「呃」「那个」全在。Voicelna 会先把这段稿子过一遍大模型,所以落到光标处的是不用改就能发出去的字。
老是识别错的名字,它能记住吗?
能。Voicelna 会攒一份你自己的词库,里面既有你常说的词,也有识别引擎把它听成过的那些错写法,两样一起随下一次听写发过去。所以你改对过一次的名字,后面基本就不会再错。词库是有意限量的——术语表太大反而更不准。
哪些平台能用?
macOS,全局热键在任何 App 里都能用;iPhone,做成第三方键盘,在别的 App 里也能说。
现在能用了吗?
还不能。Voicelna 在开发中,作者本人每天在用。想上架时收到通知,发邮件到 hello@aivmelna.com。