开发中 · macOS 与 iPhone

一句话里 中英混说,它跟得上。

市面上的听写工具几乎都是英文优先。念一句干净的英文没问题,可你一开口是中文句子里夹三个英文产品名,它就崩了。Voicelna 就是为这句话做的。

约 1.6 秒
从你说完到整理好的文字落在光标处,中位数。只要原文不要整理的话,约 0.5 秒就出。
一句话
不用切语言、不用换模式。中文英文在同一口气里,英文词按它本来的样子出来。
≤ 40 个词
你自己的词——人名、型号、行话——每次听写随请求带上,让识别别再猜。词库存在你自己机器上,不在服务器。

中英混说难在哪。

难点不是「支持两种语言」,是「一句话里两种都有」。

识别引擎会二选一

多数引擎先判语种再照着走。你说一句中文,里头有 Kubernetes 和 staging,英文词就被写成谐音汉字——或者整句翻成英文。

专名全靠猜

产品名、客户名、内部黑话,识别引擎一个都没见过。它每次都替换成最接近的常用词,然后你每次都手动改回来。

它是怎么跑的。

四步,你能看见的只有一步。

  1. 按住键说话

    在任何 App 里按住右 Option 说。按下的瞬间就建连——握手藏在你开口的那几百毫秒里,不会等你说完了再让你干等。

  2. 先回原文

    流式识别,专门调过一句话中途换语种的情况。说完到原文中位数 0.47 秒。

  3. 大模型整理一遍

    断句、标点、去掉「呃」「那个」,该分条的分条。就是这一步把「说的话」变成「能发出去的字」。

  4. 落在光标处

    不是让你去转写窗口里复制。整理好的字直接进你本来在打字的地方——邮件、编辑器、终端,都行。

它跟别的差在哪。

按类别比,不点名——这些差别是结构性的,不是某一家做得好不好。
macOS 自带听写英文优先的 AI 听写Voicelna
一句话里中英混说勉强就是为它做的
去口头禅、加标点不做
学你的专名不学很少学,每次带 ≤40 个
文字落在光标处
词库存在哪多在服务端在你自己设备上

你的话去了哪。

音频进的是 Aivmelna 自建的推理集群,不经任何第三方语音 API。Voicelna 学到的那些词——你的人名、术语——存在你自己机器上的一个文件里;每次只把跟这次听写相关的那几十个词发给服务端,服务端一个都不存。日志只记条数,不记内容。

常见问题。

Voicelna 能处理一句话里中英混说吗?

能——它就是为这个做的。你不用切语言也不用换模式,一句话里中文英文都有,英文词会按英文出来,不会变成谐音汉字。

有多快?

从说完到整理好的文字落在光标处,中位数 1.6 秒,90 分位 2.5 秒。如果你宁可要快不要整理,原文约 0.5 秒就到,可以跳过整理这一步。

它跟普通听写差在哪?

普通听写给你的是一段转写稿:没标点、没分段、「呃」「那个」全在。Voicelna 会先把这段稿子过一遍大模型,所以落到光标处的是不用改就能发出去的字。

老是识别错的名字,它能记住吗?

能。Voicelna 会攒一份你自己的词库,里面既有你常说的词,也有识别引擎把它听成过的那些错写法,两样一起随下一次听写发过去。所以你改对过一次的名字,后面基本就不会再错。词库是有意限量的——术语表太大反而更不准。

哪些平台能用?

macOS,全局热键在任何 App 里都能用;iPhone,做成第三方键盘,在别的 App 里也能说。

现在能用了吗?

还不能。Voicelna 在开发中,作者本人每天在用。想上架时收到通知,发邮件到 hello@aivmelna.com。

说说你想做的东西。

一个产品想法、一套要真跑起来的 AI 系统,或者介于两者之间。不合适我们会直说。

hello@aivmelna.com

中文英文都行。说清楚这套系统要做到什么、你手上已经有什么,第一封信这些就够了。