Windows 语音输入 · 在你的机器上运行 · 无需账号
难写的词,它不会写错。
别的语音输入工具只听声音,然后猜。Vtypes 会先看一眼你屏幕上已经有的内容,所以它知道你说的是 symlinks ,而不是“sink links”。
2026 年桌面 CPU 上的实测时间,改写这一步交给托管模型。纯本地模式牺牲的是这点速度,换来的是任何东西都不离开这台机器。
麦克风听不出拼写。
所有语音输入工具都在把声音变成文字。声音本身是有歧义的,而一条只拿得到波形的流水线只能靠猜来消歧——而且猜得很流畅,流畅才是危险的那种。Vtypes 会读取你正在口述的那个窗口里可见的文字,把它放到负责收拾你这段转写的模型面前。答案本来就在你屏幕上。
- 01
point the CI at the sink links symlinks in the repo
Cursor · CLAUDE.md - 02
restart the cooper netties Kubernetes pods after the deploy
Terminal · kubectl get pods - 03
run pee en pee em pnpm install and try that again
Terminal · pnpm-lock.yaml - 04
the sequel light SQLite migration still needs an index
VS Code · 003_add_index.sql - 05
spin the staging box up on axe your Azure instead
Chrome · portal.azure.com
屏幕读取是转写页面上的一个开关,你不打开它就一直是关的。读到的内容只会送到你自己配置的模型端点,不去别的任何地方——这条路径上没有 Vtypes 的服务器。
你不发出去,就什么都不会出去。
一共五步。其中三步根本没有离开你机器的能力。另外两步同样在本地跑,除非你把它们指向某个 API——那时它们去的也是你自己的端点,用的是你自己的密钥。没有 Vtypes 账号,没有 Vtypes 服务器,中间也没有什么需要你去信任的东西。
-
采集
按住快捷键。音频只在内存里。
- 可选 → 你的 API
转写 312ms
在你的 CPU 上跑 whisper.cpp,或者你选定的端点。
-
读屏幕 8ms
通过 Windows UI Automation 读取当前窗口里可见的文字。
- 可选 → 你的 API
改写 244ms
本地模型,或者你自己填的 API 密钥。从来不是我们的。
-
粘贴
粘回刚才有焦点的地方。除非你留了历史记录,否则什么都不保存。
本地
Whisper 和改写都在这台机器上跑。飞机上也能用。按字数算是零成本。老硬件上会慢一些,要权衡的就这一点。
你自己的密钥
指向 Groq、OpenAI,或任何讲同一套协议的服务。更快,也更准。由他们按他们的价格向你收费——请求我们从来看不到。
没有什么可订阅的。
Vtypes 不卖转写服务。它只是一个客户端,你指向哪里它就连哪里,包括跑在你自己机器上的模型——那是默认选项,一分钱不花。如果你更想用托管模型,密钥由你带,你就是他们的客户。
- 这个应用
- 免费
- 没有账号,不用登录,也没有试用倒计时。
- 本地模式
- $0
- Whisper 和改写都在你的 CPU 上跑。没有调用,也就没有账单。
- 你自己的 API 密钥
- 按他们的价
- 由你的服务商直接向你收费。请求和账单我们都看不到。
一笔实际的账
连续口述一小时大约是九千字。托管语音识别按音频时长计费,改写按 token 计费,而口述在这两项上都算小量——说满一小时也就几万个 token,其中大部分还是屏幕上下文。按那几家便宜服务商在 2026 年 8 月公布的价格,这一小时落在 个位数美分.
价格会变,这一页也不是报价单。之所以说该信的是量级而不是具体数字,是因为我们根本不在这笔交易里:去看你服务商的价目表,那就是你要付的钱。