Spracheingabe für Windows · läuft auf deinem Rechner · kein Konto

Diktieren, das die schweren Wörter trifft.

Andere Diktierwerkzeuge hören Klang und raten. Vtypes sieht erst nach, was ohnehin auf deinem Bildschirm steht, und weiß deshalb, dass du symlinks gesagt hast und nicht „sink links“.

Kostenlos · 0.1.28 · Windows 10 und 11 · 46 MB

Andere Plattformen
vtypes.term
$vtypes --listen
ready · hold Alt + W + Shift
REC 00:03.4 −18 dB
$whisper v3-turbo · local 312ms
"the sink links in the repo point at cloud dot em"
$screen context · focused window 8ms
Cursor — CLAUDE.md · saw "symlinks", "claude.md"
$post-process · gpt-oss-120b 244ms
"the symlinks in the repo point at claude.md"
pasted → Cursor · 564ms · audio never left the device

Echte Zeiten von einer Desktop-CPU von 2026, die Nachbearbeitung auf einem gehosteten Modell. Der rein lokale Modus tauscht dieses Tempo dagegen ein, dass nichts den Rechner verlässt.

01 Bildschirmkontext

Ein Mikrofon kann Rechtschreibung nicht hören.

Jedes Diktierwerkzeug macht aus Klang Wörter. Klang ist mehrdeutig, und eine Kette, die nichts als eine Wellenform hat, löst die Mehrdeutigkeit durch Raten auf — flüssig, und das ist die gefährliche Variante. Vtypes liest den sichtbaren Text des Fensters, in das du diktierst, und legt ihn dem Modell vor, das dein Transkript aufräumt. Die Antwort stand längst auf deinem Bildschirm.

  1. 01

    point the CI at the sink links symlinks in the repo

    Cursor · CLAUDE.md
  2. 02

    restart the cooper netties Kubernetes pods after the deploy

    Terminal · kubectl get pods
  3. 03

    run pee en pee em pnpm install and try that again

    Terminal · pnpm-lock.yaml
  4. 04

    the sequel light SQLite migration still needs an index

    VS Code · 003_add_index.sql
  5. 05

    spin the staging box up on axe your Azure instead

    Chrome · portal.azure.com

Das Mitlesen ist ein Schalter auf der Seite „Transkription“ und bleibt aus, bis du ihn einschaltest. Was gelesen wird, geht an den Modell-Endpunkt, den du eingerichtet hast, und sonst nirgendwohin — auf diesem Weg steht kein Vtypes-Server.

02 Wo es läuft

Nichts geht raus, außer du schickst es.

Fünf Schritte. Drei davon können deinen Rechner gar nicht verlassen. Die anderen beiden laufen ebenfalls lokal, außer du richtest sie auf eine API — dann gehen sie an deinen Endpunkt, mit deinem Schlüssel. Es gibt kein Vtypes-Konto, keinen Vtypes-Server und nichts dazwischen, dem man vertrauen müsste.

Dein Rechner
  1. Aufnehmen

    Kürzel gedrückt halten. Das Audio liegt im Arbeitsspeicher.

  2. Transkribieren 312ms

    whisper.cpp auf deiner CPU oder ein Endpunkt deiner Wahl.

    optional → deine API
  3. Bildschirm lesen 8ms

    Der sichtbare Text des aktiven Fensters, über Windows UI Automation.

  4. Umschreiben 244ms

    Ein lokales Modell oder der API-Schlüssel, den du hinterlegt hast. Nie unserer.

    optional → deine API
  5. Einfügen

    In das, was gerade den Fokus hatte. Gespeichert wird nichts, außer du führst einen Verlauf.

Lokal

Whisper und die Nachbearbeitung laufen beide auf dem Rechner. Funktioniert im Flugzeug. Kostet nichts pro Wort. Auf alter Hardware langsamer — das ist der ganze Handel.

Dein eigener Schlüssel

Richte es auf Groq, OpenAI oder alles aus, das dasselbe Protokoll spricht. Schneller und schärfer. Abgerechnet von denen, an dich, zu deren Preisen — wir sehen die Anfrage nie.

03 Was es kostet

Es gibt nichts zu abonnieren.

Vtypes verkauft keine Transkription. Es ist ein Client für das, worauf du es richtest — auch für ein Modell auf deinem eigenen Rechner, was der Standard ist und nichts kostet. Wenn dir ein gehostetes Modell lieber ist, bringst du den Schlüssel mit und bist deren Kunde.

Die App
kostenlos
Kein Konto, keine Anmeldung, keine ablaufende Testphase.
Lokaler Modus
$0
Whisper und die Nachbearbeitung laufen auf deiner CPU. Es wird nichts aufgerufen, also nichts berechnet.
Dein eigener API-Schlüssel
deren Tarif
Abgerechnet von deinem Anbieter, an dich. Wir sehen weder die Anfrage noch die Rechnung.

Ein Rechenbeispiel

Eine Stunde durchgehendes Diktat sind rund neuntausend Wörter. Gehostete Spracherkennung wird nach Audiodauer abgerechnet, die Nachbearbeitung nach Token, und Diktat fällt bei beidem klein aus — eine Stunde Reden sind ein paar zehntausend Token, das meiste davon der Bildschirmkontext. Zu den Preisen, die die günstigen Anbieter im August 2026 veröffentlicht haben, landet das bei einstelligen Cent-Beträgen.

Preise ändern sich, und diese Seite ist kein Angebot. Der Grund, der Größenordnung statt der Zahl zu trauen: Wir sind an dem Geschäft nicht beteiligt. Sieh in die Preisliste deines Anbieters — das ist, was du zahlst.

04 Loslegen

Sag den Satz. Behalte die Wörter.

Installieren, lokal oder eigenen Schlüssel wählen, Kürzel gedrückt halten. Einen Registrierungsschritt gibt es nicht, weil es kein Konto gibt.

Für Windows herunterladen 0.1.28 · Windows 10 und 11 · 46 MB

Windows und macOS auf Apple Silicon, beide auf 0.1.28. Der macOS-Build ist nicht von Apple signiert, der erste Start braucht deshalb einen Extraschritt. Linux baut aus demselben Code, geprüft haben wir es nicht.