Zum Dokumentationsinhalt springen
Keebye Docs

Bereinigung und Wörterbuch

Was zwischen Spracherkennung und Einfügen mit Ihrem Transkript passiert: das Wörterbuch, die regelbasierte Bereinigung, App-spezifische Ausnahmen und der optionale lokale LLM-Feinschliff.

Jedes Diktat läuft durch dieselbe kurze Pipeline auf Ihrem Mac. Nichts davon nutzt das Netzwerk.

Die Pipeline

  1. Spracherkennung mit der gewählten Engine.

  2. Ersetzungen aus dem eigenen Wörterbuch, immer angewendet.

  3. Bereinigung — regelbasiert oder per lokalem LLM, wenn Sie das aktiviert haben — nur wenn die Verbesserung für die vorderste App aktiv ist.

  4. Einfügen per Paste oder Tippen.

Regelbasierte Bereinigung

Das ist der komplette Regelsatz. Die Bereinigung entfernt keine Fehlstarts und nicht das Wort "like".

  • Entfernt alleinstehende "um", "uh", "erm" und das zweiteilige "you know", jeweils nur als ganze Tokens.
  • Fasst direkt wiederholte Wörter zusammen, aus "the the" wird "the".
  • Fasst Leerraum zusammen.
  • Schreibt den ersten Buchstaben groß.
  • Hängt einen Punkt an, wenn der Text auf einen Buchstaben oder eine Ziffer endet.

App-spezifische Ausnahmen

Settings › Enhancement › "Clean up transcripts by default" ist an. Ausnahmen sind an die Bundle-ID der App gebunden. "Add current app…" fügt die letzte App hinzu, die Sie außer Keebye benutzt haben, mit dem Gegenteil des Standards. Jeder Eintrag hat eine Checkbox und einen Button "Remove".

Eigenes Wörterbuch

Settings › Dictionary: "Replace spoken words with fixed spellings." Tragen Sie in "heard as…" ein, was Keebye hört, und in "write as…" die gewünschte Schreibweise, dann drücken Sie Add (Enter geht auch). Remove löscht einen Eintrag. Der Leerzustand lautet "No replacements yet."

  • Trifft nur ganze Wörter, nie innerhalb eines längeren Wortes.
  • Die Suche ignoriert Groß- und Kleinschreibung; die Ersetzung behält die Schreibweise, die Sie eingegeben haben.
  • Schlüssel können aus mehreren Wörtern bestehen. Der längste Treffer gewinnt.
  • Wird auf jedes Diktat angewendet, unabhängig davon, ob die Bereinigung für die App aktiv ist.

Lokaler LLM-Feinschliff (opt-in)

Keebye kann das Transkript an ein lokales Sprachmodell geben, statt es regelbasiert zu bereinigen. Das Modell ist Qwen3-1.7B (Q4_K_M GGUF, etwa 1,28 GB) und läuft über llama.cpp mit Metal. Es arbeitet mit Greedy Sampling, abgeschaltetem Thinking, einem Limit von 64 Tokens und einer Frist von 2 Sekunden. Bei jedem Fehler greift die regelbasierte Bereinigung.

Ein Fidelity-Guard prüft die LLM-Ausgabe, bevor sie verwendet wird: Sie muss mindestens die Hälfte der Wortvorkommen der Eingabe behalten, darf die doppelte Wortzahl der Eingabe plus vier nicht überschreiten, darf keinen Satz und keine Vier-Wort-Phrase dreimal oder öfter enthalten und darf nicht leer sein. Andernfalls wird die LLM-Ausgabe verworfen.