跳到文档正文
Keebye 文档

清理与词典

从语音转文字到插入之间,你的转写文本经历了什么:词典、基于规则的清理、按应用覆盖,以及需主动开启的本地 LLM 润色。

每一次听写都在你的 Mac 上走同一条短流水线。这里没有任何一步用到网络。

处理流程

  1. 用所选引擎完成语音转文字。

  2. 应用自定义词典替换,始终执行。

  3. 清理 — 基于规则,或者在你主动开启后由本地 LLM 完成 — 只在最前面的应用启用了增强时执行。

  4. 通过粘贴或模拟键入插入文字。

基于规则的清理

以下就是完整的规则集。清理不会删掉说错重来的开头,也不会删掉 "like"。

  • 删除单独出现的 "um"、"uh"、"erm",以及两个词的 "you know",只匹配完整的词。
  • 合并紧邻的重复词,所以 "the the" 会变成 "the"。
  • 合并多余的空白。
  • 把首字母改成大写。
  • 如果文本以字母或数字结尾,就补上一个句号。

按应用覆盖

Settings(设置)› Enhancement › "Clean up transcripts by default" 默认开启。覆盖设置以应用的 bundle id 为键。"Add current app…" 会添加你最近用过的、非 Keebye 的应用,并采用与默认相反的设置。每一条都有一个复选框和一个 "Remove" 按钮。

自定义词典

Settings › Dictionary:"Replace spoken words with fixed spellings." 在 "heard as…" 里填 Keebye 听到的内容,在 "write as…" 里填你想要的写法,然后点击 Add(按 Enter 也可以)。Remove 会删掉一条。空状态显示 "No replacements yet."

  • 只匹配完整的词,绝不匹配更长词内部的片段。
  • 匹配不区分大小写;替换结果保留你输入时的大小写。
  • 键可以是多个词。匹配最长的那条胜出。
  • 对每一次听写都生效,无论该应用是否启用了清理。

本地 LLM 润色(需主动开启)

Keebye 可以把转写文本交给本地语言模型处理,代替基于规则的清理。模型是 Qwen3-1.7B(Q4_K_M GGUF,约 1.28 GB),通过 llama.cpp 在 Metal 上运行。它使用贪心采样、关闭思考过程、限制 64 个 token,并设有 2 秒的截止时间。任何失败都会回退到基于规则的清理。

在使用 LLM 输出之前,一道保真检查会先验证它:输出必须保留输入中至少一半的词次、不超过输入词数的两倍加四、不含任何重复三次或更多的句子或四词短语,且不能为空。否则 LLM 的输出会被丢弃。