Перейти к содержанию документации
Keebye Docs

Очистка и словарь

Что происходит с расшифровкой между распознаванием речи и вставкой: словарь, очистка по правилам, переопределения для отдельных приложений и необязательная шлифовка локальной LLM.

Каждая диктовка проходит один и тот же короткий конвейер на вашем Mac. Сеть здесь не используется нигде.

Конвейер

  1. Распознавание речи выбранным движком.

  2. Замены из пользовательского словаря — применяются всегда.

  3. Очистка — по правилам или локальной LLM, если вы её включили — только когда для активного приложения включено улучшение.

  4. Вставка через буфер обмена или набором.

Очистка по правилам

Это полный набор правил. Очистка не убирает оборванные начала фраз и слово "like".

  • Удаляет отдельно стоящие "um", "uh", "erm" и двусловное "you know", совпадая только с целыми словами.
  • Сворачивает подряд идущие повторы слов: "the the" становится "the".
  • Сжимает пробелы.
  • Делает первую букву заглавной.
  • Добавляет точку, если текст заканчивается буквой или цифрой.

Переопределения для отдельных приложений

Settings › Enhancement › "Clean up transcripts by default" включено. Переопределения привязаны к bundle id приложения. "Add current app…" добавляет последнее приложение, которым вы пользовались (кроме Keebye), со значением, противоположным значению по умолчанию. У каждой записи есть флажок и кнопка "Remove".

Пользовательский словарь

Settings › Dictionary: "Replace spoken words with fixed spellings." Введите то, что слышит Keebye, в поле "heard as…", а нужное написание — в "write as…", затем нажмите Add (Enter тоже работает). Remove удаляет запись. Пустое состояние выглядит как "No replacements yet."

  • Совпадает только с целыми словами, никогда внутри более длинного слова.
  • Сопоставление не учитывает регистр; замена сохраняет тот регистр, который вы ввели.
  • Ключ может состоять из нескольких слов. Побеждает самое длинное совпадение.
  • Применяется к каждой диктовке, независимо от того, включена ли очистка для приложения.

Шлифовка локальной LLM (по желанию)

Keebye может передать расшифровку локальной языковой модели вместо очистки по правилам. Модель — Qwen3-1.7B (Q4_K_M GGUF, около 1.28 GB), работает через llama.cpp с Metal. Используется жадное сэмплирование с отключённым размышлением, ограничение в 64 токена и дедлайн 2 секунды. Любой сбой откатывает к очистке по правилам.

Перед использованием вывод LLM проверяет защита точности: он должен сохранить не меньше половины вхождений слов исходного текста, не превышать двойное число слов исходника плюс четыре, не содержать предложения или четырёхсловной фразы, повторённой три раза и более, и не быть пустым. Иначе вывод LLM отбрасывается.