Очистка и словарь
Что происходит с расшифровкой между распознаванием речи и вставкой: словарь, очистка по правилам, переопределения для отдельных приложений и необязательная шлифовка локальной LLM.
Каждая диктовка проходит один и тот же короткий конвейер на вашем Mac. Сеть здесь не используется нигде.
Конвейер
Распознавание речи выбранным движком.
Замены из пользовательского словаря — применяются всегда.
Очистка — по правилам или локальной LLM, если вы её включили — только когда для активного приложения включено улучшение.
Вставка через буфер обмена или набором.
Очистка по правилам
Это полный набор правил. Очистка не убирает оборванные начала фраз и слово "like".
- Удаляет отдельно стоящие "um", "uh", "erm" и двусловное "you know", совпадая только с целыми словами.
- Сворачивает подряд идущие повторы слов: "the the" становится "the".
- Сжимает пробелы.
- Делает первую букву заглавной.
- Добавляет точку, если текст заканчивается буквой или цифрой.
Переопределения для отдельных приложений
Settings › Enhancement › "Clean up transcripts by default" включено. Переопределения привязаны к bundle id приложения. "Add current app…" добавляет последнее приложение, которым вы пользовались (кроме Keebye), со значением, противоположным значению по умолчанию. У каждой записи есть флажок и кнопка "Remove".
Пользовательский словарь
Settings › Dictionary: "Replace spoken words with fixed spellings." Введите то, что слышит Keebye, в поле "heard as…", а нужное написание — в "write as…", затем нажмите Add (Enter тоже работает). Remove удаляет запись. Пустое состояние выглядит как "No replacements yet."
- Совпадает только с целыми словами, никогда внутри более длинного слова.
- Сопоставление не учитывает регистр; замена сохраняет тот регистр, который вы ввели.
- Ключ может состоять из нескольких слов. Побеждает самое длинное совпадение.
- Применяется к каждой диктовке, независимо от того, включена ли очистка для приложения.
Шлифовка локальной LLM (по желанию)
Keebye может передать расшифровку локальной языковой модели вместо очистки по правилам. Модель — Qwen3-1.7B (Q4_K_M GGUF, около 1.28 GB), работает через llama.cpp с Metal. Используется жадное сэмплирование с отключённым размышлением, ограничение в 64 токена и дедлайн 2 секунды. Любой сбой откатывает к очистке по правилам.
Перед использованием вывод LLM проверяет защита точности: он должен сохранить не меньше половины вхождений слов исходного текста, не превышать двойное число слов исходника плюс четыре, не содержать предложения или четырёхсловной фразы, повторённой три раза и более, и не быть пустым. Иначе вывод LLM отбрасывается.