Кажи каквото казах: диктовка без пренаписване от AI

AI диктовката пренаписва казаното — губи уточнения, обръща смисъла. Защо LLM изглаждането ви преразказва и защо Keebye остава буквален.

Teodor Deleanu10 юли 2026 г.7 мин четене

Има едно оплакване от диктовката с AI подобрение, което звучи парадоксално, докато не го изживеете: транскрипцията беше наред — развалило се е онова, което се е случило след нея. Казали сте едно, а инструментът е доставил излъскано, самоуверено и леко различно нещо. Тихо изпуснато уточнение. Премахната уговорка. Изречение, преструктурирано в нещо, което никога не бихте казали. А в най-лошата версия на този модел — тази, която кара хората да зарежат инструмента на място — смисълът се обръща. „Не деплойвай, докато тестовете не минат“ излиза от другия край като инструкция за деплойване, без не-то.

За случайна диктовка това е досада. За начина, по който аз наистина ползвам диктовката — да храня с промпти Claude Code, работният процес от Управление на Claude Code с глас — е отрова. Агентът за код приема думите ви като спецификация. Той не знае, че инструментът ви за диктовка ви е преразказал. Ако уточнението, което е правело инструкцията безопасна, е било изгладено някъде между устата ви и терминала, агентът ще изпълни изгладената версия с радост. Точността е целият смисъл на един промпт, а слоят за пренаписване с AI е машина за махане на точност, която същевременно кара резултата да изглежда по-обмислен.

Защо AI инструментите за диктовка пренаписват казаното?

Отговорът на ниво категория не е, че някой е тръгнал да изкривява речта. Той е, че „изчисти тази транскрипция“ е наистина привлекателна функция, а очевидният начин да се построи е суровата транскрипция да мине през езиков модел.

Суровата реч е разхвърляна — паразитни думи, фалшиви начала, повторени думи, липсваща пунктуация. LLM, помолен да въведе ред, произвежда красив изход. Бедата е, че езиковият модел не редактира така, както редактира човек коректор, който маха едно „ъъъ“. Той регенерира. Изходът е нов текст, който моделът смята за добра версия на входа ви, а „добра“ е мястото, откъдето изтича намерението ви. Модели, обучени към услужливост и гладкост, имат мнения: уговорките приличат на шум, уточненията приличат на бъркотия, тромавата, но точна формулировка прилича на нещо за подобряване. През повечето време пренаписването е безобидно. Но е вероятностно и от изхода не можете да познаете кои изречения са транскрибирани и кои — съчинени. Лакът е равномерен; верността — не.

Това е дълбокият проблем на слоевете за изглаждане с LLM: те се провалят мълчаливо и уверено. Разпознавател на реч, който ви чуе погрешно, обикновено произвежда нещо видимо грешно. Слой за пренаписване, който ви предава, произвежда нещо видимо правилно — граматично, правдоподобно, облечено във вашия глас — и точно затова обърнатото „не деплойвай“ бива изпратено, вместо да бъде хванато.

Буквален по подразбиране

Позицията на Keebye е проста: каквото е чул моделът за реч към текст, това каца при курсора ви. По подразбиране между транскрипцията и терминала ви не седи езиков модел, който съчинява по-добра версия на вас — етапът на изглаждане по подразбиране е кратък списък детерминистични правила и толкова.

Това е съзнателен залог и идва от случая с vibecoding. Когато диктовката ви е каналът за управление на агенти за код, работата на инструмента е транспорт, а не авторство. Вие сте авторът; агентът е публиката; слоят за диктовка не бива да има мнения. Този работен процес — изговаряне на цели промпти вместо изписването им — е изложен в гласова диктовка за AI промпти.

В Keebye има и изглаждане с LLM — ще стигна до него — но то се включва по избор, върви изцяло на вашата машина и работи под предпазител, направен да отхвърля обичайните форми на отклонение, разрастване и повторение. Ако изходът не мине проверката, Keebye се връща към правилата. Подразбирането си остават правилата.

Тогава какво прави изчистването всъщност?

Буквален не значи суров. Keebye идва с опционален етап на изчистване — enhancement, включен по подразбиране и с възможност за отмяна за всяко приложение — но той е базиран на правила, а не на модел, и пълният списък какво прави се събира в един абзац.

Той маха самостоятелните паразитни думи (um, uh, erm, you know). Свива непосредствените повторения на дума — „the the“ става „the“. Свива празните пространства. Прави първата буква главна и добавя точка накрая, ако не сте завършили с такава. Това е целият списък. Правилата са детерминистични и тясно очертани; те не преподреждат нарочно части от изречението, не махат отрицания и не заместват със синоними.

Преди изчистването да се пусне, се прилагат замените от речника ви — дефинирани от вас замени за жаргона и собствените имена, които моделите за реч осакатяват, така че „pnpm“ и имената на модулите ви да пристигат изписани така, както ги изписва кодовата ви база.

А ако дори етапът с правила е повече намеса, отколкото искате, изключете enhancement и Keebye вмъква суровата транскрипция от модела за реч: паразитни думи, повторения и всичко останало. За някои контексти — когато цитирате някого, когато диктувате в поле, в което точката накрая чупи нещата — суровата транскрипция е по-добрият избор, а отмяната за всяко приложение ви позволява да я изберете.

Изглаждането по избор и предпазителят за вярност около него

Сега LLM-ът, до който обещах да стигна. За хората, които наистина искат по-умно изчистване, Keebye предлага опционален режим на изглаждане (polish_mode, зададен на local_llm): малък модел Qwen3, който върви на устройството през llama.cpp, ускорен с Metal, без нищо да се изпраща никъде. Инструкциите му са тясната версия на изглаждането — поправи пунктуацията и главните букви, махни паразитните думи, запази точните думи, езика и смисъла на потребителя, запази кода и имената на файлове дословно. Генерирането е детерминистично (greedy sampling, същият вход → същият изход) и е с таван; ако моделът забуксува отвъд срок от две секунди, изходът му се изоставя.

Но инструкциите са надежди, а тази статия съществува, защото надеждите не са гаранции. Затова всеки резултат, изгладен от LLM, минава през предпазител за вярност, преди да може да докосне курсора ви. Изходът трябва да запази поне 50% от токените на оригиналната транскрипция. Не бива да се надува — всичко над приблизително двойната дължина на оригинала (плюс четири токена) пада. Излязлото извън контрол повторение се засича. Ако изгладеният резултат падне на някоя от тези проверки, Keebye го изхвърля и вместо това се връща към изчистването по правила.

Този предпазител хваща тежката загуба на токени, неконтролираното разрастване и повторението, преди изходът на модела да може да замести изчистената по правила транскрипция. Той е евристика, а не семантично доказателство: кратко пренаписване или сменено отрицание още могат да минат праговете му. Ако едно уточнение не може да си позволи да се отклони, дръжте изглаждането с AI изключено и преглеждайте вмъкнатия текст, преди да го изпратите.

Честните ограничения

Буквален значи буквален. Ако говорите разхвърляно, разхвърляното каца — дори изглаждането по избор е инструктирано и предпазено към изчистване, а не към съчиняване, така че Keebye няма да превърне лутаща се мисъл в ясна инструкция. Дисциплината да казвате каквото имате предвид си остава ваша.

Изчистването по правила е нарочно глупаво. То маха „um“; няма да ви поправи граматиката, няма да преструктурира разлято изречение и няма да забележи, че сте си противоречили. Всичко по-умно би върнало обратно точно преценките, заради избягването на които съществува този замисъл.

И верността пази от пренаписване, а не от грешно разпознаване. Ако моделът за реч чуе „cache“ като „cash“, тази грешка се запазва вярно — предпазителят няма представа какво сте искали да кажете, а само какво е било транскрибирано. Буквалната диктовка мести границата на доверие към модела за реч към текст; тя не я премахва. (По темата: ако проблемът ви е, че моделът транскрибира изцяло на грешен език, това е друг провал с друго решение — Закачете езика на диктовката си.)

Накрая, рамката на ниво категория: изглаждането с AI не е измама и немалко потребители наистина предпочитат изход, който се чете по-гладко, отколкото говорят. Ако това сте вие, други инструменти залагат добре на него и сравненията ни го казват честно — Keebye срещу Wispr Flow и Keebye срещу Superwhisper съдържат истински раздел „кога другият инструмент пасва по-добре“.

Транспорт, а не авторство

Сделката, която Keebye предлага, е нарочно тясна: вие говорите и леко изчистена транскрипция каца там, където е курсорът ви. Когато тези думи са промпти към агент, който ще действа буквално по тях, тясното е предимство. Най-скъпото нещо, което инструмент за диктовка може да причини на един разработчик, не е печатна грешка. То е гладко изречение, което никога не сте изричали.

Keebye е в ранен достъп за macOS. Започнете безплатния си пробен период по-долу, продиктувайте „Не деплойвай, докато тестовете не минат“ и проверете дали точно това ограничение оцелява след изчистването. Този тест е целият продукт.

Тествайте инструкцията, която не може да си позволи да се отклони

Започнете безплатния си пробен период и продиктувайте промпт с решаващо уточнение — особено едно „не“ — после огледайте какво пристига.

Start free trial

Early access: we'll email you the moment the macOS build is ready — your 14 days start when you first sign in from the app.

Продължете да четете