Minu öeldud sõnad: dikteerimine ilma AI ümberkirjutuseta

AI-dikteerimine kirjutab su öeldu ümber: täpsustused kaovad, tähendus pöördub. Miks LLM-viimistlus sõnastab ümber ja Keebye jääb sõnasõnaliseks.

Teodor Deleanu10. juuli 20266 min lugemist

AI-täiendusega dikteerimise kohta on üks kaebus, mis kõlab paradoksaalselt seni, kuni sa pole seda ise läbi elanud: transkriptsioon oli korras — rikkus asja see, mis juhtus transkriptsiooni järel. Sa ütlesid üht ja tööriist andis välja viimistletud, enesekindla, veidi teistsuguse asja. Täpsustus vaikselt kadunud. Ettevaatlik reservatsioon eemaldatud. Lause ümber ehitatud millekski, mida sa iial ei ütleks. Ja selle mustri halvimas versioonis — selles, mille peale inimesed tööriista kohe maha jätavad — pöördub tähendus. „Ära juuruta enne, kui testid läbivad“ tuleb teisest otsast välja juhisena juurutamise kohta, ilma ärata.

Juhusliku dikteerimise puhul on see tüütus. Selle jaoks, kuidas mina dikteerimist päriselt kasutan — promptide söötmine Claude Code’ile, töövoog loost Claude Code’i juhtimine häälega —, on see mürk. Kodeerimisagent võtab su sõnu spetsifikatsioonina. Ta ei tea, et su dikteerimistööriist sõnastas su ümber. Kui täpsustus, mis muutis juhise ohutuks, siluti su suu ja terminali vahel ära, täidab agent rõõmsalt siluti versiooni. Täpsus on kogu prompti mõte, ja AI ümberkirjutuskiht on masin täpsuse eemaldamiseks nii, et tulemus näeks välja veel läbimõeldum.

Miks AI-dikteerimistööriistad su öeldu ümber kirjutavad?

Kategooriaülene vastus ei ole see, et keegi asus kõnet moonutama. Vaid see, et „puhasta see transkriptsioon ära“ on päriselt ahvatlev funktsioon ja ilmne viis seda ehitada on lasta toores transkriptsioon läbi keelemudeli.

Toores kõne on segane — parasiitsõnad, valestardid, korduvad sõnad, puuduvad kirjavahemärgid. LLM, kellel palutakse see korda teha, toodab kauni väljundi. Häda on selles, et keelemudel ei toimeta nii, nagu inimtoimetaja „ee“ eemaldades toimetab. Ta genereerib uuesti. Väljund on uus tekst, mida mudel peab sinu sisendi heaks versiooniks, ja „hea“ ongi see koht, kust su kavatsus välja lekib. Abivalmiduse ja sujuvuse poole treenitud mudelitel on arvamused: reservatsioonid näevad välja nagu müra, täpsustused näevad välja nagu prügi, kohmakas-aga-täpne sõnastus näeb välja nagu miski, mida parandada. Enamasti on ümberkirjutus kahjutu. Aga see on tõenäosuslik ja sa ei suuda väljundi järgi öelda, millised laused olid transkribeeritud ja millised komponeeritud. Viimistlus on ühtlane; täpsus ei ole.

Selles ongi LLM-viimistluskonveierite sügav probleem: nad kukuvad läbi vaikselt ja enesekindlalt. Kõnetuvastaja, kes sind valesti kuuleb, toodab tavaliselt midagi nähtavalt valet. Ümberkirjutuskiht, mis su reedab, toodab midagi nähtavalt õiget — grammatilist, usutavat, sinu häält kandvat —, ja täpselt sellepärast saadetakse pööratud „ära juuruta“ ära, selle asemel et see kinni püüda.

Vaikimisi sõnasõnaline

Keebye seisukoht on lihtne: see, mida kõnetuvastusmudel kuulis, ongi see, mis su kursorile maandub. Vaikimisi ei istu transkriptsiooni ja su terminali vahel ükski keelemudel, mis sinust paremat versiooni komponeeriks — vaikimisi viimistlusaste on lühike nimekiri deterministlikke reegleid, ja ongi kõik.

See on teadlik panus ja see tuleb vibe-kodeerimise kasutusloost. Kui su dikteerimine on kodeerimisagentide juhtkanal, on tööriista töö transport, mitte autorlus. Sina oled kirjutaja; agent on lugeja; dikteerimiskihil ei tohiks olla arvamusi. See töövoog — tervete promptide rääkimine nende trükkimise asemel — on lahti kirjutatud loos häälega dikteerimine AI-promptide jaoks.

Keebye’s on LLM-viimistlus — jõuan selleni —, aga see on valikuline, töötab täielikult sinu masinas ja käib kaitse all, mis on mõeldud tõrjuma tavalisi triivi, ohjeldamatu paisumise ja kordamise vorme. Kui väljund selle kontrolli ei läbi, taandub Keebye reeglitele. Vaikevalik jääb reegliteks.

Mida see puhastus siis tegelikult teeb?

Sõnasõnaline ei pea tähendama toorest. Keebye’ga tuleb kaasa valikuline puhastuskäik — enhancement, vaikimisi sees ja rakenduse kaupa ülekirjutatav —, aga see on reeglipõhine, mitte mudel, ja täielik nimekiri sellest, mida ta teeb, mahub ühte lõiku.

See eemaldab omaette seisvad parasiitsõnad (um, uh, erm, you know). See koondab vahetud sõnakordused — „the the“ muutub „the“-ks. See koondab tühikud. See teeb esimese tähe suureks ja lisab lõppu punkti, kui sa ise lauset ei lõpetanud. See ongi kogu nimekiri. Reeglid on deterministlikud ja kitsalt piiritletud; nad ei muuda meelega osalausete järjekorda, ei eemalda eitusi ega asenda sõnu sünonüümidega.

Enne puhastuse käivitumist rakenduvad su sõnastikuasendused — kasutaja määratud asendused žargooni ja pärisnimede jaoks, mida kõnemudelid sassi ajavad, nii et „pnpm“ ja su moodulinimed saabuvad kirjutatuna nii, nagu su koodibaas neid kirjutab.

Ja kui isegi reeglipõhine käik on rohkem sekkumist, kui sa tahad, lülita enhancement välja ja Keebye sisestab toore kõnemudeli transkriptsiooni: parasiitsõnad, kordused ja kõik muu. Mõnes kontekstis — kellegi tsiteerimisel, dikteerimisel välja, kus lõpupunkt asju rikub — on toores transkriptsioon parem valik, ja rakendusepõhine ülekirjutus laseb sul selle valida.

Valikuline viimistlus ja täpsuskaitse selle ümber

Nüüd see LLM, milleni ma lubasin jõuda. Nendele, kes tahavad nutikamat puhastust, pakub Keebye valikulist viimistlusrežiimi (polish_mode väärtusel local_llm): väike Qwen3 mudel, mis jookseb seadmes llama.cpp kaudu, Metaliga kiirendatuna, ilma et midagi kuhugi saadetaks. Selle juhised on viimistluse kitsas versioon — paranda kirjavahemärgid ja suurtähed, eemalda parasiitsõnad, säilita kasutaja täpsed sõnad, keel ja tähendus, hoia kood ja failinimed sõna-sõnalt alles. Genereerimine on deterministlik (ahne valik, sama sisend → sama väljund) ja piiratud; kui mudel jääb kahesekundilisest tähtajast kaugemale toppama, jäetakse tema väljund kõrvale.

Aga juhised on lootused ja see artikkel on olemas seepärast, et lootused ei ole garantiid. Nii et iga LLM-viimistletud tulemus läbib enne su kursorile jõudmist täpsuskaitse. Väljund peab säilitama vähemalt 50% algse transkriptsiooni tokenitest. See ei tohi paisuda — kõik, mis ületab ligikaudu kahekordse algse pikkuse (pluss neli tokenit), kukub läbi. Ohjeldamatu kordamine tuvastatakse. Kui viimistletud tulemus ühe neist kontrollidest läbi kukub, viskab Keebye selle minema ja taandub reeglipõhisele puhastusele.

See kaitse püüab kinni tõsise tokenikao, ohjeldamatu paisumise ja kordamise, enne kui mudeli väljund saab reeglitega puhastatud transkriptsiooni asendada. See on heuristika, mitte semantiline tõestus: lühike ümberkirjutus või muudetud eitus võivad ikkagi lävendist läbi minna. Kui täpsustus ei tohi triivida, hoia AI-viimistlus väljas ja vaata sisestatud tekst enne saatmist üle.

Ausad piirid

Sõnasõnaline tähendab sõnasõnalist. Kui sa lobised, maandub su lobisemine — isegi valikuline viimistlus on juhendatud ja kaitstud puhastuse, mitte komponeerimise poole, seega ei tee Keebye looklevast mõttest krõbedat juhist. Distsipliin öelda seda, mida mõtled, jääb sinu kanda.

Reeglipõhine puhastus on meelega loll. See eemaldab „um“; see ei paranda su grammatikat, ei ehita ümber jooksvat lauset ega märka, et sa ise endale vastu rääkisid. Miski nutikam tooks tagasi need hinnangulised otsused, mille vältimiseks see disain olemas on.

Ja täpsus kaitseb ümberkirjutamise, mitte valesti tuvastamise eest. Kui kõnemudel kuuleb „cache“ asemel „cash“, säilitatakse see viga truult — kaitsel ei ole aimugi, mida sa öelda tahtsid, ainult sellest, mis transkribeeriti. Sõnasõnaline dikteerimine nihutab usalduspiiri kõnetuvastusmudelile; see ei kaota seda ära. (Seotud teema: kui su probleem on see, et mudel transkribeerib täiesti vales keeles, on see teine tõrge teise lahendusega — kinnita oma dikteerimiskeel.)

Ja lõpuks kategooria raamistus: AI-viimistlus ei ole pettus ja hulk kasutajaid eelistab päriselt väljundit, mis loeb sujuvamalt kui nende kõne. Kui see oled sina, siis mõned teised tööriistad panustavad sellele hästi ja meie võrdlused ütlevad seda ausalt — nii Keebye vs Wispr Flow kui ka Keebye vs Superwhisper sisaldavad päris „millal teine tööriist sobib paremini“ jaotist.

Transport, mitte autorlus

Tehing, mida Keebye pakub, on meelega kitsas: sina räägid ja kergelt puhastatud transkriptsioon maandub seal, kus su kursor on. Kui need sõnad on promptid agendile, kes neid sõna-sõnalt täidab, on kitsas hoopis funktsioon. Kõige kallim asi, mida dikteerimistööriist arendajale teha saab, ei ole kirjaviga. See on sujuv lause, mida sa kunagi ei öelnud.

Keebye on macOS-i jaoks varajases ligipääsus. Alusta allpool tasuta prooviperioodi, dikteeri „Ära juuruta enne, kui testid läbivad“ ja kontrolli, kas see täpne piirang puhastuse üle elab. See test ongi kogu toode.

Testi juhist, mis ei tohi triivida

Alusta tasuta prooviperioodi ja dikteeri prompt kriitilise täpsustusega — eriti eitusega — ning vaata siis, mis kohale jõuab.

Start free trial

Early access: we'll email you the moment the macOS build is ready — your 14 days start when you first sign in from the app.

Loe edasi