Sebut Apa Yang Saya Sebut: Imlak Tanpa Tulis Semula AI
AI menulis semula imlak: penentu gugur, makna terbalik. Kenapa penggilapan LLM memparafrasa kata anda dan kenapa Keebye kekal literal.
Ada satu rungutan tentang imlak yang dipertingkat AI yang kedengaran paradoks sehinggalah anda mengalaminya sendiri: transkripsinya elok — apa yang berlaku selepas transkripsi itulah yang merosakkannya. Anda sebut satu perkara, dan alat itu menyampaikan sesuatu yang digilap, yakin, dan sedikit berbeza. Satu penentu digugurkan diam-diam. Satu hedge dibuang. Satu ayat disusun semula menjadi sesuatu yang anda tidak akan sebut. Dan dalam versi corak yang paling teruk — versi yang membuatkan orang berhenti menggunakan sesuatu alat serta-merta — maknanya terbalik. “Jangan deploy sebelum ujian lulus” keluar di hujung sana sebagai arahan tentang melakukan deploy, tolak jangan itu.
Untuk imlak santai ini gangguan kecil. Untuk cara saya benar-benar menggunakan imlak — menyuap prompt kepada Claude Code, aliran kerja daripada memandu Claude Code dengan suara anda — ia racun. Sesuatu coding agent mengambil kata-kata anda sebagai spesifikasi. Ia tidak tahu bahawa alat imlak anda telah memparafrasa anda. Jika penentu yang menjadikan arahan itu selamat telah dilicinkan hilang antara mulut anda dan terminal, agent itu akan melaksanakan versi yang dilicinkan itu dengan riang. Ketepatan ialah keseluruhan tujuan sesuatu prompt, dan lapisan tulis-semula AI ialah mesin untuk membuang ketepatan sambil menjadikan hasilnya kelihatan lebih bersengaja.
Kenapa alat imlak AI menulis semula apa yang anda sebut?
Jawapan peringkat kategori bukanlah bahawa ada sesiapa yang berniat memesongkan pertuturan. Ia kerana “bersihkan transkripsi ini” memang satu ciri yang menarik, dan cara yang paling jelas untuk membinanya ialah menjalankan transkrip mentah itu melalui sebuah model bahasa.
Pertuturan mentah memang bersepah — kata pengisi, permulaan palsu, perkataan berulang, tanda baca yang hilang. Sebuah LLM yang diminta mengemaskan itu menghasilkan output yang cantik. Masalahnya ialah model bahasa tidak menyunting, dalam erti kata seorang penyunting salinan manusia yang membuang “um”. Ia menjana semula. Outputnya ialah teks baharu yang model itu anggap sebagai versi baik bagi input anda, dan “baik” itulah tempat niat anda bocor keluar. Model yang dilatih ke arah kebergunaan dan kelancaran mempunyai pendapat: hedge kelihatan seperti bunyi bising, penentu kelihatan seperti kekusutan, ungkapan yang janggal-tetapi-tepat kelihatan seperti sesuatu yang patut diperbaiki. Kebanyakan masa tulis semula itu tidak berbahaya. Tetapi ia bersifat kebarangkalian, dan anda tidak dapat tahu daripada outputnya ayat mana yang ditranskrip dan ayat mana yang dikarang. Gilapnya seragam; kesetiaannya tidak.
Itulah masalah mendalam dengan pipeline penggilapan LLM: ia gagal secara senyap dan penuh yakin. Pengecam pertuturan yang salah dengar biasanya menghasilkan sesuatu yang jelas salah. Lapisan tulis semula yang mengkhianati anda menghasilkan sesuatu yang kelihatan jelas betul — bertatabahasa, munasabah, memakai suara anda — dan itulah tepatnya sebabnya “jangan deploy” yang terbalik itu dihantar dan bukannya ditangkap.
Literal secara lalai
Pendirian Keebye mudah: apa yang didengar oleh model speech-to-text itulah yang mendarat pada kursor anda. Secara lalai, tiada model bahasa duduk antara transkripsi dan terminal anda mengarang versi diri anda yang lebih baik — peringkat penggilapan lalai ialah satu senarai pendek peraturan berketentuan, dan itu sahaja.
Itu pertaruhan yang disengajakan, dan ia datang daripada kes penggunaan vibecoding. Apabila imlak anda menjadi saluran kawalan bagi coding agent, tugas alat itu ialah pengangkutan, bukan kepengarangan. Anda penulisnya; agent itu audiennya; lapisan imlak itu sepatutnya tiada pendapat. Aliran kerja itu — menyebut prompt penuh dan bukannya menaipnya — dihuraikan dalam imlak suara untuk prompt AI.
Ada memang satu penggilapan LLM dalam Keebye — saya akan sampai kepadanya — tetapi ia bersifat pilihan, ia berjalan sepenuhnya pada mesin anda, dan ia beroperasi di bawah satu pengawal yang direka untuk menolak bentuk pesongan, pengembangan liar dan pengulangan yang lazim. Jika outputnya gagal semakan itu, Keebye berundur kepada peraturan. Lalainya kekal peraturan.
Jadi apa sebenarnya yang dilakukan oleh pembersihan itu?
Literal tidak semestinya bermakna mentah. Keebye disertakan dengan satu pusingan pembersihan pilihan — penambahbaikan, hidup secara lalai, dan boleh ditindih setiap aplikasi — tetapi ia berasaskan peraturan, bukan model, dan senarai lengkap apa yang dilakukannya muat dalam satu perenggan:
Ia membuang kata pengisi yang berdiri sendiri (um, uh, erm, you know). Ia meruntuhkan pengulangan perkataan serta-merta — “the the” menjadi “the”. Ia meruntuhkan ruang putih. Ia menghurufbesarkan huruf pertama, dan ia menambah noktah akhir jika anda tidak mengakhirinya dengan satu. Itu keseluruhan senarainya. Peraturan itu berketentuan dan berskop sempit; ia tidak menyusun semula klausa, membuang penafian, atau menggantikan sinonim dengan sengaja.
Sebelum pembersihan berjalan, penggantian kamus anda dikenakan dahulu — gantian yang ditakrifkan pengguna untuk jargon dan kata nama khas yang dirosakkan model pertuturan, supaya “pnpm” dan nama modul anda tiba dieja sebagaimana pangkalan kod anda mengejanya.
Dan jika pusingan berasaskan peraturan itu pun lebih daripada campur tangan yang anda mahukan, matikan penambahbaikan dan Keebye akan memasukkan transkrip model pertuturan yang mentah: kata pengisi, pengulangan, semuanya. Untuk sesetengah konteks — memetik kata seseorang, mengimlak ke dalam medan di mana noktah di hujung merosakkan sesuatu — transkrip mentah ialah pilihan yang lebih baik, dan tindihan setiap aplikasi membolehkan anda memilihnya.
Penggilapan pilihan itu, dan pengawal kesetiaan di sekelilingnya
Sekarang LLM yang saya janjikan tadi. Untuk orang yang memang mahukan pembersihan yang lebih pintar, Keebye menawarkan mod penggilapan pilihan (polish_mode ditetapkan kepada local_llm): sebuah model Qwen3 kecil yang berjalan on-device melalui llama.cpp, dipecut dengan Metal, tiada apa yang dihantar ke mana-mana. Arahannya ialah versi sempit bagi penggilapan — betulkan tanda baca dan huruf besar, buang kata pengisi, kekalkan perkataan, bahasa dan makna pengguna dengan tepat, pelihara kod dan nama fail secara verbatim. Penjanaannya berketentuan (persampelan tamak, input sama → output sama) dan berhad; jika model itu tersekat melepasi had masa dua saat, outputnya ditinggalkan.
Tetapi arahan itu harapan, dan artikel ini wujud kerana harapan bukan jaminan. Jadi setiap hasil yang digilap LLM melalui satu pengawal kesetiaan sebelum ia boleh menyentuh kursor anda. Output itu mesti mengekalkan sekurang-kurangnya 50% daripada token transkripsi asal. Ia tidak boleh membengkak — apa-apa yang melepasi kira-kira dua kali panjang asal (tambah empat token) akan gagal. Pengulangan liar dikesan. Jika hasil yang digilap itu gagal salah satu daripada semakan tersebut, Keebye membuangnya dan berundur kepada pembersihan berasaskan peraturan.
Pengawal itu menangkap kehilangan token yang teruk, pengembangan liar, dan pengulangan sebelum output model itu boleh menggantikan transkrip yang telah dibersihkan peraturan. Ia satu heuristik, bukan bukti semantik: tulis semula yang pendek atau penafian yang berubah masih boleh lulus ambangnya. Jika sesuatu penentu tidak mampu terpesong, biarkan penggilapan AI mati dan semak teks yang dimasukkan sebelum menghantarnya.
Had yang jujur
Literal bermakna literal. Jika anda merepek, repekan anda itulah yang mendarat — malah penggilapan pilihan itu pun diarah dan dikawal ke arah pembersihan, bukan pengarangan, jadi Keebye tidak akan menukar fikiran yang berbelit menjadi arahan yang tajam. Disiplin menyebut apa yang anda maksudkan kekal pada anda.
Pembersihan berasaskan peraturan itu sengaja bodoh. Ia membuang “um”; ia tidak akan membetulkan tatabahasa anda, menyusun semula ayat yang berjela, atau perasan bahawa anda bercanggah dengan diri sendiri. Apa-apa yang lebih pintar akan memperkenalkan semula pertimbangan yang menjadi sebab reka bentuk ini wujud untuk mengelakkannya.
Dan kesetiaan melindungi daripada tulis semula, bukan daripada salah kecam. Jika model pertuturan tersalah dengar “cache” sebagai “cash”, ralat itu dipelihara dengan setia — pengawal itu langsung tidak tahu apa yang anda maksudkan, hanya apa yang telah ditranskrip. Imlak literal memindahkan sempadan kepercayaan kepada model STT; ia tidak menghapuskannya. (Berkaitan: jika masalah anda ialah model mentranskrip dalam bahasa yang salah sama sekali, itu kegagalan berbeza dengan penyelesaian berbeza — semat bahasa imlak anda.)
Akhir sekali, rangka kategorinya: penggilapan AI bukan penipuan, dan ramai pengguna memang lebih suka output yang membaca lebih lancar daripada cara mereka bercakap. Jika itu anda, alat lain menyandarkan diri padanya dengan baik, dan perbandingan kami mengatakannya secara jujur — Keebye vs Wispr Flow dan Keebye vs Superwhisper kedua-duanya mengandungi bahagian “bila alat lain lebih sesuai” yang sebenar.
Pengangkutan, bukan kepengarangan
Tawaran Keebye sengaja sempit: anda bercakap, dan satu transkrip yang dibersihkan sedikit mendarat di tempat kursor anda berada. Apabila kata-kata itu ialah prompt kepada sesuatu agent yang akan bertindak ke atasnya secara literal, sempit itu satu ciri. Perkara paling mahal yang boleh dilakukan oleh alat imlak kepada seorang pembangun bukan kesilapan menaip. Ia satu ayat yang lancar yang anda tidak pernah sebut.
Keebye berada dalam akses awal untuk macOS. Mulakan percubaan percuma anda di bawah, imlakkan “Jangan deploy sebelum ujian lulus,” dan periksa sama ada kekangan tepat itu terselamat daripada pembersihan. Ujian itulah keseluruhan produknya.
Uji arahan yang tidak mampu terpesong
Mulakan percubaan percuma anda dan imlakkan satu prompt dengan penentu yang kritikal—terutamanya satu 'jangan'—kemudian periksa apa yang tiba.
Start free trialEarly access: we'll email you the moment the macOS build is ready — your 14 days start when you first sign in from the app.
Teruskan membaca
Mengimlak Prompt kepada Agent Selari, Lane demi Lane
Menjalankan dua tiga coding agent serentak menjadikan prompting sebagai bottleneck. Aliran kerja suara untuk menyuap lane selari tanpa meninggalkan lane anda.
Memandu Claude Code dengan Suara Anda: Pembinaan Lane Selari
Coding agent AI menjadikan menaip bottleneck. Aliran kerja praktikal mengimlak prompt, review dan arahan baharu merentas lane agent selari pada macOS.
Imlak yang Bertahan dalam Terminal
Tampalan imlak gagal senyap dalam terminal, SSH, tmux dan susun atur bukan QWERTY. Kenapa papan keratan gagal di situ dan cara mod menaip membantu.