Auto-Kesan Asyik Meneka Salah: Semat Bahasa Anda

Imlak asyik mendarat dalam bahasa yang salah? Auto-kesan memang bergolak pada pertuturan dwibahasa. Semat bahasa anda sekali dan ia kekal tersemat.

Teodor Deleanu10 Julai 2026Bacaan 7 min

Jika anda mengimlak dalam lebih daripada satu bahasa, anda pernah lihat kegagalan itu. Anda menyebut satu ayat dalam bahasa Romania dan transkripnya kembali sebagai bahasa Inggeris yang dirosakkan secara fonetik — perkataan sebenar, tiada satu pun milik anda. Atau ia terbalik di tengah ayat: separuh pertama dalam bahasa yang betul, separuh kedua dalam sesuatu yang model itu putuskan anda telah bertukar kepadanya. Atau, kegemaran peribadi saya, sup abjad campur — aksara Latin dengan beberapa aksara Cyril ditaburkan, seolah-olah model itu melindung nilai tekaannya huruf demi huruf.

Ini bukan rungutan tentang satu produk. Ia mod kegagalan yang boleh diramal bagi pengesanan bahasa automatik, termasuk lalai Keebye yang ditala untuk bahasa Inggeris. Ia mengenai penutur dengan bahasa Inggeris beraksen dan sesiapa yang bertukar kod sepanjang hari. Seorang pembangun dwibahasa yang Slack-nya dalam bahasa Poland dan mesej commit-nya dalam bahasa Inggeris memberi auto-pengesanan tepat isyarat bercampur yang paling teruk dikendalikannya.

Separuh kedua rungutan itu lebih senyap tetapi sama nyata: apabila tetapan bahasa itu memang wujud, ia selalunya tertimbus. Tiga menu ke dalam, di sebalik pemilih enjin, melepasi satu togol yang namanya langsung tidak menyebut bahasa. Jika anda bertukar bahasa dua puluh kali sehari, tetapan yang tertimbus itu secara fungsinya bukan tetapan langsung.

Saya mahu menerangkan kenapa golakan itu berlaku — menggunakan kisah perang produk saya sendiri, kerana Keebye mempunyai masalah ini sebelum ia mempunyai penyelesaiannya — kemudian menunjukkan rupa penyelesaian yang sebenar.

Kenapa auto-kesan bergolak (dan kenapa ia bukan pepijat sepenuhnya)

Inilah mekanik yang jujur. Model pertuturan moden melakukan pengenalan bahasa secara senyap, sebagai sebahagian daripada penyahkodan. Model itu mendengar, membentuk tekaan dalaman tentang bahasa apa yang didengarinya, dan menyahkod terhadap tekaan itu. Apabila audionya bersih, tanpa aksen dan ekabahasa, ini berfungsi begitu baik sehingga anda tidak pernah memikirkannya.

Sekarang suapkan ia dengan pertuturan sebenar. Satu aksen mengalihkan vokal ke arah fonem bahasa lain. Satu ayat mengandungi tiga kata pinjaman Inggeris — setiap perbualan teknikal memang begitu. Ada seorang budak di belakang, atau anda menggunakan mikrofon laptop. Setiap satu daripada ini menjadikan tekaan bahasa dalaman model itu kurang yakin, dan tekaan berkeyakinan rendah boleh terbalik antara bingkai. Apabila ia terbalik, penyahkodan terbalik bersamanya, dan anda dapat transkrip yang bertukar bahasa di tengah fikiran.

Bahagian yang penting: dalam kebanyakan alat, tiada apa yang menambat tekaan itu. Model yang memutuskan, secara senyap, setiap ucapan, dan anda tiada tindihan. Itu bukan pepijat dalam mana-mana satu aplikasi — itulah hakikat auto-pengesanan yang senyap. Satu model membuat pertimbangan yang anda tidak boleh betulkan.

Saya tahu ini dengan mendalam kerana enjin lalai Keebye mempunyai sifat ini dengan tepat. Parakeet, lalai kami yang ditala untuk bahasa Inggeris, mengabaikan sebarang petunjuk bahasa pada lapisan penyahkodan — anda tidak boleh memberitahunya apa yang anda akan sebut. Pada bahasa Inggeris yang jelas ia sangat baik, dan itulah sebabnya ia lalai. Pada audio yang tidak jelas ia boleh bergolak antara bahasa seperti semua benda lain dalam kategori ini. Saya memberitahu anda ini tentang produk saya sendiri dahulu, kerana penyelesaiannya hanya masuk akal setelah anda menerima bahawa masalah itu terletak dalam senibinanya, bukan dalam kecuaian pesaing.

Apa sebenarnya yang dilakukan oleh menyemat satu bahasa?

Penyelesaiannya ialah berhenti meminta model itu meneka. Keebye disertakan dengan enjin on-device kedua — Canary 1B v2 daripada NVIDIA, dikuantum kepada int8 — yang merangkumi tepat 25 bahasa: Bulgaria, Croatia, Czech, Denmark, Belanda, Inggeris, Estonia, Finland, Perancis, Jerman, Greek, Hungary, Itali, Latvia, Lithuania, Malta, Poland, Portugis, Romania, Slovak, Slovenia, Sepanyol, Sweden, Rusia dan Ukraine. Tidak seperti enjin lalai, Canary menerima arahan bahasa dan mematuhinya.

Keebye mendedahkan itu sebagai satu semat: tetapan bahasa yang eksplisit yang dihantar kepada enjin Canary bagi setiap ucapan. Semat bahasa Romania dan penyahkod itu menggunakan bahasa Romania dan bukannya membuat pilihan bahasa automatik. Pengecaman masih boleh salah, terutamanya di sekitar kata pinjaman dan audio bising, tetapi pilihan bahasa itu bukan lagi tekaan yang tidak disemak.

Tetapan itu dibaca secara langsung, setiap imlak. Ubahnya dan tahan-untuk-mengimlak yang seterusnya menggunakan bahasa baharu itu tanpa memulakan semula aplikasi. Itu lebih penting daripada bunyinya: kawalan bahasa jauh lebih berguna apabila menukarnya tidak mengganggu kerja.

Dan kerana Canary berjalan on-device seperti semua benda lain dalam Keebye, semat itu tidak menelan kos kisah privasi anda. Model itu kira-kira 1.3 GB, dimuat turun sekali; selepas itu bahasa Romania anda, bahasa Poland anda, bahasa Ukraine anda tidak pernah keluar dari mesin. (Kenapa kami rasa imlak berbilang bahasa setempat itu penting sama sekali ialah artikelnya sendiri — imlak untuk pembangun tidak sepatutnya bahasa Inggeris sahaja. Yang ini ialah sekuel praktikalnya: artikel itu berhujah untuk bahasa-bahasa itu, yang ini tentang menjadikannya benar-benar boleh diguna.)

Dua klik, bukan tiga menu ke dalam

Semat yang tidak dapat anda capai ialah semat yang tidak akan anda guna, jadi suisnya tinggal dalam dulang. Ikon bar menu Keebye mempunyai menu “Dictation Language” dengan senarai pendek terkurasi 11 bahasa — Inggeris, Romania, Perancis, Jerman, Sepanyol, Itali, Portugis, Belanda, Poland, Rusia, Ukraine. Dua klik dari mana-mana aplikasi: klik dulang, klik bahasa. Anda tidak membuka Settings, anda tidak meninggalkan tetingkap tempat anda bekerja.

Senarai penuh 25 bahasa tinggal dalam Settings untuk bahasa di luar senarai pendek itu. Tetapi senarai pendek itu merangkumi realiti harian kebanyakan kerja dwibahasa: anda menulis kepada pasukan anda dalam satu bahasa dan kepada pelanggan atau agent AI dalam bahasa lain, dan anda perlukan pertukaran itu tidak menelan kos apa-apa.

Ada satu lagi pilihan yang berbaloi diketahui, kerana ia mengubah sepenuhnya cara sesetengah orang menggunakan semat itu: togol terjemah-ke-bahasa-Inggeris. Sebut dalam bahasa anda, bahasa Inggeris mendarat pada kursor — enjin yang sama, pelaksanaan on-device yang sama. Jika monolog dalaman anda berjalan dalam bahasa Romania tetapi output anda perlu dalam bahasa Inggeris (mesej commit, prompt kepada coding agent, balasan kepada pasukan antarabangsa), ini meruntuhkan langkah terjemahan yang anda lakukan dalam kepala. Saya menggunakannya lebih daripada yang saya jangka.

Apa kos semat itu

25 bahasa ialah 25 bahasa. Alat imlak cloud menyenaraikan jauh lebih banyak, kerana menghantar audio ke model besar di sebelah pelayan ialah cara murah menambah bahasa. Itulah tolak ansur sebenar on-device: model yang muat pada Mac anda merangkumi lebih sedikit dunia berbanding model yang memenuhi pusat data. Jika bahasa anda tiada dalam senarai 25 itu, enjin berbilang bahasa Keebye tidak merangkumi anda hari ini, dan saya lebih rela mengatakannya daripada membundarkannya ke atas.

Semat bermakna semat. Ini sisi sebaliknya bagi keberketentuan, dan saya mahu berterus terang tentangnya: jika anda menyemat bahasa Romania kemudian bercakap bahasa Inggeris, Keebye akan dengan setia tersalah nyahkod bahasa Inggeris anda sebagai bahasa Romania sehingga anda menukarnya. Enjin itu melakukan tepat apa yang anda suruh. Seluruh daya tarikan auto-pengesanan ialah anda tidak perlu memikirkan hal ini — semat itu menukar kemudahan tersebut dengan kebolehramalan. Pada pengalaman saya pertukaran itu berbaloi, kerana tekaan salah yang tidak boleh anda kawal lebih teruk daripada tetapan salah yang boleh anda betulkan dalam dua klik. Tetapi ia satu pertukaran, bukan makan tengah hari percuma.

Senarai pendek dulang ialah 11 bahasa, bukan 25. Jika pasangan harian anda termasuk, katakan, bahasa Finland atau Greek, anda akan melalui Settings untuk satu sebelahnya. Kurasi bermakna bahasa seseorang tidak masuk ke dalam menu pantas itu.

Ke mana ini meninggalkan rungutan itu

Rungutan peringkat kategori — “imlak saya asyik keluar dalam bahasa yang salah” — sebenarnya rungutan tentang keputusan yang senyap. Model itu meneka, tekaan itu salah, dan tiada cara untuk memberitahunya sebaliknya. Setiap penyelesaian yang mengekalkan tekaan (pengesanan lebih baik, tetingkap audio lebih panjang, ambang keyakinan) hanya menjadikan kegagalan itu lebih jarang dan lebih pelik. Penyelesaian yang benar-benar menamatkan rungutan itu ialah memulangkan keputusan itu kepada pengguna.

Jika anda sedang mengalaminya dengan alat lain, halaman perbandingan kami jujur tentang di mana setiap alat sesuai — Keebye vs Superwhisper dan Keebye vs Wispr Flow kedua-duanya merangkumi persoalan bahasa antara lain. Untuk mencuba semat itu sendiri, mulakan percubaan percuma anda di bawah, mainkan semula ayat bahasa Romania atau Poland dari permulaan artikel ini, dan lihat berapa banyak golakan itu datang daripada tekaan yang tidak disemak dan bukannya daripada aksen anda.

Semat bahasa yang benar-benar anda guna

Mulakan percubaan percuma anda dan mainkan semula satu balasan dalam bahasa ibunda yang pernah dirosakkan auto-kesan.

Start free trial

Early access: we'll email you the moment the macOS build is ready — your 14 days start when you first sign in from the app.

Teruskan membaca