Pembersihan dan kamus
Apa yang terjadi pada transkripmu antara speech-to-text dan penyisipan: kamus, pembersihan berbasis aturan, penimpaan per aplikasi, dan polesan LLM lokal yang opsional.
Setiap dikte melewati pipeline pendek yang sama di Mac kamu. Tidak ada bagian di sini yang memakai jaringan.
Pipeline-nya
Speech-to-text dengan engine yang dipilih.
Penggantian dari kamus kustom, selalu diterapkan.
Pembersihan — berbasis aturan, atau LLM lokal kalau kamu mengaktifkannya — hanya kalau enhancement aktif untuk aplikasi yang paling depan.
Penyisipan lewat paste atau pengetikan.
Pembersihan berbasis aturan
Ini seluruh kumpulan aturannya. Pembersihan tidak menghapus salah mulai atau kata "like".
- Menghapus "um", "uh", "erm" yang berdiri sendiri, dan "you know" dua kata, hanya kalau cocok sebagai token utuh.
- Menggabungkan kata yang langsung terulang, jadi "the the" menjadi "the".
- Merapatkan spasi berlebih.
- Mengapitalkan huruf pertama.
- Menambahkan titik kalau teks berakhir dengan huruf atau angka.
Penimpaan per aplikasi
Settings › Enhancement › "Clean up transcripts by default" aktif. Penimpaan dikunci berdasarkan bundle id aplikasi. "Add current app…" menambahkan aplikasi non-Keebye terakhir yang kamu pakai, dengan setelan kebalikan dari default. Setiap entri punya kotak centang dan tombol "Remove".
Kamus kustom
Settings › Dictionary: "Replace spoken words with fixed spellings." Tulis apa yang Keebye dengar di "heard as…" dan ejaan yang kamu inginkan di "write as…", lalu tekan Add (Enter juga bisa). Remove menghapus sebuah entri. Keadaan kosongnya berbunyi "No replacements yet."
- Hanya cocok untuk kata utuh, tidak pernah di dalam kata yang lebih panjang.
- Pencocokan tidak membedakan huruf besar-kecil; penggantinya memakai kapitalisasi yang kamu tulis.
- Kuncinya bisa terdiri dari beberapa kata. Kecocokan terpanjang yang menang.
- Diterapkan pada setiap dikte, baik pembersihan aktif untuk aplikasi itu maupun tidak.
Polesan LLM lokal (opsional)
Keebye bisa menyerahkan transkrip ke model bahasa lokal alih-alih ke pembersihan berbasis aturan. Modelnya adalah Qwen3-1.7B (Q4_K_M GGUF, sekitar 1.28 GB) yang berjalan lewat llama.cpp dengan Metal. Ia memakai greedy sampling dengan thinking dimatikan, batas 64 token, dan tenggat 2 detik. Setiap kegagalan jatuh kembali ke pembersihan berbasis aturan.
Sebuah fidelity guard memeriksa keluaran LLM sebelum dipakai: keluaran itu harus mempertahankan setidaknya separuh kemunculan kata dari input, tidak melebihi dua kali jumlah kata input ditambah empat, tidak memuat kalimat atau frasa empat kata yang terulang tiga kali atau lebih, dan tidak boleh kosong. Kalau tidak, keluaran LLM dibuang.