Langkau ke kandungan dokumentasi
Keebye Docs

Pembersihan dan kamus

Apa yang berlaku kepada transkrip anda antara speech-to-text dan sisipan: kamus, pembersihan berasaskan peraturan, penggantian per aplikasi, dan penggilapan LLM setempat yang bersifat pilihan.

Setiap imlak melalui pipeline pendek yang sama pada Mac anda. Tiada apa-apa di sini yang menggunakan rangkaian.

Pipeline-nya

  1. Speech-to-text dengan enjin yang dipilih.

  2. Penggantian daripada kamus tersuai, sentiasa diterapkan.

  3. Pembersihan — berasaskan peraturan, atau LLM setempat jika anda menghidupkannya — hanya apabila enhancement dihidupkan untuk aplikasi yang paling hadapan.

  4. Sisipan melalui tampal atau menaip.

Pembersihan berasaskan peraturan

Inilah keseluruhan set peraturannya. Pembersihan tidak membuang permulaan tersasar atau perkataan "like".

  • Membuang "um", "uh", "erm" yang berdiri sendiri, dan "you know" dua perkataan, dengan memadankan token penuh sahaja.
  • Menggabungkan perkataan yang berulang secara langsung, jadi "the the" menjadi "the".
  • Merapatkan ruang berlebihan.
  • Menghurufbesarkan huruf pertama.
  • Menambah noktah jika teks berakhir dengan huruf atau angka.

Penggantian per aplikasi

Settings › Enhancement › "Clean up transcripts by default" dihidupkan. Penggantian dikunci berdasarkan bundle id aplikasi. "Add current app…" menambah aplikasi bukan-Keebye terakhir yang anda gunakan, dengan tetapan bertentangan dengan lalai. Setiap entri mempunyai kotak semak dan butang "Remove".

Kamus tersuai

Settings › Dictionary: "Replace spoken words with fixed spellings." Taip apa yang Keebye dengar dalam "heard as…" dan ejaan yang anda mahukan dalam "write as…", kemudian tekan Add (Enter juga berfungsi). Remove memadam sesuatu entri. Keadaan kosongnya berbunyi "No replacements yet."

  • Memadankan perkataan penuh sahaja, tidak pernah di dalam perkataan yang lebih panjang.
  • Pemadanan tidak mengambil kira huruf besar atau kecil; penggantinya mengekalkan huruf yang anda taip.
  • Kuncinya boleh terdiri daripada beberapa perkataan. Padanan terpanjang menang.
  • Diterapkan pada setiap imlak, sama ada pembersihan dihidupkan untuk aplikasi itu atau tidak.

Penggilapan LLM setempat (pilihan)

Keebye boleh menyerahkan transkrip kepada model bahasa setempat dan bukannya kepada pembersihan berasaskan peraturan. Modelnya ialah Qwen3-1.7B (Q4_K_M GGUF, kira-kira 1.28 GB) yang berjalan melalui llama.cpp dengan Metal. Ia menggunakan greedy sampling dengan thinking dimatikan, had 64 token, dan tempoh akhir 2 saat. Sebarang kegagalan berbalik kepada pembersihan berasaskan peraturan.

Sebuah fidelity guard memeriksa output LLM sebelum ia digunakan: output itu mesti mengekalkan sekurang-kurangnya separuh kemunculan perkataan input, tidak melebihi dua kali bilangan perkataan input campur empat, tidak mengandungi ayat atau frasa empat perkataan yang berulang tiga kali atau lebih, dan tidak boleh kosong. Jika tidak, output LLM itu dibuang.