Liigu dokumentatsiooni sisu juurde
Keebye Docs

Puhastus ja sõnastik

Mis juhtub sinu transkriptiga kõnetuvastuse ja sisestamise vahel: sõnastik, reeglipõhine puhastus, rakendusepõhised erandid ja valikuline kohaliku LLM-i viimistlus.

Iga dikteerimine läbib sinu Macis sama lühikese konveieri. Miski siin ei kasuta võrku.

Konveier

  1. Kõne teisendamine tekstiks valitud mootoriga.

  2. Oma sõnastiku asendused, mida rakendatakse alati.

  3. Puhastus — reeglipõhine või kohalik LLM, kui oled selle valinud — ainult siis, kui täiustus on esiplaanil oleva rakenduse jaoks sisse lülitatud.

  4. Sisestamine kleepides või trükkides.

Reeglipõhine puhastus

See on kogu reeglistik. Puhastus ei eemalda valesid algusi ega sõna "like".

  • Eemaldab omaette seisvad "um", "uh", "erm" ja kahesõnalise "you know", sobitades ainult terveid sõnu.
  • Ühendab vahetud sõnakordused, nii et "the the" muutub "the".
  • Tihendab tühikud.
  • Muudab esimese tähe suureks.
  • Lisab punkti, kui tekst lõpeb tähe või numbriga.

Rakendusepõhised erandid

Settings › Enhancement › "Clean up transcripts by default" on sees. Erandid on seotud rakenduse bundle id-ga. "Add current app…" lisab viimase rakenduse, mida kasutasid ja mis ei olnud Keebye, vaikeseade vastandväärtusega. Igal kirjel on märkeruut ja nupp "Remove".

Oma sõnastik

Settings › Dictionary: "Replace spoken words with fixed spellings." Kirjuta väljale "heard as…" see, mida Keebye kuuleb, ja väljale "write as…" soovitud kirjapilt, seejärel vajuta Add (töötab ka Enter). Remove kustutab kirje. Tühi olek ütleb "No replacements yet."

  • Sobitab ainult terveid sõnu, mitte kunagi pikema sõna sees.
  • Sobitamine ei arvesta suur- ja väiketähti; asendus säilitab sinu kirjutatud tähekuju.
  • Võtmed võivad olla mitmesõnalised. Võidab pikim vaste.
  • Rakendub igale dikteerimisele, olenemata sellest, kas puhastus on rakenduse jaoks sees või mitte.

Kohaliku LLM-i viimistlus (valikuline)

Keebye võib anda transkripti reeglipõhise puhastuse asemel kohalikule keelemudelile. Mudel on Qwen3-1.7B (Q4_K_M GGUF, umbes 1,28 GB), mis töötab llama.cpp ja Metali kaudu. See kasutab ahnet valikut, mõtlemine on välja lülitatud, ülempiir on 64 tokenit ja tähtaeg 2 sekundit. Iga tõrge langeb tagasi reeglipõhisele puhastusele.

Truuduskontroll kontrollib LLM-i väljundit enne kasutamist: see peab säilitama vähemalt poole sisendi sõnaesinemistest, ei tohi ületada kahekordset sisendi sõnade arvu pluss neli, ei tohi sisaldada ühtki lauset ega neljasõnalist fraasi kolm või enam korda ja ei tohi olla tühi. Muidu visatakse LLM-i väljund minema.