Opschonen en woordenboek
Wat er met je transcript gebeurt tussen spraakherkenning en invoegen: het woordenboek, regelgebaseerd opschonen, uitzonderingen per app en de optionele polijstslag met een lokale LLM.
Elke dictatie loopt op je Mac door dezelfde korte pijplijn. Niets hiervan gebruikt het netwerk.
De pijplijn
Spraak naar tekst met de gekozen engine.
Vervangingen uit het eigen woordenboek, altijd toegepast.
Opschonen — regelgebaseerd, of met de lokale LLM als je daarvoor kiest — alleen als opschonen aanstaat voor de app die vooraan staat.
Invoegen door plakken of typen.
Regelgebaseerd opschonen
Dit is de volledige set regels. Opschonen verwijdert geen valse starts en niet het woord "like".
- Verwijdert losstaande "um", "uh", "erm" en het tweewoordige "you know", en kijkt daarbij alleen naar hele woorden.
- Vouwt directe woordherhalingen samen, dus "the the" wordt "the".
- Vouwt witruimte samen.
- Zet de eerste letter in een hoofdletter.
- Zet een punt achter de tekst als die op een letter of cijfer eindigt.
Uitzonderingen per app
Settings › Enhancement › "Clean up transcripts by default" staat aan. Uitzonderingen worden bijgehouden op de bundle-id van de app. "Add current app…" voegt de laatste app toe die je gebruikte buiten Keebye, met het tegenovergestelde van de standaard. Elke regel heeft een selectievakje en een knop "Remove".
Eigen woordenboek
Settings › Dictionary: "Replace spoken words with fixed spellings." Typ wat Keebye hoort in "heard as…" en de spelling die je wilt in "write as…", en druk op Add (Enter werkt ook). Remove verwijdert een regel. De lege staat luidt "No replacements yet."
- Werkt alleen op hele woorden, nooit binnen een langer woord.
- De vergelijking negeert hoofdletters; de vervanging houdt de schrijfwijze die jij hebt getypt.
- Een sleutel mag uit meerdere woorden bestaan. De langste treffer wint.
- Wordt op elke dictatie toegepast, of opschonen voor die app nu aanstaat of niet.
Polijsten met een lokale LLM (opt-in)
Keebye kan het transcript aan een lokaal taalmodel geven in plaats van aan het regelgebaseerde opschonen. Het model is Qwen3-1.7B (Q4_K_M GGUF, ongeveer 1,28 GB) en draait via llama.cpp met Metal. Het gebruikt greedy sampling met thinking uit, een limiet van 64 tokens en een deadline van 2 seconden. Gaat er iets mis, dan valt het terug op regelgebaseerd opschonen.
Een getrouwheidscontrole beoordeelt de uitvoer van de LLM voordat die wordt gebruikt: die moet minstens de helft van de woordvoorkomens uit de invoer behouden, niet boven het dubbele van het aantal invoerwoorden plus vier uitkomen, geen zin of viervoudige woordgroep bevatten die drie keer of vaker terugkomt, en niet leeg zijn. Anders wordt de uitvoer van de LLM weggegooid.