Uppstädning och ordlista
Vad som händer med ditt transkript mellan tal-till-text och infogning: ordlistan, den regelbaserade uppstädningen, undantag per app och valfri polering med lokal LLM.
Varje diktering går genom samma korta pipeline på din Mac. Ingenting här använder nätverket.
Pipelinen
Tal-till-text med den valda motorn.
Ersättningar från den egna ordlistan, alltid tillämpade.
Uppstädning — regelbaserad, eller den lokala LLM:en om du har valt det — bara när förbättring är aktiverad för appen längst fram.
Infogning genom inklistring eller skrivning.
Regelbaserad uppstädning
Det här är hela regeluppsättningen. Uppstädningen tar inte bort felstarter eller ordet "like".
- Tar bort fristående "um", "uh", "erm" och tvåordsformen "you know", och matchar bara hela tokens.
- Slår ihop omedelbara ordupprepningar, så "the the" blir "the".
- Slår ihop blanktecken.
- Gör den första bokstaven till versal.
- Lägger till en punkt om texten slutar på en bokstav eller siffra.
Undantag per app
Settings › Enhancement › "Clean up transcripts by default" är på. Undantag kopplas till appens bundle-id. "Add current app…" lägger till den senaste appen du använde som inte var Keebye, med motsatsen till standardinställningen. Varje post har en kryssruta och en "Remove"-knapp.
Egen ordlista
Settings › Dictionary: "Replace spoken words with fixed spellings." Skriv det Keebye hör i "heard as…" och stavningen du vill ha i "write as…", och tryck sedan på Add (Enter fungerar också). Remove tar bort en post. Tomt läge visar "No replacements yet."
- Matchar bara hela ord, aldrig inuti ett längre ord.
- Matchningen är skiftlägesokänslig; ersättningen behåller det skiftläge du skrev.
- Nycklar kan bestå av flera ord. Den längsta matchningen vinner.
- Tillämpas på varje diktering, oavsett om uppstädning är aktiverad för appen eller inte.
Polering med lokal LLM (tillval)
Keebye kan skicka transkriptet till en lokal språkmodell i stället för till den regelbaserade uppstädningen. Modellen är Qwen3-1.7B (Q4_K_M GGUF, ungefär 1,28 GB) som körs genom llama.cpp med Metal. Den använder greedy sampling med tänkande avstängt, ett tak på 64 tokens och en deadline på 2 sekunder. Varje fel faller tillbaka till regelbaserad uppstädning.
Ett trohetsskydd kontrollerar LLM-utdatan innan den används: den måste behålla minst hälften av förekomsterna av orden i indatan, inte överstiga dubbla antalet ord i indatan plus fyra, inte innehålla någon mening eller fyraordsfras som upprepas tre gånger eller mer, och inte vara tom. Annars kastas LLM-utdatan.