Hoppa till dokumentationens innehåll
Keebye Docs

Uppstädning och ordlista

Vad som händer med ditt transkript mellan tal-till-text och infogning: ordlistan, den regelbaserade uppstädningen, undantag per app och valfri polering med lokal LLM.

Varje diktering går genom samma korta pipeline på din Mac. Ingenting här använder nätverket.

Pipelinen

  1. Tal-till-text med den valda motorn.

  2. Ersättningar från den egna ordlistan, alltid tillämpade.

  3. Uppstädning — regelbaserad, eller den lokala LLM:en om du har valt det — bara när förbättring är aktiverad för appen längst fram.

  4. Infogning genom inklistring eller skrivning.

Regelbaserad uppstädning

Det här är hela regeluppsättningen. Uppstädningen tar inte bort felstarter eller ordet "like".

  • Tar bort fristående "um", "uh", "erm" och tvåordsformen "you know", och matchar bara hela tokens.
  • Slår ihop omedelbara ordupprepningar, så "the the" blir "the".
  • Slår ihop blanktecken.
  • Gör den första bokstaven till versal.
  • Lägger till en punkt om texten slutar på en bokstav eller siffra.

Undantag per app

Settings › Enhancement › "Clean up transcripts by default" är på. Undantag kopplas till appens bundle-id. "Add current app…" lägger till den senaste appen du använde som inte var Keebye, med motsatsen till standardinställningen. Varje post har en kryssruta och en "Remove"-knapp.

Egen ordlista

Settings › Dictionary: "Replace spoken words with fixed spellings." Skriv det Keebye hör i "heard as…" och stavningen du vill ha i "write as…", och tryck sedan på Add (Enter fungerar också). Remove tar bort en post. Tomt läge visar "No replacements yet."

  • Matchar bara hela ord, aldrig inuti ett längre ord.
  • Matchningen är skiftlägesokänslig; ersättningen behåller det skiftläge du skrev.
  • Nycklar kan bestå av flera ord. Den längsta matchningen vinner.
  • Tillämpas på varje diktering, oavsett om uppstädning är aktiverad för appen eller inte.

Polering med lokal LLM (tillval)

Keebye kan skicka transkriptet till en lokal språkmodell i stället för till den regelbaserade uppstädningen. Modellen är Qwen3-1.7B (Q4_K_M GGUF, ungefär 1,28 GB) som körs genom llama.cpp med Metal. Den använder greedy sampling med tänkande avstängt, ett tak på 64 tokens och en deadline på 2 sekunder. Varje fel faller tillbaka till regelbaserad uppstädning.

Ett trohetsskydd kontrollerar LLM-utdatan innan den används: den måste behålla minst hälften av förekomsterna av orden i indatan, inte överstiga dubbla antalet ord i indatan plus fyra, inte innehålla någon mening eller fyraordsfras som upprepas tre gånger eller mer, och inte vara tom. Annars kastas LLM-utdatan.