Pulizia e dizionario
Cosa succede alla trascrizione tra il riconoscimento vocale e l'inserimento: il dizionario, la pulizia basata su regole, le eccezioni per app e la rifinitura opzionale con LLM locale.
Ogni dettatura passa dalla stessa breve catena sul tuo Mac. Niente di tutto questo usa la rete.
La catena
Riconoscimento vocale con il motore selezionato.
Sostituzioni del dizionario personalizzato, applicate sempre.
Pulizia — basata su regole, o con l'LLM locale se l'hai attivato — solo quando la pulizia è attiva per l'app in primo piano.
Inserimento con incolla o digitazione.
Pulizia basata su regole
Questo è l'insieme completo delle regole. La pulizia non rimuove le false partenze né la parola "like".
- Rimuove "um", "uh" e "erm" isolati e il "you know" di due parole, solo come token interi.
- Riduce le ripetizioni immediate di una parola, così "the the" diventa "the".
- Riduce gli spazi bianchi.
- Mette l'iniziale in maiuscolo.
- Aggiunge un punto se il testo finisce con una lettera o una cifra.
Eccezioni per app
Settings › Enhancement › "Clean up transcripts by default" è attivo. Le eccezioni sono indicizzate per bundle id dell'app. "Add current app…" aggiunge l'ultima app diversa da Keebye che hai usato, con il valore opposto al predefinito. Ogni voce ha una casella e un pulsante "Remove".
Dizionario personalizzato
Settings › Dictionary: "Replace spoken words with fixed spellings." Scrivi quello che Keebye sente in "heard as…" e la grafia che vuoi in "write as…", poi premi Add (funziona anche Invio). Remove elimina una voce. Lo stato vuoto dice "No replacements yet."
- Corrisponde solo a parole intere, mai dentro una parola più lunga.
- La corrispondenza ignora maiuscole e minuscole; la sostituzione mantiene le maiuscole che hai scritto.
- Le chiavi possono essere di più parole. Vince la corrispondenza più lunga.
- Si applica a ogni dettatura, che la pulizia sia attiva o no per quell'app.
Rifinitura con LLM locale (opzionale)
Keebye può passare la trascrizione a un modello linguistico locale invece della pulizia basata su regole. Il modello è Qwen3-1.7B (Q4_K_M GGUF, circa 1,28 GB) eseguito con llama.cpp e Metal. Usa campionamento greedy con il ragionamento disattivato, un limite di 64 token e una scadenza di 2 secondi. Qualsiasi errore ricade sulla pulizia basata su regole.
Un controllo di fedeltà verifica l'output dell'LLM prima di usarlo: deve conservare almeno metà delle occorrenze di parola dell'input, non superare il doppio del numero di parole dell'input più quattro, non contenere nessuna frase o sequenza di quattro parole ripetuta tre volte o più, e non essere vuoto. Altrimenti l'output dell'LLM viene scartato.