Aller au contenu de la documentation
Keebye Docs

Nettoyage et dictionnaire

Ce qui arrive à votre transcription entre la reconnaissance vocale et l'insertion : le dictionnaire, le nettoyage à base de règles, les exceptions par app et le polissage optionnel par LLM local.

Chaque dictée passe par le même court pipeline, sur votre Mac. Rien ici n'utilise le réseau.

Le pipeline

  1. Reconnaissance vocale avec le moteur sélectionné.

  2. Remplacements du dictionnaire personnalisé, toujours appliqués.

  3. Nettoyage — à base de règles, ou par le LLM local si vous l'avez activé — uniquement quand l'amélioration est active pour l'app au premier plan.

  4. Insertion par collage ou par frappe.

Nettoyage à base de règles

Voici l'ensemble complet des règles. Le nettoyage ne retire ni les faux départs ni le mot "like".

  • Retire les "um", "uh", "erm" isolés et le "you know" en deux mots, uniquement sur des tokens entiers.
  • Fusionne les mots répétés à la suite : "the the" devient "the".
  • Réduit les espaces multiples.
  • Met la première lettre en majuscule.
  • Ajoute un point si le texte finit par une lettre ou un chiffre.

Exceptions par app

Settings › Enhancement › "Clean up transcripts by default" est activé. Les exceptions sont associées à l'identifiant de bundle de l'app. "Add current app…" ajoute la dernière app non-Keebye que vous avez utilisée, avec l'inverse du réglage par défaut. Chaque entrée a une case à cocher et un bouton "Remove".

Dictionnaire personnalisé

Settings › Dictionary : "Replace spoken words with fixed spellings." Tapez ce que Keebye entend dans "heard as…" et l'orthographe voulue dans "write as…", puis appuyez sur Add (Entrée marche aussi). Remove supprime une entrée. L'état vide indique "No replacements yet."

  • Ne correspond qu'à des mots entiers, jamais à l'intérieur d'un mot plus long.
  • La correspondance ignore la casse ; le remplacement garde la casse que vous avez tapée.
  • Les clés peuvent faire plusieurs mots. La correspondance la plus longue gagne.
  • Appliqué à chaque dictée, que le nettoyage soit actif ou non pour l'app.

Polissage par LLM local (sur activation)

Keebye peut confier la transcription à un modèle de langue local au lieu du nettoyage à base de règles. Le modèle est Qwen3-1.7B (Q4_K_M GGUF, environ 1,28 GB), exécuté via llama.cpp avec Metal. Il utilise un échantillonnage glouton, sans thinking, avec un plafond de 64 tokens et un délai de 2 secondes. Toute défaillance retombe sur le nettoyage à base de règles.

Un garde-fou de fidélité contrôle la sortie du LLM avant qu'elle ne serve : elle doit garder au moins la moitié des occurrences de mots de l'entrée, ne pas dépasser le double du nombre de mots de l'entrée plus quatre, ne contenir aucune phrase ni groupe de quatre mots répété trois fois ou plus, et ne pas être vide. Sinon la sortie du LLM est jetée.