Az automatikus felismerés téved: rögzítsd a nyelved
A diktálás rossz nyelven landol? Az automatikus felismerés tervezésénél fogva kapkod a kétnyelvű beszédnél. Rögzítsd a nyelved egyszer, és úgy marad.
Ha egynél több nyelven diktálsz, láttad már a hibát. Mondasz egy mondatot románul, és az átirat fonetikusan elkutyult angolként jön vissza — valódi szavak, csak egyik sem a tiéd. Vagy mondat közben vált: az első fele a jó nyelven, a második valamin, amire a modell szerint átváltottál. Vagy — ez a személyes kedvencem — vegyes ábécéjű leves: latin karakterek, közéjük szórva néhány cirill, mintha a modell betűnként fedezte volna a fogadásait.
Ez nem egyetlen termékről szóló panasz. Ez az automatikus nyelvfelismerés kiszámítható hibamódja, beleértve a Keebye angolra hangolt alapértelmezését is. Azokat sújtja, akik akcentussal beszélnek angolul, és mindenkit, aki napközben nyelvet vált. Egy kétnyelvű fejlesztő, akinek a Slackje lengyel, a commit üzenetei pedig angolok, pontosan azokat a vegyes jeleket adja az automatikus felismerésnek, amelyeket a legrosszabbul kezel.
A panasz második fele csendesebb, de ugyanolyan valós: amikor létezik nyelvi beállítás, gyakran el van temetve. Három menüvel mélyebben, egy motorválasztó mögött, egy olyan kapcsolón túl, amelynek a neve meg sem említi a nyelvet. Ha napi húszszor váltasz nyelvet, egy eltemetett beállítás funkcionálisan nem beállítás.
El akarom magyarázni, miért történik a kapkodás — a saját termékem háborús történetén keresztül, mert a Keebye-ban is megvolt ez a probléma, mielőtt megvolt rá a megoldás —, aztán megmutatom, hogyan néz ki egy tényleges megoldás.
Miért kapkod az automatikus felismerés (és miért nem pont hiba ez)
Íme az őszinte mechanika. A modern beszédmodellek csendben, a dekódolás részeként végzik a nyelvazonosítást. A modell hallgat, kialakít egy belső tippet arról, milyen nyelvet hall, és e tipp ellenében dekódol. Ha a hang tiszta, akcentusmentes és egynyelvű, ez olyan jól működik, hogy soha nem gondolsz rá.
Most etesd valódi beszéddel. Egy akcentus egy másik nyelv fonémái felé tolja a magánhangzókat. Egy mondatban három angol jövevényszó van — minden technikai beszélgetésben van. A háttérben ott egy gyerek, vagy épp laptopmikrofonon beszélsz. Mindegyik kevésbé magabiztossá teszi a modell belső nyelvi tippjét, egy kevéssé magabiztos tipp pedig képkockák között átbillenhet. Amikor átbillen, vele billen a dekódolás, és olyan átiratot kapsz, amely gondolat közben nyelvet vált.
A lényeg: a legtöbb eszközben semmi nem horgonyozza le ezt a tippet. A modell dönt, csendben, megnyilatkozásonként, és neked nincs felülbírálásod. Ez nem hiba egyetlen appban sem — ez maga a csendes automatikus felismerés. Egy modell, amely olyan megítélési döntést hoz, amelyet nem tudsz korrigálni.
Ezt bensőségesen ismerem, mert a Keebye alapértelmezett motorjának pontosan ilyen a természete. A Parakeet, az angolra hangolt alapértelmezésünk, a dekódolási rétegen figyelmen kívül hagy minden nyelvi utalást — nem tudod megmondani neki, mit fogsz mondani. Tiszta angolon kiváló, ezért is az alapértelmezés. Nem tiszta hangon ugyanúgy kapkodhat a nyelvek között, mint a kategóriában minden más. Először a saját termékemről mondom ezt el, mert a megoldásnak csak akkor van értelme, ha elfogadod, hogy a probléma az architektúrában lakik, nem valamelyik versenytárs hanyagságában.
Mit csinál valójában a nyelv rögzítése?
A megoldás az, hogy nem kérjük meg a modellt a találgatásra. A Keebye-ban van egy második, eszközön futó motor — az NVIDIA Canary 1B v2-je, int8-ra kvantálva —, amely pontosan 25 nyelvet fed le: bolgár, horvát, cseh, dán, holland, angol, észt, finn, francia, német, görög, magyar, olasz, lett, litván, máltai, lengyel, portugál, román, szlovák, szlovén, spanyol, svéd, orosz és ukrán. Az alapértelmezett motorral ellentétben a Canary elfogad nyelvi utasítást, és tiszteletben is tartja.
A Keebye ezt rögzítésként teszi elérhetővé: explicit nyelvi beállítás, amelyet minden megnyilatkozáshoz átadunk a Canary motornak. Rögzítsd a románt, és a dekóder románt használ ahelyett, hogy automatikus nyelvválasztást hozna. A felismerés továbbra is tévedhet, különösen jövevényszavak és zajos hang körül, de a nyelv megválasztása már nem ellenőrizetlen tipp.
A beállítást élőben, diktálásonként olvassuk. Változtasd meg, és a következő nyomva tartás már az új nyelvet használja, appújraindítás nélkül. Ez többet számít, mint amennyire hangzik: egy nyelvi vezérlő sokkal hasznosabb, ha a váltása nem szakítja meg a munkát.
És mivel a Canary is az eszközön fut, mint a Keebye-ban minden más, a rögzítés nem kerül az adatvédelmi történetedbe. A modell nagyjából 1,3 GB, egyszer letöltendő; utána a románod, a lengyeled, az ukránod sosem hagyja el a gépet. (Hogy egyáltalán miért tartjuk fontosnak a helyi többnyelvű diktálást, arról külön írás szól — a fejlesztői diktálás nem lehet csak angol. Ez itt annak a gyakorlati folytatása: az az írás a nyelvek mellett érvel, ez pedig arról szól, hogyan lesznek valóban használhatók.)
Két kattintás, nem három menünyi mélység
Az a rögzítés, amelyet nem érsz el, olyan rögzítés, amelyet nem fogsz használni, ezért a váltás a tálcán él. A Keebye menüsor-ikonjában van egy „Dictation Language” menü egy 11 nyelvből álló, gondozott rövidlistával — angol, román, francia, német, spanyol, olasz, portugál, holland, lengyel, orosz, ukrán. Két kattintás bármelyik appból: kattints a tálcára, kattints a nyelvre. Nem nyitod meg a Beállításokat, nem hagyod el az ablakot, amelyben dolgoztál.
A teljes, 25 nyelvű lista a Beállításokban lakik, a rövidlistán kívüli nyelvekhez. De a rövidlista lefedi a legtöbb kétnyelvű munka napi valóságát: az egyik nyelven írsz a csapatodnak, a másikon egy ügyfélnek vagy egy AI-agentnek, és a váltásnak nem szabad semmibe kerülnie.
Van még egy lehetőség, amelyről érdemes tudni, mert néhányaknál teljesen megváltoztatja a rögzítés használatát: az angolra fordítás kapcsolója. A saját nyelveden beszélsz, a kurzornál angol landol — ugyanaz a motor, ugyanaz az eszközön futó végrehajtás. Ha a belső monológod románul megy, de a kimenetnek angolnak kell lennie (commit üzenetek, promptok egy kódolóügynöknek, válaszok egy nemzetközi csapatnak), ez összeomlasztja azt a fordítási lépést, amelyet a fejedben csináltál. Többet használom, mint vártam.
Mibe kerül a rögzítés
25 nyelv az 25 nyelv. A felhős diktálóeszközök jóval többet sorolnak fel, mert a hang elküldése egy nagy, szerveroldali modellhez az olcsó módja a nyelvek hozzáadásának. Ez az eszközön futó megoldás valódi átváltása: egy modell, amely elfér a Maceden, kevesebbet fed le a világból, mint egy modell, amely megtölt egy adatközpontot. Ha a nyelved nincs a 25 között, a Keebye többnyelvű motorja ma nem fed le téged, és ezt inkább kimondom, mint hogy felkerekítsem.
A rögzítés az rögzítés. Ez a determinizmus másik oldala, és világos akarok lenni: ha rögzíted a románt, aztán angolul szólalsz meg, a Keebye hűségesen félre fogja dekódolni az angolodat románként, amíg át nem váltasz. A motor pontosan azt csinálja, amit mondtál neki. Az automatikus felismerés egész vonzereje az volt, hogy sosem kell ezzel foglalkoznod — a rögzítés ezt a kényelmet cseréli kiszámíthatóságra. Az én tapasztalatom szerint megéri a csere, mert egy rossz tipp, amelyet nem tudsz kontrollálni, rosszabb, mint egy rossz beállítás, amelyet két kattintással javítasz. De ez csere, nem ingyenebéd.
A tálcán 11 nyelv van, nem 25. Ha a napi párosodban mondjuk finn vagy görög is szerepel, annak az egyik feléhez a Beállításokon mész át. A gondozás azt jelenti, hogy valakinek a nyelve nem került be a gyorsmenübe.
Hol hagyja ez a panaszt
A kategóriaszintű panasz — „a diktálásom folyton rossz nyelven jön ki” — valójában a csendes döntésekről szóló panasz. A modell tippelt, a tipp rossz volt, és nem volt mód mást mondani neki. Minden megoldás, amely megtartja a találgatást (jobb felismerés, hosszabb hangablakok, konfidenciaküszöbök), csak ritkábbá és furcsábbá teszi a hibát. Az a megoldás, amely valóban véget vet a panasznak, visszaadja a döntést a felhasználónak.
Ha ezt jelenleg egy másik eszközzel éled meg, az összehasonlító oldalaink őszinték arról, melyik eszköz hová illik — a Keebye vs Superwhisper és a Keebye vs Wispr Flow is kitér a nyelvi kérdésre a többi mellett. Magának a rögzítésnek a kipróbálásához indítsd el lent az ingyenes próbaidőszakot, játszd újra a cikk elejéről azt a román vagy lengyel mondatot, és nézd meg, mennyi jött a kapkodásból egy ellenőrizetlen tippből, és mennyi az akcentusodból.
Rögzítsd azt a nyelvet, amelyet valóban használsz
Indítsd el az ingyenes próbaidőszakot, és játszd újra azt az anyanyelvi választ, amelyet az automatikus felismerés korábban összekutyult.
Start free trialEarly access: we'll email you the moment the macOS build is ready — your 14 days start when you first sign in from the app.
Olvass tovább
Diktáld a kódreview-idat a saját nyelveden
A kód angol. A review-megjegyzéseidnek nem kell annak lenniük. Hogyan diktálj visszajelzést 25 nyelv egyikén, eszközön, és miért számít a nyelv rögzítése.
Promptok diktálása párhuzamos agenteknek, lane-ről lane-re
Ha két-három kódolóügynök fut egyszerre, a promptolás lesz a szűk keresztmetszet. Munkafolyamat a párhuzamos lane-ek etetésére a sajátod elhagyása nélkül.
A Claude Code vezetése hanggal: építés párhuzamos lane-ekben
Az AI-kódügynökök miatt a gépelés lett a szűk keresztmetszet. Munkafolyamat promptok, review-k és irányváltások diktálására párhuzamos ágakon, macOS-en.