Automātiskā noteikšana kļūdās: piefiksē savu valodu
Diktējums atkal ir nepareizā valodā? Automātiskā noteikšana divvalodu runā svārstās pēc būtības. Piefiksē valodu vienreiz, un tā paliek piefiksēta.
Ja diktē vairāk nekā vienā valodā, tu šo kļūmi esi redzējis. Tu pasaki teikumu latviski, un transkripts atgriežas kā fonētiski sakropļota angļu valoda — īsti vārdi, tikai neviens no taviem. Vai arī tas apmetas teikuma vidū: pirmā puse pareizajā valodā, otrā puse kaut kur, uz kurieni modelis nolēma, ka esi pārslēdzies. Vai, mans personīgais favorīts, jaukta alfabēta zupa — latīņu rakstzīmes ar dažām kirilicas starpā, it kā modelis riskus sadalītu burtu pa burtam.
Šī nav sūdzība par vienu produktu. Tas ir paredzams automātiskās valodas noteikšanas kļūmes veids, ieskaitot Keebye angļu valodai pielāgoto noklusējumu. Tas skar runātājus ar akcentētu angļu valodu un ikvienu, kas dienas gaitā pārslēdzas starp valodām. Divvalodīgs izstrādātājs, kura Slack ir poļu valodā un kura komitu ziņas ir angliski, dod automātiskajai noteikšanai tieši tos jauktos signālus, ar kuriem tā tiek galā vissliktāk.
Sūdzības otra puse ir klusāka, bet tikpat īsta: kad valodas iestatījums tomēr eksistē, tas bieži ir aprakts. Trīs izvēlnes dziļumā, aiz dzinēja izvēlnes, aiz slēdža, kura nosaukumā valoda vispār nav pieminēta. Ja pārslēdz valodas divdesmit reizes dienā, aprakts iestatījums funkcionāli nav nekāds iestatījums.
Gribu paskaidrot, kāpēc šī svārstīšanās notiek — izmantojot sava paša produkta kara stāstu, jo Keebye šī problēma bija, pirms tam bija risinājums —, un tad parādīt, kā izskatās īsts risinājums.
Kāpēc automātiskā noteikšana svārstās (un kāpēc tā nav gluži kļūda)
Lūk, godīgā mehānika. Mūsdienu runas modeļi valodas identifikāciju veic klusi, kā daļu no dekodēšanas. Modelis klausās, izveido iekšēju minējumu par to, kādu valodu dzird, un dekodē pret šo minējumu. Kad audio ir tīrs, bez akcenta un vienvalodīgs, tas strādā tik labi, ka tu par to nekad nepadomā.
Tagad padod tam īstu runu. Akcents pabīda patskaņus pret citas valodas fonēmām. Teikumā ir trīs angļu aizguvumi — tādi ir katrā tehniskā sarunā. Fonā ir bērns, vai arī tu esi pie klēpjdatora mikrofona. Katrs no tiem padara modeļa iekšējo valodas minējumu mazāk pārliecinātu, un mazpārliecināts minējums starp kadriem var apmesties. Kad apmetas tas, apmetas arī dekodēšana, un tu iegūsti transkriptu, kas domas vidū maina valodu.
Būtiskākais: vairumā rīku nav nekā, kas šo minējumu noenkurotu. Modelis izlemj, klusi, katram izteikumam, un tev nav iespējas to labot. Tā nav kļūda kādā vienā lietotnē — tā ir klusā automātiskā noteikšana. Modelis pieņem spriedumu, ko tu nevari izlabot.
Es to zinu tuvu, jo Keebye noklusējuma dzinējam ir tieši šī īpašība. Parakeet, mūsu angļu valodai pielāgotais noklusējums, dekodēšanas slānī ignorē jebkuru valodas norādi — tu nevari tam pateikt, ko gatavojies runāt. Skaidrā angļu valodā tas ir izcils, tāpēc tas ir noklusējums. Neskaidrā audio tas var svārstīties starp valodām tāpat kā viss pārējais šajā kategorijā. Es tev to vispirms stāstu par savu produktu, jo risinājums kļūst saprotams tikai tad, kad pieņem, ka problēma dzīvo arhitektūrā, nevis kāda konkurenta paviršībā.
Ko valodas piefiksēšana patiesībā dara?
Risinājums ir pārstāt lūgt modelim minēt. Keebye piedāvā otru uz ierīces darbojošos dzinēju — NVIDIA Canary 1B v2, kvantēts uz int8 —, kas aptver tieši 25 valodas: bulgāru, horvātu, čehu, dāņu, holandiešu, angļu, igauņu, somu, franču, vācu, grieķu, ungāru, itāļu, latviešu, lietuviešu, maltiešu, poļu, portugāļu, rumāņu, slovāku, slovēņu, spāņu, zviedru, krievu un ukraiņu. Atšķirībā no noklusējuma dzinēja Canary pieņem valodas instrukciju un to ievēro.
Keebye to atklāj kā piefiksējumu: skaidru valodas iestatījumu, kas katram izteikumam tiek padots Canary dzinējam. Piefiksē latviešu valodu, un dekodētājs izmanto latviešu valodu, nevis izdara automātisku valodas izvēli. Atpazīšana joprojām var būt nepareiza, īpaši ap aizguvumiem un trokšņainā audio, bet valodas izvēle vairs nav nepārbaudīts minējums.
Iestatījums tiek nolasīts dzīvi, katrai diktēšanai. Nomaini to, un nākamā turi-un-runā reize izmanto jauno valodu bez lietotnes pārstartēšanas. Tas ir svarīgāk, nekā izklausās: valodas vadīkla ir daudz noderīgāka, kad tās pārslēgšana nepārtrauc darbu.
Un, tā kā Canary darbojas uz ierīces tāpat kā viss pārējais Keebye, piefiksējums nemaksā tev privātuma stāstu. Modelis ir ap 1,3 GB, lejupielādēts vienreiz; pēc tam tava latviešu, tava poļu, tava ukraiņu valoda nekad nepamet datoru. (Kāpēc mēs vispār uzskatām, ka lokāla daudzvalodu diktēšana ir svarīga, ir atsevišķs raksts — diktēšanai izstrādātājiem nevajadzētu būt tikai angliskai. Šis ir tā praktiskais turpinājums: tas raksts argumentē par valodām, šis ir par to, kā tās padarīt patiešām lietojamas.)
Divi klikšķi, nevis trīs izvēlnes dziļumā
Piefiksējums, kuram nevar aizsniegties, ir piefiksējums, ko nelietosi, tāpēc pārslēgs dzīvo izvēļņu joslā. Keebye izvēļņu joslas ikonai ir izvēlne „Dictation Language” ar kuratētu 11 valodu īso sarakstu — angļu, rumāņu, franču, vācu, spāņu, itāļu, portugāļu, holandiešu, poļu, krievu, ukraiņu. Divi klikšķi no jebkuras lietotnes: klikšķini uz ikonas, klikšķini uz valodas. Tu neatver iestatījumus un nepamet logu, kurā strādāji.
Pilnais 25 valodu saraksts dzīvo iestatījumos tām valodām, kas ir ārpus īsā saraksta. Bet īsais saraksts nosedz vairuma divvalodu darba ikdienas realitāti: tu raksti savai komandai vienā valodā un klientam vai AI aģentam citā, un tev vajag, lai pārslēgšanās neko nemaksātu.
Ir vēl viena iespēja, ko vērts zināt, jo dažiem tā pilnībā maina piefiksējuma lietojumu: slēdzis tulkošanai uz angļu valodu. Runā savā valodā, un pie kursora nonāk angļu teksts — tas pats dzinējs, tā pati izpilde uz ierīces. Ja tavs iekšējais monologs rit latviski, bet izvadei jābūt angliski (komitu ziņas, prompti kodēšanas aģentam, atbildes starptautiskai komandai), tas sabrucina tulkošanas soli, ko līdz šim veici galvā. Es to lietoju vairāk, nekā gaidīju.
Ko piefiksējums tev maksā
25 valodas ir 25 valodas. Mākoņa diktēšanas rīki uzskaita daudz vairāk, jo audio sūtīšana uz lielu servera puses modeli ir lētais veids, kā pievienot valodas. Tas ir īstais kompromiss darbam uz ierīces: modelis, kas ietilpst tavā Mac datorā, aptver mazāk pasaules nekā modelis, kas aizpilda datu centru. Ja tavas valodas šo 25 sarakstā nav, Keebye daudzvalodu dzinējs tevi šodien nenosedz, un es to labāk pasaku, nekā noapaļoju uz augšu.
Piefiksējums nozīmē piefiksējumu. Šī ir determinisma otra puse, un gribu par to runāt tieši: ja piefiksē latviešu valodu un tad runā angliski, Keebye uzticami nepareizi dekodēs tavu angļu valodu kā latviešu, līdz pārslēgsi. Dzinējs dara tieši to, ko tu tam liki. Automātiskās noteikšanas viss pievilcīgums bija tajā, ka par šo nekad nebūtu jādomā — piefiksējums maina šo ērtumu pret paredzamību. Manā pieredzē maiņa ir tā vērta, jo nepareizs minējums, ko nevari kontrolēt, ir sliktāks par nepareizu iestatījumu, ko divos klikšķos vari salabot. Bet tā ir maiņa, nevis bezmaksas ieguvums.
Īsais saraksts izvēļņu joslā ir 11 valodas, nevis 25. Ja tavā ikdienas pārī ir, teiksim, somu vai grieķu valoda, vienai pusei tev jāiet caur iestatījumiem. Kuratēšana nozīmē, ka kāda cilvēka valoda ātrajā izvēlnē netika.
Kur tas atstāj sūdzību
Kategorijas līmeņa sūdzība — „mans diktējums visu laiku iznāk nepareizā valodā” — patiesībā ir sūdzība par klusiem lēmumiem. Modelis minēja, minējums bija nepareizs, un nebija veida, kā tam pateikt ko citu. Katrs risinājums, kas minēšanu saglabā (labāka noteikšana, garāki audio logi, pārliecības sliekšņi), padara kļūmi tikai retāku un dīvaināku. Risinājums, kas sūdzību patiešām izbeidz, ir atdot lēmumu lietotājam.
Ja pašlaik to piedzīvo ar citu rīku, mūsu salīdzinājumu lapas godīgi runā par to, kur katrs rīks der — Keebye vs Superwhisper un Keebye vs Wispr Flow abās starp citiem jautājumiem aplūkots arī valodas jautājums. Lai izmēģinātu pašu piefiksējumu, sāc bezmaksas izmēģinājumu zemāk, atkārto to latviešu vai poļu teikumu no šī raksta sākuma un paskaties, cik daudz no svārstīšanās nāca no nepārbaudīta minējuma, nevis no tava akcenta.
Piefiksē to valodu, ko tiešām lieto
Sāc bezmaksas izmēģinājumu un atkārto vienu atbildi dzimtajā valodā, ko automātiskā noteikšana iepriekš sakropļoja.
Start free trialEarly access: we'll email you the moment the macOS build is ready — your 14 days start when you first sign in from the app.
Lasīt tālāk
Diktē koda pārskatus savā valodā
Kods ir angliski. Taviem pārskatu komentāriem tā nav jābūt. Kā uz ierīces diktēt pārskatus 25 valodās un kāpēc valodas piefiksēšana ir svarīga.
Promptu diktēšana paralēliem aģentiem, joslu pa joslai
Divi trīs kodēšanas aģenti vienlaikus padara promptēšanu par šauro vietu. Balss darbplūsma paralēlo joslu barošanai, nepametot to, kurā esi.
Claude Code vadīšana ar balsi: būvēšana paralēlās joslās
AI kodēšanas aģenti padarīja rakstīšanu par šauro vietu. Praktiska darbplūsma promptu, pārskatu un pārvirzīšanu diktēšanai paralēlās aģentu joslās macOS vidē.