Ditando prompts para agentes paralelos, lane por lane
Ilustração

Ditando prompts para agentes paralelos, lane por lane

Rodar dois ou três agentes de código ao mesmo tempo transforma o prompt no gargalo. Um fluxo por voz para alimentar lanes paralelas sem sair da que você está.

Teodor Deleanu3 de setembro de 20268 min de leitura

Na primeira vez que você roda dois agentes de código lado a lado, alguma coisa parece fora de lugar, e leva um tempo até você conseguir nomear o quê. Cada agente é rápido. Cada um, sozinho, seria um ganho claro. Juntos, deveriam ser o dobro do ganho. Em vez disso, o dia parece mais fragmentado do que era com um só, e você termina a tarde com menos coisa pronta do que esperava.

O motivo não são os agentes. É o formato da entrada de que eles precisam. Um agente de código funciona com prosa: "divida o handler, mantenha a assinatura pública, adicione um teste para o caminho de timeout." Prosa é barata de pensar e cara de entregar, porque entregar significa colocar as suas mãos e a sua atenção na janela certa no momento certo. Com um agente, esse momento se encaixa no seu ritmo natural. Com três, os momentos chegam quando eles querem, e cada um interrompe o que você estava no meio de fazer.

Este post é sobre o problema da entrega, não sobre o problema do pensamento. É um fluxo de trabalho prático para ditar prompts em lanes paralelas de agentes no Mac, com os limites honestos incluídos. Se você não leu Dirigindo o Claude Code com a sua voz, aquele post cobre o básico de uma lane só; este aqui presume que você já roda mais de uma.

Por que lanes paralelas punem especificamente a digitação

Um prompt tem três custos: formular, entregar e se recuperar depois. Formular é inevitável e acontece quase todo dentro da sua cabeça. Entregar, quando você digita, significa mudar o foco para o terminal do agente, achar a linha de entrada, digitar de quarenta a oitenta palavras e apertar enter. Se recuperar significa voltar para aquilo que você estava fazendo antes de o agente perguntar.

Com uma lane só, o custo de entrega é pequeno porque você provavelmente já estava olhando aquele terminal. Com lanes paralelas, você quase nunca está. A lane um faz uma pergunta enquanto você lê o diff da lane dois. A pergunta é fácil; a resposta é uma frase. Mas responder significa sair do diff, e quando você volta, relê as últimas trinta linhas para achar onde estava.

Multiplique isso por cada redirecionamento, cada "sim, continue", cada "não, o outro arquivo", e o custo se acumula. Lanes paralelas não falham porque os agentes são lentos. Elas falham porque você se torna o barramento de mensagens, e um barramento de mensagens que precisa se mover fisicamente entre janelas tem uma latência terrível.

A voz elimina a maior parte do custo de entrega. Você mantém os olhos no diff, segura uma tecla, fala a frase, solta. As palavras caem no campo de entrada do agente. Você nunca saiu.

A configuração que funciona

Aqui está a configuração, deliberadamente sem graça.

Uma hotkey, não uma janela. O Keebye vive na barra de menus e escuta uma hotkey de segurar-ou-tocar (⌘ direita por padrão; Fn e ⌥ direita são as outras opções, e Esc cancela um ditado em andamento). Não há janela de app para abrir nem modo para entrar. Segure, fale, solte. Isso importa mais do que parece: uma ferramenta de ditado que precisa da própria janela é só mais uma lane.

Inserção no campo em foco. A transcrição é inserida onde o seu cursor está. Por padrão isso é uma colagem, com dosagem sensível ao terminal para que um prompt longo não atropele um shell. Se você roda agentes dentro do tmux ou sobre SSH, onde colar se comporta mal, existe um modo de digitação opt-in que injeta o texto como toques de tecla Unicode; ditado que sobrevive ao terminal explica quando virar essa chave.

Em lote, não em streaming. O Keebye transcreve quando você solta a tecla, como uma única fala. Você não vai ver as palavras aparecendo enquanto fala. Para prompts, essa é a troca certa: você quer que a frase inteira caia de uma vez, já limpa, em vez de vê-la se materializar palavra por palavra enquanto a entrada do agente já tem meio pensamento dentro.

Tudo on-device. A transcrição roda localmente (um modelo padrão ajustado para inglês, ou um modelo de 25 idiomas se você optar por ele). Depois do download do modelo, funciona com o Wi-Fi desligado. Para prompts de agente isso é menos teatro de privacidade e mais latência: não há ida e volta pela rede, então um prompt curto está pronto quase no instante em que você solta a tecla.

Um ritmo de troca de lanes

O fluxo que acabou pegando tem três hábitos.

Os olhos ficam na lane que exige julgamento. A qualquer momento, uma lane é onde a sua atenção pertence, normalmente um diff ou a saída de um teste. É essa a lane que você lê. As outras só recebem instruções verbais curtas. Quando a lane dois precisa de uma decisão, você dá uma olhada, clica no campo dela, segura a tecla, fala a decisão, solta e clica de volta. O clique é o único custo mecânico; a frase em si é de graça.

Prompts são falados como frases completas. Agentes lidam melhor com frases completas do que com fragmentos telegráficos, e o ditado produz frases completas naturalmente, porque é assim que as pessoas falam. "Reverta a mudança de schema mas mantenha o rename da API, depois rode a migração de novo e me mostre a saída" é um bom prompt falado. É um prompt tedioso de digitar.

Os vícios de linguagem saem; o sentido não. A limpeza do Keebye é baseada em regras por padrão: ela remove o "hum", o "é", a palavra repetida, e deixa as suas palavras em paz. Existe um polimento opcional por LLM local para frases mais arrumadas, apoiado por uma proteção de fidelidade que recua para a transcrição literal quando a versão polida mostra perda severa de tokens, expansão ou repetição. Essa proteção é uma heurística, não uma checagem semântica: ela não verifica se o texto polido preservou o seu sentido ou uma negação. Para instruir um agente, a maioria das pessoas deixa o polimento desligado; uma transcrição literal é exatamente o que você disse, e é isso que você quer que o agente execute.

Para o que a voz serve, lane por lane

Não é todo prompt que quer ser falado. Depois de alguns meses, a divisão é mais ou menos esta.

Redirecionamentos e continuações: sempre por voz. "Continue." "Não, a outra config." "Adicione um teste para o caso vazio e rode de novo." Esses são os prompts de maior volume numa sessão paralela e todos eles têm o tamanho de um sopro.

Comentários de revisão: quase sempre por voz. Ler um diff e narrar o que está errado nele é natural. "O loop de retry engole o erro, logue antes do sleep e limite as tentativas a cinco." O ditado captura isso na velocidade da fala enquanto os seus olhos ficam no código.

Briefings iniciais de tarefa: misto. Um briefing longo e estruturado, com caminhos de arquivo e restrições, ainda se beneficia da digitação, ou de ditar uma versão bruta e editar. A voz vai bem para a prosa; identificadores exatos saem mais fáceis digitados. O dicionário personalizado ajuda aqui: adicione os nomes de módulo do seu projeto e o jargão recorrente uma vez, e eles param de ser transcritos como a palavra inglesa mais próxima.

Qualquer coisa com código: digitada. Ditar uma regex é uma péssima experiência. Dite a instrução ("escreva uma regex que casa com o header de versão"), não o artefato.

Limites honestos

Alguns são do Keebye; alguns são da categoria.

Latência do primeiro ditado. O microfone aquece depois do primeiro ditado da sessão e mantém um pré-buffer de 500 ms a partir daí. O primeiríssimo segurar do dia pode pagar um custo de início de stream, e uma palavra falada antes de o buffer engatar pode ser cortada. Por que apps de ditado comem a sua primeira palavra cobre a mecânica.

Precisão em identificadores. Nomes de variável em snake case e siglas internas são onde qualquer modelo de fala sofre. O dicionário reduz isso, mas não elimina. Leia o prompt antes de apertar enter em qualquer coisa destrutiva.

Campos seguros. O Keebye recusa inserir em campos de senha e de entrada segura. Isso é intencional e ocasionalmente inconveniente quando um prompt de terminal está pedindo uma passphrase.

Sem comandos de voz. Não existe vocabulário de "nova linha" ou "selecionar tudo". O Keebye é uma ferramenta de ditado, não uma camada de controle por voz. Navegar entre lanes continua sendo um clique ou um atalho de teclado.

Só macOS. O build para Windows não foi lançado.

Para onde ir agora

Se os seus agentes vivem quase todos em um editor, os guias do Cursor e do Claude Code têm as especificidades de cada ferramenta. Se você está escolhendo entre apps de ditado para esse fluxo, Keebye vs Superwhisper é uma comparação honesta que inclui onde o Superwhisper serve melhor.

A versão curta de tudo isso: agentes paralelos não precisam que você digite mais rápido. Eles precisam que você pare de ser o salto mais lento entre eles. Mantenha os olhos na lane que exige julgamento e fale com as outras.

Alimente cada lane de onde você está

Comece o teste grátis e dite o próximo prompt no agente que estiver esperando — sem sair do diff que você está lendo.

Start free trial

Early access: we'll email you the moment the macOS build is ready — your 14 days start when you first sign in from the app.

Continue lendo