Ditado por voz para programadores (2026): Claude Code, Cursor, VS Code e o terminal
Antes de instalar qualquer coisa: a ferramenta que você já usa provavelmente tem ditado dentro dela. O Claude Code lançou o /voice na primavera, o Cursor tem um microfone na caixa de chat desde outubro de 2025, e o VS Code dita dentro do editor há mais tempo ainda. Tudo o que está nesta página foi lido em documentação oficial, changelogs e registros de pacotes em 27 de agosto de 2026, incluindo as condições que os guias escritos por fabricantes de ditado deixam de fora, e são várias.
O motivo para acrescentar uma ferramenta paga não é que as nativas sejam ruins. É que cada uma cobre exatamente uma janela. Se você circula entre terminal, editor, navegador e Slack, acaba querendo um atalho só que funcione em todos, e é isso que se paga.
Para um atalho só em todo lugar, o Wispr Flow é o que indicamos para a maioria dos programadores. Se o código não pode sair da sua máquina, o Handy faz o mesmo serviço de graça e nunca manda áudio para lugar nenhum.
- Claude Code: digite
/voice. Já vem embutido, não gasta tokens e exige login na Claude.ai. - Cursor: segure
Ctrl+Mna entrada do chat. Embutido desde o Cursor 2.0. - VS Code e Copilot Chat:
Ctrl+Ipara o chat,Ctrl+Alt+Vpara ditar dentro do editor. O reconhecimento roda na sua máquina. - Warp: ligue a voz em Settings, Agents, Warp Agent, Voice.
- Tudo de uma vez, inclusive o terminal: uma camada que vale para o sistema todo, como Wispr Flow, Superwhisper ou Handy.
- Código que você não pode mandar para lugar nenhum: Handy (grátis, MIT), VoiceInk em Apple Silicon, ou a extensão VS Code Speech.
- Linux: Voicy para um app comercial, Handy para um gratuito.
- Usar um editor sem encostar no teclado: Talon mais Cursorless. Grátis, e um esporte completamente diferente.
Sob a expressão "programar por voz" existem duas tarefas diferentes
Quase toda discussão sobre o tema nasce de confundir as duas.
Ditar a intenção para um agente. Você diz o que quer, a prosa cai numa caixa de prompt, o modelo escreve o código. Nada muda no seu editor. É isso que os recursos nativos fazem, é isso que um app de ditado faz, e para a maioria de quem lê isto aqui é a tarefa inteira. Tempo de configuração: cerca de um minuto.
Conduzir o editor por voz. Você emite comandos estruturados que movem o cursor, selecionam um token, apagam um argumento, renomeiam um símbolo. Nada de digitação em ponto algum do ciclo. Isso é Talon e Cursorless, é uma habilidade que se aprende, não um app que se instala, e quem dominou fez isso quase sempre porque digitar começou a doer.
A primeira tarefa ficou fácil em 2026. A segunda é possível desde mais ou menos 2018 e continua difícil. Se você veio parar aqui porque os seus pulsos doem, pule para a seção do Talon, porque um app de ditado não vai resolver o seu problema.
Por que isso passou a fazer sentido agora
Um prompt para um agente de código não é uma linha de código. São duzentas palavras de prosa descrevendo o que você quer, quais arquivos estão envolvidos, o que você já tentou e quais são as restrições. Prosa é exatamente aquilo em que a fala é boa e exatamente aquilo que é lento de digitar.
Os números que se citam sobre isso vêm de um estudo de 2016 de Ruan, Wobbrock, Liou, Ng e Landay (arXiv:1608.07323). Num iPhone 6 Plus, a entrada por fala em inglês rendeu 153 palavras por minuto contra 52 do teclado de tela, cerca de três vezes mais rápido, com o mandarim em 123 contra 43. Bom saber antes de repetir o número: aquilo era digitação com os polegares, no celular. A comparação que interessa a você é com um teclado físico, e o maior estudo desse caso, o de Dhakal e colegas na CHI 2018, com 168.000 participantes e 136 milhões de toques, também chegou a uma média de 52 palavras por minuto, com os 5% do topo acima de 80.
Então, para quem digita na média, a diferença é mesmo de três para um. Se você digita a 100 palavras por minuto, a diferença cai para perto de 1,5, e o argumento da voz deixa de ser velocidade. O mesmo estudo de 2016 achou que a fala deixava um pouco mais de erros não corrigidos no texto final, 1,30 por cento contra 0,79 por cento, o que pesa mais quando você dita um caminho de arquivo do que quando dita uma frase.
A versão honesta do discurso: o ditado não faz de você um programador mais rápido. Ele torna barato escrever prompts longos, então você escreve a versão de três frases em vez da de seis palavras, e o agente adivinha menos.
Panorama rápido
| Ferramenta | O que cobre | Preço conferido em 27 ago 2026 | Onde o áudio é processado |
|---|---|---|---|
Claude Code /voice | O prompt do Claude Code, no terminal e na extensão do VS Code | Grátis com um plano Claude.ai, sem custo de tokens | Servidores da Anthropic |
| Voz do Cursor | Só a entrada de chat do Cursor | Incluída no Cursor | Não documentado |
| VS Code Speech | Copilot Chat e o editor do VS Code | Grátis | Na sua máquina |
| Voz do Warp | Os campos de entrada do Warp e o agente dele | Incluída no Warp | Serviço do Wispr Flow |
| Wispr Flow | Todo app no Mac, Windows, iPhone, Android | Grátis 2.000 palavras/semana; Pro $15/mês, $12/mês no anual | Nuvem |
| Superwhisper | Todo app no Mac, Windows, iOS | Plano gratuito, permanente; Pro $8.49/mês | Modelos locais ou nuvem, você escolhe |
| Handy | Todo app no Mac, Windows, Linux | Grátis, licença MIT | Na sua máquina, sempre |
| VoiceInk | Todo app em Macs com Apple Silicon | $29 / $49 / $69 pagamento único | Na sua máquina por padrão |
| Voicy | Todo app no Mac, Windows, Linux, mais celular | 30 minutos grátis; $8.49/mês; $260 vitalício | Nuvem (Groq) |
| Voibe | Todo app no Mac e no Windows | $7.50/mês, $59/ano, $149 vitalício | Local no Apple Silicon, nuvem no Windows |
| Talon + Cursorless | A máquina inteira, e edição estrutural no VS Code | Grátis, Patreon para versões beta | Na sua máquina |
Claude Code: o comando /voice
É esse que atrai o tráfego de busca, e é também o descrito com menos precisão nos artigos que aparecem no topo, então aqui vai o quadro completo, tirado da documentação da Anthropic.
Como ligar. Digite /voice na CLI. A primeira execução faz um teste de microfone, e no macOS é aí que o seu terminal finalmente pede permissão de microfone. O rodapé do prompt confirma o estado:
Voice mode enabled (hold). Hold space to record. Dictation language: en (/config to change).
/voice hold, /voice tap e /voice off definem o modo direto. O ajuste sobrevive a reinícios, e dá para pular o comando inteiramente colocando isto no seu arquivo de configurações do usuário:
{ "voice": { "enabled": true, "mode": "tap" } }
O modo hold, que é o padrão, é apertar e segurar a barra de espaço para falar. Há uma manha que vale conhecer: o Claude Code detecta que a tecla está pressionada observando eventos de repetição vindos do terminal, então existe um pequeno aquecimento, o rodapé diz keep holding… antes de dizer listening…, e os primeiros espaços perdidos são limpos automaticamente. O texto aparece esmaecido enquanto você fala e é inserido no cursor quando você solta, ou seja, dá para digitar metade da frase, falar o resto e seguir em frente.
O modo tap elimina o aquecimento: toque no espaço uma vez para começar, toque de novo para parar, e o prompt se envia sozinho se a transcrição tiver ao menos três palavras. A gravação para sozinha depois de 15 segundos de silêncio ou dois minutos no total. O primeiro toque só funciona com a entrada vazia, então você ainda consegue digitar um espaço normalmente.
Dois ajustes que valem a pena mudar no primeiro dia. Acrescente "autoSubmit": true ao objeto voice se quiser que o modo hold envie ao soltar, em vez de esperar o Enter. E se o aquecimento da barra de espaço te irritar, remapeie a ação em ~/.claude/keybindings.json, porque uma combinação com modificador começa a gravar já no primeiro toque, sem aquecimento nenhum:
{ "bindings": [ { "context": "Chat", "bindings": { "meta+k": "voice:pushToTalk" } } ] }
O transcritor foi apontado para o nosso vocabulário, não para a fala em geral. A Anthropic diz que ele acerta termos como regex, OAuth, JSON e localhost, e que o nome do seu projeto atual e o nome do branch do git entram automaticamente como pistas de reconhecimento. Esse último detalhe é o tipo de coisa que decide se o ditado é usável, e nenhuma ferramenta de terceiros consegue fazer isso sem ler o seu repositório.
Vinte idiomas de ditado, definidos pelo /config ou pelo ajuste language: tcheco, dinamarquês, holandês, inglês, francês, alemão, grego, híndi, indonésio, italiano, japonês, coreano, norueguês, polonês, português, russo, espanhol, sueco, turco e ucraniano. Qualquer outro cai para o inglês, com um aviso ao ativar.
Agora as condições, que é onde os guias dos fabricantes emudecem. O ditado por voz exige:
- Uma conta Claude.ai. Ele não fica disponível se o Claude Code estiver apontado direto para uma chave de API da Anthropic, para o Amazon Bedrock, para o Agent Platform do Google Cloud ou para o Microsoft Foundry. Uma fatia grande dos usuários profissionais roda exatamente essas configurações, e para eles o
/voicesimplesmente não existe. - Um microfone local. Não funciona por SSH nem no Claude Code na web, porque o microfone está no seu notebook e o processo não.
- WSLg, se você roda o Claude Code no WSL. Ele vem junto do WSL2 da Microsoft Store. No WSL1, a orientação é rodar o Claude Code no Windows nativo.
O áudio vai para os servidores da Anthropic. A documentação resolve isso em quatro palavras: "O áudio não é processado localmente." Em compensação, a transcrição "não consome mensagens nem tokens do Claude e não conta para os limites mostrados em /usage", então o recurso é gratuito no sentido que importa.
A extensão do VS Code tem o mesmo recurso e a mesma exigência de conta Claude.ai, e ela não fica disponível em sessões remotas do VS Code, ou seja, SSH, Dev Containers e Codespaces. O administrador da sua organização também pode desligar tudo por política, e nesse caso o /voice avisa.
No Linux, a gravação usa um módulo nativo, e se ele não carregar o Claude Code recorre ao arecord do ALSA utils ou ao rec do SoX. No WSLg você precisa do backend do PulseAudio explicitamente, sudo apt install sox libsox-fmt-pulse, porque o sox puro traz o backend do ALSA e não há /dev/snd de onde gravar. Essa única linha economiza uma noite de trabalho de quem desenvolve no WSL.
Quando isso chegou. A Anthropic não data o changelog dela, então fomos pelo lado. Entre as 377 versões do changelog público, a primeira entrada que menciona voz é a 2.1.69, que somou mais dez idiomas de ditado para chegar a vinte, e o registro do npm dá a essa versão a data de publicação de 4 de março de 2026. Ou seja, o recurso pousou bem no começo de março de 2026 e vem recebendo correções em ritmo constante desde então, quase todas sobre áudio no Linux, WSL e terminais que não enviam eventos de repetição de tecla.
Cursor: o microfone na caixa de chat
O Cursor acrescentou voz no Cursor 2.0, em 29 de outubro de 2025, descrita no changelog como controlar o agente com a voz por meio de reconhecimento de fala embutido, com palavras-chave de envio que você define nas configurações, de modo que dizer o seu gatilho dispara a execução. O Cursor 3.1, em 13 de abril de 2026, reconstruiu o recurso: segure Ctrl+M para falar, e agora o editor grava o clipe inteiro e o transcreve de uma vez, em vez de transmitir em fluxo, o que segundo o changelog melhorou a qualidade. Durante a gravação você vê a forma de onda, um cronômetro e botões de cancelar ou confirmar.
Uma página que hoje aparece bem posicionada nessa busca afirma que a entrada de voz do Cursor "não é coberta por documentação pública que pudéssemos verificar". É, sim. As entradas de changelog acima são públicas, datadas e específicas, o que diz alguma coisa sobre o cuidado com que se escreve nessa área.
O que o microfone do Cursor não faz é sair da caixa de chat. Ele não alcança o Cmd+K, nem o editor em si, nem o terminal integrado, nem a aba do navegador onde você está lendo uma documentação de API. Se você roda Claude Code ou Codex dentro do terminal do Cursor, o microfone do chat não ajuda em nada ali, e essa é a razão mais comum para quem usa Cursor acabar instalando uma ferramenta para o sistema todo.
O fórum da comunidade do Cursor também mantém um fluxo constante de relatos de bugs de voz: entrada que abre um contexto de áudio mas captura silêncio, formas de onda que se mexem sem que texto nenhum apareça, e texto ditado que cai no fim da primeira linha, esteja o cursor onde estiver. Nada disso significa que o recurso está quebrado para todo mundo. Significa que você deve testá-lo antes de construir um hábito em cima dele.
VS Code e Copilot Chat
O VS Code dita em dois lugares, e os atalhos merecem ser decorados: Ctrl+I (⌘I no Mac) fala dentro do chat, Ctrl+Alt+V (⌥⌘V) dita dentro do editor, na posição do cursor. Os dois são apertar e segurar. Existe também a ativação por palavra-chave "Hey Code", se você preferir não encostar em tecla alguma.
A parte que importa para quem tem um empregador rigoroso: a documentação da Microsoft afirma que o modelo padrão "processa o áudio do microfone no seu dispositivo" e que, depois do download inicial do modelo, o reconhecimento de fala não precisa de conexão com a internet. É uma opção local de verdade e capaz de verdade, que vem do mesmo fornecedor do seu editor, e é gratuita.
Nas plataformas de computador mais comuns, o recurso já vem embutido. A extensão VS Code Speech separada continua sendo necessária na web, em Macs com Intel, em sistemas de 32 bits e Arm32 e em distribuições Linux baseadas em musl. Ela está em 1.417.222 instalações, versão 0.16.0, e cobre 26 idiomas pelo ajuste accessibility.voice.speechLanguage.
O limite é o óbvio. Funciona dentro do VS Code e em nenhum outro lugar. E, como o Cursor é um fork do VS Code e não o VS Code, não presuma que a extensão se comporta igual lá.
Terminais
O Warp é o ponto fora da curva: tem voz como recurso de primeira classe, configurado em Settings, Agents, Warp Agent, Voice, e usável em vários campos de entrada, não só no modo de agente. A documentação do próprio Warp diz que a transcrição "funciona com o Wispr Flow" e que o áudio é processado em tempo real e não fica guardado como gravação. Se você já paga pelo Wispr Flow, está rodando o mesmo motor em dois lugares.
Para iTerm2, Windows Terminal, Ghostty, Alacritty ou um gnome-terminal comum, não existe ditado embutido e não vai existir. Um terminal é uma superfície de texto como qualquer outra, então a resposta é uma camada para o sistema todo, que digita na janela em foco. Essa é também a resposta para as IDEs da JetBrains, para o Zed, para o Neovim e para os agentes de linha de comando que você roda dentro de qualquer um deles.
A camada que vale para o sistema todo
Esses programas ficam em segundo plano, escutam enquanto você segura um atalho e colam o texto pronto onde o cursor estiver. Uma ferramenta, todas as janelas. A comparação aqui é nos mesmos termos: quanto custa, para onde vai o áudio, onde ele é processado.
Wispr Flow
O que foi feito especificamente para este público. A página de desenvolvedores promete um ditado que "entende jargão de dev", lida com camelCase, snake_case e siglas, pega nomes de produto como Supabase ou MongoDB e marca arquivos no Cursor e no Windsurf, para o contexto certo cair no seu prompt. Alega entregar 4x mais rápido, que é o número do fabricante e não uma medição que alguém tenha publicado.
Aqui está o que lhe garante a recomendação apesar do preço. Você segura uma tecla, fala do jeito que fala, e prosa limpa cai na janela em que você estava: sem muletas, com a pontuação posta, e a frase que você recomeçou aparece como a frase que você quis dizer. Funciona no terminal, no painel de chat, num comentário do GitHub e no Slack sem saber nem se importar com qual é qual, então aquele custo mental de "qual microfone eu aperto aqui" some depois de dois dias. O time do Warp escolheu esse motor para o próprio recurso de voz deles, o que é um voto real de quem avaliou as alternativas.
As letras miúdas. O plano gratuito é de 2.000 palavras por semana no computador, o Pro custa $15 por mês ou $12 por mês na cobrança anual. É um serviço de nuvem, então sem conexão não há ditado. O Windows é só x64: máquinas ARM, ou seja, os notebooks com Snapdragon, não têm suporte, e máquinas virtuais e área de trabalho remota também não, o que elimina uma boa parte dos ambientes corporativos. Não existe versão para Linux. A nossa análise completa está aqui, e as alternativas, aqui.
Superwhisper
A novidade tem um dia, no momento em que escrevemos: em 26 de agosto de 2026 o Superwhisper lançou um plano gratuito permanente. Zero dólar agora compra voz para texto em qualquer app, gravação e transcrição de reuniões, suporte a mais de 100 idiomas e uso ilimitado dos modelos Whisper. O Pro, a $8.49 por mês, acrescenta as suas próprias chaves de API, modelos de IA locais e na nuvem, tradução e transcrição de arquivos de áudio e vídeo. Quem chega ganha 3.000 palavras de Pro para experimentar, e depois disso os recursos gratuitos continuam seus por tempo indeterminado.
Roda em Mac, Windows e iOS, e é um dos poucos apps comerciais que processam a sua fala inteiramente na sua própria máquina. Os modelos offline pedem Apple Silicon; o fabricante diz que, em Macs com Intel, é melhor ficar nos modelos de nuvem.
Existe também uma integração dedicada com o Claude Code, adicionada em abril de 2026, que põe uma janela flutuante do Superwhisper na frente do agente, para você falar com ele sem trocar para o terminal. A instalação é um script de uma linha no site deles. Há páginas equivalentes para OpenCode, Codex, Pi e Grok CLI.
Handy
Gratuito, licenciado sob MIT, e faz uma coisa só: você aperta um atalho, fala e recebe texto no campo em foco, sem nada saindo do computador. A transcrição roda nos modelos Whisper ou no Parakeet V3, otimizado para CPU e com detecção automática de idioma, com a detecção de atividade de voz do Silero filtrando o silêncio. Windows, macOS e Linux, versão atual v0.9.6 de 24 de agosto de 2026, e 30.430 estrelas no GitHub.
O projeto se descreve como uma tentativa de ser o app de voz para texto mais fácil de forkar, e não o melhor, o que é um posicionamento incomumente honesto e também a expectativa correta a ter. Não há camada de polimento que arrume a sua gramática, nem dicionário que aprenda o nome dos seus colegas. Para um programador confortável em escolher o tamanho do modelo e conviver com arestas ocasionais, o Handy é a opção gratuita mais forte desta página.
VoiceInk
Só macOS em Apple Silicon, modelos locais no Neural Engine, código aberto, 6.123 estrelas, e preço de compra única: $29 para um Mac, $49 para dois, $69 para três, com atualizações vitalícias. Provedores de nuvem só ficam disponíveis se você fornecer a sua própria chave de API e escolher isso.
Se o seu Mac é a máquina onde mora o código do cliente, este é o caminho mais curto para um ditado que nunca manda áudio a lugar nenhum, e pagar $29 uma vez contra $144 por ano de assinatura se paga em cerca de dez semanas. O nosso comparativo de Mac vai mais fundo.
Voicy
A opção comercial que de fato entrega uma versão para Linux: .deb, .rpm e AppImage, cobrindo Ubuntu, Debian, Fedora e Arch. Ele escreve em todo app, terminal e navegador do sistema, funciona no VS Code e nos editores da JetBrains, e roda também em Windows, macOS, Chrome e celular. O teste gratuito são 30 minutos de gravação, o Pro custa $8.49 por mês, e existe licença vitalícia a $260. Estudantes e pessoas com deficiência têm 20 por cento de desconto.
O limite honesto: não há modo offline. O reconhecimento roda na infraestrutura da Groq, então o áudio sai da sua máquina toda vez. A Voicy diz que ele é apagado logo depois do processamento e nunca usado em treinamento, o que é uma política razoável e ainda assim não é a mesma coisa que processar localmente.
Voibe
Merece ser citado por um recurso que os outros não têm: um modo de desenvolvedor que resolve identificadores falados contra o seu workspace de verdade, de modo que "auth middleware ponto t s" sai como authMiddleware.ts, e não como palavras soltas. É a falha mais irritante de ditar dentro de um editor, resolvida de frente. $7.50 por mês, $59 por ano, ou $149 pagamento único, em Mac e Windows.
Uma correção que por aí sai errada: o Voibe é totalmente local no Apple Silicon, mas no Windows ele roda em modo de nuvem com retenção zero, segundo o FAQ dele mesmo. Retenção zero é uma política que significa alguma coisa. E não é a mesma coisa que o áudio nunca sair da sala.
Se o código não pode sair da máquina
Esta é a pergunta que separa uma configuração de hobby de uma que você pode usar no trabalho, e o texto de marketing da categoria embaralha isso de propósito. Duas coisas são confundidas: onde o áudio é processado e o que o fabricante promete fazer com ele depois. Só a primeira é um fato técnico.
O áudio nunca sai do seu computador: VS Code Speech, Handy, VoiceInk em Apple Silicon, Superwhisper com modelos locais, Voibe em Apple Silicon, Talon.
O áudio vai para um servidor: Claude Code /voice, voz do Cursor, voz do Warp, Wispr Flow, Voicy, Voibe no Windows, Superwhisper com modelos de nuvem.
Repare onde o Claude Code fica, e repare no efeito de segunda ordem: o /voice não existe no Bedrock, no Agent Platform do Google Cloud nem no Microsoft Foundry, que são exatamente as implantações escolhidas por empresas reguladas. Se o seu empregador pôs o Claude Code atrás do Bedrock por questão de conformidade, o microfone nativo não é uma opção sobre a qual você precise discutir, porque ele não vai aparecer.
Para esse leitor a recomendação não custa nada: Handy se você quer multiplataforma e gratuito, VS Code Speech se você vive dentro de um editor só, VoiceInk se você está num Mac com Apple Silicon e prefere pagar uma vez por algo mais acabado. Confirme mesmo assim com quem cuida da sua política de segurança, porque "roda localmente" é uma afirmação que se verifica, não que se herda de uma página como esta.
Talon e Cursorless: o outro esporte
Se as suas mãos são o motivo de você estar aqui, nada do que veio acima é a sua resposta. Ditado digita palavras. Ele não move um cursor, não seleciona o terceiro argumento, não refatora nada.
Talon é um sistema de entrada sem as mãos: comandos de voz, controle por ruído (um assovio ou um estalo vira um clique), rastreamento ocular e scripts em Python para definir o que você quiser. Roda offline no motor de fala próprio, em macOS, Windows e Linux sob X11, e é gratuito, com um nível no Patreon para versões beta. Olhe os números de versão antes de se comprometer: a versão pública é a 0.4.0, datada de 24 de julho de 2023 no changelog do próprio Talon. O canal beta é onde está o trabalho recente, incluindo um motor híbrido com Whisper, um "modo misto" que aceita comandos e ditado ao mesmo tempo, e o modelo Conformer D, ao qual o changelog credita cerca de 20 por cento mais precisão. O desenvolvimento está vivo; o download estável é que não mostra isso.
Cursorless é a camada que torna a edição estrutural em vez de posicional. Ele pinta um "chapéu" colorido sobre um caractere de cada token visível, e você endereça o código por esses chapéus: "chuck bat" apaga o token cujo chapéu está naquele b. É uma extensão do VS Code conduzida pelo Talon, licenciada sob MIT, com 1.335 estrelas, e recebeu commit tão recentemente quanto 26 de agosto de 2026. O conjunto de comandos da comunidade em talonhub/community, que é o que a maioria de fato roda em cima do Talon, foi mexido pela última vez em 24 de agosto de 2026. Os dois projetos estão saudáveis.
Não deixe ninguém te dizer que isso é vitória rápida. Você está aprendendo uma língua falada para editar texto, e o retorno chega em semanas, não em horas. O relato mais lido sobre o assunto, o Cursorless is alien magic from the future, de Xe Iaso, chegou à primeira página do Hacker News em 10 de novembro de 2023, com 790 pontos e 337 comentários, e ler aquela discussão é o jeito mais rápido de se calibrar: a conversa é quase toda sobre LER, tendinite e continuar empregável, e quase nada sobre velocidade. É para essas pessoas que isso existe.
Serenade ainda aparece em listas de ferramentas de programação por voz. O site está no ar e o botão de download funciona, mas o repositório no GitHub não recebe push desde 11 de junho de 2024. Trate como sem manutenção até que isso mude.
Como ditar para o resultado ser aproveitável
Os hábitos abaixo vêm do formato do problema, não de qualquer ferramenta, e valem igualmente para o /voice, para o Cursor e para um app que roda no sistema todo.
Fale a intenção, não a sintaxe. "Pagine a tabela de usuários, vinte por página, no servidor" vale mais do que narrar um for. O agente é melhor em sintaxe do que o seu microfone, e cada símbolo que você tenta pronunciar é uma chance de errar.
De dez a trinta palavras por rajada, depois pause. Monólogos longos e ininterruptos degradam, e os curtos demais perdem o contexto que faz a transcrição sair certa.
Deixe a ferramenta resolver os nomes, e confira os que ela não resolve. O Claude Code passa o nome do seu projeto e do branch ao transcritor; o Voibe compara identificadores falados com o workspace; o Wispr Flow aprende jargão conforme você usa. Nenhum deles vai acertar de forma confiável o sobrenome de um colega ou o codinome de um serviço interno, então dê uma olhada no prompt antes de enviar.
Segure o envio automático até confiar no que volta. Enviar sozinho a partir de três palavras é conveniente até o instante em que uma frase mal ouvida inicia uma execução do agente que você não queria, e você passa os dois minutos seguintes tentando parar aquilo.
Por fim, mantenha a digitação à mão. Toda implementação decente deixa você misturar as duas dentro de uma mensagem: caminhos de arquivo, flags e regexes saem mais rápido digitados, e não há prêmio por pureza.
Como conferimos isto, e o que não conferimos
Nenhum teste de precisão foi feito para este artigo, e não vamos fingir o contrário. Leia as páginas que hoje aparecem no topo dessas buscas e você vai encontrar números confiantes, "cerca de 98% de precisão", "200ms contra 700ms", "97,3% no benchmark AISpeak", publicados por empresas que vendem a ferramenta que ficou em primeiro na comparação delas mesmas, sem gravações, sem roteiros e sem dados brutos anexados.
O que fizemos, em 27 de agosto de 2026, foi verificar na fonte aquilo que dá para verificar.
- Lemos a documentação de ditado por voz da Anthropic inteira, de onde vem cada condição da seção do Claude Code.
- Buscamos entradas sobre voz nas 377 versões do changelog público do Claude Code, e datamos a versão 2.1.69 pelo carimbo de publicação no registro do npm.
- Lemos as entradas de changelog do Cursor 2.0 e 3.1 para as datas, o atalho e a mudança para transcrição em lote.
- Lemos a documentação de acessibilidade da Microsoft e a página da extensão VS Code Speech no marketplace.
- Lemos a documentação do próprio Warp para confirmar que a transcrição dele roda no Wispr Flow.
- Lemos o changelog público do Talon para a data de lançamento e a lista de recursos do beta.
- Consultamos a API do GitHub para as contagens de estrelas e as datas do último commit de Cursorless, do conjunto de comandos da comunidade do Talon, de Handy, VoiceInk e Serenade.
- Lemos as páginas de preço atuais de Wispr Flow, Superwhisper, Voicy, Voibe e VoiceInk, em vez de copiar preços de outros comparativos.
Três coisas que não conseguimos verificar e que sinalizamos em vez de disfarçar. Alegações de precisão e de latência dos fabricantes são marketing, reportadas aqui como tal e sem endosso. O Cursor não documenta onde a transcrição dele acontece nem quem a fornece, então a linha da nossa tabela diz "não documentado" em vez de chutar. E o Reddit não está acessível do nosso ambiente de pesquisa, então a percepção de comunidade citada aqui vem de fontes que você pode clicar: uma discussão no Hacker News, com data, e o fórum público do próprio Cursor.
Ferramentas que olhamos e deixamos de fora
Aqua Voice, Willow Voice, Spokenly, Vibe Typer, VoiceDash e o resto da turma que nasce de blog. São produtos reais, com usuários reais, e a operação de conteúdo deles é a razão de este tema ser difícil de pesquisar: cada um publica um guia que trata os recursos nativos como problema e o próprio download como solução. Alguns certamente são bons. Não os testamos, e não vamos ranquear o que não conferimos.
Servidores MCP de voz como o mcp-voice-hooks. Engenhosos, e permitem que um agente fale de volta em vez de só escutar. Também são mais uma peça móvel na configuração do seu agente, para um trabalho que um atalho já faz. Vale olhar se você quer conversa nos dois sentidos, não se você quer prompts mais rápidos.
Ski, freeflow, Yap e a onda semanal do Show HN. Ferramentas locais de ditado nascem no Hacker News a um ritmo de mais ou menos uma por semana neste momento, quase todas gratuitas e offline. Se você gosta de chegar cedo, é esse o feed para acompanhar. O Handy é o que já acumulou usuários, versões e empacotamento.
Dragon Professional. Ainda é a referência para corrigir e formatar por voz, ainda é só Windows, ainda custa uns $699 nos revendedores, e a distribuição para consumidor foi desmontada: o que aconteceu com o Dragon. Ele nunca foi feito para editores nem para terminais.
Ditado do sistema no macOS e no Windows. Grátis, já instalado, ótimo para uma frase num campo de texto. Os dois desabam no vocabulário técnico, que é o conteúdo inteiro da fala de um programador.
O que fazer agora
Gaste cinco minutos com o que você já tem: /voice no Claude Code, Ctrl+M no Cursor, Ctrl+I no VS Code. Se a única coisa que te incomoda é ter um microfone diferente em cada janela, esse é exatamente o problema que uma camada para o sistema todo resolve, e você resolve a questão no plano gratuito do Wispr Flow antes de pagar qualquer coisa. Se o seu código não pode sair da máquina, instale o Handy, ou o VoiceInk se você está num Mac com Apple Silicon e quer algo mais acabado por $29 uma vez só. E se você está aqui porque digitar dói, nada disso é a sua resposta: comece por Talon e Cursorless, e dê semanas a isso.
Perguntas frequentes
O Claude Code tem entrada de voz?
Tem. Rode /voice na CLI para ligar o ditado e segure a barra de espaço para falar, ou use /voice tap para gravar com toques. Funciona no terminal e na extensão do Claude Code para VS Code. Exige uma conta Claude.ai, não funciona por SSH nem na web, e a transcrição não consome tokens.
Por que o /voice não aparece no meu Claude Code?
Quase com certeza é a sua autenticação. O ditado por voz fica indisponível quando o Claude Code usa direto uma chave de API da Anthropic, o Amazon Bedrock, o Agent Platform do Google Cloud ou o Microsoft Foundry. Comandos indisponíveis para a sua configuração ficam escondidos em vez de aparecerem. Uma política da organização também pode desativá-lo, e nesse caso o /voice avisa.
A entrada de voz do Claude Code gasta tokens?
Não. A documentação da Anthropic afirma que a transcrição não consome mensagens nem tokens do Claude e não conta para os limites mostrados em /usage.
Como eu dito dentro do Cursor?
Segure Ctrl+M na entrada do chat. A voz chegou no Cursor 2.0 em 29 de outubro de 2025 e foi reconstruída no Cursor 3.1 em 13 de abril de 2026, que somou a forma de onda, o cronômetro e os controles de cancelar, além de passar a transcrever o clipe inteiro de uma vez. Ela alcança só a caixa de chat, não o Cmd+K, o editor ou o terminal integrado.
Dá para ditar dentro do terminal?
O Warp já tem voz embutida. Todo outro terminal precisa de um app de ditado para o sistema todo, que digite na janela em foco: Wispr Flow, Superwhisper, Handy, Voicy ou VoiceInk dão conta. Se você roda um agente de linha de comando dentro do painel de terminal do seu editor, essa é a única abordagem que chega até lá.
Existe entrada de voz gratuita para programadores?
Várias. O /voice do Claude Code vem incluído num plano Claude.ai, o ditado do VS Code é gratuito e roda na sua máquina, o microfone do Cursor vem incluído no Cursor, o Handy é gratuito e de código aberto nas três plataformas de computador, o Superwhisper agora tem plano gratuito permanente, e o Talon é gratuito para baixar.
O que eu posso usar se o meu código está sob NDA?
Qualquer coisa que transcreva localmente: a extensão VS Code Speech, o Handy, o VoiceInk ou o Superwhisper com modelos locais, o Voibe em Apple Silicon, ou o Talon. Claude Code, Cursor, Warp, Wispr Flow e Voicy mandam áudio para um servidor, diga o que disser a política de retenção deles.
Dá mesmo para escrever código por voz, e não só prompts?
Dá, com Talon e Cursorless, e é uma habilidade, não uma instalação. O Cursorless marca cada token visível com um chapéu colorido e você edita chamando esses chapéus, o que torna possível editar de forma estrutural sem teclado. Espere semanas até parecer natural. A maior parte de quem chega lá foi empurrada por LER, não puxada pela velocidade.
O Talon ainda tem manutenção?
Tem, embora a página de download esconda isso. A versão pública é a 0.4.0, de julho de 2023, enquanto o desenvolvimento ativo corre no canal beta do Patreon, que hoje traz um motor híbrido com Whisper e um modo misto de comando e ditado. O conjunto de comandos da comunidade no GitHub foi atualizado pela última vez em 24 de agosto de 2026.
Ditar é realmente mais rápido do que digitar, para um programador?
Para prompts, em geral sim: a fala foi medida em 153 palavras por minuto contra 52 de quem digita na média, ou seja, cerca de três para um. Para código, não, e ninguém sério afirma o contrário. Se você digita acima de 80 palavras por minuto, o argumento da velocidade praticamente evapora, e as razões que sobram para usar voz são os seus pulsos e o fato de que um prompt mais longo não te custa nada a mais.
E o GitHub Copilot?
O Copilot Chat é uma das superfícies em que o ditado do VS Code escreve. Aperte Ctrl+I para falar no chat, ou diga "Hey Code" se você tiver a ativação por palavra-chave ligada. Não existe um produto de voz separado do Copilot para instalar.
Comentários
Ainda não há comentários. Faça uma pergunta ou conte o que funcionou para você.