Melhores programas de ditado para Linux (2026): 9 opções, e por que o seu texto nunca chega

Alguns links desta página são de afiliado: o preço para você não muda. Como trabalhamos.

O seu desktop não tem ditado embutido. Nem o GNOME, nem o KDE, nem nenhuma distribuição que você possa instalar hoje, e isso está prestes a mudar mas ainda não mudou. O que você pode ter, agora, é um app gratuito e offline que roda um modelo de fala moderno na sua própria máquina e digita na janela para a qual você está olhando.

Pela redação do VoiceBoardAtualizado em 28 de agosto de 2026

O problema não é a precisão. A precisão foi resolvida anos atrás e desde então melhorou de novo. O problema são os últimos cinco centímetros: tirar o texto reconhecido de dentro do app e colocá-lo no campo em que você estava olhando. No Wayland esse passo falha, e falha em silêncio, e é por isso que tanta gente conclui que ditado no Linux não funciona quando, na verdade, a transcrição saiu perfeita e simplesmente não foi a lugar nenhum.

Esta página está organizada em torno desse problema. Preços, versões e conteúdo dos pacotes foram lidos na fonte em 27 de agosto de 2026.

Nossa escolha

Handy é por onde a maioria deve começar. É gratuito, licenciado sob MIT, roda Parakeet ou Whisper inteiramente na sua máquina, entrega .deb, .rpm e AppImage, e teve um lançamento há três dias. Reserve vinte minutos para o auxiliar de inserção de texto, porque você vai ter de instalar um.

Se você está no GNOME ou no KDE com Wayland, que é o caso da maioria, comece pelo Vocalinux. É o único projeto que foi atrás do caso mais difícil de frente, usando o IBus como método de entrada em vez de brigar com o compositor, e foi atualizado no dia em que escrevemos isto.

Se você prefere pagar a depurar, o Voicy é o único app comercial de ditado do qual conseguimos verificar uma versão de Linux viva e atual. Baixamos o pacote e lemos o que tem dentro: ele configura para você o acesso privilegiado a /dev/uinput na hora da instalação, que é exatamente o passo que consome uma noite quando não é feito assim. É só nuvem, $8,49 por mês ou $260 uma vez.

Nossas escolhas

PapelFerramentaPreço hoje
Melhor opção gratuita no geralHandygratuito, MIT
Melhor opção gratuita no GNOME ou KDE com WaylandVocalinuxgratuito, AGPL-3.0
Melhor se você quer que funcione e está disposto a pagar por issoVoicy$8,49/mês, ou $260 uma vez
Melhor para ler, traduzir e transcrever arquivosSpeech Notegratuito, MPL-2.0
Melhor pressionar-para-falar para quem usa compositor de janelas em mosaicoVoxtypegratuito, MIT
Melhor uso do caminho oficial do WaylandSpeed of Soundgratuito, MIT
Melhor sem instalar absolutamente nadaDigitação por voz do Google Docs no Chromegratuito
Melhor para comandar a máquina inteira por voz, se você ainda conseguir uma sessão X11Talongratuito
O que todo artigo recomenda, e por que nós nãonerd-dictationgratuito, GPL-3.0

O que mudou, e por que os outros artigos não acompanharam

Quatro coisas se mexeram recentemente, e juntas invalidam quase tudo o que está ranqueando hoje.

A Canonical está colocando ditado dentro do Ubuntu. Em 17 de junho de 2026 saiu um anúncio no Ubuntu Community Hub apresentando o Myna, descrito como "a new initiative to bring speech to text dictation to Ubuntu Desktop" (uma nova iniciativa para levar ditado de fala para texto ao Ubuntu Desktop). Ele roda modelos locais, os candidatos citados são Whisper, Nemotron e Qwen3-ASR, e "no internet connection is required once the necessary models are installed" (nenhuma conexão de internet é necessária depois que os modelos estiverem instalados). O alvo é o Ubuntu 26.10, e a primeira versão "targets Ubuntu Desktop on Wayland, with GNOME as the primary validated environment" (mira o Ubuntu Desktop no Wayland, com o GNOME como ambiente validado principal). Não saia procurando download: o repositório canonical/myna foi criado em 5 de junho de 2026, é GPL-3.0 e não tem nenhum lançamento até hoje. Comandos de voz, controle do desktop e detecção automática de idioma estão explicitamente fora do escopo da primeira versão. Ainda assim, a frase de abertura de toda lista desta categoria, aquela sobre o Linux estar permanentemente de fora, agora tem prazo de validade.

O Talon está indo embora do Linux. O Talon vem sendo a resposta para quem comanda o computador inteiro por voz, e a documentação dele para a versão 0.4.0 declara a posição sem rodeio: "Wayland compositors lack the APIs necessary for Talon and Wayland support is not planned" (os compositores Wayland não têm as APIs necessárias para o Talon, e suporte a Wayland não está nos planos). A página de download oferece "Linux (X11)" e nada além. Em 31 de maio de 2026 o OSnews noticiou que o Talon "vai remover em breve TODO o suporte a Linux da versão pública, à medida que o X11 continua a ser aposentado", e citou desenvolvedores do KDE contestando o raciocínio técnico: "Wayland implements all the APIs needed for Talon to work, but Talon's developers are simply not interested in using them" (o Wayland implementa todas as APIs necessárias para o Talon funcionar, mas os desenvolvedores do Talon simplesmente não têm interesse em usá-las). Não vimos a remoção acontecer. Sinalizamos porque quem mais sofre com isso é quem tem menos espaço para trocar.

"É só entrar numa sessão X11" deixou de ser conselho. Esta é a que invalida silenciosamente o maior número de páginas. As notas de versão do próprio GNOME contam a história em três linhas: a versão 47 acrescentou a possibilidade de desativar sessões X11, o GNOME 49 as desativou por padrão quando saiu, em 17 de setembro de 2025, e o GNOME 50, lançado em 18 de março de 2026, removeu de vez o suporte a rodar sessões X11, levando junto os arquivos de unidade específicos do servidor gráfico. O Fedora 43 acompanhou no nível da distribuição, apagando os pacotes do GNOME para X11 dos repositórios e migrando esses usuários para o Wayland. O KDE ainda oferece sessão X11. O GNOME não. Ou seja, todo guia que dá de ombros e manda escolher X11 na tela de login, inclusive o guia de instalação da ferramenta da qual mais dependem as pessoas que não conseguem digitar, está dando uma instrução que boa parte dos leitores não consegue mais seguir.

A ferramenta que está no topo desses resultados de busca está parada. Um post curto e honesto de janeiro de 2026 recomenda o Whispering, e ele mereceu a posição: o autor ditou o texto inteiro com a ferramenta e disse isso. Desde então, o último lançamento foi o v7.11.0, em 27 de dezembro de 2025, e o README do repositório onde ele vive hoje diz, palavra por palavra, "Whispering, vocab, skills, and the Epicenter host do not compile right now" (o Whispering, o vocab, as skills e o host do Epicenter não compilam no momento). Os binários antigos ainda baixam. Ninguém está construindo novos.

Por que o seu texto nunca chega

Esta é a seção que o resto do campo pula, e é a pergunta de verdade.

O Handy, a ferramenta mais usada da categoria, resume tudo numa linha na própria issue de acompanhamento: "Wayland has no single API for programmatic text insertion or registering global hotkeys" (o Wayland não tem uma API única para inserção programática de texto nem para registrar atalhos globais). As duas metades do ditado estão quebradas de forma independente, e só o Handy carrega 48 issues abertas sobre isso.

No X11, qualquer programa pode pedir ao servidor X que sintetize teclas pela extensão XTEST, que está no padrão desde 1992 e se descreve como "limited synthesis of input device events, almost as if a cooperative user had moved the pointing device or pressed a key" (síntese limitada de eventos de dispositivos de entrada, quase como se um usuário cooperativo tivesse movido o ponteiro ou pressionado uma tecla). É o que o xdotool type faz. Funciona em todo lugar, em todo app, sem permissão nenhuma. Também significa que qualquer programa que você rode pode digitar no site do seu banco e ler cada tecla que vai para qualquer outra janela. O X11 não tem noção de um app isolado do outro.

O Wayland fechou esse buraco de propósito, e não o substituiu por uma versão restrita. Simplesmente não existe uma requisição de "digite isto no que estiver em foco", porque um global do Wayland não consegue saber quem está chamando, então qualquer coisa exposta ali fica exposta para tudo. O próprio README do xdotool afirma a consequência sem meias palavras: "Typing, window searching, and many other functions of xdotool do not work, and it is unclear if they could ever work" (digitar, buscar janelas e muitas outras funções do xdotool não funcionam, e não está claro se um dia poderiam funcionar).

Então as ferramentas de ditado escolhem um contorno, e cada um funciona em alguns lugares e em outros não. Existem cinco em circulação.

O protocolo de teclado virtual (zwp_virtual_keyboard_v1), que é o que o wtype usa. Limpo, seguro em Unicode, e implementado apenas por compositores derivados do wlroots. O GNOME não vai implementá-lo, e disse isso por escrito. Jonas Ådahl em 2021: "The virtual keyboard protocol is unlikely something we are going to support, where instead the plan for handling things like xdotool, Synergy, and similar things is using libei via a portal" (é improvável que a gente venha a suportar o protocolo de teclado virtual; o plano para lidar com coisas como xdotool, Synergy e afins é usar libei através de um portal). Sebastian Wick, ao fechar o pedido seguinte em 26 de maio de 2025: "Yes, wayland doesn't have access control and we would have to expose this to every client. Having and maintaining multiple ways to do the same thing is also not sustainable" (sim, o Wayland não tem controle de acesso e teríamos de expor isso a todo cliente. Ter e manter várias formas de fazer a mesma coisa também não é sustentável). O KDE também não implementou. Alguém testando no Ubuntu 25.10 com KDE Plasma em novembro de 2025 recebeu o erro literal: "Compositor does not support the virtual keyboard protocol" (o compositor não suporta o protocolo de teclado virtual). O rastreador do próprio wtype carrega isso como issue #45 desde 25 de novembro de 2022, e o wtype em si não tem commit de verdade desde janeiro de 2022. Se você está no GNOME ou no KDE, o wtype não é a sua resposta, por mais artigos que o listem.

O caminho do kernel (/dev/uinput), que é o que o ydotool e o dotool usam. Você cria um dispositivo de entrada virtual no kernel e digita por ele. Funciona em todo compositor, no X11, até num TTY, por um motivo: fica abaixo do compositor, então o compositor não tem voz nenhuma. O relato mais claro disso veio de um texto de fevereiro de 2026 sobre colocar ditado para rodar no COSMIC: tanto a detecção do atalho quanto a saída de texto "operate at the Linux kernel level, below the Wayland compositor" (operam no nível do kernel do Linux, abaixo do compositor Wayland).

O preço é uma permissão que a maioria dos guias despacha em uma linha, e ela merece mais. O ydotoold precisa de acesso de escrita a /dev/uinput, o que normalmente significa uma regra de udev e você se adicionar ao grupo input. Só que as regras padrão do systemd colocam todos os dispositivos de entrada nesse grupo. Entrar nele não deixa você apenas escrever num teclado virtual, deixa você ler cada tecla de cada teclado real, permanentemente, sem nenhum aviso. Você está trocando uma permissão mediada pelo compositor exatamente pela capacidade que o Wayland foi construído para tirar. Faça se quiser, mas faça sabendo.

Há também uma diferença de qualidade entre as duas ferramentas que ninguém menciona. O ydotool manda códigos de tecla crus do kernel e a própria documentação admite que ele "does not recognize if the user is using a custom keyboard layout" (não percebe se o usuário está usando um layout de teclado personalizado). O dotool se liga à libxkbcommon e entende layout. Se o seu layout é qualquer coisa diferente de US QWERTY, e o ABNT2 brasileiro é bem diferente, prefira o dotool.

Um método de entrada (IBus). Em vez de fingir ser um teclado, a ferramenta se registra como o maquinário que alimenta texto para os aplicativos em primeiro lugar, o mesmo caminho que trata a entrada de chinês e japonês. Ele carrega texto e não códigos de tecla, então layouts deixam de importar. É o caminho que o Vocalinux toma no GNOME e no KDE, e é o que parece mais nativo de todos quando funciona.

A área de transferência mais um atalho de colar. Copiar e mandar Ctrl+V. Parece trivial e é, na prática, a opção mais bagunçada. O guia de configuração do hyprwhspr é o melhor catálogo público do que dá errado: terminais precisam de Ctrl+Shift+V em vez de Ctrl+V, então a ferramenta tem de saber em que app você está, o que o Wayland também não conta, e no GNOME ela acaba recorrendo ao barramento de acessibilidade para descobrir; o Emacs usa Ctrl+Y e trata Ctrl+V como rolagem; em Dvorak ou bépo o código físico da tecla v não é v; em layouts tailandês, russo ou árabe nenhuma tecla produz o símbolo v, então a ferramenta troca rapidinho a sua fonte de entrada para uma latina e depois volta. E no GNOME especificamente, como o Mutter não implementa nenhum dos protocolos de controle de dados, colocar texto na área de transferência exige abrir uma superfície e tomar o foco do teclado, o que significa roubar o foco por um instante do app em que você está ditando.

O portal do desktop com libei, que é o caminho que o projeto Wayland de fato pretende. Seu app pede permissão ao desktop uma vez, por uma caixa de diálogo, e depois envia entrada por um canal sancionado onde o compositor sabe quem está mandando. Essa é a resposta certa e ela não está pronta. Até a libei 1.6.0, lançada em 15 de maio de 2026, a interface carregava códigos de tecla e um mapa de teclado, então uma ferramenta de ditado ainda não conseguia digitar um caractere ausente do seu layout ativo. Aquela versão acrescentou uma interface para enviar texto UTF-8 direto, o que elimina o problema por completo. Ela ainda não chegou até você: o KDE tem isso só no master, e chega no Plasma 6.8, em outubro de 2026, e o merge request do GNOME está aberto desde 24 de março de 2026 e no momento tem conflitos.

Qual funciona onde

Verificado em 27 de agosto de 2026 contra tabelas de suporte a protocolos e árvores de código dos compositores.

Sua configuraçãowtype (teclado virtual)ydotool / dotool (uinput)método de entrada IBusPortal + libeiColar da área de transferência
X11, qualquer desktopdesnecessário, use o xdotoolfuncionafuncionadesnecessáriofunciona
GNOME no Waylandnão, e nunca vaifuncionafuncionasó códigos de tecla, pede permissão o tempo todofunciona, mas rouba o foco
KDE Plasma no Waylandnãofuncionafuncionacódigos de tecla agora, texto no Plasma 6.8funciona
Sway, Hyprland, niri, river, Wayfire, labwcfuncionafuncionafuncionasem backend de portalfunciona
COSMICprotocolo presente, saída erradafuncionarelatado quebrado em uma ferramentaincertofunciona
Janelas XWayland dentro de qualquer um dessesinstável, bug antigofuncionadessincronização de layout relatadacombinações de tecla sim, Unicode nãofunciona

O COSMIC merece linha própria, porque é a falha mais bem documentada da categoria. Ali o wtype não dá erro. Ele digita a coisa errada. O texto de fevereiro de 2026 descreve dizer "hello world" e receber de volta 84 101 108 108 111, os próprios códigos de tecla renderizados como dígitos. E, iniciado pela ação de execução do próprio COSMIC, o wtype falha sem mensagem nenhuma.

Mais uma armadilha que vale nomear: o XWayland não te salva. O Xwayland moderno consegue rotear chamadas XTEST pelo portal, então xdotool key ctrl+v ainda funciona dentro de um aplicativo X. Mas ele encaminha o código de tecla cru e deixa o compositor interpretar, o que descarta em silêncio o truque do xdotool de reescrever o mapa de teclado para alcançar Unicode arbitrário. O xdotool type com qualquer coisa fora do seu layout ativo não produz nada. E o wtype apontado para uma janela XWayland tem um bug próprio e antigo, registrado repetidas vezes contra aplicativos Chromium e Electron desde 2022.

A pessoa com mais direito de estar irritada com tudo isso é Jordan Sissel, que mantém o xdotool. Testando o estado das coisas em novembro de 2025, ele encontrou o GNOME 48 exibindo "Permitir interação remota" a cada poucos minutos, sem forma de conceder aquilo em definitivo, e escreveu: "I want to make this work but am at a loss for how to proceed with all the fragmentation. I don't mind what the protocol is, but I sure would love to have any protocol that does what I need. Is it worth it to continue?" (quero fazer isso funcionar, mas não sei como seguir com toda essa fragmentação. Não me importo com qual seja o protocolo, mas adoraria ter qualquer protocolo que faça o que eu preciso. Vale a pena continuar?)

Como descobrir o que quebrou, em cerca de um minuto

Se o ditado parece não fazer nada, descubra qual metade está quebrada antes de trocar de ferramenta.

  1. echo $XDG_SESSION_TYPE diz se você está em x11 ou wayland. Metade dos conselhos da internet pressupõe o outro.
  2. ydotool type "hello" com o cursor numa caixa de texto. Se "hello" aparecer, a inserção funciona e o seu problema é o áudio ou o modelo. Se nada aparecer, o problema é a inserção.
  3. groups | grep input diz se você tem permissão de usar o caminho do kernel.
  4. pactl list sources short mostra se o seu microfone é mesmo a fonte de onde a ferramenta está gravando.

Essa sequência vale mais do que qualquer tabela comparativa, inclusive a nossa.

E conheça o formato da falha silenciosa, porque ela está por toda parte nos rastreadores de 2026. A issue #523 do Vocalinux, aberta em 15 de julho de 2026, tem por título: o app "reported 'Text injection completed successfully' while the text never reached the app" (relatou "inserção de texto concluída com sucesso" enquanto o texto nunca chegou ao aplicativo). A issue #485, de 30 de junho de 2026, relata inserção que "silently does nothing on COSMIC / wlroots compositors when IBus is active" (não faz nada, em silêncio, nos compositores COSMIC e wlroots quando o IBus está ativo). O rastreador do Spokenly abre com a mesma classe de bug no COSMIC, registrado em 8 de agosto de 2026. Um visto verde na janela do ditado não é prova de que algo foi digitado.

O Whisper não é mais a resposta, e isso muda o que instalar

Todo artigo desta categoria pressupõe o Whisper. Essa pressuposição venceu ao longo de 2025.

O Open ASR Leaderboard no Hugging Face é público, reproduzível e atualizado continuamente. Nós o lemos em 27 de agosto de 2026, quando tinha 67 entradas. Eis onde ficam de fato os modelos que essas ferramentas entregam, medidos por taxa de erro de palavra, quanto menor melhor, junto do RTFx, que é quantos segundos de áudio o modelo processa por segundo de computação:

ModeloPosiçãoTaxa de erro de palavraVelocidade (RTFx)
NVIDIA Parakeet TDT 0.6B v2185,885.998
OpenAI Whisper large-v3457,03bem mais lento
OpenAI Whisper large-v3-turbo517,52mais rápido que o large-v3
Vosk, Kaldi, DeepSpeech, Coquifora da lista

O Parakeet leva um ponto inteiro de vantagem em taxa de erro sobre o maior modelo Whisper e é cerca de uma ordem de grandeza mais rápido, o que numa CPU de laptop é a diferença entre o texto aparecer quando você termina de falar e o texto aparecer depois de uma pausa constrangedora. O Handy hoje entrega 69 modelos de 14 famílias, incluindo Parakeet, Canary, Moonshine, Nemotron, Granite e Qwen3-ASR, e o Whisper é uma opção entre elas, não o ponto do app. Uma ressalva que muda a conta para quem dita em português, e que o leaderboard não deixa óbvio: o modelo dessa tabela, o Parakeet v2, é só de inglês. Quem transcreve português é o Parakeet v3, que cobre 25 idiomas europeus e não aparece nessa comparação, e cujo próprio card de modelo avisa que os dados de treino usam português europeu, enquanto a maioria dos testes de referência usa o brasileiro, atribuindo a isso parte da diferença de desempenho. Então, em português, a vantagem numérica acima não é a sua vantagem: teste v3 e Whisper com a sua própria voz e decida pelo resultado.

Duas consequências para agir. Primeira, se uma ferramenta oferece Parakeet V3, experimente antes de tentar o Whisper. Segunda, qualquer coisa construída sobre o Vosk está uma geração atrás, e isso inclui a ferramenta que a maioria desses artigos coloca em segundo lugar.

Uma ressalva que mantém os números honestos: o mesmo modelo em dois aplicativos diferentes não rende igual, porque o motor que o embrulha e o pós-processamento que vem depois são diferentes. Um usuário comparando dois apps rodando o mesmo Parakeet V3 colocou isso com precisão em junho de 2026: "This was with the same underlying Parakeet model, I think the differences are in the surrounding engine and post processing etc." (isso foi com o mesmo modelo Parakeet por baixo; acho que as diferenças estão no motor em volta e no pós-processamento). Trate a posição no leaderboard como piso, não como promessa.

Em resumo

FerramentaMelhor paraPreço (verificado em 27 ago 2026)MotorO áudio sai da sua máquina?Como ela digita
HandyDitado gratuito na maioria dos desktopsGratuito, MIT69 modelos de 14 famílias, incl. Parakeet V2 e V3, Canary, Moonshine, WhisperNãoxdotool no X11; wtype ou dotool no Wayland; ydotool no Ubuntu 26.04
VocalinuxGNOME e KDE no WaylandGratuito, AGPL-3.0whisper.cpp com Vulkan, Whisper, VOSKNãoIBus, com wtype no wlroots e reserva pela área de transferência
VoicyPagar para pular a configuração30 minutos gratuitos; $8,49/mês, $260 vitalícioSó nuvem; o fornecedor diz ser o Whisper V3 hospedado na GroqSim, nuvemXTEST no X11; área de transferência mais /dev/uinput no Wayland
Speech NoteTranscrever arquivos, ler, traduzirGratuito, MPL-2.0whisper.cpp, Faster Whisper, VOSK, April-ASR, CoquiNão"Inserir na janela ativa", exige o daemon ydotool rodando no Wayland
VoxtypePressionar para falar em compositores em mosaicoGratuito, MITwhisper.cpp, mais Parakeet, Moonshine, SenseVoice e outros via ONNXNãowtype primeiro, dotool para layouts fora do US, ydotool como reserva
Speed of SoundO caminho sancionado do WaylandGratuito, MITWhisper, Parakeet, Canary via Sherpa ONNXNão, a menos que você ligue o polimento por LLMPortais XDG do desktop
Digitação por voz do Google DocsUm documento, nada instaladoGratuitoGoogle, nuvemSim, nuvemNão digita. O texto cai no documento do Google
TalonControle total sem as mãosGratuito, Patreon para as betasConformer D, no aparelhoNãoSó X11
nerd-dictationA resposta históricaGratuito, GPL-3.0Só VOSKNãoxdotool, ou ydotool/dotool/wtype

As ferramentas

Handy

Melhor para: a maioria das pessoas, na maior parte do tempo.

Preço: gratuito, licença MIT, 30.459 estrelas, último lançamento v0.9.6 em 24 de agosto de 2026.

O Handy é um pequeno app de desktop que grava enquanto você segura uma tecla e solta o texto pronto onde está o cursor. O catálogo de modelos dele cresceu para 69 modelos de 14 famílias, todos rodando localmente: Parakeet, Canary, Moonshine, Nemotron, Granite, Qwen3-ASR e Whisper entre eles. O Parakeet V3 é o primeiro a experimentar, descrito na documentação dele como otimizado para CPU e com detecção automática de idioma. Há AppImages para x86_64 e ARM, um .deb e dois .rpm no último lançamento, então instalar é um clique duplo na maioria dos sistemas. Nada sai da sua máquina. É, com folga, a ferramenta mais usada do tipo, e há razão para as pessoas irem parar nela.

Agora a parte que a página de marketing omite e a documentação diz em voz alta. O Handy tem "limited support for Wayland display server" (suporte limitado ao servidor gráfico Wayland). Você instala o auxiliar de inserção por conta própria: xdotool no X11, wtype ou dotool no Wayland, e especificamente ydotool no Ubuntu 26.04, que usa Wayland por padrão. Os atalhos globais "must be configured through your desktop environment" (precisam ser configurados pelo seu ambiente de desktop) em vez de dentro do app. A sobreposição de gravação vem desativada porque "certain compositors treat it as the active window" (certos compositores a tratam como a janela ativa). E a documentação admite que os modelos Whisper "crash on certain system configurations" (travam em certas configurações de sistema).

Nada disso desqualifica. É uma configuração de vinte minutos em vez de dois. Mas, se você está no GNOME ou no KDE com Wayland, repare que o auxiliar recomendado, o wtype, é justamente o que o seu compositor recusa, então leia a seção anterior antes de começar.

Vocalinux

Melhor para: GNOME ou KDE no Wayland, que é o caso que a maioria das ferramentas trata pior.

Preço: gratuito, AGPL-3.0. 783 estrelas, v0.16.0 lançada em 23 de agosto de 2026, com builds noturnas saindo todo dia.

Este é um projeto pensado para Linux desde o início, e não um app multiplataforma com uma porta para Linux, e isso aparece nas escolhas. Em vez de tentar fingir um teclado, ele se registra como método de entrada IBus no GNOME e no KDE, usa o wtype onde o wtype de fato funciona, recorre ao xdotool para janelas XWayland, e tem um caminho pela área de transferência para compositores que não oferecem mais nada. Esse é o conjunto correto de respostas para a matriz acima, e nenhuma outra ferramenta desta lista tem as quatro.

Ele roda whisper.cpp por padrão com aceleração Vulkan, então GPUs AMD, Intel e NVIDIA entram todas no jogo, e recorre ao VOSK ou ao Whisper em PyTorch quando precisa. A instalação é um script interativo, um pacote do AUR, um build Flatpak ou pip install vocalinux. Ele quer Python 3.11 ou mais novo e Ubuntu 24.04 ou equivalente.

O contrapeso honesto: é um projeto jovem, com equipe pequena, e o rastreador dele é onde dá para ver as arestas. A issue #738, ainda aberta desde 25 de agosto de 2026, descreve o layout de teclado dessincronizando entre GNOME, IBus e XWayland no meio do ditado. A issue #664, de 10 de agosto, tem o ditado trocando em silêncio um layout ABNT2 brasileiro por US, o que é exatamente o tipo de problema que quem lê esta página em português vai encontrar primeiro. As issues #485 e #523 são as falhas silenciosas de inserção citadas antes. A tabela de compatibilidade do site marca todo compositor grande como "suporte completo", o que é mais confiante do que o rastreador justifica. Ainda assim começaríamos por aqui no GNOME com Wayland, porque a alternativa é fazer o mesmo trabalho na mão.

Voicy

Melhor para: quem quer ditado, não um projeto.

Preço: 30 minutos de gravação grátis, sem cartão. O Pro custa $8,49 por mês, com 20% de desconto no pagamento anual, e a licença vitalícia sai por $260. Equipes pagam $6,79 por assento a partir de três assentos. Estudantes e pessoas com deficiência têm 20% de desconto. Verificado na página de preços em 27 de agosto de 2026.

Eis como é comprar isso na prática. Você instala um pacote como instala qualquer pacote, escolhe um atalho durante a configuração, e depois fala dentro da janela em que estiver e o texto pronto aparece com a pontuação já no lugar. Firefox, VS Code, um terminal, uma caixa do Slack, a barra de busca. Nenhum modelo para baixar, nenhuma GPU para pensar, nenhum daemon auxiliar para configurar. Se você já perdeu uma noite com permissões do ydotool, sabe exatamente quanto isso vale.

Queríamos saber se a versão de Linux era real ou um item de checklist, então fomos olhar, e essa é a parte que mais ninguém nesta categoria faz. Os três downloads respondem HTTP 200 e têm tamanho de gente grande: o .deb tem 134 MB, o .rpm 119 MB, o AppImage 174 MB. Os três trazem data de Last-Modified de 26 de agosto de 2026, o dia anterior à nossa checagem. Dentro do .deb, o arquivo de controle diz Version: 2.4.5, Architecture: amd64, e tamanho instalado de uns 465 MB. A linha de dependências é a parte interessante: libxtst6, libnotify4, libasound2, libappindicator3-1, wl-clipboard, gjs. O libxtst6 é o XTEST, o caminho de inserção do X11. O wl-clipboard é o caminho do Wayland. E o script de pós-instalação diz o resto em voz alta, num comentário: ele concede "ao usuário ativo acesso de escrita a /dev/uinput para que o injetor de colagem do Wayland do Voicy possa abri-lo", carregando o módulo uinput, escrevendo uma regra de udev marcada com uaccess e criando o grupo input se ele não existir. Quem usa o AppImage recebe a mesma coisa por um pedido do pkexec em tempo de execução. Ele também adiciona o próprio repositório apt, então se atualiza junto com o resto do sistema.

Um detalhe desse script merece crédito, porque é melhor do que o que a maioria dos guias manda fazer. A regra de udev é marcada com uaccess, o que entrega a ACL a quem estiver logado no posto, com o grupo apenas como reserva para sistemas que não suportam aquilo. Ou seja, ele não coloca você permanentemente no grupo input, e você não termina capaz de ler cada tecla de cada teclado como efeito colateral. Ele concede a capacidade de escrever entrada sintética, e para por aí. Essa é a versão mais estreita e mais correta da troca.

Então: é um app Electron que resolve o Wayland do mesmo jeito que o ydotool, e toda a proposta de valor dele no Linux é fazer a configuração privilegiada por você em vez de deixar uma página de wiki na sua mão. É justo cobrar por isso. Não é mágica, e quem disser que é outra classe de tecnologia está vendendo.

Dois limites ditos com todas as letras. Não existe modo offline, e o pacote prova. A própria tabela comparativa do Voicy diz "Funciona offline: não", e não há um único artefato de inferência local dentro do download: nenhum peso ggml, nenhum ONNX, nenhum whisper.cpp, nada. O que há lá dentro são endpoints WebSocket fixos no código, wss://us.usevoicy.com e wss://eu.usevoicy.com. O documento de segurança dele descreve o trajeto: o áudio vai da sua máquina para os servidores da Voicy na Heroku, nos EUA, é "immediately forwarded to Groq.com, which hosts the open-source Whisper V3 transcription model" (imediatamente encaminhado para a Groq.com, que hospeda o modelo aberto de transcrição Whisper V3), e nenhuma das duas partes armazena. Tome esse nome de modelo como declaração do fornecedor, e não como algo que pudéssemos verificar de fora, mas, se estiver certo, você está pagando pelo encanamento e pela velocidade, não por um modelo melhor do que as ferramentas gratuitas rodam localmente. Retenção zero é uma política real e significativa. Ainda assim não é a mesma coisa que a sua voz nunca sair da sala.

Segundo, não testamos numa máquina de verdade. Lemos o pacote, não a experiência. Em particular, não temos como dizer como o caminho de colagem pela área de transferência se comporta num terminal, onde Ctrl+V não é colar.

O número de mais de 99% de precisão nas páginas de marketing é do próprio fornecedor, não verificado por ninguém, nós inclusive.

Ver o Voicy

Speech Note

Melhor para: transformar gravações em texto, e para idiomas que mais ninguém cobre.

Preço: gratuito, MPL-2.0. 1.610 estrelas, código atualizado no dia em que checamos. O lançamento atual para desktop é o 4.8.4, de 15 de abril de 2026: a versão 4.9.0 existe, mas saiu só para Sailfish OS, com a versão de desktop prometida para depois.

O Speech Note é antes de tudo um aplicativo de notas e só depois uma ferramenta de ditado, e vale ter pelo primeiro trabalho sozinho. Ele carrega 146 modelos de reconhecimento de fala em 42 idiomas, divididos entre cinco motores: Vosk, Whisper, Faster Whisper, April-ASR e o antigo Coqui STT. Também faz leitura em voz alta e tradução automática offline. Tudo roda localmente: "no data is sent to the Internet" (nenhum dado é enviado à internet). Instale pelo Flathub, pelo AUR, pelo Packman do openSUSE ou pelo OpenRepos, se você estiver no Sailfish. Reserve disco: o Flatpak completo tem cerca de 1 GiB para baixar e 3,6 GiB instalado, embora a variante Tiny tenha 48 MiB.

Ele tem sim um modo de "inserir na janela ativa", então pode servir de ditado para o sistema inteiro, e a documentação é específica sobre o preço disso no Wayland: "the external ydotool daemon must be installed and running for it to work. If you are using Flatpak, also make sure that the application has permission to access the ydotool daemon's socket file." (o daemon externo ydotool precisa estar instalado e rodando para funcionar. Se você usa Flatpak, garanta também que o aplicativo tenha permissão de acessar o arquivo de socket do daemon.)

A limitação honesta é a geração dos modelos. Essa biblioteca é a linhagem anterior a 2025: sem Parakeet, sem Canary, sem Nemotron. Em variedade de idiomas nada aqui chega perto. Em precisão bruta no inglês, uma ferramenta com Parakeet ganha dele.

Onde ele se encaixa: se o seu trabalho é uma pasta de gravações de entrevista, ou um idioma no qual os invólucros de Whisper nem pensaram, esta é a coisa gratuita mais forte no Linux e não chega perto. Se o seu trabalho é digitar no Slack o dia inteiro, um dos apps de pressionar-para-falar vai parecer melhor.

Voxtype

Melhor para: Sway, Hyprland, niri, river, e quem gosta de arquivo de configuração.

Preço: gratuito, MIT. 1.270 estrelas, último envio em 25 de agosto de 2026.

O Voxtype é pressionar-para-falar feito por alguém que claramente usa compositor em mosaico. Roda whisper.cpp por padrão e pode trocar por Parakeet, Moonshine, SenseVoice, Paraformer e outros via ONNX, tudo localmente, e afirma de 9 a 11 vezes o tempo real na CPU. É distribuído pelo AUR, .deb, .rpm, AppImage, Homebrew e cargo. Precisa de glibc 2.38 ou mais nova e do seu usuário no grupo input.

O que o torna digno de menção separada é ser honesto sobre a matriz. Ele tenta o wtype primeiro, troca para o dotool quando o seu layout de teclado não é o dos EUA, e cai para o ydotool no X11 e em TTYs. A documentação dele afirma que no KDE e no GNOME o wtype não tem suporte e que você precisa de dotool ou ydotool. Essa única frase é mais útil do que a cobertura de Wayland de qualquer lista que esteja ranqueando hoje.

Speed of Sound

Melhor para: quem quer o caminho oficialmente abençoado, e não uma gambiarra esperta.

Preço: gratuito, MIT. 197 estrelas, último envio em 13 de julho de 2026.

Sozinho nesta lista, o Speed of Sound digita pelos portais XDG do desktop, que é o mecanismo que o projeto Wayland de fato pretende que os aplicativos usem para isso. Sem grupo input, sem regra de udev, sem loteria de protocolo de teclado virtual. A transcrição é local, via Sherpa ONNX, com Whisper, Parakeet ou Canary, e há polimento opcional de texto por um LLM, que você pode apontar para o seu próprio Ollama ou llama.cpp se quiser que aquilo não saia de casa. Flathub, Snap, AppImage, .deb e .rpm.

A razão de ele não ser a nossa primeira escolha é tração. É um projeto mais jovem e menor, com 61 issues abertas e um ritmo de lançamento mais quieto que o do Handy ou do Vocalinux, e a cobertura de portais ainda varia por desktop. Mas, arquiteturalmente, é onde esta categoria deveria terminar, e se o caminho pelo portal importa para você, instale este primeiro.

Digitação por voz do Google Docs no Chrome

Melhor para: um documento, numa máquina onde você não pode instalar nada.

Preço: gratuito.

Abra um Google Doc no Chrome, aperte Ctrl+Shift+S, fale. A página de ajuda do Google lista como requisito "the latest versions of: Chrome, Edge, Safari" (as versões mais recentes de Chrome, Edge e Safari) e cobre cerca de 80 idiomas e variantes, com português do Brasil e de Portugal listados separadamente; no Apresentações funciona nas notas do apresentador e nas legendas. Repare que o Linux não está listado nem excluído nessa página, então trate como não suportado mas funcionando, e não como suporte oficial.

A limitação é total e óbvia: as palavras caem no documento do Google e em lugar nenhum mais. Para um texto longo, um laptop de trabalho travado ou uma máquina de biblioteca, é uma troca justa e não custa nada. Para uso diário, você vai cansar de copiar e colar lá pela quinta-feira. Ele também manda a sua voz para o Google, o que para parte dos leitores deste artigo encerra a conversa sozinho.

Talon

Melhor para: comandar um computador inteiro sem as mãos, se você conseguir ficar no X11.

Preço: download gratuito. Um nível pago no Patreon libera builds beta e suporte prioritário.

O Talon não é um app de ditado, é um sistema de entrada sem as mãos: comandos de voz, controle por ruído, onde um som vira um clique, rastreamento ocular e scripts em Python para o que você quiser definir. O motor de fala dele, o Conformer D, roda na sua máquina. Para quem programa por voz porque digitar dói, ele é a resposta há anos, e nada mais nesta lista tenta o que ele faz.

Leia o estado do projeto com atenção antes de investir as semanas que ele leva para ser aprendido.

A página de download oferece "Linux (X11)". A documentação da versão 0.4.0 diz: "Wayland compositors lack the APIs necessary for Talon and Wayland support is not planned" (os compositores Wayland não têm as APIs necessárias para o Talon, e suporte a Wayland não está nos planos). Em 31 de maio de 2026 o OSnews noticiou que todo o suporte a Linux está sendo removido da versão pública, e citou desenvolvedores do KDE contestando o argumento: "Wayland implements all the APIs needed for Talon to work, but Talon's developers are simply not interested in using them" (o Wayland implementa todas as APIs necessárias para o Talon funcionar, mas os desenvolvedores do Talon simplesmente não têm interesse em usá-las).

Há também um dado que coloca o resto em contexto. Checamos os cabeçalhos dos três downloads públicos, Linux, macOS e Windows. Todos trazem Last-Modified: 24 de julho de 2023. A versão estável pública tem três anos em todas as plataformas, não só nesta. O desenvolvimento ativo vive no canal beta pago. Essa é uma forma legítima de tocar um projeto, e vale saber antes de montar um fluxo de trabalho em cima da versão gratuita.

E aqui a coisa fica de fato ruim, e não apenas incômoda. O guia de instalação do Talon diz: "Talon, like many tools for automation or accessibility, does not support Wayland. You will have to select an X11 session from your login manager." (O Talon, como muitas ferramentas de automação ou acessibilidade, não suporta Wayland. Você terá de selecionar uma sessão X11 no seu gerenciador de login.) Desde o GNOME 50, de março de 2026, não existe sessão X11 no seu gerenciador de login para selecionar. Para uma pessoa no GNOME que comanda o computador por voz porque não consegue usar o teclado, o contorno documentado deixou de existir na máquina dela. Nada mais nesta categoria tenta o que o Talon faz, e é por isso que isso merece ser dito de forma direta, e não dobrado dentro de uma lista de prós e contras.

Se você precisa de controle por voz e não de ditado, e já está no Wayland, olhe o numen, software livre com o mesmo objetivo, que digita por /dev/uinput e portanto funciona no X11, no Wayland e num TTY igualmente. É uma coisa menor que o Talon. É também uma coisa que roda.

nerd-dictation

Melhor para: nada, em 2026, e ainda está em todo artigo.

Preço: gratuito, GPL-3.0. 1.913 estrelas.

Esta é a ferramenta que o gênero inteiro recomenda, e ela mereceu isso um dia. É um único arquivo Python com quase nenhuma dependência que canaliza o VOSK para o xdotool, e foi a primeira coisa que fez o ditado no Linux parecer possível. O autor foi claro sobre o acordo, inclusive na linha do README que explica a maior parte das reclamações: "Text from VOSK is all lower-case" (o texto que vem do VOSK é todo em minúsculas).

Duas coisas mudaram por baixo dele. O último commit foi em 10 de outubro de 2025, uns dez meses atrás, com 83 issues abertas, várias sobre Wayland e layouts de teclado, abertas desde 2021. E o VOSK deixou de ser competitivo. Ele não aparece no Open ASR Leaderboard, o último lançamento foi o v0.3.50, em abril de 2024, e a precisão desmorona fora de áudio limpo: o modelo pequeno de inglês fica perto de 9,85% de taxa de erro em fala lida e limpa, e o modelo grande chega a 29,78% em gravações de central de atendimento. Um desenvolvedor trabalhando em Arch com Wayland em janeiro de 2026 descreveu o resultado prático, com o Vosk produzindo "sporadic hallucinations: during silence, Vosk would randomly output 'the' or 'there'" (alucinações esporádicas: durante o silêncio, o Vosk soltava aleatoriamente "the" ou "there"), além de pontuação chegando como palavras literais, e concluiu que se deve "skip Vosk entirely" (pular o Vosk por completo).

Mais uma coisa que vale saber se você for distribuir algo construído sobre ele: os modelos do Vosk não são uniformemente permissivos. O vosk-model-small-fr-pguyot-0.3 é CC BY-NC-SA, que proíbe uso comercial, e o vosk-model-fr-0.6-linto é AGPL. Verifique a licença do modelo específico, não a do kit.

Se você já usa e está feliz, nada aqui obriga você a mudar, e o Elograf lhe dá uma interface gráfica mantida. Se você está começando hoje porque uma lista mandou, comece por outro lugar.

Para onde vai a sua voz

Para um público de Linux isso não é nota de rodapé, então vai direto.

O áudio nunca sai da sua máquina: Handy, Vocalinux, Speech Note, Voxtype, Speed of Sound (a menos que você ligue o polimento por LLM), Talon, nerd-dictation.

O áudio vai para um servidor: Voicy, digitação por voz do Google Docs, NovaVoice.

Leia essa coluna duas vezes. Toda ferramenta da lista acima que mantém a sua voz em casa é gratuita, e todas elas são open source. Isso não acontece no Windows nem no macOS, e é a coisa mais forte que esta plataforma tem a seu favor nesta categoria. Se processamento local é o motivo de você estar no Linux, você não precisa abrir mão de nada e não precisa pagar.

Há uma segunda questão de privacidade específica do Linux que ninguém enquadra direito. Dar a um app de ditado o acesso a /dev/uinput de que a maioria das ferramentas compatíveis com Wayland precisa compra mais do que a capacidade de sintetizar entrada. Por causa de como as regras padrão do systemd agrupam os dispositivos de entrada, entrar no grupo input também deixa qualquer coisa rodando como você ler cada tecla de cada teclado físico da máquina. É exatamente a capacidade que o Wayland removeu de propósito, devolvida por um passo de instalação de uma linha. As ferramentas pedem isso porque ainda não há opção universal melhor, e o caminho pelo portal é a saída, o que é parte do motivo de valorizarmos a abordagem do Speed of Sound, mesmo com o app sendo menor. Se uma ferramenta configura isso com uma marca uaccess de udev em vez de colocar você no grupo, como faz o pacote do Voicy, ela está pedindo a versão mais estreita da permissão, e isso merece preferência.

E, já que estamos sendo imparciais: o KDE Plasma tem um buraco próprio que ninguém fechou. O KWin ainda expõe um protocolo legado de entrada falsa a todo cliente Wayland, sem condição nenhuma, e a função de autorização dele é um esqueleto com um comentário // TODO: make secure acima de uma linha que aprova a requisição. No Plasma com Wayland, qualquer aplicativo que você rodar pode injetar teclas sem nenhum aviso. Isso não é um argumento contra o KDE, é um argumento a favor de ler código em vez de páginas de segurança, e é a mesma razão pela qual abrimos o pacote do Voicy em vez de confiar no marketing dele.

E um aviso que vale para toda ferramenta baseada em Whisper desta página: o Whisper alucina no silêncio. De vez em quando ele produz um "Thank you" ou uma frase solta quando você não disse nada, comportamento acompanhado na issue #331 do Vocalinux, de 18 de março de 2026, e reclamado por toda parte. É uma propriedade do modelo, não um bug do app que você escolheu.

O que checamos, e o que não checamos

Não rodamos um teste de precisão, e não vamos insinuar o contrário.

E aqui está a questão neste campo específico: mais ninguém rodou também. Lemos todos os artigos que ranqueiam para essas buscas e não há um único número medido em nenhum deles. Nenhuma taxa de erro de palavra, nenhuma latência, nenhum dado de memória, nenhuma cronometragem, e quase nenhuma captura de tela. As tabelas comparativas todas trazem uma coluna de "precisão", e cada célula de cada uma delas é um adjetivo. O que é duplamente vazio, porque dois apps rodando o mesmo modelo Parakeet V3 produzem resultados visivelmente diferentes conforme o motor e o pós-processamento.

Então, em vez de inventar números, fomos buscar os que já existem e são reproduzíveis, no Open ASR Leaderboard público, e verificamos na fonte tudo o mais que é verificável. Em 27 de agosto de 2026 nós:

Duas coisas que sinalizamos em vez de disfarçar. Não instalamos nem usamos nenhuma dessas ferramentas numa máquina de verdade, então a matriz de compositores aqui foi montada a partir de documentação, rastreadores de issues e relatos práticos datados de outras pessoas, e não da nossa máquina. E o Reddit não é alcançável de onde trabalhamos, então toda voz da comunidade nesta página vem de uma fonte em que você pode clicar.

A concorrência

Ferramentas e respostas que olhamos e deixamos de fora, e por quê.

Wispr Flow é o nome mais procurado desta categoria inteira por quem está no Linux, e a resposta é não. A documentação dele lista como dispositivos suportados "Mac, Windows, iOS, Android" e depois diz: "iPad, Linux, Chromebooks, and virtual machines or remote desktop environments are not supported" (iPad, Linux, Chromebooks e máquinas virtuais ou ambientes de área de trabalho remota não têm suporte). Um artigo de ajuda separado é ainda mais direto: "There is no native Linux application" (não existe aplicativo nativo para Linux). Se você roda Linux no WSL ou numa máquina virtual sobre um host Windows ou Mac, o Flow consegue colar lá de dentro a partir do host, e essa é toda a história de Linux dele.

O reempacotamento não oficial do Wispr Flow em wispr-flow-linux existe, tem umas 100 estrelas, e junta o app Electron a um auxiliar em Rust feito do zero que reimplementa a inserção de texto que a Wispr entrega só no macOS e no Windows. Ele tem até um comando --doctor que verifica o tipo da sua sessão e o acesso a /dev/uinput, o que já diz qual era a parte difícil. Estamos nomeando porque você vai encontrar, não recomendando: aquilo reempacota o aplicativo proprietário de outra pessoa, e essa é uma decisão para se tomar de olhos abertos.

Superwhisper, VoiceInk, Aqua Voice e Typeless são todos pesquisados com "linux" no fim, e nenhum tem versão de Linux. O VoiceInk é só macOS com Apple Silicon.

Dragon NaturallySpeaking sob o Wine é a resposta mais antiga desta categoria e nunca funcionou do jeito que as pessoas esperam. O banco de aplicativos do próprio WineHQ, que é onde isso se resolve em vez de se discutir, classifica o Dragon 13, o 15 Home e o 15 Professional todos como lixo. A melhor nota que qualquer versão já teve foi prata, para a 12.5, marcada como obsoleta, testada pela última vez em 27 de janeiro de 2021. E até essa entrada contém a frase que encerra a ideia: "Dictation works only within the wine environment... Text can be cut and pasted into any application" (o ditado funciona apenas dentro do ambiente Wine... o texto pode ser recortado e colado em qualquer aplicativo). Ou seja, o melhor caso, numa versão de mais de uma década atrás, é ditar dentro de uma janela Windows e colar para fora. Sendo justos com o registro: ninguém retestou o Dragon num Wine atual desde 2022, então "hoje ele falha" é suposição, não medição. O contorno que as pessoas de fato adotaram foi uma máquina virtual Windows retransmitindo texto por um socket, que um desenvolvedor descreveu ter construído no Hacker News em 2023. Se você chegou aqui vindo de uma busca por Dragon, prefira o caminho local com Parakeet ou Whisper. A precisão logo de cara vai surpreender você e não custa nada.

Buzz tem 21.162 estrelas e aparece nessas listas o tempo todo. Ele transcreve arquivos e entrada de microfone dentro da própria janela. Não existe recurso de digitar no app em foco e ninguém pediu um. Excelente no trabalho dele, que não é o trabalho desta página.

Wspr é uma compra única de $14,99 com whisper.cpp local e um .deb, o que soa ideal até você ler os requisitos: ele digita pelo xdotool via XWayland, e a documentação dele diz que "pure-Wayland setups are not supported yet" (configurações puramente Wayland ainda não têm suporte). Barato, honesto, e especificamente não serve para a configuração que a maioria dos leitores tem.

Spokenly merece menção por ter um nível gratuito local de verdade, com chave própria, um Pro a $99,99 por ano e a seção sobre Wayland mais bem organizada de qualquer blog de fornecedor. Também tem uma issue aberta, registrada em 8 de agosto de 2026, relatando que o texto não é colado no app de destino no COSMIC porque a sobreposição rouba o foco. Ele vende a solução de um problema que ainda não terminou de resolver.

NovaVoice é o outro app comercial com cliente de Linux, .deb e AppImage para Ubuntu 20.04+, Debian e Fedora, a $10 por mês. Só nuvem, e a página de Linux dele não diz absolutamente nada sobre X11 ou Wayland, que para esta categoria é a pergunta inteira.

Simon, CMU Sphinx, Julius e IBM ViaVoice aparecem em listas publicadas este ano. Estão sendo copiados de uma página da Wikipédia cujas fontes são quase todas de 2012 e que não contém a palavra Wayland em lugar nenhum. O ViaVoice saiu do mercado em 2002. O DeepSpeech foi arquivado depois da v0.9.3, em dezembro de 2020. O Coqui STT escreveu o próprio epitáfio no README, "this project is no longer actively maintained... we've seen focus shift towards newer STT models such as Whisper" (este projeto não é mais mantido ativamente... vimos o foco migrar para modelos mais novos, como o Whisper), e a empresa por trás dele fechou em 3 de janeiro de 2024. O Kaldi é a exceção da lista: ainda recebe commits, mas é um kit de pesquisa para construir reconhecedores, não algo que você instala para ditar um e-mail. Nenhum deles aparece no leaderboard de ASR. Pule qualquer artigo que os recomende como apps de ditado, o que infelizmente significa pular vários dos que estão acima desta página.

Whispering tem a nossa simpatia e uma ressalva. Boa ferramenta, fãs de verdade, e o artigo mais bem posicionado desta categoria foi ditado com ele. O repositório de origem diz hoje que ele não compila. Os binários de 27 de dezembro de 2025 ainda instalam bem, se você quiser.

Myna não está aqui como escolha porque você não consegue instalar. Volte no Ubuntu 26.10.

A turma dos invólucros virou indústria. O OpenWhispr tem 5.781 estrelas, o OpenLess 3.334, o hyprwhspr 1.176, e o Dictee, minúsculo com 56 estrelas, é o desenho mais interessante do monte: pensado para Wayland desde o início, plasmoide de KDE, Parakeet TDT v3 por padrão, inserção consciente de layout via evdev. Além desses: Sotto, VOXD, Blurt, whisrs, lokstt, hyprvoice, waystt, LinuxWhispr, Vibe Typer, e mais chegando todo mês, vários escritos por alguém que queria o Wispr Flow e não podia ter. Alguns são realmente bons. Estamos nomeando a categoria em vez de fingir que testamos cada membro dela. Se você quiser explorar, nosso guia de ditado open source vai mais fundo, e o catálogo completo do que cobrimos está em apps de ditado.

Um padrão contra o qual se armar enquanto você explora: pelo menos três dos apps pagos de ditado para Linux se descrevem, cada um, como "o único" app pago de ditado para Linux. Eles citam os blogs uns dos outros. Confira a página de download, não a afirmação.

Perguntas frequentes

O Linux tem reconhecimento de fala embutido como o Windows e o macOS?

Não. Em nenhum desktop popular, em nenhuma distribuição, hoje. Checamos os próprios painéis de acessibilidade em vez da documentação: a página de acessibilidade de digitação do GNOME oferece teclado na tela, piscar do cursor, repetição de teclas, teclas de aderência, teclas lentas e teclas de repercussão, e as palavras ditado, fala e voz não aparecem em lugar nenhum ali. O módulo de acessibilidade do KDE conta a mesma história. O Orca é um leitor de tela, ou seja, fala saindo, não entrando. A confirmação mais clara é que a Canonical anunciou o ditado em 17 de junho de 2026 como "uma nova iniciativa" mirando o Ubuntu 26.10, e uma proposta de junho de 2026 no fórum do próprio GNOME pedindo ditado para o desktop inteiro não obteve nenhum compromisso dos mantenedores, apenas indicações de ferramentas de terceiros.

Por que o meu ditado transcreve certo mas nada aparece no campo de texto?

Porque reconhecer e digitar são dois trabalhos separados, e no Wayland o segundo é restrito por projeto. A sua ferramenta provavelmente está usando o wtype, que precisa de um protocolo que o Mutter do GNOME e o KWin do KDE não implementam e que, no caso do GNOME, recusaram publicamente implementar. Teste o caminho de inserção direto com ydotool type "hello" com o cursor numa caixa de texto. Se nada aparecer, o problema é a inserção, não o modelo. Troque a ferramenta para o dotool, que entende layout e por isso lida melhor com o ABNT2, ou use uma que passe pelo IBus ou pelo portal do desktop.

O Wispr Flow funciona no Linux?

Não. A documentação dele afirma que o Linux não tem suporte e que "não existe aplicativo nativo para Linux". Se você procura a mesma sensação, o Handy é o equivalente gratuito mais próximo e o Voicy é o pago mais próximo.

Dá para ditar no Linux sem mandar a minha voz para lugar nenhum?

Sim, e esse é o ponto forte da plataforma. Handy, Vocalinux, Speech Note, Voxtype, Speed of Sound e Talon rodam o reconhecimento no seu próprio hardware, todos são gratuitos e todos são open source. Os modelos Whisper vão de uns 75 MB a vários gigabytes, e os de tamanho médio rodam de forma aceitável na CPU. As únicas ferramentas desta página que mandam áudio para um servidor são Voicy, NovaVoice e a digitação por voz do Google Docs.

Qual é o melhor ditado gratuito para Linux, e qual modelo ele deve rodar?

Handy se você está no X11 ou num compositor wlroots como Sway ou Hyprland. Vocalinux se você está no GNOME ou no KDE com Wayland, porque ele usa IBus em vez de um protocolo que o seu compositor recusa. Speech Note se o trabalho é transcrever gravações e não digitar ao vivo. Os três são gratuitos e open source. Quanto ao modelo, em inglês vale tentar o Parakeet antes do Whisper: no Open ASR Leaderboard público, o Parakeet TDT 0.6B v2 supera o Whisper large-v3 em taxa de erro de palavra e é cerca de dez vezes mais rápido. Em português a conta é outra, porque essa versão v2 é só de inglês: quem fala português precisa do Parakeet v3, treinado em português europeu, então compare v3 e Whisper com a sua própria voz antes de decidir. E esteja pronto para uma esquisitice comum a toda ferramenta baseada em Whisper desta página: diante do silêncio, o modelo às vezes inventa uma frase, tipo "Thank you". Isso é o modelo, não a sua configuração.

Preços, versões, conteúdo de pacotes e atividade dos projetos foram lidos em páginas de fornecedores, documentação oficial, na API do GitHub e nos próprios pacotes, em 27 de agosto de 2026. Esta página é reconferida a cada trimestre, e antes disso quando o Ubuntu 26.10 sair.

Comentários

Ainda não há comentários. Faça uma pergunta ou conte o que funcionou para você.

Deixar um comentário

Os comentários passam por revisão antes de aparecer, normalmente em até um dia.