El mejor software de dictado para Linux (2026): 9 opciones y por qué tu texto nunca llega

Algunos enlaces de esta página son de afiliado: tu precio no cambia. Cómo trabajamos.

Tu escritorio no lleva dictado incorporado. Ni GNOME, ni KDE, ni ninguna distribución que puedas instalar hoy, y eso está a punto de cambiar pero todavía no ha cambiado. Lo que sí puedes tener ahora mismo es una app gratuita y sin conexión que ejecuta un modelo de voz moderno en tu propia máquina y escribe en la ventana que estés mirando.

Por la redacción de VoiceBoardActualizado el 28 de agosto de 2026

El problema no es la precisión. La precisión se resolvió hace años y desde entonces ha vuelto a mejorar. El problema son los últimos cinco centímetros: sacar el texto reconocido de la app y meterlo en el campo que tenías delante. En Wayland ese paso falla, y falla en silencio, que es la razón por la que tanta gente concluye que el dictado en Linux no funciona cuando en realidad su transcripción era perfecta y sencillamente no fue a ninguna parte.

Esta página está organizada alrededor de ese problema. Los precios, las versiones y el contenido de los paquetes se leyeron en la fuente el 27 de agosto de 2026.

Nuestra elección

Handy es por donde debería empezar casi todo el mundo. Es gratuita, con licencia MIT, ejecuta Parakeet o Whisper enteramente en tu máquina, publica un .deb, un .rpm y un AppImage, y tuvo una versión nueva hace tres días. Reserva veinte minutos para el ayudante de inyección de texto, porque vas a tener que instalar uno.

Si estás en GNOME o KDE con Wayland, que es la mayoría de vosotros, empieza mejor por Vocalinux. Es el único proyecto que fue directo al caso más difícil, usando IBus como método de entrada en vez de pelearse con el compositor, y se actualizó el mismo día en que escribimos esto.

Si prefieres pagar antes que depurar, Voicy es la única app comercial de dictado de la que pudimos verificar que tiene una versión para Linux viva y al día. Descargamos su paquete y leímos lo que hay dentro: te configura durante la instalación el acceso privilegiado a /dev/uinput, que es justo el paso que si no te come una tarde entera. Es solo nube, $8.49 al mes o $260 de una vez.

Nuestras elecciones

PapelHerramientaPrecio hoy
Mejor opción gratuita en generalHandygratis, MIT
Mejor opción gratuita en GNOME o KDE con WaylandVocalinuxgratis, AGPL-3.0
Mejor si quieres que funcione sin más y estás dispuesto a pagarloVoicy$8.49/mes, o $260 una vez
Mejor para leer, traducir y transcribir archivosSpeech Notegratis, MPL-2.0
Mejor pulsar para hablar para gente de compositores de mosaicoVoxtypegratis, MIT
Mejor uso de la vía oficial de WaylandSpeed of Soundgratis, MIT
Mejor sin instalar absolutamente nadaEscribir por voz de Google Docs en Chromegratis
Mejor para manejar la máquina entera por voz, si todavía puedes conseguir una sesión X11Talongratis
La que recomiendan todos los artículos, y por qué nosotros nonerd-dictationgratis, GPL-3.0

Qué ha cambiado, y por qué los demás artículos no se han enterado

Se han movido cuatro cosas hace poco, y entre todas invalidan casi todo lo que está posicionando ahora mismo.

Canonical está metiendo el dictado dentro de Ubuntu. El 17 de junio de 2026 apareció un anuncio en el Ubuntu Community Hub presentando Myna, descrito como «una nueva iniciativa para llevar el dictado de voz a texto al escritorio de Ubuntu». Ejecuta modelos locales, los candidatos que nombran son Whisper, Nemotron y Qwen3-ASR, y «no se requiere conexión a internet una vez instalados los modelos necesarios». El objetivo es Ubuntu 26.10, y la primera entrega «apunta al escritorio de Ubuntu sobre Wayland, con GNOME como entorno principal validado». No te pongas a buscar una descarga: el repositorio canonical/myna se creó el 5 de junio de 2026, es GPL-3.0 y a día de hoy no tiene ninguna versión publicada. Los comandos de voz, el control del escritorio y la detección automática de idioma quedan explícitamente fuera del alcance de la primera versión. Aun así, la frase de apertura de todas las comparativas de esta categoría, esa de que Linux se queda fuera para siempre, ya tiene fecha de caducidad.

Talon se está yendo de Linux. Talon ha sido la respuesta para quien maneja un ordenador enteramente por voz, y su propia documentación de la versión 0.4.0 fija la postura sin rodeos: «los compositores de Wayland carecen de las API necesarias para Talon, y no está previsto dar soporte a Wayland». La página de descargas ofrece «Linux (X11)» y nada más. El 31 de mayo de 2026 OSnews informó de que Talon «va a eliminar de forma inminente TODO el soporte de Linux de la versión pública, a medida que X11 se apaga», y citó a desarrolladores de KDE discutiendo el razonamiento técnico: «Wayland implementa todas las API que Talon necesita para funcionar, pero sus desarrolladores sencillamente no están interesados en usarlas». No hemos visto que la eliminación llegue a publicarse. Lo señalamos porque los más afectados son justo quienes menos margen tienen para cambiarse.

«Inicia sesión en X11 y ya» dejó de ser un consejo. Esta es la que invalida más páginas sin hacer ruido. Las notas de publicación de GNOME cuentan la historia en tres líneas: la versión 47 añadió la posibilidad de desactivar las sesiones X11, GNOME 49 las desactivó por defecto cuando salió el 17 de septiembre de 2025, y GNOME 50, publicado el 18 de marzo de 2026, retiró por completo el soporte para ejecutar sesiones X11, llevándose con él los archivos de unidad específicos del servidor gráfico. Fedora 43 siguió el mismo camino a nivel de distribución, borrando de sus repositorios los paquetes de GNOME para X11 y migrando a esos usuarios a Wayland. KDE sigue ofreciendo sesión X11. GNOME no. Así que toda guía que se encoja de hombros y te diga que elijas X11 en la pantalla de inicio de sesión, incluida la guía de instalación de la herramienta de la que más dependen quienes no pueden teclear, está dando una instrucción que buena parte de sus lectores ya no puede seguir.

La herramienta que encabeza estos resultados de búsqueda está parada. Una entrada corta y honesta de enero de 2026 recomienda Whispering, y se ganó su puesto: el autor dictó el artículo entero con ella y lo dijo. Desde entonces, su última versión fue la v7.11.0 del 27 de diciembre de 2025, y el README del repositorio donde vive ahora dice, palabra por palabra, «Whispering, vocab, skills y el host de Epicenter no compilan ahora mismo». Los binarios antiguos se siguen descargando. Nadie está construyendo otros nuevos.

Por qué tu texto nunca llega

Esta es la sección que el resto del sector se salta, y es la pregunta de verdad.

Handy, la herramienta más usada de la categoría, lo dice en una línea en su propia incidencia de seguimiento: «Wayland no tiene una única API para la inserción programática de texto ni para registrar atajos globales». Las dos mitades del dictado están rotas por separado, y solo Handy arrastra 48 incidencias abiertas al respecto.

En X11, cualquier programa puede pedirle al servidor X que sintetice pulsaciones a través de la extensión XTEST, que está en el estándar desde 1992 y se describe a sí misma como «síntesis limitada de eventos de dispositivos de entrada, casi como si un usuario cooperativo hubiera movido el ratón o pulsado una tecla». Eso es lo que hace xdotool type. Funciona en todas partes, en todas las apps, sin permiso de ningún tipo. También significa que cualquier programa que ejecutes puede escribir en la web de tu banco y leer cada pulsación dirigida a cualquier otra ventana. X11 no tiene ninguna noción de que una app esté aislada de otra.

Wayland cerró ese agujero a propósito, y no lo sustituyó por una versión restringida. Sencillamente no existe una petición de «escribe esto en lo que tenga el foco», porque un objeto global de Wayland no puede saber quién lo está llamando, así que cualquier cosa expuesta ahí queda expuesta a todo. El propio README de xdotool enuncia la consecuencia sin adornos: «Escribir, buscar ventanas y muchas otras funciones de xdotool no funcionan, y no está claro que puedan funcionar alguna vez».

Así que las herramientas de dictado eligen un apaño, y cada uno funciona en unos sitios y en otros no. Hay cinco en circulación.

El protocolo de teclado virtual (zwp_virtual_keyboard_v1), que es lo que usa wtype. Limpio, seguro con Unicode e implementado solo por los compositores derivados de wlroots. GNOME no lo va a implementar, y lo dijo por escrito. Jonas Ådahl en 2021: «El protocolo de teclado virtual es poco probable que sea algo que vayamos a soportar; en su lugar, el plan para manejar cosas como xdotool, Synergy y similares es usar libei a través de un portal». Sebastian Wick, cerrando la petición de seguimiento el 26 de mayo de 2025: «Sí, Wayland no tiene control de acceso y tendríamos que exponer esto a todos los clientes. Tener y mantener varias formas de hacer lo mismo tampoco es sostenible». KDE tampoco lo ha implementado. Alguien que lo probó en Ubuntu 25.10 con KDE Plasma en noviembre de 2025 recibió el error tal cual: «El compositor no soporta el protocolo de teclado virtual». El rastreador de wtype arrastra esto como incidencia #45 desde el 25 de noviembre de 2022, y wtype en sí no tiene un commit de verdad desde enero de 2022. Si estás en GNOME o en KDE, wtype no es tu respuesta, por muchos artículos que lo listen.

La vía del núcleo (/dev/uinput), que es lo que usan ydotool y dotool. Creas un dispositivo de entrada virtual en el núcleo y escribes a través de él. Funciona en todos los compositores, en X11 y hasta en una TTY, por una razón: se sitúa por debajo del compositor, así que el compositor no tiene nada que opinar. La explicación más clara de esto vino de un artículo de febrero de 2026 sobre cómo poner el dictado a funcionar en COSMIC: tanto la detección del atajo como la salida del texto «operan a nivel del núcleo de Linux, por debajo del compositor de Wayland».

El precio es un permiso que casi todas las guías despachan en una línea, y merece algo mejor. ydotoold necesita acceso de escritura a /dev/uinput, lo que normalmente significa una regla de udev y añadirte al grupo input. Pero las reglas por defecto de systemd meten todos los dispositivos de entrada en ese grupo. Unirte a él no solo te deja escribir en un teclado virtual: te deja leer cada pulsación de todos los teclados reales, de forma permanente y sin ningún aviso. Estás cambiando un permiso mediado por el compositor por exactamente la capacidad que Wayland se construyó para quitar. Hazlo si quieres, pero hazlo sabiéndolo.

Hay además una diferencia de calidad entre las dos herramientas que no menciona nadie. ydotool envía códigos de tecla en bruto del núcleo y su propia documentación admite que «no reconoce si el usuario está usando una distribución de teclado personalizada». dotool enlaza libxkbcommon y sí entiende la distribución. Si tu teclado es cualquier cosa distinta del QWERTY estadounidense, y el español lo es, prefiere dotool: con la distribución española, las tildes, la eñe y los signos de apertura son justo lo que se pierde por este camino.

Un método de entrada (IBus). En lugar de fingir que es un teclado, la herramienta se registra como la maquinaria que alimenta de texto a las aplicaciones en primer lugar, la misma vía que gestiona la escritura china y japonesa. Transporta texto en vez de códigos de tecla, así que las distribuciones dejan de importar. Esta es la ruta que toma Vocalinux en GNOME y KDE, y es la que se siente más nativa de todas cuando funciona.

El portapapeles más un atajo de pegado. Copiar y luego enviar Ctrl+V. Suena trivial y es la opción más enrevesada de todas en la práctica. La guía de configuración de hyprwhspr es el mejor catálogo público de lo que sale mal: los terminales necesitan Ctrl+Mayús+V en vez de Ctrl+V, así que la herramienta tiene que saber en qué app estás, cosa que Wayland tampoco le va a decir, de modo que en GNOME acaba recurriendo al bus de accesibilidad para averiguarlo; Emacs usa Ctrl+Y y trata Ctrl+V como desplazamiento; en Dvorak o en bepo el código físico de la tecla v no es v; y con distribuciones tailandesa, rusa o árabe no hay ninguna tecla que produzca el símbolo v, así que la herramienta cambia brevemente tu fuente de entrada a una latina y luego la devuelve. Y en GNOME en concreto, como Mutter no implementa ninguno de los dos protocolos de control de datos, poner texto en el portapapeles exige abrir una superficie y tomar el foco del teclado, lo que significa robarle momentáneamente el foco a la app en la que estás dictando.

El portal de escritorio con libei, que es la ruta que el proyecto Wayland pretende de verdad. Tu app le pide permiso al escritorio una vez, mediante un diálogo, y a partir de ahí envía entrada por un canal sancionado donde el compositor sabe quién la manda. Esta es la respuesta correcta y no está terminada. Hasta libei 1.6.0, publicada el 15 de mayo de 2026, la interfaz transportaba códigos de tecla y un mapa de teclado, así que una herramienta de dictado seguía sin poder escribir un carácter ausente de tu distribución activa. Esa versión añadió una interfaz para enviar texto UTF-8 directamente, lo que elimina el problema por completo. Todavía no te ha llegado: KDE la tiene solo en master, y llegará con Plasma 6.8 en octubre de 2026, y la petición de fusión de GNOME lleva abierta desde el 24 de marzo de 2026 y ahora mismo está en conflicto.

Cuál funciona dónde

Verificado el 27 de agosto de 2026 contra tablas de soporte de protocolos y árboles de código de los compositores.

Tu configuraciónwtype (teclado virtual)ydotool / dotool (uinput)Método de entrada IBusPortal + libeiPegado por portapapeles
X11, cualquier escritoriono hace falta, usa xdotoolfuncionafuncionano hace faltafunciona
GNOME con Waylandno, y nunca lo haráfuncionafuncionasolo códigos de tecla, pide permiso una y otra vezfunciona, pero roba el foco
KDE Plasma con Waylandnofuncionafuncionacódigos de tecla ahora, texto en Plasma 6.8funciona
Sway, Hyprland, niri, river, Wayfire, labwcfuncionafuncionafuncionasin backend de portalfunciona
COSMICprotocolo presente, salida incorrectafuncionareportado como roto en una herramientainciertofunciona
Ventanas XWayland dentro de cualquiera de estospoco fiable, fallo de larga datafuncionase reporta desincronización de distribucióncombinaciones de teclas sí, Unicode nofunciona

COSMIC se gana su propia línea, porque es el fallo mejor documentado de la categoría. Allí wtype no da error. Escribe otra cosa. El artículo de febrero de 2026 describe decir «hello world» y recibir de vuelta 84 101 108 108 111, los propios códigos de tecla representados como cifras. Y lanzado a través de la acción de arranque del propio COSMIC, wtype falla sin ningún mensaje.

Otra trampa que merece nombre: XWayland no te salva. El Xwayland moderno puede encaminar las llamadas XTEST a través del portal, así que xdotool key ctrl+v seguirá funcionando dentro de una aplicación X. Pero reenvía el código de tecla en bruto y deja que lo interprete el compositor, lo que descarta en silencio el truco de xdotool de reescribir el mapa de teclado para alcanzar Unicode arbitrario. xdotool type con cualquier cosa fuera de tu distribución activa no produce nada, y en español eso incluye las vocales acentuadas, la eñe y los signos de apertura si tu distribución activa no es la española. Y wtype apuntado a una ventana XWayland tiene además su propio fallo de larga data, reportado repetidamente contra aplicaciones de Chromium y Electron desde 2022.

La persona con más derecho a estar molesta por todo esto es Jordan Sissel, que mantiene xdotool. Probando el estado de las cosas en noviembre de 2025, se encontró con GNOME 48 sacando el aviso «Permitir interacción remota» cada pocos minutos sin forma de concederlo permanentemente, y escribió: «Quiero hacer que esto funcione, pero no sé cómo seguir adelante con toda la fragmentación. Me da igual cuál sea el protocolo, pero me encantaría tener cualquier protocolo que haga lo que necesito. ¿Merece la pena continuar?»

Cómo saber qué se ha roto, en un minuto

Si el dictado parece no hacer nada, averigua qué mitad está rota antes de cambiar de herramienta.

  1. echo $XDG_SESSION_TYPE te dice x11 o wayland. La mitad de los consejos de internet dan por hecho el otro.
  2. ydotool type "hello" con el cursor dentro de una caja de texto. Si aparece «hello», la inyección funciona y tu problema es el audio o el modelo. Si no aparece nada, tu problema es la inyección.
  3. groups | grep input te dice si tienes permiso siquiera para usar la vía del núcleo.
  4. pactl list sources short muestra si tu micrófono es la fuente de la que la herramienta está grabando de verdad.

Esa secuencia vale más que cualquier tabla comparativa, incluida la nuestra.

Y aprende a reconocer la forma del fallo silencioso, porque está por todas partes en los rastreadores de 2026. La incidencia #523 de Vocalinux, del 15 de julio de 2026, se titula así: la app «informó de "Inyección de texto completada correctamente" mientras el texto nunca llegó a la aplicación». La incidencia #485, del 30 de junio de 2026, reporta una inyección que «no hace nada en silencio en COSMIC y en compositores wlroots cuando IBus está activo». El rastreador de Spokenly abre con la misma clase de fallo en COSMIC, reportado el 8 de agosto de 2026. Una marca verde en la ventana de dictado no es prueba de que se haya escrito nada.

Whisper ya no es la respuesta, y eso cambia qué instalar

Todos los artículos de esta categoría dan por supuesto Whisper. Esa suposición caducó durante 2025.

La Open ASR Leaderboard de Hugging Face es pública, reproducible y se actualiza continuamente. La leímos el 27 de agosto de 2026, cuando tenía 67 entradas. Aquí está dónde se sitúan de verdad los modelos que estas herramientas traen, medidos como tasa de error por palabra, donde menos es mejor, junto al RTFx, que es cuántos segundos de audio procesa el modelo por segundo de cómputo:

ModeloPuestoTasa de error por palabraVelocidad (RTFx)
NVIDIA Parakeet TDT 0.6B v2185.885,998
OpenAI Whisper large-v3457.03mucho más lento
OpenAI Whisper large-v3-turbo517.52más rápido que large-v3
Vosk, Kaldi, DeepSpeech, Coquini siquiera aparecen en la tabla

Parakeet saca un punto entero de tasa de error por palabra al mayor de los modelos Whisper y es aproximadamente un orden de magnitud más rápido, lo que en la CPU de un portátil es la diferencia entre que el texto aparezca cuando terminas de hablar y que aparezca tras una pausa incómoda. Aquí hay una advertencia que la versión inglesa de esta página no necesita: ese puesto 18 es de Parakeet v2, que transcribe únicamente en inglés, y la Open ASR Leaderboard mide solo en inglés. El Parakeet que te sirve a ti es el v3, que según la ficha de NVIDIA cubre 25 idiomas europeos, el español entre ellos, pero para el que no existe una comparación equivalente en esa tabla. Así que trata esos números como una prueba de que la arquitectura es buena y rápida, no como una medida de lo que te va a dar en español. Handy trae ya 69 modelos de 14 familias, incluidos Parakeet, Canary, Moonshine, Nemotron, Granite y Qwen3-ASR, y Whisper es una opción más entre ellos y no el sentido de la app.

Dos consecuencias sobre las que conviene actuar. Primera, si una herramienta ofrece Parakeet V3, pruébalo antes que Whisper, y compáralos tú mismo con tu propia voz, porque en español esa comparación no la ha hecho públicamente nadie. Segunda, cualquier cosa construida sobre Vosk va una generación por detrás, y eso incluye la herramienta que casi todos estos artículos colocan en segundo lugar.

Una salvedad que mantiene honestos los números: el mismo modelo en dos aplicaciones distintas no rinde igual, porque difieren el motor que lo envuelve y el posprocesado que viene después. Un usuario que comparaba dos apps ejecutando el mismo Parakeet V3 lo dijo con precisión en junio de 2026: «Esto era con el mismo modelo Parakeet por debajo; creo que las diferencias están en el motor que lo rodea, en el posprocesado y demás». Toma el puesto en una tabla de clasificación como un suelo, no como una promesa.

De un vistazo

HerramientaMejor paraPrecio (comprobado el 27 ago 2026)Motor¿Sale el audio de tu máquina?Cómo escribe
HandyDictado gratuito en casi cualquier escritorioGratis, MIT69 modelos de 14 familias, incluidos Parakeet V2 y V3, Canary, Moonshine y WhisperNoxdotool en X11; wtype o dotool en Wayland; ydotool en Ubuntu 26.04
VocalinuxGNOME y KDE con WaylandGratis, AGPL-3.0whisper.cpp con Vulkan, Whisper, VOSKNoIBus, con wtype en wlroots y un recurso al portapapeles
VoicyPagar por saltarse la configuración30 minutos gratis; $8.49/mes, $260 vitalicioSolo nube; el fabricante dice que es Whisper V3 alojado en GroqSí, nubeXTEST en X11; portapapeles más /dev/uinput en Wayland
Speech NoteTranscribir archivos, leer, traducirGratis, MPL-2.0whisper.cpp, Faster Whisper, VOSK, April-ASR, CoquiNo«Insertar en la ventana activa», necesita un demonio ydotool en marcha en Wayland
VoxtypePulsar para hablar en compositores de mosaicoGratis, MITwhisper.cpp, más Parakeet, Moonshine, SenseVoice y otros vía ONNXNowtype primero, dotool para distribuciones no estadounidenses, ydotool como último recurso
Speed of SoundLa vía sancionada de WaylandGratis, MITWhisper, Parakeet, Canary vía Sherpa ONNXNo, salvo que actives el pulido con LLMPortales de escritorio XDG
Escribir por voz de Google DocsUn documento, sin instalar nadaGratisGoogle, nubeSí, nubeNo escribe. El texto aterriza en el documento de Google
TalonControl completo sin manosGratis, Patreon para las betasConformer D, en el dispositivoNoSolo X11
nerd-dictationLa respuesta históricaGratis, GPL-3.0Solo VOSKNoxdotool, o ydotool/dotool/wtype

Las herramientas

Handy

Mejor para: la mayoría de la gente, la mayor parte del tiempo.

Precio: gratis, licencia MIT, 30,459 estrellas, última versión v0.9.6 del 24 de agosto de 2026.

Handy es una app de escritorio pequeña que graba mientras mantienes pulsada una tecla y suelta el texto terminado donde está el cursor. Su catálogo de modelos ha crecido hasta 69 modelos de 14 familias, todos ejecutándose en local: Parakeet, Canary, Moonshine, Nemotron, Granite, Qwen3-ASR y Whisper entre ellos. Parakeet V3 es el primero que hay que probar, descrito en su propia documentación como optimizado para CPU y con detección automática de idioma, que es lo que quieres si mezclas español e inglés al hablar. Hay AppImages para x86_64 y ARM, un .deb y dos .rpm en la última versión, así que instalarlo es un doble clic en casi cualquier sistema. Nada sale de tu máquina. Es, con mucha diferencia, la herramienta más usada de su clase, y por algo la gente acaba aquí.

Ahora la parte que su página de marketing se deja y su documentación dice en voz alta. Handy tiene «soporte limitado para el servidor gráfico Wayland». El ayudante de inyección lo instalas tú: xdotool en X11, wtype o dotool en Wayland, y específicamente ydotool en Ubuntu 26.04, que usa Wayland por defecto. Los atajos globales «deben configurarse a través de tu entorno de escritorio» y no dentro de la app. La superposición de grabación viene desactivada porque «ciertos compositores la tratan como la ventana activa». Y la documentación admite que los modelos Whisper «fallan en ciertas configuraciones de sistema».

Nada de eso la descalifica. Es una instalación de veinte minutos en vez de una de dos. Pero si estás en GNOME o en KDE con Wayland, ten en cuenta que el ayudante recomendado, wtype, es justo el que tu compositor rechaza, así que léete la sección anterior antes de empezar.

Vocalinux

Mejor para: GNOME o KDE con Wayland, que es el caso que peor manejan casi todas las herramientas.

Precio: gratis, AGPL-3.0. 783 estrellas, v0.16.0 publicada el 23 de agosto de 2026, con compilaciones nocturnas saliendo a diario.

Este es un proyecto pensado para Linux desde el principio, y no una app multiplataforma con un port de Linux, y se nota en las decisiones. En vez de intentar fingir que es un teclado, se registra como método de entrada IBus en GNOME y KDE, usa wtype donde wtype funciona de verdad, recurre a xdotool para las ventanas XWayland y tiene una vía por portapapeles para los compositores que no ofrecen nada más. Ese es el conjunto correcto de respuestas a la matriz de arriba, y ninguna otra herramienta de esta lista tiene las cuatro.

Ejecuta whisper.cpp por defecto con aceleración Vulkan, así que las GPU de AMD, Intel y NVIDIA entran todas en juego, y recurrirá a VOSK o a Whisper de PyTorch. La instalación es un script interactivo, un paquete de AUR, una compilación Flatpak o pip install vocalinux. Quiere Python 3.11 o posterior y Ubuntu 24.04 o equivalente.

El contrapeso honesto: es un proyecto joven con un equipo pequeño, y su propio rastreador es donde se ven las costuras. La incidencia #738, todavía abierta desde el 25 de agosto de 2026, describe la distribución de teclado desincronizándose entre GNOME, IBus y XWayland a mitad de dictado. La #664, del 10 de agosto, tiene al dictado cambiando calladamente una distribución brasileña ABNT2 a la estadounidense, y si escribes en español con teclado latinoamericano o español, ese es exactamente el tipo de fallo que te va a tocar. Las incidencias #485 y #523 son los fallos silenciosos de inyección citados antes. La tabla de compatibilidad de la web marca todos los compositores importantes como «soporte completo», que es más confianza de la que justifica el rastreador. Aun así, en GNOME con Wayland empezaríamos por aquí, porque la alternativa es hacer el mismo trabajo a mano.

Voicy

Mejor para: gente que quiere dictado, no un proyecto.

Precio: 30 minutos de grabación gratis y sin tarjeta. Pro cuesta $8.49 al mes, con un 20% de descuento pagando el año, y hay una licencia vitalicia por $260. Los equipos salen a $6.79 por puesto a partir de tres. Estudiantes y personas con discapacidad tienen un 20% de descuento. Comprobado en la página de precios el 27 de agosto de 2026.

Esto es lo que se siente al comprarlo. Instalas un paquete como instalas cualquier paquete, eliges un atajo durante la configuración, y a partir de ahí hablas en la ventana en la que estés y el texto terminado aparece con la puntuación ya puesta. Firefox, VS Code, un terminal, una caja de Slack, la barra de búsqueda. Ningún modelo que descargar, ninguna GPU en la que pensar, ningún demonio auxiliar que configurar. Si has pasado una tarde con los permisos de ydotool, sabes exactamente lo que eso vale.

Queríamos saber si la versión de Linux era real o una casilla marcada, así que fuimos a mirar, y esta es la parte que no hace nadie más en esta categoría. Las tres descargas responden con HTTP 200 y son sustanciales: el .deb pesa 134 MB, el .rpm 119 MB y el AppImage 174 MB. Las tres llevan una fecha de Last-Modified del 26 de agosto de 2026, el día antes de nuestra comprobación. Dentro del .deb, el archivo de control dice Version: 2.4.5, Architecture: amd64 y un tamaño instalado de unos 465 MB. La línea de dependencias es lo interesante: libxtst6, libnotify4, libasound2, libappindicator3-1, wl-clipboard, gjs. libxtst6 es XTEST, la vía de inyección de X11. wl-clipboard es la vía de Wayland. Y el script de posinstalación dice el resto en voz alta, en un comentario: concede «al usuario activo acceso de escritura a /dev/uinput para que el inyector de pegado de Wayland de Voicy pueda abrirlo», cargando el módulo uinput, escribiendo una regla de udev etiquetada como uaccess y creando el grupo input si no existe. Quien use el AppImage recibe lo mismo mediante una petición de pkexec en tiempo de ejecución. Añade además su propio repositorio de apt, así que se actualiza con el resto de tu sistema.

Un detalle de ese script merece reconocimiento, porque es mejor que lo que te dicen que hagas casi todas las guías. La regla de udev está etiquetada como uaccess, lo que entrega la ACL a quien esté con la sesión iniciada en el puesto, dejando el grupo como recurso de reserva para los sistemas que no lo soportan. Así que no te deja permanentemente en el grupo input, y no acabas pudiendo leer todas las pulsaciones de todos los teclados como efecto secundario. Concede la capacidad de escribir entrada sintética, y ahí se para. Esa es la versión más estrecha y más correcta del trato.

Así que: es una app de Electron que resuelve Wayland de la misma forma que ydotool, y toda su propuesta de valor en Linux es que hace por ti la configuración privilegiada en vez de dejarte una página de wiki. Eso es algo legítimo por lo que cobrar. No es magia, y quien te diga que es una clase distinta de tecnología te está vendiendo algo.

Dos límites dichos con claridad. No hay modo sin conexión, y el paquete lo demuestra. La propia tabla comparativa de Voicy dice «Funciona sin conexión: No», y dentro de la descarga no hay un solo artefacto de inferencia local: ni pesos ggml, ni ONNX, ni whisper.cpp, nada. Lo que sí hay son endpoints de WebSocket escritos a fuego, wss://us.usevoicy.com y wss://eu.usevoicy.com. Su documento de seguridad describe la ruta: el audio va de tu máquina a los servidores de Voicy en Heroku, en Estados Unidos, se «reenvía inmediatamente a Groq.com, que aloja el modelo de transcripción de código abierto Whisper V3», y ninguna de las dos partes lo almacena. Toma ese nombre de modelo como declaración del propio fabricante y no como algo que pudiéramos verificar desde fuera, pero si es exacto, entonces estás pagando por la fontanería y por la velocidad, no por un modelo mejor que el que las herramientas gratuitas ejecutan en local. La retención cero es una política real y con contenido. Sigue sin ser lo mismo que tu voz no saliendo nunca de la habitación.

Segundo, no lo probamos en un escritorio de verdad. Leímos el paquete, no la experiencia. En concreto no podemos decirte cómo se comporta la vía de pegado por portapapeles dentro de un terminal, donde Ctrl+V no es pegar.

La cifra de más del 99% de precisión que aparece en las páginas de marketing es el número del propio fabricante, sin verificar por nadie, nosotros incluidos.

Ver Voicy

Speech Note

Mejor para: convertir grabaciones en texto, y para idiomas que no soporta nadie más.

Precio: gratis, MPL-2.0. 1,610 estrellas, código actualizado el día que lo comprobamos. La versión actual de escritorio es la 4.8.4, del 15 de abril de 2026: la 4.9.0 existe pero salió solo para Sailfish OS, con la compilación de escritorio prometida más adelante.

Speech Note es antes una aplicación de notas que una herramienta de dictado, y merece la pena tenerla solo por el primer trabajo. Lleva 146 modelos de reconocimiento de voz repartidos en 42 idiomas, divididos entre cinco motores: Vosk, Whisper, Faster Whisper, April-ASR y el viejo Coqui STT. También hace lectura en voz alta y traducción automática sin conexión. Todo se ejecuta en local: «no se envía ningún dato a Internet». Instálala desde Flathub, o desde AUR, Packman de openSUSE u OpenRepos si estás en Sailfish. Cuenta con el disco: el Flatpak completo ronda 1 GiB de descarga y 3.6 GiB instalado, aunque la variante Tiny son 48 MiB. Para el español la cobertura es real: hay modelos Vosk grande y pequeño y un DeepSpeech Jaco, y conviene saber que sus entradas de Whisper y Faster Whisper son alias de los pesos multilingües de OpenAI, así que heredan exactamente las mismas alucinaciones que se describen más abajo.

Sí tiene un modo de «insertar en la ventana activa», así que puede hacer de dictado para todo el sistema, y la documentación es concreta sobre el precio en Wayland: «el demonio externo ydotool debe estar instalado y en marcha para que funcione. Si usas Flatpak, asegúrate además de que la aplicación tenga permiso para acceder al archivo de socket del demonio ydotool».

La limitación honesta es la generación de los modelos. Esa biblioteca es la alineación anterior a 2025: sin Parakeet, sin Canary, sin Nemotron. En amplitud de idiomas no hay nada aquí que se le acerque. En precisión bruta, una herramienta capaz de ejecutar Parakeet la va a superar.

Dónde encaja: si tu trabajo es una carpeta de grabaciones de entrevistas, o un idioma en el que los envoltorios de Whisper no han pensado, esto es lo más fuerte que hay gratis en Linux y no está ni cerca. Si tu trabajo es escribir en Slack todo el día, una de las apps de pulsar para hablar te va a sentar mejor.

Voxtype

Mejor para: Sway, Hyprland, niri, river y gente a la que le gusta un archivo de configuración.

Precio: gratis, MIT. 1,270 estrellas, último push el 25 de agosto de 2026.

Voxtype es pulsar para hablar construido por alguien que claramente usa un compositor de mosaico. Ejecuta whisper.cpp por defecto y puede cambiar a Parakeet, Moonshine, SenseVoice, Paraformer y otros a través de ONNX, todos en local, y afirma ir de 9 a 11 veces más rápido que el tiempo real en CPU. Se distribuye por AUR, .deb, .rpm, AppImage, Homebrew y cargo. Necesita glibc 2.38 o posterior y tu usuario en el grupo input.

Lo que lo hace digno de mención aparte es que es honesto con la matriz. Prueba wtype primero, cambia a dotool cuando tu distribución de teclado no es la estadounidense, y baja a ydotool para X11 y para las TTY. Su propia documentación dice que en KDE y GNOME wtype no está soportado y que necesitas dotool o ydotool. Esa sola frase es más útil que la cobertura de Wayland de todas las listas que hoy están posicionando. Y para quien escribe en español es justo la decisión importante, porque dotool es el único de los tres que respeta tu distribución de teclado.

Speed of Sound

Mejor para: quien quiere la vía oficialmente bendecida en lugar de un truco ingenioso.

Precio: gratis, MIT. 197 estrellas, último push el 13 de julio de 2026.

Solo en esta lista, Speed of Sound escribe a través de los portales de escritorio XDG, que es el mecanismo que el proyecto Wayland pretende de verdad que usen las aplicaciones para esto. Sin grupo input, sin regla de udev, sin lotería del protocolo de teclado virtual. La transcripción es local a través de Sherpa ONNX con Whisper, Parakeet o Canary, y hay un pulido opcional del texto mediante un LLM, que puedes apuntar a tu propio Ollama o llama.cpp si quieres que no salga del edificio. Flathub, Snap, AppImage, .deb y .rpm.

La razón por la que no es nuestra primera elección es el impulso. Es un proyecto más joven y más pequeño, con 61 incidencias abiertas y un ritmo de publicación más tranquilo que el de Handy o Vocalinux, y la cobertura de portales todavía varía según el escritorio. Pero arquitectónicamente es donde esta categoría debería acabar, y si la vía del portal te importa, instala esta primero.

Escribir por voz de Google Docs en Chrome

Mejor para: un documento, en una máquina donde no puedes instalar software.

Precio: gratis.

Abre un documento de Google en Chrome, pulsa Ctrl+Mayús+S y habla. La propia página de ayuda de Google enumera como requisito «las últimas versiones de: Chrome, Edge, Safari» y cubre unos 80 idiomas y variantes, el español entre ellos con varias variantes regionales; en Presentaciones funciona en las notas del orador y en los subtítulos. Ten en cuenta que Linux no aparece ni listado ni excluido en esa página, así que trátalo como no soportado pero funcional. Y hay una limitación que solo afecta a quien no dicta en inglés: los comandos de voz para dar formato, puntuar o moverse por el documento existen únicamente en inglés, y Google exige que el idioma de la cuenta y el del documento sean inglés para que aparezcan. Dictando en español tienes el reconocimiento, pero no el control por voz.

La limitación es total y evidente: las palabras aterrizan en el documento de Google y en ningún otro sitio. Para un ensayo, un portátil de trabajo bloqueado o un ordenador de biblioteca, es un trato justo y no cuesta nada. Para uso diario te vas a cansar de copiar y pegar hacia el jueves. Además manda tu voz a Google, lo que para una parte de los lectores de este artículo cierra la conversación por sí solo.

Talon

Mejor para: manejar un ordenador entero sin manos, si puedes quedarte en X11.

Precio: gratis de descargar. Un nivel de pago en Patreon desbloquea las compilaciones beta y el soporte prioritario.

Talon no es una app de dictado, es un sistema de entrada sin manos: comandos de voz, control por ruido donde un sonido se convierte en un clic, seguimiento ocular y scripting en Python para cualquier cosa que quieras definir. Su motor de voz, Conformer D, se ejecuta en tu máquina. Para quien programa por voz porque teclear le duele, ha sido la respuesta durante años, y nada más en esta lista intenta lo que hace él.

Lee bien el estado antes de invertir las semanas que cuesta aprenderlo.

La página de descargas ofrece «Linux (X11)». La documentación de la versión 0.4.0 dice: «los compositores de Wayland carecen de las API necesarias para Talon, y no está previsto dar soporte a Wayland». El 31 de mayo de 2026 OSnews informó de que se va a eliminar todo el soporte de Linux de la versión pública, y citó a desarrolladores de KDE rebatiendo el razonamiento: «Wayland implementa todas las API que Talon necesita para funcionar, pero sus desarrolladores sencillamente no están interesados en usarlas».

Hay además un dato que pone el resto en contexto. Comprobamos las cabeceras de las tres descargas públicas, Linux, macOS y Windows. Todas llevan Last-Modified: 24 de julio de 2023. La compilación estable pública tiene tres años en todas las plataformas, no solo en esta. El desarrollo activo vive en el canal beta de pago. Esa es una forma legítima de llevar un proyecto, y conviene saberlo antes de montar un flujo de trabajo sobre la compilación gratuita.

Y aquí es donde se pone verdaderamente mal, y no solo incómodo. La guía de instalación de Talon dice: «Talon, como muchas herramientas de automatización o accesibilidad, no soporta Wayland. Tendrás que seleccionar una sesión X11 en tu gestor de inicio de sesión». Desde GNOME 50, en marzo de 2026, no hay ninguna sesión X11 que seleccionar en tu gestor de inicio de sesión. Para un usuario de GNOME que maneja su ordenador por voz porque no puede usar un teclado, el apaño documentado ya no existe en su máquina. Nada más en esta categoría intenta lo que hace Talon, y por eso merece decirse sin rodeos en vez de doblarlo dentro de una lista de pros y contras.

Si lo que necesitas es control por voz y no dictado, y ya estás en Wayland, mira numen, software libre dirigido al mismo trabajo, que escribe a través de /dev/uinput y por tanto funciona igual en X11, en Wayland y en una TTY. Es una cosa más pequeña que Talon. También es una cosa que funciona.

nerd-dictation

Mejor para: nada, en 2026, y sigue apareciendo en todos los artículos.

Precio: gratis, GPL-3.0. 1,913 estrellas.

Esta es la herramienta que recomienda el género entero, y en su momento se lo mereció. Es un único archivo de Python con casi ninguna dependencia que canaliza VOSK hacia xdotool, y fue lo primero que hizo que el dictado en Linux pareciera posible. Su autor fue claro con el trato, incluida la línea del README que explica la mayoría de las quejas sobre él: «El texto que sale de VOSK está todo en minúsculas».

Dos cosas han cambiado por debajo. Su último commit es del 10 de octubre de 2025, hace unos diez meses, con 83 incidencias abiertas, varias sobre Wayland y sobre distribuciones de teclado que llevan abiertas desde 2021. Y VOSK ya no es competitivo. No aparece en la Open ASR Leaderboard en absoluto, su última versión fue la v0.3.50 en abril de 2024, y su precisión se desmorona fuera del audio limpio: el modelo pequeño de inglés ronda un 9.85% de tasa de error por palabra en habla leída limpia, y el grande llega al 29.78% en grabaciones de centro de llamadas. Para el español, Vosk publica 7.50 con el modelo grande y 16.02 con el pequeño sobre Common Voice, y ninguna cifra sobre audio ruidoso, así que la parte de «se desmorona con audio real» no se puede comprobar en español. Un desarrollador que trabajaba en Arch con Wayland en enero de 2026 describió el resultado práctico: Vosk producía «alucinaciones esporádicas: durante el silencio, Vosk soltaba aleatoriamente "the" o "there"», además de la puntuación llegando como palabras literales, y concluyó que hay que «saltarse Vosk por completo».

Una cosa más que conviene saber si publicas algo construido sobre él: los modelos de Vosk no son uniformemente permisivos. vosk-model-small-fr-pguyot-0.3 es CC BY-NC-SA, que prohíbe el uso comercial, y vosk-model-fr-0.6-linto es AGPL. Buena noticia si trabajas en español: los dos modelos españoles, el grande y el pequeño, son Apache 2.0, así que esa trampa concreta no te toca. Aun así, comprueba la licencia del modelo concreto y no la del kit.

Si ya lo usas y estás contento, nada de lo de aquí te obliga a moverte, y Elograf le da una interfaz gráfica mantenida. Si estás empezando hoy porque te lo dijo una lista, empieza por otro sitio.

Adónde va tu voz

Para un público de Linux esto no es una nota al pie, así que aquí va sin rodeos.

El audio nunca sale de tu máquina: Handy, Vocalinux, Speech Note, Voxtype, Speed of Sound (salvo que actives el pulido con LLM), Talon, nerd-dictation.

El audio va a un servidor: Voicy, Escribir por voz de Google Docs, NovaVoice.

Lee esa columna dos veces. Todas las herramientas de la lista de arriba que se quedan tu voz en casa son gratuitas, y todas son de código abierto. Eso no pasa en Windows ni en macOS, y es lo más fuerte que tiene esta plataforma en esta categoría. Si el procesamiento local es la razón por la que estás en Linux, no tienes que ceder en nada y no tienes que pagar.

Hay una segunda cuestión de privacidad específica de Linux que nadie plantea bien. Darle a una app de dictado el acceso a /dev/uinput que necesitan aquí casi todas las herramientas capaces de trabajar con Wayland compra más que la capacidad de sintetizar entrada. Por cómo agrupan los dispositivos de entrada las reglas por defecto de systemd, unirte al grupo input también permite que cualquier cosa que se ejecute con tu usuario lea cada pulsación de cada teclado físico de la máquina. Esa es exactamente la capacidad que Wayland quitó a propósito, devuelta por un paso de instalación de una línea. Las herramientas la piden porque todavía no hay una opción universal mejor, y la vía del portal es la salida, que es parte de por qué valoramos el enfoque de Speed of Sound aunque la app sea más pequeña. Si una herramienta monta esto con una etiqueta de udev uaccess en vez de meterte en el grupo, como hace el paquete de Voicy, está pidiendo la versión estrecha del permiso y eso es preferible.

Ya que estamos siendo ecuánimes: KDE Plasma tiene un agujero propio que nadie ha cerrado. KWin todavía expone un protocolo heredado de entrada falsa a todos los clientes de Wayland sin condiciones, y su función de autorización es un esqueleto con un comentario // TODO: make secure encima de una línea que aprueba la petición. En Plasma con Wayland, cualquier aplicación que ejecutes puede inyectar pulsaciones sin ningún aviso. Eso no es un argumento contra KDE, es un argumento a favor de leer código en lugar de páginas de seguridad, y es la misma razón por la que abrimos el paquete de Voicy en vez de fiarnos de su marketing.

Y un aviso que se aplica a todas las herramientas basadas en Whisper de esta página: Whisper alucina con el silencio. De vez en cuando produce una frase suelta cuando no has dicho nada, un comportamiento seguido en la incidencia #331 de Vocalinux, del 18 de marzo de 2026, y del que se queja mucha gente. En inglés lo típico es «Thank you»; dictando en español lo que aparece son créditos de subtítulos, porque el modelo se entrenó con subtítulos y esas líneas van donde ya no habla nadie: «Subtítulos realizados por la comunidad de Amara.org», «Gracias por ver el video» o «Dale like y suscríbete». Es una propiedad del modelo, no un fallo de la app que hayas elegido.

Qué hemos comprobado y qué no

No hicimos una prueba comparativa de precisión, y no vamos a insinuar lo contrario.

Y hay algo que decir sobre este campo en concreto: tampoco lo ha hecho nadie más. Leímos todos los artículos que posicionan para estas búsquedas y no hay un solo número medido en ninguno. Ni tasa de error por palabra, ni latencia, ni cifra de memoria, ni tiempos, y casi ninguna captura de pantalla. Las tablas comparativas llevan todas una columna de «Precisión», y cada celda de cada una de ellas es un adjetivo. Lo cual es doblemente hueco, porque dos apps ejecutando el mismo modelo Parakeet V3 producen resultados visiblemente distintos según su motor y su posprocesado.

Así que en vez de inventarnos números, fuimos a buscar los que ya existen y son reproducibles, en la Open ASR Leaderboard pública, y verificamos en la fuente todo lo demás que se puede comprobar. El 27 de agosto de 2026:

Dos cosas que señalamos en vez de pasarlas por alto. No instalamos ni usamos ninguna de estas herramientas en un escritorio real, así que la matriz de compositores de aquí está montada a partir de documentación, rastreadores de incidencias e informes prácticos y fechados de otras personas, no de nuestra propia máquina. Y Reddit no es accesible desde donde trabajamos, así que toda voz de la comunidad en esta página viene de una fuente en la que puedes hacer clic.

La competencia

Herramientas y respuestas que miramos y dejamos fuera, y por qué.

Wispr Flow es el nombre más buscado de toda esta categoría por gente que está en Linux, y la respuesta es no. Su documentación lista como dispositivos compatibles «Mac, Windows, iOS, Android» y luego dice: «iPad, Linux, Chromebooks y máquinas virtuales o entornos de escritorio remoto no están soportados». Un artículo de ayuda aparte es aún más rotundo: «No hay aplicación nativa para Linux». Si ejecutas Linux dentro de WSL o de una máquina virtual sobre un anfitrión Windows o Mac, Flow puede pegar dentro desde el lado del anfitrión, y esa es toda su historia con Linux.

El reempaquetado no oficial de Wispr Flow en wispr-flow-linux existe, tiene unas 100 estrellas y combina la app de Electron con un ayudante en Rust hecho de cero que reimplementa la inyección de texto que Wispr solo publica en macOS y Windows. Hasta tiene un comando --doctor que comprueba tu tipo de sesión y el acceso a /dev/uinput, lo que te dice cuál era la parte difícil. Lo nombramos porque lo vas a encontrar, no porque lo recomendemos: reempaqueta la aplicación propietaria de otro, y esa es una decisión que hay que tomar con los ojos abiertos.

Superwhisper, VoiceInk, Aqua Voice y Typeless se buscan todos con «linux» detrás, y ninguno tiene versión para Linux. VoiceInk es solo macOS y solo en Apple Silicon.

Dragon NaturallySpeaking bajo Wine es la respuesta más antigua de esta categoría y nunca ha funcionado como la gente espera. La propia base de datos de aplicaciones de WineHQ, que es donde esto se zanja en vez de discutirse, califica a Dragon 13, 15 Home y 15 Professional todos como Basura. La mejor calificación que ha conseguido cualquier versión es Plata, para la 12.5, marcada como obsoleta y probada por última vez el 27 de enero de 2021. E incluso esa entrada contiene la frase que acaba con la idea: «El dictado funciona solo dentro del entorno de Wine... El texto se puede cortar y pegar en cualquier aplicación». Así que el mejor caso, con una versión de hace más de una década, es dictar en una ventana de Windows y pegar desde ahí. Seamos justos con el registro, eso sí: nadie ha vuelto a probar Dragon sobre una versión actual de Wine desde 2022, así que «hoy falla» es una suposición y no una medición. El apaño que la gente adoptó de verdad fue una máquina virtual de Windows retransmitiendo texto por un socket, que un desarrollador describió haber montado en Hacker News en 2023. Si has llegado aquí desde una búsqueda sobre Dragon, coge en su lugar la vía local de Parakeet o Whisper. La precisión a la primera te va a sorprender y no cuesta nada.

Buzz tiene 21,162 estrellas y aparece en estas listas constantemente. Transcribe archivos y entrada de micrófono dentro de su propia ventana. No tiene ninguna función de escribir en la app enfocada y nadie la ha pedido. Excelente en su trabajo, que no es el trabajo de esta página.

Wspr es una compra única de $14.99 con whisper.cpp en local y un .deb, lo que suena ideal hasta que lees los requisitos: escribe mediante xdotool a través de XWayland, y su propia documentación dice que «las configuraciones puramente Wayland todavía no están soportadas». Barato, honesto y específicamente no para la configuración que tiene la mayoría de los lectores.

Spokenly merece mención por tener un nivel local gratuito de verdad con tu propia clave, un Pro a $99.99 al año y la sección sobre Wayland mejor organizada de cualquier blog de fabricante. También tiene una incidencia abierta, del 8 de agosto de 2026, que informa de que el texto no se pega en la app de destino en COSMIC porque la superposición roba el foco. Vende la solución a un problema que no ha terminado de resolver.

NovaVoice es la otra app comercial con cliente de Linux, .deb y AppImage para Ubuntu 20.04+, Debian y Fedora, a $10 al mes. Solo nube, y su página de Linux no dice absolutamente nada sobre X11 o Wayland, que para esta categoría es la pregunta entera.

Simon, CMU Sphinx, Julius e IBM ViaVoice aparecen en comparativas publicadas este año. Se están copiando de una página de Wikipedia cuyas fuentes son en su mayoría de 2012 y que no contiene la palabra Wayland en ninguna parte. ViaVoice se fue del mercado en 2002. DeepSpeech quedó archivado tras la v0.9.3 en diciembre de 2020. Coqui STT escribió su propio epitafio en su README, «este proyecto ya no se mantiene activamente... hemos visto el foco desplazarse hacia modelos de voz a texto más nuevos como Whisper», y la empresa que había detrás cerró el 3 de enero de 2024. Kaldi es la excepción de esa lista: sigue recibiendo commits, pero es un kit de investigación para construir reconocedores, no algo que instales para dictar un correo. Ninguno aparece en la tabla de clasificación de ASR. Sáltate cualquier artículo que los recomiende como apps de dictado, lo que por desgracia significa saltarse varios de los que están por encima de esta página.

Whispering tiene nuestra simpatía y una advertencia. Buena herramienta, seguidores reales, y el artículo mejor posicionado de esta categoría se dictó a sí mismo con ella. Su repositorio original dice ahora mismo que no compila. Los binarios del 27 de diciembre de 2025 se siguen instalando bien si la quieres.

Myna no está aquí como recomendación porque no puedes instalarla. Vuelve en Ubuntu 26.10.

La marea de envoltorios ya es una industria. OpenWhispr tiene 5,781 estrellas, OpenLess 3,334, hyprwhspr 1,176, y Dictee, diminuta con 56 estrellas pero el diseño más interesante del montón: pensada para Wayland desde el principio, plasmoide de KDE, Parakeet TDT v3 por defecto e inyección consciente de la distribución de teclado a través de evdev. Más allá de esas: Sotto, VOXD, Blurt, whisrs, lokstt, hyprvoice, waystt, LinuxWhispr, Vibe Typer, y llegando más cada mes, varias escritas por alguien que quería Wispr Flow y no podía tenerlo. Algunas son genuinamente buenas. Nombramos la categoría en vez de fingir que hemos probado a cada miembro. Si quieres explorar, nuestra guía de dictado de código abierto entra más a fondo, y el catálogo completo de lo que cubrimos vive en apps de dictado.

Un patrón contra el que armarte mientras exploras: al menos tres de las apps de dictado de pago para Linux se describen cada una como «la única» app de dictado de pago para Linux. Se citan los blogs unas a otras. Comprueba la página de descargas, no la afirmación.

Preguntas frecuentes

¿Linux tiene voz a texto integrado como Windows y macOS?

No. En ningún escritorio principal, en ninguna distribución, hoy. Comprobamos los propios paneles de accesibilidad en vez de la documentación: la página de accesibilidad de escritura de GNOME ofrece teclado en pantalla, parpadeo del cursor, repetición de teclas, teclas persistentes, teclas lentas y teclas de rebote, y las palabras dictado, voz y habla no aparecen por ninguna parte. El módulo de accesibilidad de KDE cuenta lo mismo. Orca es un lector de pantalla, que es voz saliendo, no entrando. La confirmación más clara es que Canonical anunció el dictado el 17 de junio de 2026 como «una nueva iniciativa» dirigida a Ubuntu 26.10, y que una propuesta de junio de 2026 en el propio foro de GNOME pidiendo dictado para todo el escritorio no obtuvo ningún compromiso de los mantenedores, solo indicaciones hacia herramientas de terceros.

¿Por qué mi dictado transcribe bien pero no aparece nada en el campo de texto?

Porque reconocer y escribir son dos trabajos separados, y en Wayland el segundo está restringido por diseño. Tu herramienta probablemente está usando wtype, que necesita un protocolo que ni Mutter de GNOME ni KWin de KDE implementan y que, en el caso de GNOME, han declinado públicamente implementar. Prueba la vía de inyección directamente con ydotool type "hello" con el cursor dentro de una caja de texto. Si no aparece nada, el problema es la inyección, no el modelo. Cambia la herramienta a dotool, que respeta tu distribución de teclado y es el que quieres si escribes en español con tildes y eñes, o usa una que vaya por IBus o por el portal de escritorio.

¿Wispr Flow funciona en Linux?

No. Su documentación dice que Linux no está soportado y que «no hay aplicación nativa para Linux». Si buscas la misma sensación, Handy es el equivalente gratuito más cercano y Voicy el de pago más cercano.

¿Puedo dictar en Linux sin mandar mi voz a ninguna parte?

Sí, y este es el punto fuerte de la plataforma. Handy, Vocalinux, Speech Note, Voxtype, Speed of Sound y Talon ejecutan todos el reconocimiento en tu propio hardware, todos son gratuitos y todos son de código abierto. Los modelos Whisper van de unos 75 MB a varios gigabytes, y los de tamaño medio corren aceptablemente en CPU. Las únicas herramientas de esta página que mandan audio a un servidor son Voicy, NovaVoice y Escribir por voz de Google Docs.

¿Cuál es el mejor dictado gratuito para Linux, y qué modelo debería ejecutar?

Handy si estás en X11 o en un compositor wlroots como Sway o Hyprland. Vocalinux si estás en GNOME o KDE con Wayland, porque usa IBus en vez de un protocolo que tu compositor rechaza. Speech Note si el trabajo es transcribir grabaciones y no escribir en directo. Las tres son gratuitas y de código abierto. Para el modelo, prueba Parakeet antes que Whisper, con una salvedad importante si dictas en español: la ventaja que muestra la Open ASR Leaderboard pública, donde Parakeet TDT 0.6B v2 supera a Whisper large-v3 en tasa de error por palabra y es unas diez veces más rápido, está medida solo en inglés y ese v2 solo transcribe inglés. El que cubre el español es el v3, sin comparación pública equivalente, así que pruébalo con tu propia voz. Y prepárate para una rareza compartida por todas las herramientas basadas en Whisper de esta página: ante el silencio, el modelo se inventa a veces una frase, y en español suelen ser créditos de subtítulos del tipo «Subtítulos realizados por la comunidad de Amara.org». Eso es el modelo, no tu configuración.

Los precios, las versiones, el contenido de los paquetes y la actividad de los proyectos se leyeron en las páginas de los fabricantes, en la documentación oficial, en la API de GitHub y en los propios paquetes el 27 de agosto de 2026. Esta página se revisa cada trimestre, y antes cuando salga Ubuntu 26.10.

Comentarios

Todavía no hay comentarios. Haz una pregunta o cuéntanos qué te ha funcionado.

Dejar un comentario

Los comentarios se revisan antes de publicarse, normalmente en menos de 24 horas.