Dictado por voz para programadores (2026): Claude Code, Cursor, VS Code y el terminal
Antes de instalar nada: la herramienta que ya usas probablemente lleve dictado dentro. Claude Code sacó /voice en primavera, Cursor tiene micrófono en el cuadro de chat desde octubre de 2025, y VS Code dicta dentro del editor desde antes que eso. Todo lo de esta página sale de la documentación oficial, de los registros de cambios y de los registros de paquetes, leídos el 27 de agosto de 2026, incluidas las condiciones que se callan las guías escritas por los vendedores de dictado, y son unas cuantas.
La razón para añadir una herramienta de pago no es que las integradas sean malas. Es que cada una cubre exactamente una ventana. Si te mueves entre un terminal, un editor, un navegador y Slack, acabas queriendo un único atajo que funcione en todos ellos, y eso es lo que pagas.
Para tener un solo atajo en todas partes, a la mayoría de los programadores les recomendamos Wispr Flow. Si el código no puede salir de tu máquina, Handy hace el mismo trabajo gratis y no envía audio a ninguna parte.
- Claude Code: escribe
/voice. Viene incluido, no gasta tokens y necesita una cuenta de Claude.ai. - Cursor: mantén pulsado
Ctrl+Men el cuadro de chat. Integrado desde Cursor 2.0. - VS Code y Copilot Chat:
Ctrl+Ipara el chat,Ctrl+Alt+Vpara dictar dentro del editor. El reconocimiento se ejecuta en tu máquina. - Warp: activa la voz en Settings, Agents, Warp Agent, Voice.
- Todo a la vez, incluido el terminal: una capa para todo el sistema como Wispr Flow, Superwhisper o Handy.
- Código que no puedes enviar a ninguna parte: Handy (gratis, MIT), VoiceInk en Apple Silicon, o la extensión VS Code Speech.
- Linux: Voicy si quieres una app comercial, Handy si la quieres gratuita.
- Manejar un editor sin tocar el teclado: Talon más Cursorless. Gratis, y un deporte completamente distinto.
Bajo la etiqueta «programar por voz» viven dos trabajos distintos
Casi todas las discusiones sobre este tema nacen de confundirlos.
Dictarle la intención a un agente. Dices lo que quieres, la prosa entra en un cuadro de prompt y el modelo escribe el código. Tu editor no cambia en nada. Esto es lo que hacen las funciones integradas, lo que hace una app de dictado, y para la mayoría de quienes leen esto es la tarea entera. Tiempo de configuración: un minuto.
Manejar el editor con la voz. Das órdenes estructuradas que mueven el cursor, seleccionan un token, borran un argumento, renombran un símbolo. Sin teclear en ningún momento. Esto es Talon y Cursorless: una destreza que se aprende, no una app que se instala, y quienes la dominan suelen haber llegado ahí porque teclear empezó a dolerles.
El primer trabajo se volvió fácil en 2026. El segundo es posible desde 2018 más o menos y sigue siendo difícil. Si has llegado aquí porque te duelen las muñecas, salta a la sección de Talon: una app de dictado no te va a resolver el problema.
Por qué esto ha empezado a tener sentido
Un prompt a un agente de programación no es una línea de código. Son doscientas palabras de prosa que describen qué quieres, qué archivos están implicados, qué has intentado ya y cuáles son las restricciones. La prosa es justo aquello en lo que el habla es buena y justo aquello que se teclea despacio.
Las cifras que se citan sobre esto vienen de un único estudio de 2016 de Ruan, Wobbrock, Liou, Ng y Landay (arXiv:1608.07323). En un iPhone 6 Plus, la entrada por voz en inglés alcanzó 153 palabras por minuto frente a 52 del teclado en pantalla, unas tres veces más rápido, con el mandarín en 123 frente a 43. Conviene saberlo antes de repetir el dato: aquello era teclear con los pulgares en un móvil. La comparación que a ti te interesa es con un teclado físico, y el mayor estudio sobre eso, el de Dhakal y sus colegas en el CHI 2018, con 168,000 participantes y 136 millones de pulsaciones, también dio una media de 52 palabras por minuto, con el cinco por ciento más rápido por encima de 80.
Así que para quien teclea a velocidad media la diferencia sí ronda el tres a uno. Si tecleas a 100 palabras por minuto, la diferencia baja a 1.5 y el argumento a favor de la voz deja de ser la velocidad. El mismo estudio de 2016 encontró que el habla dejaba algo más de errores sin corregir en el texto final, 1.30 por ciento frente a 0.79 por ciento, algo que pesa más cuando dictas la ruta de un archivo que cuando dictas una frase.
La versión honesta del argumento: el dictado no te convierte en mejor programador ni en uno más rápido. Abarata los prompts largos, así que escribes la versión de tres frases en lugar de la de seis palabras, y el agente adivina menos.
De un vistazo
| Herramienta | Qué cubre | Precio comprobado el 27 ago 2026 | Dónde se procesa el audio |
|---|---|---|---|
Claude Code /voice | El prompt de Claude Code, en el terminal y en la extensión de VS Code | Gratis con un plan de Claude.ai, sin coste en tokens | Los servidores de Anthropic |
| Voz de Cursor | Solo el cuadro de chat de Cursor | Incluido con Cursor | Sin documentar |
| VS Code Speech | Copilot Chat y el editor de VS Code | Gratis | En tu máquina |
| Voz de Warp | Las superficies de entrada de Warp y su agente | Incluido con Warp | El servicio de Wispr Flow |
| Wispr Flow | Todas las apps en Mac, Windows, iPhone, Android | Gratis 2,000 palabras/semana; Pro $15/mes, $12/mes anual | Nube |
| Superwhisper | Todas las apps en Mac, Windows, iOS | Plan gratuito permanente; Pro $8.49/mes | Modelos locales o nube, tú eliges |
| Handy | Todas las apps en Mac, Windows, Linux | Gratis, licencia MIT | En tu máquina, siempre |
| VoiceInk | Todas las apps en Macs con Apple Silicon | $29 / $49 / $69 pago único | En tu máquina por defecto |
| Voicy | Todas las apps en Mac, Windows, Linux, y también en móvil | 30 minutos gratis; $8.49/mes; $260 vitalicio | Nube (Groq) |
| Voibe | Todas las apps en Mac y Windows | $7.50/mes, $59/año, $149 vitalicio | Local en Apple Silicon, nube en Windows |
| Talon + Cursorless | Toda la máquina, y edición estructural en VS Code | Gratis, Patreon para las versiones beta | En tu máquina |
Claude Code: el comando /voice
Es la opción que se lleva el tráfico de búsqueda y también la peor descrita en los artículos que posicionan por ella, así que aquí va el cuadro completo a partir de la documentación de Anthropic.
Cómo activarlo. Escribe /voice en la CLI. La primera vez hace una comprobación del micrófono, y en macOS ese es el momento en que tu terminal por fin te pide permiso para usarlo. El pie del prompt confirma el estado:
Voice mode enabled (hold). Hold space to record. Dictation language: en (/config to change).
/voice hold, /voice tap y /voice off fijan el modo directamente. El ajuste sobrevive a los reinicios, y puedes saltarte el comando poniéndolo en tu archivo de ajustes de usuario:
{ "voice": { "enabled": true, "mode": "tap" } }
El modo hold, el que viene por defecto, es pulsar para hablar con la barra espaciadora. Hay una peculiaridad que conviene conocer: Claude Code detecta que mantienes una tecla vigilando los eventos de repetición que manda el terminal, así que hay un pequeño calentamiento, el pie dice keep holding… antes de decir listening…, y los espacios sueltos que se cuelan se limpian solos. El texto aparece atenuado mientras hablas y se inserta en el cursor cuando sueltas, lo que significa que puedes teclear media frase, decir el resto y seguir adelante.
El modo tap elimina el calentamiento: toca el espacio una vez para empezar, tócalo otra para parar, y el prompt se envía solo si la transcripción tiene al menos tres palabras. La grabación se detiene por su cuenta tras 15 segundos de silencio o dos minutos en total. El primer toque solo funciona con la entrada vacía, así que puedes seguir escribiendo un espacio con normalidad.
Dos ajustes que conviene cambiar el primer día. Añade "autoSubmit": true al objeto voice si quieres que el modo hold envíe al soltar en vez de esperar al Enter. Y si el calentamiento de la barra espaciadora te molesta, reasigna la acción en ~/.claude/keybindings.json, porque una combinación con modificador empieza a grabar en la primera pulsación y sin calentamiento ninguno:
{ "bindings": [ { "context": "Chat", "bindings": { "meta+k": "voice:pushToTalk" } } ] }
El transcriptor está apuntado a nuestro vocabulario, no al habla general. Anthropic dice que maneja bien términos como regex, OAuth, JSON o localhost, y que el nombre de tu proyecto actual y el de tu rama de git se le pasan automáticamente como pistas de reconocimiento. Ese último detalle es de los que deciden si el dictado sirve o no, y ninguna herramienta de terceros puede hacerlo sin leer tu repositorio.
Veinte idiomas de dictado, que se eligen con /config o con el ajuste language: checo, danés, neerlandés, inglés, francés, alemán, griego, hindi, indonesio, italiano, japonés, coreano, noruego, polaco, portugués, ruso, español, sueco, turco y ucraniano. Cualquier otro recurre al inglés con un aviso al activarlo.
Y ahora las condiciones, que es donde las guías de los vendedores se quedan calladas. El dictado por voz requiere:
- Una cuenta de Claude.ai. No está disponible si apuntas Claude Code directamente a una clave de API de Anthropic, a Amazon Bedrock, a Agent Platform de Google Cloud o a Microsoft Foundry. Buena parte de los usuarios profesionales trabajan justo con esos montajes, y para ellos
/voicesencillamente no está. - Un micrófono local. No funciona por SSH ni en Claude Code en la web, porque el micrófono está en tu portátil y el proceso no.
- WSLg, si ejecutas Claude Code bajo WSL. Viene con WSL2 de la Microsoft Store. En WSL1 te dicen que ejecutes Claude Code en Windows nativo.
El audio va a los servidores de Anthropic. La documentación lo resuelve en cuatro palabras: «El audio no se procesa localmente». A cambio, la transcripción «no consume mensajes ni tokens de Claude y no cuenta para los límites que muestra /usage», así que la función es gratis en el sentido que importa.
La extensión de VS Code tiene la misma función y la misma exigencia de cuenta de Claude.ai, y no está disponible en sesiones remotas de VS Code, es decir SSH, Dev Containers y Codespaces. El administrador de tu organización también puede desactivarla entera por política, y en ese caso /voice te lo dice.
En Linux, la grabación usa un módulo nativo, y si ese módulo no carga, Claude Code recurre a arecord de ALSA utils o a rec de SoX. Bajo WSLg necesitas el backend de PulseAudio de forma explícita, sudo apt install sox libsox-fmt-pulse, porque el sox a secas arrastra el backend de ALSA y no hay ningún /dev/snd del que grabar. Esa única línea le ahorra una tarde a cualquiera que programe en WSL.
Cuándo llegó. Anthropic no fecha su registro de cambios, así que lo abordamos de lado. De las 377 versiones del registro público, la primera entrada que menciona la voz es la 2.1.69, que añadió diez idiomas de dictado más hasta llegar a veinte, y el registro de npm fecha esa versión el 4 de marzo de 2026. Así que la función aterrizó justo al principio de marzo de 2026 y desde entonces recibe correcciones a buen ritmo, casi todas sobre audio en Linux, sobre WSL y sobre terminales que no envían eventos de repetición de tecla.
Cursor: el micrófono del cuadro de chat
Cursor añadió la voz en Cursor 2.0, el 29 de octubre de 2025, y su registro de cambios lo describía como controlar el agente con la voz mediante reconocimiento de voz integrado, con palabras clave de envío que defines en los ajustes para que decir tu palabra gatillo lance la ejecución. Cursor 3.1, el 13 de abril de 2026, lo rehízo: mantienes Ctrl+M para hablar, y ahora el editor graba el clip entero y lo transcribe de una vez en lugar de ir en streaming, lo que según el registro mejoró la calidad. Mientras grabas ves una onda, un cronómetro y botones para cancelar o confirmar.
Una de las páginas que ahora mismo posicionan por esta búsqueda afirma que la entrada por voz de Cursor «no está cubierta por documentación pública que hayamos podido verificar». Sí lo está. Las entradas del registro de cambios que citamos arriba son públicas, fechadas y concretas, lo que te dice bastante sobre el cuidado con que se escribe en este campo.
Lo que el micrófono de Cursor no hace es salir del cuadro de chat. No llega a Cmd+K, ni al editor, ni al terminal integrado, ni a la pestaña del navegador donde estás leyendo la documentación de una API. Si ejecutas Claude Code o Codex dentro del terminal de Cursor, el micrófono del chat no te sirve ahí de nada, y esa es la razón más habitual de que quien usa Cursor acabe instalando igualmente una herramienta para todo el sistema.
El foro de la comunidad de Cursor también acumula un goteo constante de errores de voz: entradas que abren un contexto de audio pero capturan silencio, ondas que se animan mientras el texto no aparece nunca, y texto dictado que aterriza al final de la primera línea sin importar dónde esté el cursor. Nada de eso significa que la función esté rota para todo el mundo. Sí significa que deberías probarla antes de construir una costumbre encima.
VS Code y Copilot Chat
VS Code dicta en dos sitios, y vale la pena memorizar los atajos: Ctrl+I (⌘I en Mac) habla dentro del chat, Ctrl+Alt+V (⌥⌘V) dicta en el editor, justo en el cursor. Los dos son de pulsar y mantener. También existe la activación por palabra clave «Hey Code» si prefieres no tocar ninguna tecla.
La parte que importa si tu empresa es estricta: la documentación de Microsoft dice que el modelo por defecto «procesa el audio del micrófono en tu dispositivo» y que, tras la descarga inicial del modelo, el reconocimiento de voz no necesita conexión a internet. Es una opción de verdad capaz, de verdad local, que viene del mismo fabricante que tu editor, y encima gratis.
En las plataformas de escritorio principales la capacidad ya viene integrada. La extensión aparte, VS Code Speech, sigue haciendo falta en la web, en los Macs con Intel, en sistemas de 32 bits y Arm32 y en distribuciones de Linux basadas en musl. Va por 1,417,222 instalaciones, versión 0.16.0, y cubre 26 idiomas mediante el ajuste accessibility.voice.speechLanguage.
El límite es el evidente. Funciona dentro de VS Code y en ningún otro sitio. Y como Cursor es un fork de VS Code y no VS Code, no des por hecho que la extensión se comporta igual allí.
Terminales
Warp es la excepción: tiene la voz como función de primera clase, se configura en Settings, Agents, Warp Agent, Voice, y sirve en todas sus superficies de entrada, no solo en el modo agente. La propia documentación de Warp dice que su transcripción «funciona con Wispr Flow» y que el audio se procesa en tiempo real y no se guarda después como grabación. Si ya pagas Wispr Flow, estás usando el mismo motor en dos sitios.
En iTerm2, Windows Terminal, Ghostty, Alacritty o un gnome-terminal a secas no hay dictado integrado, y no lo va a haber. Un terminal es una superficie de texto como cualquier otra, así que la respuesta es una capa para todo el sistema que escriba en la ventana que tenga el foco. Vale lo mismo para los IDE de JetBrains, para Zed, para Neovim y para los agentes de CLI que ejecutes dentro de cualquiera de ellos.
La capa para todo el sistema
Se quedan en segundo plano, escuchan mientras mantienes un atajo y pegan el texto terminado allí donde esté el cursor. Una herramienta, todas las ventanas. Aquí las comparamos con los mismos criterios: qué pagas, adónde va el audio, dónde se ejecuta.
Wispr Flow
La que está hecha específicamente para este público. Su página para desarrolladores promete un dictado que «entiende la jerga de desarrollo», maneja camelCase, snake_case y siglas, reconoce nombres de producto como Supabase o MongoDB, y etiqueta archivos en Cursor y Windsurf para que el contexto correcto llegue a tu prompt. Afirma que multiplica por 4 la velocidad a la que entregas, que es el número del vendedor y no una medición publicada por nadie.
Esto es lo que le gana la recomendación pese al precio. Mantienes una tecla, hablas como hablas, y en la ventana donde estabas aterriza prosa limpia: sin muletillas, con la puntuación puesta, y la frase que reempezaste convertida en la frase que querías decir. Funciona en el terminal, en el panel de chat, en un comentario de GitHub y en Slack sin saber ni importarle cuál es cuál, así que a los dos días desaparece el peso mental de «qué micrófono pulso aquí». El equipo de Warp lo eligió como motor de su propia función de voz, y eso es un voto real de gente que evaluó las alternativas.
La letra pequeña. El plan gratuito son 2,000 palabras a la semana en el escritorio, y Pro cuesta $15 al mes o $12 al mes con facturación anual. Es un servicio en la nube, así que sin conexión no hay dictado. Windows solo en x64: las máquinas ARM, es decir los portátiles con Snapdragon, no son compatibles, y tampoco lo son las máquinas virtuales ni el escritorio remoto, lo que lo descarta en buena parte de los montajes de empresa. No hay versión para Linux. Nuestra reseña completa está aquí, y las alternativas, aquí.
Superwhisper
La noticia tiene un día cuando escribimos esto: el 26 de agosto de 2026 Superwhisper lanzó un plan gratuito permanente. Cero dólares te dan ahora voz a texto en cualquier app, grabación y transcripción de reuniones, soporte para más de 100 idiomas y uso ilimitado de los modelos Whisper. Pro, a $8.49 al mes, añade tus propias claves de API, modelos de IA en la nube y en local, traducción y transcripción de archivos de audio y vídeo. Quien se registra nuevo recibe 3,000 palabras de Pro para probar, y después las funciones gratuitas siguen siendo suyas indefinidamente.
Funciona en Mac, Windows e iOS, y es una de las pocas apps comerciales que procesa tu voz enteramente en tu propia máquina. Los modelos sin conexión piden Apple Silicon; el fabricante dice que a los Macs con Intel les conviene más tirar de modelos en la nube.
También hay una integración específica con Claude Code, añadida en abril de 2026, que pone una ventana flotante de Superwhisper delante del agente para que puedas hablarle sin cambiar al terminal. La instalación es un script de una línea desde su web. Existen páginas equivalentes para OpenCode, Codex, Pi y Grok CLI.
Handy
Gratis, con licencia MIT, y hace una sola cosa: pulsas un atajo, hablas, y aparece el texto en el campo que tenga el foco, sin que nada salga del ordenador. La transcripción funciona con modelos Whisper o con Parakeet V3, que está optimizado para CPU y detecta el idioma solo, con la detección de actividad de voz Silero filtrando los silencios. Windows, macOS y Linux, versión actual v0.9.6 del 24 de agosto de 2026, y 30,430 estrellas en GitHub.
El proyecto se describe como un intento de ser la app de voz a texto más fácil de forkear, no la mejor, lo que es un posicionamiento honesto poco frecuente y también la expectativa correcta. No hay una capa de pulido que te arregle la gramática ni un diccionario que aprenda los nombres de tus compañeros. Para un programador al que no le importe elegir el tamaño del modelo y convivir con alguna aspereza, Handy es la opción gratuita más sólida de esta página.
VoiceInk
Solo macOS con Apple Silicon, modelos locales sobre el Neural Engine, código abierto, 6,123 estrellas, y precio de compra única: $29 para un Mac, $49 para dos, $69 para tres, con actualizaciones de por vida. Los proveedores en la nube solo entran en juego si pones tu propia clave de API y decides usarlos.
Si tu Mac es la máquina donde está el código del cliente, este es el camino más corto hacia un dictado que no envía audio a ninguna parte, y pagar $29 una vez frente a $144 al año de suscripción se amortiza en unas diez semanas. Nuestra comparativa de Mac entra en más detalle.
Voicy
La opción comercial que sí publica una versión para Linux: .deb, .rpm y AppImage, cubriendo Ubuntu, Debian, Fedora y Arch. Escribe en todas las apps, terminales y navegadores del sistema, funciona en VS Code y en los editores de JetBrains, y además corre en Windows, macOS, Chrome y móvil. La prueba gratuita son 30 minutos de grabación, Pro cuesta $8.49 al mes, y hay licencia vitalicia por $260. Estudiantes y personas con discapacidad tienen un 20 por ciento de descuento.
El límite honesto: no hay modo sin conexión. El reconocimiento pasa por la infraestructura de Groq, así que el audio sale de tu máquina cada vez. Voicy dice que se borra justo después de procesarlo y que nunca se usa para entrenar, lo cual es una política razonable y sigue sin ser lo mismo que procesarlo en local.
Voibe
Merece una mención por una función que las demás no tienen: un modo para programadores que resuelve los identificadores dictados contra tu espacio de trabajo real, de modo que «auth middleware punto t s» sale como authMiddleware.ts y no como palabras sueltas. Es el fallo más irritante de dictar dentro de un editor, resuelto de frente. $7.50 al mes, $59 al año, o $149 una sola vez, en Mac y Windows.
Una corrección que por ahí se repite mal: Voibe funciona íntegramente en el dispositivo en Apple Silicon, pero en Windows opera en modo nube sin retención, según sus propias preguntas frecuentes. La retención cero es una política con contenido. No es lo mismo que el audio no salga nunca de la habitación.
Si el código no puede salir de la máquina
Esta es la pregunta que separa un montaje de aficionado de uno que puedes usar en el trabajo, y el marketing de esta categoría la enturbia a propósito. Se mezclan dos cosas: dónde se procesa el audio y qué promete el fabricante hacer con él después. Solo la primera es un hecho técnico.
El audio no sale de tu ordenador: VS Code Speech, Handy, VoiceInk en Apple Silicon, Superwhisper con modelos locales, Voibe en Apple Silicon, Talon.
El audio va a un servidor: el /voice de Claude Code, la voz de Cursor, la voz de Warp, Wispr Flow, Voicy, Voibe en Windows, Superwhisper con modelos en la nube.
Fíjate en dónde queda Claude Code, y fíjate en el efecto de segundo orden: /voice no está disponible en Bedrock, en Agent Platform de Google Cloud ni en Microsoft Foundry, que son justo los despliegues que eligen las empresas reguladas. Si tu empresa puso Claude Code detrás de Bedrock por cumplimiento normativo, el micrófono integrado no es una opción sobre la que discutir, porque directamente no aparecerá.
Para ese lector la recomendación no cuesta nada: Handy si quieres multiplataforma y gratis, VS Code Speech si vives en un solo editor, VoiceInk si estás en un Mac con Apple Silicon y prefieres pagar una vez por algo más acabado. Consúltalo igualmente con quien lleve la política de seguridad, porque «se ejecuta en local» es una afirmación que deberías verificar y no heredar de una página como esta.
Talon y Cursorless: el otro deporte
Si tus manos son la razón por la que estás aquí, nada de lo anterior es tu respuesta. El dictado escribe palabras. No mueve un cursor, no selecciona el tercer argumento y no refactoriza nada.
Talon es un sistema de entrada sin manos: comandos de voz, control por ruidos (un siseo o un chasquido se convierten en un clic), seguimiento ocular y scripts en Python para definir lo que quieras. Funciona sin conexión con su propio motor de voz, en macOS, Windows y Linux bajo X11, y es gratis, con un nivel de Patreon para las versiones beta. Mira los números de versión antes de comprometerte: la versión pública es la 0.4.0, del 24 de julio de 2023, según el propio registro de cambios de Talon. El trabajo reciente está en el canal beta, que incluye un motor híbrido con Whisper, un «modo mixto» que acepta comandos y dictado a la vez, y el modelo Conformer D, al que el registro atribuye alrededor de un 20 por ciento más de precisión. El desarrollo está vivo; la descarga estable simplemente no lo enseña.
Cursorless es la capa que convierte la edición en algo estructural en vez de posicional. Pinta un «sombrero» de color sobre un carácter de cada token visible, y te diriges al código por esos sombreros: "chuck bat" borra el token cuyo sombrero está sobre esa b. Es una extensión de VS Code manejada por Talon, con licencia MIT, 1,335 estrellas, y con commits tan recientes como el 26 de agosto de 2026. El conjunto de comandos de la comunidad, talonhub/community, que es lo que casi todo el mundo ejecuta encima de Talon, se tocó por última vez el 24 de agosto de 2026. Los dos proyectos están sanos.
Que nadie te venda esto como una victoria rápida. Estás aprendiendo un idioma hablado para editar texto, y la recompensa llega en semanas, no en horas. El relato más leído sobre el tema, Cursorless is alien magic from the future, de Xe Iaso, llegó a la portada de Hacker News el 10 de noviembre de 2023 con 790 puntos y 337 comentarios, y leer ese hilo es la forma más rápida de calibrar: la conversación va casi por completo de lesiones por esfuerzo repetitivo, de tendinitis y de seguir siendo empleable, y casi nada de velocidad. Ese es el público de esto.
Serenade sigue apareciendo en las listas de herramientas para programar por voz. Su web está en pie y el botón de descarga funciona, pero el repositorio de GitHub no recibe un push desde el 11 de junio de 2024. Trátalo como abandonado mientras eso no cambie.
Cómo dictar para que el resultado sirva
Las costumbres que siguen salen de la forma del problema, no de ninguna herramienta, y valen igual para /voice, para Cursor y para una app de todo el sistema.
Di la intención, no la sintaxis. «Pagina la tabla de usuarios, veinte por página, en el servidor» gana a narrar un bucle for. El agente es mejor con la sintaxis que tu micrófono, y cada símbolo que intentas pronunciar es una oportunidad de equivocarse.
De diez a treinta palabras por tanda, y luego una pausa. Los monólogos largos sin cortes se degradan, y los demasiado cortos pierden el contexto que hace que la transcripción se resuelva bien.
Deja que la herramienta resuelva los nombres, y revisa los que no puede. Claude Code le pasa al transcriptor el nombre de tu proyecto y el de la rama; Voibe compara los identificadores dictados con el espacio de trabajo; Wispr Flow aprende la jerga según la usas. Ninguna acertará de forma fiable el apellido de un compañero ni el nombre en clave de un servicio interno, así que echa un vistazo al prompt antes de enviarlo.
No actives el envío automático hasta que te fíes de lo que vuelve. Enviar solo con tres palabras es cómodo justo hasta el momento en que una frase mal oída lanza una ejecución del agente que no pretendías y te pasas los dos minutos siguientes parándola.
Y por último, no renuncies al teclado. Toda implementación decente te deja mezclar las dos cosas dentro del mismo mensaje: las rutas de archivo, las banderas y las expresiones regulares se escriben más rápido, y aquí no dan premios por pureza.
Cómo lo hemos comprobado, y qué no hemos comprobado
Para este artículo no ejecutamos ninguna prueba de precisión, y no vamos a insinuar lo contrario. Lee las páginas que ahora mismo posicionan por estas búsquedas y encontrarás cifras rotundas, «en torno al 98% de precisión», «200ms frente a 700ms», «97.3% en el benchmark AISpeak», publicadas por empresas que venden la herramienta que quedó primera en su propia comparativa, sin grabaciones, sin guiones y sin datos en bruto.
Lo que hicimos nosotros, el 27 de agosto de 2026, fue verificar en la fuente lo que sí se puede verificar.
- Leímos entera la documentación de dictado por voz de Anthropic, de donde sale cada condición de la sección de Claude Code.
- Buscamos entradas sobre voz en las 377 versiones del registro público de cambios de Claude Code, y fechamos la versión 2.1.69 con la marca de publicación del registro de npm.
- Leímos las entradas de los registros de cambios de Cursor 2.0 y 3.1 para las fechas, el atajo y el cambio a transcripción por lotes.
- Leímos la documentación de accesibilidad de Microsoft y la ficha del marketplace de la extensión VS Code Speech.
- Leímos la documentación de Warp para confirmar que su transcripción funciona con Wispr Flow.
- Leímos el registro público de cambios de Talon para la fecha de la versión y la lista de funciones en beta.
- Consultamos la API de GitHub para las estrellas y la fecha del último commit de Cursorless, del conjunto de comandos de la comunidad de Talon, de Handy, de VoiceInk y de Serenade.
- Leímos las páginas de precios actuales de Wispr Flow, Superwhisper, Voicy, Voibe y VoiceInk en lugar de copiar precios de otras comparativas.
Tres cosas que no pudimos verificar y que señalamos en vez de pasar por encima. Las afirmaciones de precisión y de latencia de los fabricantes son marketing: aquí se recogen como tales y no las respaldamos. Cursor no documenta dónde ocurre su transcripción ni quién la proporciona, así que la fila de nuestra tabla dice «sin documentar» en vez de adivinar. Y Reddit no es accesible desde nuestro entorno de investigación, así que el sentir de la comunidad que aparece aquí sale de fuentes que puedes abrir: un hilo de Hacker News con fecha y el foro público de Cursor.
Herramientas que miramos y dejamos fuera
Aqua Voice, Willow Voice, Spokenly, Vibe Typer, VoiceDash y el resto de la cuadrilla que vive del blog. Son productos reales con usuarios reales, y su maquinaria de contenidos es la razón de que este tema sea difícil de investigar: cada una publica una guía que presenta las funciones integradas como un problema y su propia descarga como la solución. Alguna seguro que es buena. No las hemos probado y no vamos a ordenar lo que no hemos comprobado.
Servidores MCP de voz como mcp-voice-hooks. Ingeniosos, y permiten que un agente te hable en lugar de solo escucharte. También son una pieza móvil más en la configuración de tu agente para un trabajo que ya hace un atajo de teclado. Merecen un vistazo si quieres conversación en los dos sentidos, no si quieres prompts más rápidos.
Ski, freeflow, Yap y la oleada semanal de Show HN. Ahora mismo salen herramientas locales de dictado en Hacker News a razón de una por semana, casi todas gratuitas y sin conexión. Si te gusta llegar pronto, ese es el sitio donde mirar. Handy es la que ya ha acumulado los usuarios, las versiones y el empaquetado.
Dragon Professional. Sigue siendo la referencia para corregir y dar formato con la voz, sigue siendo solo para Windows, sigue costando unos $699 en los distribuidores, y su distribución de consumo se ha desmontado: qué pasó con Dragon. Nunca estuvo pensado para editores ni terminales.
El dictado del sistema en macOS y en Windows. Gratis, ya instalado, suficiente para una frase en un campo de texto. Los dos se desmoronan con el vocabulario técnico, que es justamente todo el contenido del habla de un programador.
Qué hacer ahora
Dedica cinco minutos a lo que ya tienes: /voice en Claude Code, Ctrl+M en Cursor, Ctrl+I en VS Code. Si lo único que te molesta es tener un micrófono distinto en cada ventana, ese es exactamente el problema que resuelve una capa para todo el sistema, y puedes zanjarlo en el plan gratuito de Wispr Flow antes de pagar nada. Si tu código no puede salir de la máquina, instala Handy, o VoiceInk si estás en un Mac con Apple Silicon y quieres algo más acabado por $29 una sola vez. Y si estás aquí porque teclear duele, nada de eso es tu respuesta: empieza con Talon y Cursorless, y dale semanas.
Preguntas frecuentes
¿Claude Code tiene entrada por voz?
Sí. Ejecuta /voice en la CLI para activar el dictado y después mantén pulsada la barra espaciadora para hablar, o usa /voice tap para grabar con un toque. Funciona en el terminal y en la extensión de Claude Code para VS Code. Requiere una cuenta de Claude.ai, no funciona por SSH ni en la web, y la transcripción no consume tokens.
¿Por qué no aparece /voice en mi Claude Code?
Casi seguro que es tu autenticación. El dictado por voz no está disponible cuando Claude Code usa directamente una clave de API de Anthropic, Amazon Bedrock, Agent Platform de Google Cloud o Microsoft Foundry. Los comandos que no están disponibles para tu configuración se ocultan en lugar de mostrarse. Una política de la organización también puede desactivarlo, y en ese caso /voice te lo dice.
¿La entrada por voz de Claude Code gasta tokens?
No. La documentación de Anthropic dice que la transcripción no consume mensajes ni tokens de Claude y no cuenta para los límites que muestra /usage.
¿Cómo dicto dentro de Cursor?
Mantén Ctrl+M en el cuadro de chat. La voz llegó con Cursor 2.0 el 29 de octubre de 2025 y se rehízo en Cursor 3.1 el 13 de abril de 2026, que añadió la onda, el cronómetro y los controles para cancelar, y pasó a transcribir el clip entero de una vez. Solo llega al cuadro de chat, no a Cmd+K, ni al editor, ni al terminal integrado.
¿Puedo dictar en el terminal?
Warp trae la voz integrada. Cualquier otro terminal necesita una app de dictado para todo el sistema que escriba en la ventana con el foco: Wispr Flow, Superwhisper, Handy, Voicy o VoiceInk sirven todas. Si ejecutas un agente de CLI dentro del panel de terminal de tu editor, esta es la única vía que llega hasta ahí.
¿Hay entrada por voz gratuita para programadores?
Varias. El /voice de Claude Code viene incluido con un plan de Claude.ai, el dictado de VS Code es gratis y se ejecuta en tu máquina, el micrófono de Cursor viene con Cursor, Handy es gratis y de código abierto en las tres plataformas de escritorio, Superwhisper ya tiene un plan gratuito permanente, y Talon se descarga gratis.
¿Qué puedo usar si mi código está bajo acuerdo de confidencialidad?
Cualquier cosa que transcriba en local: la extensión VS Code Speech, Handy, VoiceInk o Superwhisper con modelos locales, Voibe en Apple Silicon, o Talon. Claude Code, Cursor, Warp, Wispr Flow y Voicy envían el audio a un servidor, diga lo que diga su política de retención.
¿Se puede escribir código por voz de verdad, y no solo prompts?
Sí, con Talon y Cursorless, y es una destreza más que una instalación. Cursorless marca cada token visible con un sombrero de color y editas nombrándolos, lo que hace posible la edición estructural sin teclado. Cuenta con semanas hasta que te resulte natural. Casi todos los que llegan ahí fueron empujados por una lesión por esfuerzo repetitivo, no atraídos por la velocidad.
¿Talon sigue manteniéndose?
Sí, aunque la página de descargas lo disimule. La versión pública es la 0.4.0 de julio de 2023, mientras que el desarrollo activo va por el canal beta de Patreon, que ahora mismo lleva un motor híbrido con Whisper y un modo mixto de comandos y dictado. El conjunto de comandos de la comunidad en GitHub se actualizó por última vez el 24 de agosto de 2026.
¿Dictar es de verdad más rápido que teclear para un programador?
Para prompts, normalmente sí: el habla se midió en 153 palabras por minuto frente a 52 de quien teclea a velocidad media, o sea unas tres veces. Para código, no, y nadie serio afirma lo contrario. Si tecleas por encima de 80 palabras por minuto, el argumento de la velocidad casi se evapora, y las razones que quedan para usar la voz son tus muñecas y el hecho de que un prompt más largo no te cuesta nada producirlo.
¿Y GitHub Copilot?
Copilot Chat es una de las superficies en las que escribe el dictado de VS Code. Pulsa Ctrl+I para hablar en el chat, o di «Hey Code» si tienes activada la activación por palabra clave. No hay un producto de voz de Copilot aparte que haya que instalar.
Comentarios
Todavía no hay comentarios. Haz una pregunta o cuéntanos qué te ha funcionado.