Cómo transcribir una entrevista o una clase (2026): todos los métodos, con su precio en horas y en dólares
Si tienes una hora de audio y una fecha de entrega, súbela a un servicio y en unos minutos tendrás una transcripción en bruto. Si tienes una hora de audio y una obligación con la persona que aparece en ella, ese atajo es la decisión que conviene tomar despacio, porque casi todos estos servicios se quedan el archivo y algunos dicen sin rodeos que entrenan con él. Todo lo que sigue está organizado en torno a esa bifurcación: tres vías que no cuestan nada, varias que cuestan dinero, una que te cuesta la tarde, y un relato honesto de en qué falla cada una.
Transkriptor es el servicio de pago que resuelve el trabajo entero por menos dinero: $99.99 al año salen a $8.33 al mes y cubren cuarenta horas de grabación mensuales, con etiquetas de interlocutor y una promesa por escrito de no entrenar con tus datos en ese plan.
Si la grabación no puede salir de tu ordenador, usa Whisper en local con Buzz o MacWhisper. Es gratis, se traga veinte archivos con la misma facilidad que uno, y el audio no se mueve de sitio.
Nuestras recomendaciones
| Papel | Herramienta |
|---|---|
| Mejor vía gratuita si ya pagas Microsoft 365 | Transcribir en Word, 300 minutos al mes |
| Mejor vía gratuita para una grabación que no puede salir de tu máquina | Whisper en local, con Buzz o MacWhisper |
| Mejor servicio de pago para la mayoría | Transkriptor |
| Mejor para reuniones y entrevistas que organizas tú | Otter |
| Mejor cuando la transcripción tiene que aguantar en un juzgado, en antena o en una cita publicada | transcripción humana de Rev |
| Mejor para un solo archivo y sin suscripción | la transcripción con IA de Rev, a $0.25 el minuto |
| Mejor si la entrevista va a acabar en pódcast o en vídeo | Descript |
| Mejor para equipos multilingües | Notta |
| Mejor si has decidido escribirla tú | oTranscribe, gratis y de código abierto |
Una aclaración antes de los métodos, porque las dos palabras se confunden todo el rato. La transcripción convierte en texto una grabación que ya existe. El dictado convierte tu habla en directo en texto mientras escribes. Si lo que quieres de verdad es hablar en vez de teclear, lo que buscas es una app de dictado, y tenemos guías aparte para Windows y Mac.
Antes de subir nada
Responde a una pregunta y el resto de esta página se reduce a dos o tres opciones.
¿La persona que sale en la grabación aceptó que su voz se enviara a una empresa de la que nunca ha oído hablar?
Aceptar que te graben no es lo mismo que aceptar que te suban. Una fuente que dice «claro, grábalo» está pensando en tu cuaderno, no en los servidores de un proveedor, en una empresa subcontratada de etiquetado de datos y en una tanda de entrenamiento de un modelo. Para una rueda de prensa o para los apuntes de tu propia clase, esto da igual. Para un denunciante, un paciente, un participante de una investigación que firmó un consentimiento donde constaba exactamente quién manejaría sus datos, o cualquiera que hable de algo que podría costarle el trabajo, decide el flujo entero.
Si la respuesta es no, o si no lo tienes claro, salta a Whisper en local. Se ejecuta en tu propio ordenador, no cuesta nada y el audio no se mueve. Todo lo demás en esta página implica entregarle el archivo a alguien.
Y no es una preocupación marginal. La Freedom of the Press Foundation, que forma a periodistas justo en este tipo de decisiones, revisó las herramientas de transcripción más populares y llegó a una conclusión rotunda en un texto actualizado el 2 de junio de 2026: «cada una de estas empresas tiene la capacidad técnica de acceder al audio que has subido», y «Recomendamos evitar la transcripción por completo si tu audio, en las manos equivocadas, podría poner a alguien en peligro». Sus formadores en seguridad mandan a esos mismos lectores a Whisper sin conexión, ejecutado en su propio dispositivo.
Un investigador en activo lo dijo en términos prácticos mejor de lo que podríamos nosotros. Escribiendo en Hacker News el 17 de julio de 2026, un desarrollador explicaba por qué se había construido su propia herramienta de transcripción: «no hay opciones reales para transcribir entrevistas con detección de interlocutor que sirvan en la evaluación de un estudio universitario sin subir los datos a la nube de otra persona, con políticas de privacidad cuestionables».
De un vistazo
Los costes son por hora de grabación, porque esa es la unidad que de verdad tienes. Todo comprobado el 27 de agosto de 2026.
| Método | Mejor para | Cuánto cuesta una hora de audio | Etiquetas de interlocutor | Adónde va el audio |
|---|---|---|---|---|
| A mano | citas que no te puedes permitir equivocar | de 4 a 6 horas de tu tiempo | las escribes tú | a ninguna parte |
| Transcribir en Word | cualquiera con una suscripción a Microsoft 365 | gratis, dentro de 300 min/mes | sí | Microsoft |
| Subtítulos automáticos de YouTube | charlas y clases que ya son públicas | gratis | no | |
| Whisper en local | grabaciones confidenciales, y lotes grandes | gratis, más el tiempo de máquina | solo con herramientas extra | a ninguna parte |
| API de Whisper | un lote y ningún programa que instalar | $0.36 | no | OpenAI |
| Transkriptor | el trabajo entero al precio más bajo | $8.33/mes cubren 40 horas | sí | Transkriptor |
| Otter | reuniones en directo que organizas tú | $8.33/usuario/mes con pago anual | sí | Otter, que entrena con ello |
| Notta | reuniones multilingües y archivos largos | $97.99/año cubren 30 horas al mes | sí | Notta |
| Rev, con IA | un solo archivo, pagando por uso | $15.00 | no lo indica | Rev |
| Rev, humana | registro legal, emisión, citas publicadas | $119.40 | sí | Rev, más una persona transcriptora verificada |
| Descript | entrevistas que acaban en audio o vídeo | $16/mes anual por 10 horas de medios | sí, 8 o más interlocutores | Descript, que entrena con ello salvo que lo desactives |
Vía 1. Escribirla tú
Mejor para: fragmentos cortos, audio pésimo y material en el que necesitas oír cada titubeo.
Nadie en el negocio del software quiere que sepas cuánto se tarda en esto, así que aquí van tres estimaciones de gente que vende transcripción y que, por tanto, no tiene ningún motivo para exagerar el esfuerzo a tu favor. SpeakWrite lo sitúa en «unas cuatro veces la duración del audio». La propia guía de Otter dice «de 3 a 6 horas por hora de audio». El consejero delegado de Happy Scribe, escribiendo en septiembre de 2025, da como proporción de trabajo 4:1, «hasta 6:1 o incluso 8:1 en transcripciones complejas», y la revisión añade «otro 25-50%» encima.
Ninguno de los tres cita un estudio, así que trata las cifras por lo que son: una estimación del gremio, coherente entre sí, hecha por gente que se dedica a esto a diario. Cuenta con una jornada laboral entera para una entrevista de una hora, y con más si dos personas se pisan al hablar.
Con ese panorama, ¿por qué iba nadie a seguir haciéndolo? Por tres razones reales. Los extractos muy cortos se escriben antes de lo que se tarda en subirlos y limpiarlos. El audio grabado en un bar, por teléfono, a través de una mascarilla o con un acento cerrado puede derrotar a todos los modelos de esta página, y te pasarás el día arreglando las conjeturas de la máquina en vez de escribir las tuyas. Y en investigación cualitativa, transcribir es analizar: quien escribe sus propias entrevistas se fija en cosas que jamás habría captado leyendo por encima una transcripción limpia.
Si vas a hacerlo a mano, no lo hagas con un reproductor por un lado y un procesador de textos por otro. oTranscribe es un editor gratuito y de código abierto hecho para esta única tarea: el reproductor de audio y el texto viven en la misma ventana, así que no cambias de programa, y el teclado pausa y rebobina sin que tus manos se muevan de las teclas. El proyecto tiene licencia MIT, y su repositorio seguía recibiendo commits el 10 de agosto de 2026, algo que no puede decirse de la mayoría de las herramientas gratuitas de su generación. Tu archivo se queda en tu ordenador.
Decide tu estilo antes de empezar, porque cambiar a mitad de camino echa a perder la sesión entera.
- Literal conserva cada «eh», cada arranque en falso y cada repetición. El análisis conversacional lo necesita. Nadie más.
- Literal inteligente quita muletillas y tartamudeos y conserva todo lo que significa algo. Es lo habitual en periodismo y en la mayoría de las investigaciones.
- Editado convierte la gramática torcida y las frases a medias en prosa legible. Bien para unas preguntas y respuestas publicadas, mal para cualquier cosa que luego vayas a citar como habla.
Vía 2. Las opciones gratuitas
Las tres son gratuitas de verdad, y ninguno de los ocho artículos que ahora mismo posicionan por este tema menciona ni una. También tienen límites reales, así que lee en qué fallan antes de comprometer una tarde.
Transcribir en Word
Mejor para: casi cualquiera que ya pague Microsoft 365 y no se haya enterado de que esta función existe.
Abre Word en el navegador, ve a Inicio, pulsa la flecha que hay junto a Dictar, elige Transcribir y sube el archivo. La propia documentación de Microsoft fija los límites: «Los usuarios con una suscripción a Microsoft 365 pueden transcribir un máximo de 300 minutos de audio cargado al mes», y 30,000 minutos si tienes licencia de Copilot. Admite .wav, .mp4, .m4a y .mp3, funciona solo en Edge y Chrome, necesita conexión y separa a los interlocutores automáticamente. El proceso tarda más o menos lo que dure la grabación. El resultado aterriza en una carpeta «Archivos transcritos» de tu OneDrive, y puedes soltar pasajes sueltos o la transcripción entera directamente en el documento.
Cinco horas al mes, gratis, con separación de interlocutores, dentro de un producto que decenas de millones de personas ya pagan. Es lo más desaprovechado de toda esta categoría.
Las pegas, por orden de cuánto molestan. Es procesamiento en la nube: Microsoft afirma que «Tus archivos de audio se envían a Microsoft y se usan únicamente para prestarte este servicio», lo cual es un compromiso claro y aun así significa que el archivo sale de tu máquina. Solo funciona en la versión de navegador, no en la app de escritorio. Y circula por todas partes un tope de 200 MB por archivo, incluso en las respuestas de soporte de la propia Microsoft, pero no está en la página de documentación actual, así que no vamos a darlo por hecho. Si el tuyo se niega a subir, parte las grabaciones largas.
Subtítulos automáticos de YouTube
Mejor para: una charla, una clase o una mesa redonda que ya está en YouTube, o que no te importa publicar.
Si el vídeo existe en YouTube, puede que ya tengas la transcripción. Pulsa «Mostrar transcripción» en la descripción y el texto aparece en un panel desplazable, con marcas de tiempo, y al pulsar cualquier línea el vídeo salta a ese punto. Si el vídeo es tuyo, YouTube Studio te da el propio archivo de subtítulos: Subtítulos, eliges el vídeo, Editar junto al idioma, Opciones, Descargar subtítulos.
Google publica la lista de idiomas que reciben subtítulos automáticos, y es larga: va del afrikáans al zulú, con unas sesenta y pico entradas. Google publica también, con una franqueza poco habitual, cuándo esto falla. Los subtítulos no aparecen si el audio es demasiado complejo de procesar, si el idioma no está admitido, cuando «El vídeo es demasiado largo», cuando hay «mala calidad de sonido o YouTube no reconoce el habla», tras un «periodo largo de silencio al principio», y con «varios interlocutores que se solapan o varios idiomas a la vez». Eso último es la descripción de casi cualquier entrevista. Y la advertencia sobre la precisión es de la propia Google: «Los subtítulos automáticos pueden tergiversar el contenido hablado por errores de pronunciación, acentos, dialectos o ruido de fondo».
Existe un truco muy transitado: subir un vídeo privado o no listado solo para cosechar los subtítulos. Muchas veces funciona. No vamos a recomendarlo por dos razones: Google no documenta si el estado de privacidad afecta a la generación de subtítulos, así que el comportamiento podría cambiar sin aviso, y subir la entrevista de una fuente a YouTube es subírsela a Google. Para las grabaciones de tus propias clases, adelante. Para algo sensible, no.
Whisper en local
Mejor para: grabaciones que no pueden salir de tu ordenador, y para veinte archivos de golpe.
OpenAI publicó Whisper como modelo abierto, y el ecosistema que ha crecido a su alrededor es hoy la mejor opción gratuita de esta categoría. No se sube nada, no se cuenta nada, y la calidad con audio limpio se acerca tanto a la de los servicios de pago que la mayoría deja de notar la diferencia.
La entrada más fácil es una interfaz gráfica. Buzz es gratis y de código abierto, funciona en Mac, Windows y Linux, acepta un archivo o un enlace de YouTube, y exporta texto plano o subtítulos. MacWhisper es la opción pulida para Mac, freemium, y vale su precio si haces esto cada semana (descárgalo solo desde macwhisper.com, porque la propia web avisa de que existen sitios imitadores con malware). Debajo de los dos está whisper.cpp, que no necesita dependencias, funciona solo con CPU y está muy optimizado en Apple Silicon, donde Core ML puede hacer el codificador «más de x3 más rápido en comparación con la ejecución solo con CPU».
La elección del modelo es la única decisión que tienes que tomar, y el intercambio es velocidad contra precisión. El modelo large tiene 1550M de parámetros y quiere unos 10 GB de VRAM. turbo es una versión optimizada de large-v3 que corre unas ocho veces más rápido con, en palabras de OpenAI, «una pérdida de precisión mínima». En el extremo pequeño, tiny funciona en cualquier cosa y se equivoca con los nombres continuamente. Una regla práctica de alguien del oficio, en Hacker News en junio de 2026: «medium suele ser el punto dulce entre precisión y velocidad en inglés, sobre todo si después le das una pasada de posprocesado».
Calibra tus expectativas con quien usa esto a diario y no con la demostración. Como escribía uno de ellos en agosto de 2026: «Puede funcionar muy bien como primera pasada que alguien luego corrige, pero no por sí sola». Ese es el resumen honesto de todas las vías de esta página, gratuitas o de pago, y la razón de que ninguna elimine el paso de edición.
La debilidad de verdad son las etiquetas de interlocutor. Whisper a secas te da un muro de texto indiferenciado, y así viene siendo desde 2023, cuando alguien lo resumió en Hacker News: «Lo único que le falta a Whisper es la diarización de interlocutores». Tres años después, el arreglo sigue siendo una herramienta añadida: WhisperX para marcas de tiempo por palabra más diarización, o whisper-diarization. Las dos funcionan. Las dos añaden una instalación, la descarga de un modelo y una licencia que leer, y un desarrollador abandonó WhisperX en julio de 2026 precisamente por la licencia del modelo de interlocutores del que depende. Para una entrevista entre dos personas grabada en canales separados, puedes esquivar el problema entero transcribiendo cada canal por su lado.
Si prefieres no instalar nada, el mismo modelo está en la API de OpenAI a $0.006 el minuto, es decir 36 centavos por hora de audio. Es una vía de pago, pero pertenece a este apartado porque es la más barata de la página por dos órdenes de magnitud, y porque el más económico gpt-4o-mini-transcribe cuesta la mitad. Eso sí, vuelves a estar subiendo el archivo.
El apaño de repetir en voz alta
Mejor para: nada, sinceramente, pero la gente no para de preguntar por ello.
El truco: abrir la escritura por voz en Google Docs o Dictar en Word, poner la grabación en alto y dejar que el micrófono la recoja. Funciona a medias. El reconocimiento está hecho para alguien que habla en directo a distancia de conversación, así que el altavoz de un móvil al otro lado de la mesa pierde palabras, la puntuación se desmorona y la sesión tiende a cortarse cuando cambias de ventana. La documentación de Google no dice nada de grabaciones, de reproducción ni de dispositivos de audio virtuales, así que nada de esto es un comportamiento admitido.
La versión que sí funciona es de un tedio auténtico: escuchar con auriculares y repetir lo que oyes, con claridad, al micrófono. Los transcriptores profesionales lo llaman rehablado y es una técnica real. Va más o menos a tiempo real, más las correcciones, así que calcula noventa minutos por hora. Dado que Transcribir en Word hace el mismo trabajo solo y gratis, esto ha quedado como recurso para quien no tiene suscripción a Microsoft 365 ni posibilidad de instalar programas.
Vía 3. Los servicios
Hacen el trabajo en minutos, dan formato al resultado, etiquetan a los interlocutores y exportan algo que puedes entregarle a otra persona. La razón para pagar no es la precisión: un modelo local se le acerca. La razón para pagar es el formato, las etiquetas de interlocutor y la exportación que, si no, tendrías que montar a mano en cada archivo.
Transkriptor
Mejor para: resolver el trabajo entero por el menor dinero.
Precio: plan gratuito con 90 minutos para empezar. Lite cuesta $9.99 al mes por 300 minutos. Pro cuesta $19.99 al mes, o $99.99 al año, lo que sale a $8.33 al mes e incluye 2,400 minutos al mes. Team son $30 por puesto, o $240 al año.
Haz la cuenta y la posición queda clara: Pro cubre cuarenta horas de grabación al mes por lo que cuesta un bocadillo. Si eres estudiante de posgrado con veinte entrevistas, o periodista con una pila de cintas atrasada, ningún otro servicio de esta página juega en ese rango. Maneja más de 100 idiomas, identifica a varios interlocutores con etiquetas editables, exporta a TXT, SRT y Word (su página de entrevistas menciona además PDF), y hace lo que harías tú a mano: resúmenes, un chat con IA sobre la transcripción, traducción.
Dos cosas que conviene decir claras. Su página de entrevistas promete «Consigue un 99% de precisión», mientras que la de clases dice que el mismo producto «ofrece transcripciones con un 99% de precisión la mayoría de las veces». La segunda versión es la honesta, y sigue siendo el número de un vendedor, no una medición. Y la frase «Tus datos no se usarán con fines de entrenamiento» aparece en la lista de funciones de Pro, no en la portada del sitio, lo que significa que los planes gratuito y Lite no llevan esa promesa. Si vas a subir algo sensible, eso es un argumento para pagar, no para probarlo gratis.
Otter
Mejor para: reuniones y entrevistas que diriges tú y que grabas en directo.
Precio: el plan gratuito Basic da 300 minutos al mes, con un tope de 30 minutos por conversación y tres importaciones de archivo para toda la vida de la cuenta. Pro cuesta $16.99 al mes, o $8.33 al mes con pago anual, con 1,200 minutos de grabación, diez importaciones al mes y un tope de 90 minutos por reunión. Business son $30, o $19.99 anual, con reuniones ilimitadas y cuatro horas por reunión.
Vuelve a leer lo del plan gratuito, porque todas las comparativas presentan Otter como una forma gratuita de transcribir una entrevista. No lo es. Tres subidas, en total. Otter está hecho para meterse en una llamada en directo de Zoom, Meet o Teams y transcribir mientras la gente habla, y en eso es muy bueno: el texto aparece en pantalla durante la conversación y se corrige solo según llega el contexto. Una entrevistadora sorda lo describía en Hacker News como «una ayuda enorme», y ese es un caso de uso que ningún servicio de subida de archivos puede igualar. Ahora bien, dale una grabación hecha con una grabadora de mano y lo estarás usando a contrapelo.
Dos límites más que conviene conocer antes de comprometerte. La página de precios nombra seis idiomas: inglés, español, francés, alemán, japonés y chino. Y en Basic y en Pro solo puedes exportar en mp3 y txt. SRT, DOCX y PDF son funciones de Business, así que si necesitas subtítulos o un documento con formato, el precio real son $19.99 al mes y no $8.33.
Notta
Mejor para: trabajo multilingüe y grabaciones largas.
Precio: el gratuito da 120 minutos al mes con un tope de tres minutos por grabación, lo que lo convierte en una demostración más que en un plan. Pro cuesta $97.99 al año, unos $8.17 al mes, por 1,800 minutos mensuales y hasta cinco horas por grabación. Business son $199.99 al año con transcripción ilimitada.
El techo de cinco horas por grabación de Pro es el más alto de aquí e importa si grabas sesiones de día entero. Notta tiene certificación SOC 2 Tipo II e ISO 27001, identifica interlocutores, toma notas con marcas de tiempo y se conecta a Zoom, Meet, Teams y Webex. Viene de Tokio y es especialmente fuerte en japonés, que es la razón para elegirlo por encima de Transkriptor si ese es tu idioma de trabajo. Su página de precios no indica un total de idiomas ni una lista de formatos de exportación, y no encontramos en ninguna parte de su web una declaración sobre si las grabaciones se usan para entrenar modelos. La ausencia de una afirmación no es una promesa en ningún sentido.
Rev
Mejor para: la transcripción que tiene que estar bien, y para pagar por archivo en vez de por mes.
Precio: la transcripción con IA cuesta $0.25 el minuto, es decir $15.00 por hora de audio. La humana cuesta $1.99 el minuto, o $119.40 la hora. Hay suscripciones para volumen: Essentials a $25.49 por puesto al mes con pago anual por 5,000 minutos de IA, y Pro a $47.99 por 10,000.
La transcripción humana es un producto distinto de todo lo demás en esta página, y merece tratarse como tal. Rev promete para ella «más del 99% de precisión, entregada en 12 horas o menos», frente a «más del 95% de precisión en cinco minutos o menos» de la versión con IA. Esa diferencia suena pequeña hasta que la cuentas. Una hora de conversación son unas 9,000 palabras, así que un 95% te deja unas 450 palabras mal por localizar, y se agrupan justo donde está el significado: nombres, cifras y términos técnicos. Si la transcripción va a un escrito judicial, a una emisión o a una cita publicada que leerá un abogado, $119 te compran una tarde de comprobaciones y una categoría entera de riesgo.
En privacidad, el lado humano es el más sólido de las opciones de pago: los transcriptores «pasan por una verificación rigurosa, que incluye comprobación de identidad y acuerdos de confidencialidad», y ese es un control real y poco común.
El lado de la máquina es donde hay que leer con cuidado, y es el ejemplo más claro de esta página de por qué una página de marketing no es un documento. La página de seguridad de Rev dice «nunca entrenaremos LLM externos con tus datos». Sus condiciones del servicio, en vigor desde el 15 de mayo de 2026, dicen otra cosa: «Tu Contenido de Cliente será analizado por nuestros modelos de reconocimiento automático del habla y por otros modelos de inteligencia artificial de Rev y puede usarse para el entrenamiento continuo de esos modelos». Lo que se excluye ahí es el entrenamiento generativo, no el entrenamiento sin más, y las condiciones no ofrecen forma de negarse. Las dos frases son ciertas a la vez, y toda la diferencia está en la palabra externos. Tu entrevista no acabará dentro del modelo fundacional de otra empresa. Puede acabar perfectamente dentro del de Rev.
Descript
Mejor para: una entrevista que se va a montar como pódcast o como vídeo.
Precio: el gratuito da una hora de medios al mes. Hobbyist cuesta $16 por persona al mes con pago anual, o $24 mensual, por 10 horas de medios. Creator son $24 anual, o $35 mensual, por 30. Business, $50 anual por 40.
Descript no es exactamente un servicio de transcripción, y por eso va el último. Es un editor donde la transcripción es la línea de tiempo: borras una frase en el texto y el audio se va con ella, quitas las muletillas con un comando, arreglas una frase mal dicha escribiendo encima. Para una entrevista destinada a publicarse como audio o vídeo, eso funde dos trabajos en uno. Transcribe 25 idiomas y detecta 8 o más interlocutores.
Ojo con la unidad. Descript factura horas de medios, que cubren la edición y la exportación además de la transcripción, así que diez horas al mes no son diez horas de entrevista si además piensas editarlas.
Su política de privacidad sí incluye «entrenar nuestros modelos de inteligencia artificial» entre los fines para los que trata el contenido, pero el control es mejor de lo que sugiere esa frase: el ajuste «Compartir datos con Descript» viene desactivado por defecto, así que el entrenamiento solo ocurre si lo enciendes tú. Es lo contrario de Otter y de Rev, donde entrenar es el estado por defecto y no existe ningún interruptor. Hay que reconocérselo.
Qué es lo que falla de verdad
Todos los proveedores de esta página citan una cifra entre el 95% y el 99%. Ninguno publica una prueba que puedas repetir. Esto es lo que dicen en cambio la investigación independiente y quienes hacen esto a diario, que resulta más útil, porque los errores no se reparten al azar. Caen justo sobre las palabras que ibas a citar.
Acentos. La evaluación más citada de Whisper con distintos acentos es la de Graham y Roll, publicada en JASA Express Letters en febrero de 2024. Su conclusión, en sus palabras: «Los resultados revelan un reconocimiento superior en el inglés estadounidense frente a los acentos británico y australiano, con un rendimiento similar en el inglés canadiense», y «los acentos nativos de inglés muestran mayor precisión que los no nativos». También encontraron tasas de error que seguían la lengua materna del hablante y su nivel de inglés. Si entrevistas a gente que aprendió inglés de adulta, tu transcripción será peor que la demostración que probaste, y de forma medible, y la herramienta no te lo va a decir.
Nombres y jerga. Es la mayor fuente de tiempo de edición, y lo único que ningún modelo puede adivinar. Un desarrollador lo describía en Hacker News en julio de 2026: «Por ejemplo OpenBao a veces sale como open bowel, jaja. Eso obliga a una limpieza importante». Pon ahí el apellido de tu fuente, las siglas de tu campo y el nombre de la empresa sobre la que escribes. Los servicios que te dejan aportar un vocabulario propio antes de procesar te ahorrarán más tiempo que un punto porcentual de precisión anunciada.
El silencio. Este sorprende a la gente. Los modelos de reconocimiento de voz pueden inventarse texto donde no hay ninguno. En «Careless Whisper: Speech-to-Text Hallucination Harms», presentado en ACM FAccT en junio de 2024, investigadores de Cornell, la Universidad de Washington, la NYU y la Universidad de Virginia analizaron más de 13,000 clips de audio y encontraron que en torno al 1% de las transcripciones de Whisper contenían frases enteras alucinadas. El detonante que identificaron son las pausas: «Las pausas y los silencios más largos entre palabras tienen más probabilidad de provocar alucinaciones dañinas», algo que golpea con más fuerza a las personas con trastornos del habla. El fallo tiene su propio folclore entre los profesionales, que lo reconocen por las frases hechas que el modelo produce de la nada. «El clásico "¡Gracias por ver el vídeo!"», como lo puso un comentarista de Hacker News en febrero de 2026; alguien que había pasado miles de horas de audio por Whisper contaba que a él le llegaba como «dale me gusta y suscríbete». Los dos son residuos de un modelo entrenado con muchísimo vídeo de internet, y los dos aparecen en el silencio.
Hay un arreglo práctico, y merece esos diez minutos. Recorta los silencios antes de transcribir, o pasa el audio por un detector de actividad de voz para que el modelo solo reciba habla. Sin pausa no hay frase inventada. Cuando recortar no sea posible, la regla es más simple: si una línea de tu transcripción se lee sospechosamente fluida, o le da las gracias a alguien, compárala con el audio antes de que salga a ninguna parte.
Quién dijo qué. El etiquetado de interlocutores es más débil que la transcripción en todas partes, gratis o de pago. Dos voces de tono parecido, un momento de solapamiento, alguien que se incorpora a mitad: las etiquetas se desplazan, y se desplazan en silencio. Uses la herramienta que uses, revisa los cambios de interlocutor alrededor de cada cita que pienses publicar.
La consecuencia práctica de las cuatro cosas: una transcripción hecha con IA es un borrador que puedes buscar, no una fuente. Cada pasaje que pienses citar se vuelve a escuchar y se contrasta con el audio. Esa pasada final lleva minutos, no horas, y es el paso que separa una transcripción con la que puedes trabajar de una transcripción que puedes publicar.
Quién entrena con tu grabación
Lo leímos el 27 de agosto de 2026. Estos documentos cambian, así que las fechas importan.
| Servicio | ¿Entrena con tu grabación? | Qué dicen sus propios documentos | Documento |
|---|---|---|---|
| Otter | Sí, y sin posibilidad de negarse | «entrenar nuestra tecnología de IA propietaria con grabaciones de audio desidentificadas y con transcripciones (que pueden contener Información Personal)». Aparte, nombra a «Proveedores de servicios de etiquetado de datos que prestan servicios de anotación y usan los datos que compartimos para crear datos de entrenamiento y evaluación» | Política de privacidad, en vigor desde el 16 de junio de 2026 |
| Rev | Sí, y sin posibilidad de negarse | «Tu Contenido de Cliente será analizado por nuestros modelos de reconocimiento automático del habla y por otros modelos de inteligencia artificial de Rev y puede usarse para el entrenamiento continuo de esos modelos» | Condiciones del servicio, en vigor desde el 15 de mayo de 2026 |
| Descript | Solo si lo activas tú | «entrenar nuestros modelos de inteligencia artificial» figura entre los fines del tratamiento, pero el ajuste «Compartir datos con Descript» viene desactivado por defecto | Política de privacidad, 14 de abril de 2025; página de seguridad |
| Transkriptor | No en Pro, y por escrito | «Tus datos no se usarán con fines de entrenamiento» figura como función del plan Pro. Es el único servicio económico de aquí que pone por escrito una promesa de no entrenar, y una razón más para que el plan de pago sea el adecuado con grabaciones sensibles. Conservación: se guardan «solo el tiempo necesario», y «algunos Datos pueden persistir en las copias de seguridad» | Página de precios, Política de privacidad |
| Notta | No lo indica | Certificación SOC 2 Tipo II e ISO 27001. No encontramos ninguna declaración sobre entrenamiento con grabaciones de usuarios en sus páginas de precios, privacidad o seguridad | notta.ai |
| Whisper en local | No | no hay nada que declarar. El archivo no se mueve | n/a |
Tres lecturas honestas de esta tabla.
«Desidentificadas» carga con mucho peso en la frase de Otter. Quitarle los datos de cuenta a un archivo de audio no le quita la voz, ni los nombres que se pronuncian dentro, ni nada de lo que se dijo.
La página de marketing no es el documento. Tanto Otter como Rev publican una frase tranquilizadora que es cierta en sentido estricto y se malinterpreta en general. La página de privacidad y seguridad de Otter dice que «Ningún dato de cliente se usará para entrenar» los modelos de sus proveedores de servicios de IA, que es una promesa sobre otras empresas, no sobre Otter. La página de seguridad de Rev descarta los LLM externos mientras sus condiciones permiten el entrenamiento continuo de los propios. En los dos casos, el texto que obliga es el que lleva fecha de entrada en vigor.
Y nada de esto está escondido. Es público, está escrito en frases llanas, y ni un solo artículo de los que posicionan por este tema cita una palabra.
El consentimiento para grabar y el consentimiento para subir son dos preguntas distintas
Esto no es asesoramiento legal. La ley sobre grabaciones es genuinamente complicada y cambia según la jurisdicción, así que aquí hay una señal de tráfico, no una sentencia.
Sobre grabar, la referencia que usan de verdad los periodistas es el Reporters Committee for Freedom of the Press. Su guía afirma que «La ley federal exige el consentimiento de al menos una de las partes antes de grabar conversaciones presenciales, telefónicas o electrónicas», al amparo de la ley federal de escuchas recogida en 18 U.S.C. §§ 2510 y 2511. Además, «Alrededor de 11 estados exigen principalmente el consentimiento de todas las partes para grabar. Esos estados son California, Delaware, Florida, Illinois, Maryland, Massachusetts, Michigan (al menos para las grabaciones hechas por un tercero ajeno a la conversación), Montana, New Hampshire, Pennsylvania y Washington». Unos cuantos estados se quedan a medias: Missouri y Oregón exigen el consentimiento de todos solo en conversaciones presenciales, y Connecticut y Nevada solo en llamadas telefónicas. Para una llamada que cruza fronteras estatales, el consejo de la guía es «dar por hecho que se aplicará la ley del estado más estricto».
La cautela de esa cita es deliberada. «Alrededor de» y «principalmente» están ahí porque estas leyes tienen excepciones, y por eso las cifras redondas y seguras que verás en los fragmentos de búsqueda valen menos que la propia guía. Los abogados que escribían sobre los tomadores de notas con IA en febrero de 2026 añaden el punto operativo: lee las condiciones, la política de privacidad y la política de conservación del proveedor antes de que el archivo suba.
Sobre subir, casi no hay ley, y justo por eso hace falta una decisión y no una costumbre. Nada te impide enviarle a un proveedor de transcripción una entrevista grabada legalmente. Si deberías hacerlo o no es una pregunta sobre la promesa que le hiciste a la persona que está en la cinta.
Tres reglas prácticas que no cuestan nada.
Dilo en voz alta al principio de la grabación. «Estoy grabando esto y lo voy a pasar por un servicio automático de transcripción» dura cuatro segundos, queda en la cinta para siempre, y convierte una suposición en un consentimiento. Si la otra persona duda, has aprendido algo importante muy pronto.
Ponlo en el formulario de consentimiento si haces investigación, y consulta antes la lista de tu propia institución. La aprobación ética cubre el tratamiento de datos que tú describiste, y «un servicio de transcripción en la nube de un tercero» es un paso de tratamiento de datos. Las grabaciones de participantes cuentan por sí solas como datos identificables, que es como las tratará el comité de ética de una universidad diga lo que diga la transcripción. Las instituciones no se ponen de acuerdo entre ellas: las bibliotecas de Virginia Tech afirman que «Varias herramientas de transcripción, incluidas otter.ai y NVivo transcription, no están recomendadas por el departamento de TI para los investigadores de Virginia Tech», mientras que otros comités aceptan como suficiente la política de privacidad publicada por el proveedor. Lo que significa que la respuesta para ti es una pregunta de cinco minutos a tu oficina de investigación, no un juicio sacado de un artículo. Nombrar al proveedor, el plazo de conservación y el proceso de borrado es un párrafo de trabajo en la fase de propuesta y un problema irreparable después.
Mantén una vía que no salga nunca del edificio. Montar Whisper en local lleva una tarde, una sola vez. Tenerlo listo significa que la respuesta a «¿puedo subir esto siquiera?» nunca tiene que ser que sí por defecto.
Cómo conseguir una transcripción que sirva
Las marcas de tiempo son la diferencia entre una transcripción y un documento. Sin ellas, verificar una cita significa rastrear una hora de audio. Todos los servicios de pago de aquí las ponen; Rev sincroniza con el audio cada párrafo de sus transcripciones verificadas por personas; Whisper las produce de forma nativa, y WhisperX las baja al nivel de palabra.
Las etiquetas de interlocutor hay que arreglarlas antes que ninguna otra cosa. Cambia «Interlocutor 1» e «Interlocutor 2» por nombres reales en la primera pasada, mientras todavía recuerdas quién estaba sentado dónde, y el archivo entero se vuelve buscable por persona.
Elige el estilo una sola vez. Literal para el análisis conversacional, literal inteligente para casi todo lo demás, y editado solo para unas preguntas y respuestas publicadas. Cambiar a mitad crea un documento del que nadie puede citar con seguridad.
Exporta en el formato que quiere tu siguiente herramienta. DOCX para editar y codificar, SRT o VTT para subtítulos, TXT para buscar y para alimentar otra cosa, PDF solo para enviárselo a alguien que no lo va a editar. Compruébalo antes de pagar: Otter deja SRT, DOCX y PDF detrás de su plan Business.
Haz la pasada de audio sobre las citas. Reproduce cada pasaje que vayas a publicar. Es el seguro más rápido de toda esta página.
Y la mayor mejora de todas ocurre antes de todo esto: graba mejor. Un móvil tumbado en la mesa entre dos personas, en una sala sin ventilador ni cafetera, gana a cualquier función de precisión que venda cualquier proveedor. Si entrevistas a menudo, un micrófono de solapa barato mejorará tus transcripciones más que pasar de un plan gratuito a uno de pago.
Cómo lo hemos comprobado
No hicimos ninguna prueba práctica de precisión, y no vamos a insinuar lo contrario. Lee las comparativas que están por encima de esta en los resultados y encontrarás cifras rotundas («hasta el 99%», «se queda en el 85%») publicadas por empresas que se colocaron a sí mismas en primer lugar, sin archivo de prueba, sin metodología y sin datos en bruto. Los números que no puedes comprobar valen menos que ningún número.
Lo que hicimos nosotros, el 27 de agosto de 2026.
- Leímos la página de precios actual de cada servicio de aquí y sacamos de ahí directamente los precios y los minutos incluidos, en vez de copiar cifras de otros artículos.
- Leímos la documentación de soporte de Microsoft sobre Transcribir y Dictar, y las páginas de ayuda de Google sobre los subtítulos automáticos de YouTube y la escritura por voz de Docs, de donde salen los límites y las condiciones de fallo citadas arriba.
- Leímos las políticas de privacidad, las páginas de seguridad y las condiciones del servicio de Otter, Descript, Rev, Transkriptor y Notta, y las citamos literalmente, que es como salió a la luz la distancia entre la página de seguridad de Rev y su contrato.
- Contrastamos nuestras conclusiones con una autoridad independiente y no solo con los proveedores: la revisión de herramientas de transcripción de la Freedom of the Press Foundation, actualizada el 2 de junio de 2026.
- Comprobamos el estado de las herramientas de código abierto con la API de GitHub: whisper, whisper.cpp, WhisperX, Buzz, whisper-diarization y oTranscribe están todas vivas y ninguna archivada, con los commits más recientes en agosto de 2026.
- Tomamos los hallazgos sobre acentos y alucinaciones de la investigación publicada (JASA Express Letters, febrero de 2024; ACM FAccT, junio de 2024) y no del marketing de los proveedores.
- Sacamos comentarios fechados de profesionales en Hacker News a través de su API pública de búsqueda, así que cada cita de aquí tiene un enlace y una fecha que puedes abrir.
Cuatro cosas que no pudimos verificar, señaladas en vez de disimuladas. El texto completo del artículo de JASA está de pago desde donde estamos, así que los hallazgos sobre acentos vienen de su resumen. La página de precios de Transkriptor no dice si sus 90 minutos gratuitos son una asignación única o mensual. La documentación para empresas de Otter, que quizá describa una forma de negarse que las cuentas normales no tienen, no llegó a abrirse. Y Reddit era inaccesible desde nuestro entorno de investigación, así que las voces de la comunidad que aparecen aquí salen solo de Hacker News, que tira a lo técnico.
Un número que deliberadamente no publicamos: cuánto se tarda en limpiar una transcripción de IA por hora de audio. Varios artículos citan uno, ninguno lo respalda con una fuente, y la cifra real oscila entre unos pocos minutos en una clase limpia de un solo ponente y casi una tarde entera en una entrevista ruidosa a tres bandas.
La competencia
Herramientas que miramos y no clasificamos, con el motivo.
Sonix, Trint, Happy Scribe, TranscribeMe, GoTranscript, Scribie y Temi están asentadas y varias son buenas. Ocupan el mismo terreno que los cinco servicios de arriba a precios parecidos o más altos, y añadirlas habría alargado la página sin facilitar la decisión. Sonix y Happy Scribe en particular merecen un vistazo si necesitas mucho volumen multilingüe.
TurboScribe, ScreenApp, VEED y la cuadrilla de herramientas de navegador posicionan mucho para «audio a texto» y casi siempre acaban en un plan gratuito con un tope corto y un muro de registro. Si tienes un archivo corto y ninguna cuenta en ninguna parte, sirven. Para una entrevista de una hora son peor trato que Word.
Los tomadores de notas de reuniones, es decir Fireflies, Fathom, Jamie y compañía, transcriben tu calendario, no tus archivos. Si tu «entrevista» es una llamada de Zoom que organizas tú, mira esa categoría y mira Otter. Si es una grabación hecha con una grabadora de mano, no están pensados para eso.
MAXQDA, NVivo y ATLAS.ti llevan la transcripción dentro de un software de análisis cualitativo. Si ya estás codificando datos en uno de ellos, aprovecha lo que has pagado. Si no, no compres software de análisis para conseguir una transcripción.
Speechmatics, AssemblyAI y Deepgram son API para meter esto dentro de tu propio producto. Calidad real, forma equivocada para quien tiene un archivo y una fecha de entrega.
Las apps de dictado siguen apareciendo en las comparativas de transcripción y no deberían. Wispr Flow, Voicy y las herramientas integradas de Windows y Mac escriben tu habla en directo. No procesan una grabación que ya tienes, que es el trabajo de esta página. Si era eso lo que buscabas, empieza por dictar dentro de ChatGPT o por la comparativa de Mac.
Qué hacer ahora
Coge los primeros treinta minutos de tu grabación real, la fea, la del aire acondicionado y las dos personas hablando a la vez, y pásala por los 90 minutos gratuitos de Transkriptor. Ni una muestra limpia, ni el archivo de demostración de nadie. Treinta minutos de tu peor audio te dicen en cinco minutos si alguna transcripción con IA da la talla con tus acentos, tus nombres y tu jerga, y esa es la única pregunta que decide si deberías pagar por esto. Si la respuesta es no, ya sabes que tienes que presupuestar Rev o una tarde con oTranscribe. Y si la grabación no debería haberse subido nunca, monta Whisper en local y deja esa vía preparada.
Preguntas frecuentes
¿Cuánto se tarda en transcribir una entrevista de una hora?
A mano, entre 4 y 6 horas para la mayoría, y hasta 8 si el audio es difícil o si varias personas hablan a la vez, más otro 25 a 50% de revisión. Con un servicio de IA, el procesado tarda minutos, y después dedicas una cantidad impredecible de tiempo a arreglar nombres, términos y etiquetas de interlocutor. No vamos a ponerle un número a esa segunda parte, porque depende por completo de tu audio y nadie ha publicado una cifra que merezca repetirse. Con un servicio humano como Rev, 12 horas de espera y casi ningún trabajo por tu parte.
¿Cuál es la mejor forma gratuita de transcribir una entrevista?
Si pagas Microsoft 365, Transcribir en Word: 300 minutos al mes, separación de interlocutores incluida y nada que instalar. Si no lo pagas, o si la grabación es confidencial, Whisper en local con Buzz o MacWhisper. Y si el audio ya es un vídeo público de YouTube, pulsa «Mostrar transcripción» y listo.
¿Puedo transcribir audio en Microsoft Word?
Sí, solo en Word para la web, con Inicio, Dictar, Transcribir. Quien tiene suscripción a Microsoft 365 dispone de 300 minutos de audio cargado al mes, en .wav, .mp4, .m4a o .mp3, en Edge o Chrome, con los interlocutores separados automáticamente.
¿Otter es gratis de verdad?
Su plan gratuito da 300 minutos al mes para reuniones en directo que grabas dentro de Otter, pero solo tres importaciones de archivo en toda la vida de la cuenta. Si tu entrevista es un archivo de una grabadora, el plan gratuito no hará el trabajo más de tres veces.
¿Necesito permiso para subir una grabación a un servicio de transcripción?
Legalmente, en casi todas partes, no hace falta un permiso aparte del consentimiento que necesitabas para grabar. Éticamente, y en cualquier investigación sometida a un comité de ética, sí: la persona consintió que la grabaras tú, no que su voz la procesara un tercero que puede conservarla y entrenar con ella. Dilo en la grabación, o escríbelo en el formulario de consentimiento. La Freedom of the Press Foundation va más lejos con el material de alto riesgo y recomienda «evitar la transcripción por completo si tu audio, en las manos equivocadas, podría poner a alguien en peligro».
¿Es legal grabar una entrevista?
Depende de dónde esté cada uno. La ley federal de Estados Unidos exige el consentimiento de al menos una de las partes. Alrededor de once estados exigen el de todas, entre ellos California, Florida, Illinois, Maryland, Massachusetts, Pennsylvania y Washington. En llamadas entre estados, da por hecho que se aplica la ley más estricta. Esto es una señal, no asesoramiento legal, y el Reporters Committee for Freedom of the Press mantiene el detalle estado por estado.
¿Qué precisión tiene realmente la transcripción con IA?
Con audio limpio en inglés estadounidense, lo bastante buena como para que casi toda tu edición sea puntuación y nombres. La precisión baja de forma medible con acentos no nativos y no estadounidenses, baja más con habla solapada, y falla de una forma muy concreta con nombres propios y vocabulario técnico. Los modelos también pueden insertar texto que nadie dijo, sobre todo durante los silencios: un trabajo revisado por pares lo encontró en torno al 1% de las transcripciones de Whisper. Trata cualquier transcripción como un borrador y contrasta las citas con el audio.
¿Qué herramientas etiquetan a los interlocutores?
Transkriptor, Otter, Notta, Descript (8 o más) y el Transcribir de Word lo hacen automáticamente. Las transcripciones humanas de Rev lo hacen de forma fiable. Whisper en local a secas no, y necesitas WhisperX o un complemento parecido para conseguirlo.
¿Cómo transcribo una clase grabada con el móvil?
Pasa el archivo a un ordenador y súbelo a Transcribir en Word si tienes Microsoft 365, o pásalo por Buzz en local. Si la clase dura más de cinco horas, comprueba el tope por grabación antes de pagar nada: el plan Pro de Notta admite cinco horas por archivo, y varios rivales se paran antes.
¿Cuál es la diferencia entre software de transcripción y de dictado?
La transcripción convierte en texto una grabación que ya tienes. El dictado convierte tu habla en directo en texto dentro de la aplicación que estés usando. Son productos distintos, y las herramientas que destacan en uno suelen ser inútiles en el otro.
Comentarios
Todavía no hay comentarios. Haz una pregunta o cuéntanos qué te ha funcionado.