Como transcrever uma entrevista ou aula (2026): todos os métodos, com preço em horas e em dólares

Alguns links desta página são de afiliado: o preço para você não muda. Como trabalhamos.

Se você tem uma hora de áudio e um prazo, suba o arquivo para um serviço e em poucos minutos terá uma transcrição bruta. Se você tem uma hora de áudio e um compromisso com a pessoa que está nela, esse atalho é uma decisão para tomar devagar, porque a maioria desses serviços guarda o arquivo e alguns dizem abertamente que treinam com ele. Tudo abaixo está organizado em torno dessa bifurcação: três caminhos que não custam nada, vários que custam dinheiro, um que custa a sua tarde, e um relato honesto do que cada um erra.

Pela redação do VoiceBoardAtualizado em 28 de agosto de 2026

A nossa escolha

Transkriptor é o serviço pago que dá conta do trabalho inteiro pelo menor preço: $99.99 pelo ano dão $8.33 por mês e cobrem quarenta horas de gravação por mês, com identificação de quem fala e uma promessa por escrito de não usar seus dados em treinamento nesse plano.

Se a gravação não pode sair do seu computador, use o Whisper local pelo Buzz ou pelo MacWhisper. É gratuito, dá conta de vinte arquivos com a mesma facilidade de um, e o áudio não se move.

As nossas indicações

PapelFerramenta
Melhor caminho gratuito se você já paga o Microsoft 365Transcrever no Word, 300 minutos por mês
Melhor caminho gratuito para uma gravação que não pode sair da máquinaWhisper local, pelo Buzz ou pelo MacWhisper
Melhor serviço pago para a maioria das pessoasTranskriptor
Melhor para reuniões e entrevistas que você mesmo conduzOtter
Melhor quando a transcrição precisa se sustentar num processo, no ar ou numa citaçãotranscrição humana da Rev
Melhor para um arquivo só, sem assinaturaa transcrição por IA da Rev, a $0.25 o minuto
Melhor se a entrevista vai virar podcast ou vídeoDescript
Melhor para equipes multilínguesNotta
Melhor se você decidiu digitar por conta própriaoTranscribe, gratuito e de código aberto

Um esclarecimento antes dos métodos, porque as duas palavras vivem sendo confundidas. Transcrição transforma uma gravação existente em texto. Ditado transforma a sua fala ao vivo em texto enquanto você escreve. Se o que você quer mesmo é falar em vez de digitar, o que você quer é um app de ditado, e temos guias separados para Windows e Mac.

Antes de subir qualquer arquivo

Responda uma pergunta e o resto desta página se estreita a duas ou três opções.

A pessoa que está na gravação concordou em ter a voz dela enviada para uma empresa de que ela nunca ouviu falar?

Concordar em ser gravado não é a mesma coisa que concordar em ser enviado para a nuvem. Uma fonte que diz "pode gravar" está pensando no seu caderno, não nos servidores de um fornecedor, num contratado de rotulagem de dados e numa rodada de treinamento de modelo. Para uma coletiva de imprensa ou para as suas próprias anotações de aula, isso não é problema. Para um denunciante, um paciente, um participante de pesquisa que assinou um termo de consentimento listando exatamente quem cuidaria dos dados dele, ou qualquer pessoa falando de algo que pode lhe custar o emprego, isso decide o fluxo de trabalho inteiro.

Se a resposta for não, ou se você não tiver certeza, pule para o Whisper local. Ele roda no seu próprio computador, não custa nada, e o áudio não se move. Todo o resto desta página envolve entregar o arquivo a alguém.

Essa não é uma preocupação de nicho. A Freedom of the Press Foundation, que treina jornalistas exatamente nesse tipo de decisão, revisou as ferramentas de transcrição populares e chegou a uma conclusão sem rodeios num texto atualizado em 2 de junho de 2026: "cada uma dessas empresas tem a capacidade técnica de acessar o áudio que você subiu", e "Recomendamos evitar a transcrição por completo se o seu áudio, nas mãos erradas, puder colocar pessoas em risco." Os instrutores de segurança deles apontam os mesmos leitores para o Whisper offline, rodando no aparelho de cada um.

Um pesquisador na ativa formulou a versão prática disso melhor do que nós conseguiríamos. Escrevendo no Hacker News em 17 de julho de 2026, um desenvolvedor explicou por que tinha construído a própria ferramenta de transcrição: "não existem opções de verdade para transcrição de entrevistas com detecção de quem fala que sirvam num contexto de avaliação de estudo universitário, onde você não sobe os dados para a nuvem de outra pessoa com políticas de privacidade duvidosas."

Panorama rápido

Os custos são por hora de gravação, porque essa é a unidade que você tem de fato. Tudo conferido em 27 de agosto de 2026.

MétodoMelhor paraUma hora de áudio custaIdentifica quem falaPara onde vai o áudio
Na mãocitações que você não pode errar4 a 6 horas do seu tempovocê escrevelugar nenhum
Transcrever no Wordquem tem assinatura do Microsoft 365grátis, dentro de 300 min/mêssimMicrosoft
Legendas automáticas do YouTubepalestras e aulas que já são públicasgrátisnãoGoogle
Whisper localgravações confidenciais, e lotegrátis, mais o tempo de máquinasó com ferramentas extraslugar nenhum
API do Whisperum lote, sem software para instalar$0.36nãoOpenAI
Transkriptoro trabalho inteiro pelo menor preço$8.33/mês cobrem 40 horassimTranskriptor
Otterreuniões ao vivo que você conduz$8.33/usuário/mês na cobrança anualsimOtter, que treina com o material
Nottareuniões multilíngues e arquivos longos$97.99/ano cobrem 30 horas por mêssimNotta
Rev, IAum arquivo só, pagando pelo uso$15.00não informadoRev
Rev, humanaregistro jurídico, veiculação, citações publicadas$119.40simRev, mais um transcritor verificado
Descriptentrevistas que viram áudio ou vídeo$16/mês no anual, para 10 horas de mídiasim, 8+ vozesDescript, que treina com o material se você não recusar

Caminho 1. Digitar você mesmo

Melhor para: trechos curtos, áudio péssimo e material em que você precisa ouvir cada hesitação.

Ninguém no mercado de software quer que você saiba quanto tempo isso leva, então aqui vão três estimativas de gente que vende transcrição e, portanto, não tem motivo para exagerar o esforço a seu favor. A SpeakWrite fala em "cerca de quatro vezes a duração do áudio". O guia da própria Otter diz "3 a 6 horas por hora de áudio". O presidente da Happy Scribe, escrevendo em setembro de 2025, dá a proporção de trabalho como 4:1, "chegando a 6:1 ou até 8:1 em transcrições complexas", com a revisão somando "outros 25-50%" por cima.

Nenhuma das três cita um estudo, então trate os números pelo que são: uma estimativa consistente do ofício, feita por quem faz isso diariamente. Considere um dia inteiro de trabalho para uma entrevista de uma hora, e mais do que isso se duas pessoas falam por cima uma da outra.

Diante disso, por que alguém ainda faria à mão? Três razões reais. Trechos muito curtos saem mais rápido digitados do que subidos e limpos. Áudio gravado num bar, num celular, através de uma máscara ou com sotaque forte pode derrotar todos os modelos desta página, e você vai passar o dia consertando os palpites da máquina em vez de escrever os seus. E, em pesquisa qualitativa, transcrever é analisar: quem digita as próprias entrevistas percebe coisas que jamais captaria passando o olho por uma transcrição limpinha.

Se você vai fazer à mão, não faça num tocador de mídia com um editor de texto ao lado. O oTranscribe é um editor gratuito e de código aberto feito para essa única tarefa: o player e o texto ficam na mesma janela, então você nunca troca de programa, e o teclado pausa e rebobina sem tirar as mãos das teclas. O projeto é licenciado sob MIT, e o repositório dele ainda recebia commits em 10 de agosto de 2026, o que é mais do que se pode dizer da maioria das ferramentas gratuitas da geração dele. O seu arquivo fica no seu computador.

Decida o estilo antes de começar, porque mudar no meio joga a sessão inteira fora.

Caminho 2. Os caminhos gratuitos

Os três são gratuitos de verdade, e nenhum dos oito artigos que hoje aparecem no topo desta busca menciona qualquer um deles. Todos também têm limites reais, então leia as condições de falha antes de comprometer uma tarde.

Transcrever no Word

Melhor para: praticamente qualquer pessoa que já paga o Microsoft 365 e não reparou que esse recurso existe.

Abra o Word no navegador, vá em Página Inicial, clique na seta ao lado de Ditar, escolha Transcrever e suba o arquivo. A documentação da própria Microsoft define os limites: "Usuários com assinatura do Microsoft 365 podem transcrever no máximo 300 minutos de áudio enviado por mês", e 30.000 minutos para quem tem licença do Copilot. Ele aceita .wav, .mp4, .m4a e .mp3, roda só no Edge e no Chrome, precisa de conexão e separa quem fala automaticamente. O processamento leva mais ou menos o tempo da gravação. O resultado cai numa pasta "Arquivos transcritos" no seu OneDrive, e você pode jogar trechos avulsos ou a transcrição inteira direto no documento.

Cinco horas por mês, de graça, com separação de vozes, num produto que dezenas de milhões de pessoas já pagam. É a coisa mais subutilizada da categoria.

As pegadinhas, na ordem de quantas vezes elas incomodam. É processamento na nuvem: a Microsoft afirma que "Seus arquivos de áudio são enviados à Microsoft e usados apenas para fornecer este serviço", o que é um compromisso claro e ainda assim significa que o arquivo sai da sua máquina. Só funciona na versão do navegador, não no app instalado. E circula bastante um limite de 200 MB por arquivo, inclusive nas respostas de suporte da própria Microsoft, mas ele não está na página de documentação atual, então não vamos afirmar isso como fato. Divida gravações longas se a sua se recusar a subir.

Legendas automáticas do YouTube

Melhor para: uma palestra, aula ou mesa-redonda que já está no YouTube, ou que você não se importa de publicar.

Se o vídeo existe no YouTube, talvez você já tenha uma transcrição. Clique em "Mostrar transcrição" na descrição e o texto aparece num painel rolável, com marcação de tempo, e clicar em qualquer linha pula o vídeo até ali. Se for um envio seu, o YouTube Studio entrega o próprio arquivo de legendas: Legendas, escolha o vídeo, Editar ao lado do idioma, Opções, Fazer o download das legendas.

O Google publica a lista de idiomas que recebem legendas automáticas, e ela é longa, indo do africâner ao zulu, com uns sessenta e tantos itens. O Google também publica, de forma incomumente clara, quando isso falha. As legendas não aparecem em áudio complexo demais para processar, em idiomas sem suporte, quando "O vídeo é longo demais", quando há "qualidade de som ruim ou o YouTube não reconhece a fala", depois de "um longo período de silêncio no início", e com "vários locutores falando ao mesmo tempo ou vários idiomas simultâneos". Esse último item é a descrição da maioria das entrevistas. E o aviso sobre precisão é do próprio Google: "As legendas automáticas podem representar mal o conteúdo falado por causa de pronúncias erradas, sotaques, dialetos ou ruído de fundo."

Existe um truque bastante rodado de subir um vídeo privado ou não listado só para colher as legendas. Ele funciona com frequência. Não vamos endossá-lo por duas razões: o Google não documenta se o status de privacidade afeta a geração de legendas, então o comportamento pode mudar sem aviso, e subir a entrevista de uma fonte para o YouTube é subir a entrevista para o Google. Para as suas próprias gravações de aula, tudo bem. Para qualquer coisa sensível, não.

Whisper local

Melhor para: gravações que não podem sair do seu computador, e para vinte arquivos de uma vez.

A OpenAI lançou o Whisper como modelo aberto, e o ecossistema em volta dele é hoje a opção gratuita mais forte da categoria. Nada é enviado, nada é medido, e a qualidade em áudio limpo chega perto o bastante dos serviços pagos para a maioria parar de notar a diferença.

A porta de entrada mais fácil é uma interface gráfica. O Buzz é gratuito e de código aberto, roda em Mac, Windows e Linux, aceita um arquivo ou um link do YouTube e exporta texto puro ou legendas. O MacWhisper é a opção polida para Mac, freemium, e vale o dinheiro se você faz isso toda semana (baixe só pelo macwhisper.com, já que o próprio site avisa que existem sites imitadores carregando malware). Embaixo dos dois está o whisper.cpp, que não precisa de dependências, roda só em CPU e é bastante otimizado no Apple Silicon, onde o Core ML pode deixar o encoder "mais de 3x mais rápido do que a execução só em CPU".

A escolha do modelo é a única decisão que você precisa tomar, e a troca é velocidade contra precisão. O modelo large tem 1550M de parâmetros e quer cerca de 10 GB de VRAM. O turbo é uma versão otimizada do large-v3 que roda mais ou menos oito vezes mais rápido com, nas palavras da OpenAI, "perda mínima de precisão". Na outra ponta, o tiny roda em qualquer coisa e erra nomes o tempo todo. Uma regra de bolso de quem usa isso, tirada do Hacker News em junho de 2026: "o medium costuma ser o ponto ideal entre precisão e velocidade no inglês, principalmente se você faz uma passada de pós-processamento depois."

Calibre a expectativa por quem roda isso diariamente, e não pela demonstração. Como um deles escreveu em agosto de 2026: "Funciona muito bem como primeira passada, que alguém depois arruma, mas não sozinho." Esse é o resumo honesto de todos os caminhos desta página, gratuitos ou pagos, e é a razão de nenhum deles eliminar a etapa de edição.

A fraqueza de verdade é a identificação de quem fala. O Whisper puro devolve um paredão de texto indiferenciado, e é assim desde 2023, quando alguém resumiu no Hacker News: "A única coisa que falta no Whisper é a diarização de locutores". Três anos depois, a solução ainda é ferramenta acoplada: WhisperX para marcação de tempo por palavra mais diarização, ou whisper-diarization. Os dois funcionam. Os dois somam uma instalação, um download de modelo e uma licença para ler, e um desenvolvedor abandonou o WhisperX em julho de 2026 especificamente por causa do licenciamento do modelo de locutores de que ele depende. Numa entrevista de duas pessoas gravada em canais separados, dá para contornar o problema inteiro transcrevendo cada canal em separado.

Se você prefere não instalar nada, o mesmo modelo está na API da OpenAI a $0.006 o minuto, o que dá 36 centavos por hora de áudio. É um caminho pago, mas ele pertence a esta seção porque é o mais barato da página por duas ordens de grandeza, e porque o gpt-4o-mini-transcribe, mais barato ainda, sai pela metade disso. Aí você volta a subir o arquivo, claro.

O truque de repetir em voz alta

Melhor para: nada, sinceramente, mas as pessoas não param de perguntar.

O truque: abra a digitação por voz no Google Docs ou o Ditar no Word, toque a sua gravação em voz alta e deixe o microfone captar. Funciona pela metade. O reconhecimento foi feito para alguém falando ao vivo a uma distância de conversa, então um alto-falante de celular do outro lado da mesa perde palavras, a pontuação desmorona, e a sessão costuma parar quando você troca de janela. A documentação do Google não diz nada sobre gravações, reprodução ou dispositivos de áudio virtuais, então nada aqui é comportamento suportado.

A versão que funciona é genuinamente tediosa: ouça pelo fone e repita o que ouve, com clareza, no microfone. Transcritores profissionais chamam isso de reformulação falada, e é uma técnica real. Roda em mais ou menos tempo real mais as correções, então conte noventa minutos para uma hora. Como o Transcrever do Word faz o mesmo serviço sozinho e de graça, isso hoje é um recurso para quem não tem assinatura do Microsoft 365 e não pode instalar software.

Caminho 3. Os serviços

Eles fazem o trabalho em minutos, formatam o resultado, identificam quem fala e exportam algo que você pode entregar a outra pessoa. A razão para pagar não é a precisão; um modelo local chega perto. A razão para pagar é a formatação, a identificação de quem fala e a exportação que você teria de montar na mão em cada arquivo.

Transkriptor

Melhor para: dar conta do trabalho inteiro pelo menor preço.

Preço: um plano gratuito com 90 minutos para começar. O Lite custa $9.99 por mês para 300 minutos. O Pro custa $19.99 por mês, ou $99.99 pelo ano, o que dá $8.33 por mês e inclui 2.400 minutos por mês. O Team sai por $30 por assento, ou $240 por ano.

Faça a conta e a posição fica óbvia: o Pro cobre quarenta horas de gravação por mês pelo preço de um lanche. Se você é aluno de pós com vinte entrevistas, ou jornalista com uma pilha de fitas atrasadas, nenhum outro serviço desta página chega perto. Ele lida com mais de 100 idiomas, identifica vários locutores com rótulos editáveis, exporta para TXT, SRT e Word (a página de entrevistas dele também lista PDF), e faz as coisas que você faria na mão: resumos, um chat com IA sobre a transcrição, tradução.

Duas coisas para dizer com clareza. A página de entrevistas dele promete "Alcance 99% de precisão", enquanto a página de aulas diz que o mesmo produto "entrega transcrições 99% precisas na maior parte das vezes". A segunda versão é a honesta, e ainda assim é um número do fabricante, não uma medição. E a linha "Seus dados não serão usados para fins de treinamento" aparece na lista de recursos do Pro, não no topo do site, o que significa que os planos gratuito e Lite não carregam promessa nenhuma nesse sentido. Se você vai subir algo sensível, isso é um argumento para pagar, e não para testar de graça.

Experimentar o Transkriptor

Otter

Melhor para: reuniões e entrevistas que você conduz e que está gravando ao vivo.

Preço: o plano Basic gratuito dá 300 minutos por mês, limitados a 30 minutos por conversa, e três importações de arquivo em toda a vida da conta. O Pro custa $16.99 por mês, ou $8.33 por mês na cobrança anual, com 1.200 minutos de gravação, dez importações por mês e limite de 90 minutos por reunião. O Business sai por $30, ou $19.99 no anual, com reuniões ilimitadas e quatro horas por reunião.

Leia aquele plano gratuito de novo, porque todo comparativo lista o Otter como jeito gratuito de transcrever uma entrevista. Não é. Três envios, e acabou. O Otter foi feito para entrar numa chamada ao vivo no Zoom, no Meet ou no Teams e transcrever enquanto as pessoas falam, e nisso ele é muito bom: o texto aparece na tela durante a conversa e se corrige conforme o contexto chega. Uma entrevistadora surda descreveu no Hacker News essa autocorreção ao vivo como "uma ajuda enorme", e esse é um caso de uso que nenhum serviço de envio de arquivo consegue igualar. Já entregar a ele uma gravação feita num gravador de mão é usá-lo na contramão.

Mais dois limites que compensa saber antes de assinar. A página de preços cita seis idiomas: inglês, espanhol, francês, alemão, japonês e chinês. E as exportações no Basic e no Pro são só mp3 e txt. SRT, DOCX e PDF são recursos do Business, então, se você precisa de legendas ou de um documento formatado, o preço real é $19.99 por mês, e não $8.33.

Notta

Melhor para: trabalho multilíngue e gravações longas.

Preço: o gratuito dá 120 minutos por mês com limite de três minutos por gravação, o que faz dele uma demonstração, não um plano. O Pro custa $97.99 por ano, cerca de $8.17 por mês, para 1.800 minutos mensais e até cinco horas por gravação. O Business sai por $199.99 por ano, com transcrição ilimitada.

O teto de cinco horas por gravação no Pro é o mais alto daqui e importa para quem grava sessões de um dia inteiro. O Notta tem certificação SOC 2 Type II e ISO 27001, faz identificação de quem fala e notas com marcação de tempo, e conecta com Zoom, Meet, Teams e Webex. Ele vem de Tóquio e é excepcionalmente forte em japonês, que é a razão para escolhê-lo em vez do Transkriptor se esse é o seu idioma de trabalho. A página de preços não informa a quantidade total de idiomas nem a lista de formatos de exportação, e não encontramos em lugar nenhum do site uma declaração sobre usar ou não as gravações para treinar modelos. Ausência de afirmação não é promessa em nenhum dos dois sentidos.

Rev

Melhor para: a transcrição que precisa estar certa, e para pagar por arquivo em vez de por mês.

Preço: a transcrição por IA custa $0.25 o minuto, o que dá $15.00 por hora de áudio. A transcrição humana custa $1.99 o minuto, ou $119.40 a hora. Existem assinaturas para volume: o Essentials a $25.49 por assento por mês na cobrança anual, com 5.000 minutos de IA, e o Pro a $47.99, com 10.000.

A transcrição humana é um produto diferente de tudo o mais nesta página, e merece ser tratada assim. A Rev promete "99%+ de precisão, entregue em 12 horas ou menos" para ela, contra "95%+ de precisão em cinco minutos ou menos" na versão por IA. Essa diferença parece pequena até você fazer a conta. Uma hora de conversa dá algo como 9.000 palavras, então 95% deixam cerca de 450 palavras erradas para você achar, e elas se concentram exatamente onde está o sentido: nomes, números e termos técnicos. Se a transcrição vai para uma petição, para o ar ou para uma citação publicada que um advogado vai ler, $119 compram de volta uma tarde de conferência e uma categoria inteira de risco.

O lado humano da história de privacidade é o mais forte entre as opções pagas: os transcritores "passam por triagem rigorosa, incluindo verificação de identidade e acordos de confidencialidade", o que é um controle real e raro.

O lado da máquina é onde é preciso ler com cuidado, e é o exemplo mais claro desta página de por que página de marketing não é documento. A página de segurança da Rev diz "nunca vamos treinar LLMs externos com os seus dados". Os termos de serviço, em vigor desde 15 de maio de 2026, dizem outra coisa: "O seu Conteúdo de Cliente será analisado pelos nossos modelos de ASR e por outros modelos de inteligência artificial da Rev e pode ser usado para o treinamento contínuo desses modelos". A exclusão que se abre ali é a de treinamento generativo, não a de treinamento em si, e os termos não oferecem forma de recusar. As duas frases são verdadeiras ao mesmo tempo, e a diferença inteira está na palavra externos. A sua entrevista não vai parar dentro do modelo de fundação de outra empresa. Ela pode muito bem parar dentro do da Rev.

Descript

Melhor para: uma entrevista que vai virar podcast ou vídeo.

Preço: o gratuito dá uma hora de mídia por mês. O Hobbyist custa $16 por pessoa por mês na cobrança anual, ou $24 no mensal, para 10 horas de mídia. O Creator sai por $24 no anual, ou $35 no mensal, para 30. O Business, $50 no anual, para 40.

O Descript não é bem um serviço de transcrição, e é por isso que ele está por último. É um editor em que a transcrição é a linha do tempo: apague uma frase no texto e o áudio vai junto, corte as muletas com um comando, conserte uma frase mal dita digitando por cima. Para uma entrevista destinada a virar áudio ou vídeo publicado, isso funde dois trabalhos em um. Ele transcreve 25 idiomas e detecta 8 ou mais vozes.

Fique de olho na unidade. O Descript cobra por horas de mídia, que cobrem edição e exportação, e não só transcrição, então dez horas por mês não são dez horas de entrevista se você também pretende editá-las.

A política de privacidade dele de fato lista "treinar nossos modelos de inteligência artificial" entre as finalidades de processamento de conteúdo, mas o controle é melhor do que essa frase sugere: o ajuste "Share Data with Descript" vem desligado por padrão, então o treinamento só acontece se você ligar. É o contrário do Otter e da Rev, onde o treinamento é o estado padrão e não existe chave nenhuma. Crédito a quem merece.

O que de fato dá errado

Todo fornecedor desta página cita um número entre 95% e 99%. Nenhum deles publica um teste que você possa repetir. Aqui está, em vez disso, o que dizem a pesquisa independente e quem faz isso todo dia, o que é mais útil, porque os erros não se distribuem ao acaso. Eles caem exatamente nas palavras que você ia citar.

Sotaques. A avaliação mais citada do Whisper entre sotaques é a de Graham e Roll, publicada na JASA Express Letters em fevereiro de 2024. A conclusão deles, nas palavras deles: "Os resultados revelam reconhecimento superior no inglês americano em comparação com os sotaques britânico e australiano, com desempenho semelhante no inglês canadense", e "sotaques nativos do inglês demonstram precisão maior do que sotaques não nativos". Eles também encontraram taxas de erro acompanhando a primeira língua do falante e a proficiência dele em inglês. Se você entrevista pessoas que aprenderam inglês adultas, a sua transcrição vai ser mensuravelmente pior do que a demonstração que você testou, e a ferramenta não vai te avisar disso.

Nomes e jargão. Esta é a maior fonte isolada de tempo de edição, e é a única coisa que modelo nenhum consegue adivinhar. Um desenvolvedor descreveu isso no Hacker News em julho de 2026: "Tipo, OpenBao às vezes sai como open bowel, rs. Isso obriga a uma limpeza considerável." Troque pelo sobrenome da sua fonte, pelas siglas da sua área e pelo nome da empresa sobre a qual você está escrevendo. Serviços que deixam você fornecer um vocabulário personalizado antes do processamento economizam mais tempo do que um ponto percentual de precisão de vitrine.

Silêncio. Este surpreende as pessoas. Modelos de reconhecimento de fala conseguem inventar texto onde não há nenhum. Em "Careless Whisper: Speech-to-Text Hallucination Harms", apresentado na ACM FAccT em junho de 2024, pesquisadores de Cornell, da Universidade de Washington, da NYU e da Universidade da Virgínia analisaram mais de 13.000 trechos de áudio e encontraram frases inteiras alucinadas em cerca de 1% das transcrições do Whisper. O gatilho que eles identificaram foram as pausas: "Pausas e silêncios mais longos entre palavras têm mais chance de disparar alucinações danosas", o que atinge com mais força quem tem alguma alteração de fala. A falha tem folclore próprio entre quem trabalha com isso, e é reconhecida pelas frases padronizadas que o modelo produz do nada. "O clássico 'Thank you for watching!'", como pôs um comentarista do Hacker News em fevereiro de 2026; alguém que já passou milhares de horas de áudio pelo Whisper relatou a mesma coisa chegando como "please like and subscribe". Os dois são artefatos de um modelo treinado com muito vídeo de internet, e os dois aparecem no silêncio.

Existe uma correção prática, e ela vale os dez minutos. Corte o silêncio antes de transcrever, ou passe o áudio por uma detecção de atividade de voz, para que o modelo só receba fala. Sem pausa, sem frase inventada. Onde cortar não é opção, a regra é ainda mais simples: se uma linha da sua transcrição soa lisa demais, ou agradece alguém, confira contra o áudio antes que ela vá para qualquer lugar.

Quem disse o quê. A identificação de quem fala é mais fraca do que a transcrição em toda parte, no gratuito e no pago. Duas vozes de timbre parecido, um momento de fala cruzada, alguém que entra no meio: os rótulos escorregam, e escorregam em silêncio. Seja qual for a ferramenta, confira as trocas de locutor em volta de cada citação que você pretende publicar.

A consequência prática das quatro: uma transcrição de IA é um rascunho pesquisável, não uma fonte. Todo trecho que você planeja citar é ouvido de novo e conferido contra o áudio. Essa passada final leva minutos, não horas, e é o passo que separa uma transcrição com que você pode trabalhar de uma transcrição que você pode publicar.

Quem treina com a sua gravação

Lemos estes documentos em 27 de agosto de 2026. Eles mudam, então as datas importam.

ServiçoTreina com a sua gravação?O que dizem os documentos deleDocumento
OtterSim, sem como recusar"treinar nossa tecnologia proprietária de IA com gravações de áudio desidentificadas e com transcrições (que podem conter Informações Pessoais)". Em separado, cita "Prestadores de serviço de rotulagem de dados que fornecem anotação e usam os dados que compartilhamos para criar dados de treinamento e avaliação"Política de Privacidade, em vigor desde 16 de junho de 2026
RevSim, sem como recusar"O seu Conteúdo de Cliente será analisado pelos nossos modelos de ASR e por outros modelos de inteligência artificial da Rev e pode ser usado para o treinamento contínuo desses modelos"Termos de Serviço, em vigor desde 15 de maio de 2026
DescriptSó se você ligar"treinar nossos modelos de inteligência artificial" aparece entre as finalidades de processamento, mas o ajuste "Share Data with Descript" vem desligado por padrãoPolítica de Privacidade, 14 de abril de 2025; página de segurança
TranskriptorNão no Pro, com garantia por escrito"Seus dados não serão usados para fins de treinamento" está listado como recurso do plano Pro. É o único serviço de baixo custo aqui que põe uma promessa de não treinamento por escrito, e mais uma razão para o plano pago ser o certo em gravações sensíveis. Retenção: mantida "só pelo tempo necessário", e "alguns Dados podem persistir em backups"Página de preços, Política de Privacidade
NottaNão informadoCertificado SOC 2 Type II e ISO 27001. Não encontramos declaração sobre treinar com gravações de usuários nas páginas de preços, privacidade ou segurançanotta.ai
Whisper localNãonada a declarar. O arquivo não se movenão se aplica

Três leituras honestas desta tabela.

"Desidentificadas" carrega muito peso na frase do Otter. Tirar os dados da conta de um arquivo de áudio não tira a voz, nem os nomes falados lá dentro, nem nada do que foi dito.

A página de marketing não é o documento. Tanto o Otter quanto a Rev publicam uma frase tranquilizadora que é verdadeira em sentido estrito e mal interpretada em larga escala. A página de privacidade e segurança do Otter diz que "Nenhum dado de cliente será usado para treinar" os modelos dos prestadores de serviço de IA dele, o que é uma promessa sobre outras empresas, não sobre o Otter. A página de segurança da Rev descarta LLMs externos, enquanto os termos dela permitem o treinamento contínuo dos modelos da própria Rev. Nos dois casos, o texto que vincula é o que tem data de vigência.

E nada disso está escondido. É público, escrito em frases simples, e nenhum artigo bem posicionado neste tema cita uma palavra disso.

Consentir em ser gravado e consentir em ser enviado são duas perguntas diferentes

Isto não é orientação jurídica. A lei sobre gravação é genuinamente complicada e varia por jurisdição, então isto é uma placa de sinalização, não uma decisão.

Sobre gravar, a referência que os jornalistas de fato usam é a do Reporters Committee for Freedom of the Press. O guia deles afirma que "A lei federal exige o consentimento de pelo menos uma das partes antes de gravar conversas presenciais, telefônicas ou eletrônicas", com base na lei federal de escuta, no 18 U.S.C. §§ 2510 e 2511. Além disso, "Cerca de 11 estados exigem principalmente o consentimento de todas as partes para gravar. Esses estados são Califórnia, Delaware, Flórida, Illinois, Maryland, Massachusetts, Michigan (ao menos para gravações feitas por um terceiro que não participa da conversa), Montana, New Hampshire, Pensilvânia e Washington." Alguns estados ficam no meio do caminho: Missouri e Oregon exigem o consentimento de todos só em conversas presenciais, Connecticut e Nevada só em ligações. Para uma chamada que cruza fronteiras estaduais, a orientação do guia é "presumir que valerá a lei estadual mais rígida".

As ressalvas dessa citação são deliberadas. "Cerca de" e "principalmente" estão ali porque essas leis têm exceções, e é por isso que os números redondos e confiantes que aparecem nos trechos de busca valem menos do que o guia em si. Advogados escrevendo sobre assistentes de reunião com IA em fevereiro de 2026 acrescentam o ponto operacional: leia os termos, a política de privacidade e a política de retenção do fornecedor antes que o arquivo suba.

Sobre enviar, quase não existe lei, e é justamente por isso que isso exige uma decisão, e não um hábito. Nada impede você de mandar uma entrevista licitamente gravada a um fornecedor de transcrição. Se você deve fazer isso é uma pergunta sobre a promessa que você fez à pessoa que está na fita.

Três regras práticas que não custam nada.

Diga em voz alta no começo da gravação. "Estou gravando, e vou passar isto por um serviço automático de transcrição" leva quatro segundos, fica na fita para sempre, e transforma uma suposição em consentimento. Se a pessoa hesitar, você aprendeu algo importante cedo.

Ponha no termo de consentimento, se você faz pesquisa, e confira antes a lista da sua própria instituição. A aprovação ética cobre o tratamento de dados que você descreveu, e "um serviço de transcrição em nuvem de terceiros" é uma etapa de tratamento de dados. Gravações de participantes contam como dado identificável por si só, e é assim que um comitê de ética universitário vai tratá-las, independentemente do que diga a transcrição. As instituições não concordam entre si aqui: as bibliotecas da Virginia Tech afirmam que "Várias ferramentas de transcrição, incluindo otter.ai e a transcrição do NVivo, não são recomendadas pela TI para pesquisadores da Virginia Tech", enquanto outros comitês aceitam a política de privacidade publicada de um fornecedor como suficiente. O que significa que a resposta para você é uma pergunta de cinco minutos ao seu escritório de pesquisa, e não um julgamento tirado de um artigo. Nomear o fornecedor, o prazo de retenção e o processo de exclusão é um parágrafo de trabalho na fase da proposta, e um problema insolúvel depois.

Mantenha um caminho que nunca sai de casa. O Whisper local leva uma tarde para configurar, uma vez só. Ter isso pronto significa que a resposta para "eu posso mesmo subir isto?" nunca precisa ser sim por falta de opção.

Como obter uma transcrição aproveitável

Marcações de tempo são a diferença entre uma transcrição e um documento. Sem elas, conferir uma citação significa vasculhar uma hora de áudio. Todo serviço pago daqui faz isso; a Rev sincroniza as transcrições humanas com o áudio a cada parágrafo; o Whisper as produz nativamente, e o WhisperX desce ao nível da palavra.

Os rótulos de quem fala devem ser acertados antes de qualquer outra edição. Renomeie "Locutor 1" e "Locutor 2" com os nomes reais logo na primeira passada, enquanto você ainda lembra quem estava sentado onde, e o arquivo inteiro fica pesquisável por pessoa.

Escolha o estilo uma vez só. Literal para análise de conversação, literal inteligente para quase tudo, editada só para uma entrevista publicada em pergunta e resposta. Trocar no meio cria um documento de que ninguém consegue citar com segurança.

Exporte no formato que a sua próxima ferramenta quer. DOCX para editar e codificar, SRT ou VTT para legendas, TXT para busca e para alimentar outra coisa, PDF só para mandar a quem não vai editar. Confira isso antes de pagar: o Otter deixa SRT, DOCX e PDF atrás do plano Business.

Faça a passada de áudio nas citações. Ouça de novo cada trecho que você vai publicar. É o seguro mais rápido desta página.

E o maior ganho de todos acontece antes de tudo isso: grave melhor. Um celular deitado na mesa entre duas pessoas, numa sala sem ventilador e sem cafeteira, vence qualquer recurso de precisão que um fornecedor venda. Se você entrevista com frequência, um microfone de lapela barato vai melhorar as suas transcrições mais do que trocar um plano gratuito por um pago.

Como conferimos isto

Não rodamos um teste prático de precisão, e não vamos fingir o contrário. Leia os comparativos que aparecem acima deste nos resultados de busca e você vai achar números confiantes ("até 99%", "não passa de 85%") publicados por empresas que se colocaram em primeiro, sem arquivo de teste, sem metodologia e sem dados brutos. Números que você não pode conferir valem menos do que número nenhum.

O que fizemos, em 27 de agosto de 2026.

Quatro coisas que não conseguimos verificar, sinalizadas em vez de disfarçadas. O texto completo do artigo da JASA é pago de onde estamos, então os achados sobre sotaque vêm do resumo. A página de preços do Transkriptor não diz se os 90 minutos gratuitos são uma cota única ou mensal. A documentação corporativa do Otter, que talvez descreva uma recusa que as contas comuns não têm, não abriu para nós. E o Reddit estava inacessível do nosso ambiente de pesquisa, então as vozes de comunidade aqui vêm só do Hacker News, o que puxa para o lado técnico.

Um número que deliberadamente não publicamos: quanto tempo leva limpar uma transcrição de IA por hora de áudio. Vários artigos citam um, nenhum indica a fonte, e o valor real vai de poucos minutos numa aula limpa com uma voz só até quase uma tarde inteira numa entrevista barulhenta com três pessoas.

A concorrência

Ferramentas que olhamos e não ranqueamos, com o motivo.

Sonix, Trint, Happy Scribe, TranscribeMe, GoTranscript, Scribie e Temi são estabelecidos e vários são bons. Ocupam o mesmo terreno dos cinco serviços acima, a preços parecidos ou mais altos, e incluí-los teria deixado a página mais longa sem deixar a decisão mais fácil. Sonix e Happy Scribe em especial merecem uma olhada se você precisa de bastante saída multilíngue.

TurboScribe, ScreenApp, VEED e a turma das ferramentas de navegador aparecem muito em "áudio para texto" e quase sempre se resolvem num plano gratuito com limite curto e um muro de cadastro. Se você tem um arquivo curto e nenhuma conta em lugar nenhum, eles funcionam. Para uma entrevista de uma hora, são um negócio pior do que o Word.

Assistentes de reunião, ou seja, Fireflies, Fathom, Jamie e companhia, transcrevem a sua agenda, não os seus arquivos. Se a sua "entrevista" é uma chamada de Zoom que você conduz, olhe essa categoria e o Otter. Se é uma gravação feita num gravador de mão, eles não foram feitos para isso.

MAXQDA, NVivo e ATLAS.ti trazem transcrição dentro de softwares de análise qualitativa. Se você já codifica dados em um deles, use o que já pagou. Se não, não compre software de análise para conseguir uma transcrição.

Speechmatics, AssemblyAI e Deepgram são APIs para embutir isso no seu próprio produto. Qualidade real, formato errado para quem tem um arquivo e um prazo.

Apps de ditado vivem aparecendo em comparativos de transcrição e não deveriam. Wispr Flow, Voicy e as ferramentas nativas de Windows e Mac digitam a sua fala ao vivo. Eles não processam uma gravação que você já tem, que é o trabalho desta página. Se era isso que você queria, comece por ditar dentro do ChatGPT ou pelo comparativo de Mac.

O que fazer agora

Pegue os primeiros trinta minutos da sua gravação de verdade, aquela bagunçada, com o ar-condicionado e as duas pessoas falando por cima uma da outra, e passe pelos 90 minutos gratuitos do Transkriptor. Não uma amostra limpinha, nem o arquivo de demonstração de alguém. Trinta minutos do seu pior áudio dizem em cinco minutos se alguma transcrição por IA é boa o bastante para os seus sotaques, os seus nomes e o seu jargão, e essa é a única pergunta que decide se vale pagar por isso. Se a resposta for não, agora você sabe que precisa reservar dinheiro para a Rev ou uma tarde com o oTranscribe. E se a gravação nunca deveria ter sido enviada para lugar nenhum, configure o Whisper local e mantenha esse caminho pronto.

Perguntas frequentes

Quanto tempo leva para transcrever uma entrevista de uma hora?

Na mão, de 4 a 6 horas para a maioria das pessoas, e até 8 se o áudio for difícil ou se várias pessoas falarem ao mesmo tempo, mais outros 25 a 50% de revisão. Com um serviço de IA, o processamento leva minutos, e depois você gasta um tempo imprevisível consertando nomes, termos e rótulos de quem fala. Não vamos pôr um número nessa segunda parte, porque ela depende inteiramente do seu áudio e ninguém publicou um valor que valha a pena repetir. Com um serviço humano como o da Rev, 12 horas de espera e quase nenhum trabalho seu.

Qual é o melhor jeito gratuito de transcrever uma entrevista?

Se você paga o Microsoft 365, o Transcrever no Word: 300 minutos por mês, separação de vozes incluída, nada para instalar. Se você não paga, ou se a gravação é confidencial, o Whisper local pelo Buzz ou pelo MacWhisper. Se o áudio já é um vídeo público do YouTube, clique em "Mostrar transcrição" e pronto.

Dá para transcrever áudio no Microsoft Word?

Dá, só no Word para a web, em Página Inicial, Ditar, Transcrever. Assinantes do Microsoft 365 têm 300 minutos de áudio enviado por mês, em .wav, .mp4, .m4a ou .mp3, no Edge ou no Chrome, com as vozes separadas automaticamente.

O Otter é mesmo gratuito?

O plano gratuito dá 300 minutos por mês para reuniões ao vivo que você grava dentro do Otter, mas só três importações de arquivo em toda a vida da conta. Se a sua entrevista é um arquivo vindo de um gravador, o plano gratuito não dará conta do trabalho mais de três vezes.

Preciso de permissão para subir uma gravação a um serviço de transcrição?

Juridicamente, na maioria dos lugares, não é preciso permissão separada além do consentimento necessário para gravar. Eticamente, e em qualquer pesquisa submetida a um comitê de ética, sim: a pessoa consentiu em ser gravada por você, não em ter a voz processada por um terceiro que pode guardá-la e treinar com ela. Diga isso na fita, ou escreva no termo de consentimento. A Freedom of the Press Foundation vai além para material de alto risco e recomenda "evitar a transcrição por completo se o seu áudio, nas mãos erradas, puder colocar pessoas em risco."

É legal gravar uma entrevista?

Depende de onde cada pessoa está. A lei federal nos Estados Unidos exige o consentimento de ao menos uma das partes. Cerca de onze estados exigem o consentimento de todos, incluindo Califórnia, Flórida, Illinois, Maryland, Massachusetts, Pensilvânia e Washington. Em ligações entre estados, presuma que vale a lei mais rígida. Isto é uma placa de sinalização, não orientação jurídica, e o Reporters Committee for Freedom of the Press mantém o detalhamento estado por estado.

Qual é a precisão real da transcrição por IA?

Em áudio limpo e em inglês americano, boa o suficiente para que a maior parte da sua edição seja pontuação e nomes. A precisão cai de forma mensurável em sotaques não nativos e não americanos, cai mais ainda em fala sobreposta, e falha de um jeito específico em nomes próprios e vocabulário técnico. Os modelos também podem inserir texto que nunca foi dito, especialmente em silêncios: trabalho revisado por pares encontrou isso em cerca de 1% das transcrições do Whisper. Trate qualquer transcrição como rascunho e confira as citações contra o áudio.

Quais ferramentas identificam quem fala?

Transkriptor, Otter, Notta, Descript (8 ou mais) e o Transcrever do Word fazem isso automaticamente. As transcrições humanas da Rev fazem de forma confiável. O Whisper local puro não faz, e você precisa do WhisperX ou de um complemento parecido para conseguir.

Como transcrever uma aula gravada no celular?

Passe o arquivo para um computador e suba no Transcrever do Word, se você tem Microsoft 365, ou rode pelo Buzz localmente. Se a aula passa de cinco horas, confira o limite por gravação antes de pagar qualquer coisa: o plano Pro do Notta aguenta cinco horas por arquivo, e vários concorrentes param antes.

Qual é a diferença entre software de transcrição e de ditado?

Transcrição transforma em texto uma gravação que você já tem. Ditado transforma a sua fala ao vivo em texto no aplicativo que você estiver usando. São produtos diferentes, e ferramentas excelentes num deles costumam ser inúteis no outro.

Comentários

Ainda não há comentários. Faça uma pergunta ou conte o que funcionou para você.

Deixar um comentário

Os comentários passam por revisão antes de aparecer, normalmente em até um dia.