Comment transcrire un entretien ou une conférence (2026) : toutes les méthodes, chiffrées en heures et en dollars
Si vous avez une heure d'audio et une échéance, envoyez le fichier à un service et vous aurez une transcription brute en quelques minutes. Si vous avez une heure d'audio et une obligation envers la personne enregistrée, ce raccourci mérite une décision lente, parce que la plupart de ces services gardent le fichier et que certains disent franchement qu'ils s'en servent pour entraîner leurs modèles. Tout ce qui suit s'organise autour de cette bifurcation : trois voies qui ne coûtent rien, plusieurs qui coûtent de l'argent, une qui coûte votre après-midi, et un compte rendu honnête de ce que chacune rate.
Transkriptor est le service payant qui fait tout le travail pour le moins d'argent : $99.99 pour l'année, soit $8.33 par mois, couvrent quarante heures d'enregistrement par mois, avec identification des intervenants et un engagement écrit de ne pas entraîner de modèles sur cette offre.
Si l'enregistrement ne doit pas quitter votre ordinateur, utilisez Whisper en local, via Buzz ou MacWhisper. C'est gratuit, cela avale vingt fichiers aussi facilement qu'un seul, et l'audio ne bouge pas.
Nos recommandations
| Usage | Outil |
|---|---|
| Meilleure voie gratuite si vous payez déjà Microsoft 365 | Transcrire dans Word, 300 minutes par mois |
| Meilleure voie gratuite pour un enregistrement qui ne doit pas quitter la machine | Whisper en local, via Buzz ou MacWhisper |
| Meilleur service payant pour la plupart des gens | Transkriptor |
| Meilleur pour les réunions et les entretiens que vous animez vous-même | Otter |
| Meilleur quand la transcription doit tenir devant un tribunal, à l'antenne ou dans une citation | la transcription humaine de Rev |
| Meilleur pour un fichier unique sans abonnement | la transcription par IA de Rev, à $0.25 la minute |
| Meilleur si l'entretien deviendra un podcast ou une vidéo | Descript |
| Meilleur pour les équipes multilingues | Notta |
| Meilleur si vous avez décidé de le taper vous-même | oTranscribe, gratuit et open source |
Une précision avant les méthodes, parce que les deux mots sont sans cesse confondus. La transcription transforme un enregistrement existant en texte. La dictée transforme votre parole en direct en texte, pendant que vous travaillez. Si ce que vous voulez vraiment, c'est parler au lieu de taper, c'est une application de dictée qu'il vous faut, et nous avons des guides séparés pour Windows et pour Mac.
Avant d'envoyer quoi que ce soit
Répondez à une seule question et le reste de cette page se réduit à deux ou trois options.
La personne enregistrée a-t-elle accepté que sa voix soit envoyée à une entreprise dont elle n'a jamais entendu parler ?
Accepter d'être enregistré n'est pas la même chose qu'accepter d'être téléversé. Une source qui vous dit « oui, bien sûr, enregistrez » pense à votre carnet, pas aux serveurs d'un prestataire, à un sous-traitant d'annotation de données et à un entraînement de modèle. Pour une conférence de presse ou vos propres notes de cours, la question ne se pose pas. Pour un lanceur d'alerte, un patient, un participant à une recherche qui a signé un formulaire de consentement listant précisément qui manipulerait ses données, ou pour quiconque parle d'un sujet qui pourrait lui coûter son emploi, elle décide de tout le déroulé.
Si la réponse est non, ou si vous n'êtes pas sûr, sautez à Whisper en local. Il tourne sur votre propre ordinateur, ne coûte rien, et l'audio ne bouge pas. Tout le reste de cette page revient à confier le fichier à quelqu'un.
Ce n'est pas une inquiétude marginale. La Freedom of the Press Foundation, qui forme les journalistes exactement à ce type de décision, a passé en revue les outils de transcription les plus répandus et tranché sans détour dans un texte mis à jour le 2 juin 2026 : « chacune de ces entreprises a la capacité technique d'accéder à l'audio que vous avez téléversé », et « Nous recommandons de renoncer complètement à la transcription si votre audio, entre de mauvaises mains, peut mettre des gens en danger. » Ses formateurs en sécurité renvoient les mêmes lecteurs vers Whisper hors ligne, sur leur propre appareil.
Un chercheur en activité en a donné une version pratique mieux que nous ne le ferions. Sur Hacker News, le 17 juillet 2026, un développeur expliquait pourquoi il avait construit son propre outil de transcription : « il n'existe aucune vraie option de transcription d'entretiens avec détection des intervenants utilisable dans le cadre de l'évaluation d'une étude universitaire, sans téléverser les données dans le cloud de quelqu'un d'autre avec des politiques de confidentialité douteuses. »
Vue d'ensemble
Les coûts sont donnés par heure d'enregistrement, parce que c'est l'unité que vous avez réellement. Tout a été vérifié le 27 août 2026.
| Méthode | Idéal pour | Une heure d'audio coûte | Identification des intervenants | Où va l'audio |
|---|---|---|---|---|
| À la main | les citations que vous ne pouvez pas vous permettre de rater | 4 à 6 heures de votre temps | vous les écrivez | nulle part |
| Transcrire dans Word | quiconque a un abonnement Microsoft 365 | gratuit, dans la limite de 300 min/mois | oui | Microsoft |
| Sous-titres automatiques YouTube | les interventions et cours déjà publics | gratuit | non | |
| Whisper en local | les enregistrements confidentiels, et le traitement en masse | gratuit, plus du temps machine | seulement avec des outils supplémentaires | nulle part |
| API Whisper | un lot unique, sans rien à installer | $0.36 | non | OpenAI |
| Transkriptor | tout le travail au prix le plus bas | $8.33/mois couvrent 40 heures | oui | Transkriptor |
| Otter | les réunions en direct que vous animez | $8.33/utilisateur/mois en facturation annuelle | oui | Otter, qui s'en sert pour entraîner ses modèles |
| Notta | les réunions multilingues et les longs fichiers | $97.99/an couvrent 30 heures par mois | oui | Notta |
| Rev, IA | un fichier isolé, payé à l'usage | $15.00 | non précisé | Rev |
| Rev, humain | pièce juridique, diffusion, citations publiées | $119.40 | oui | Rev, plus un transcripteur vérifié |
| Descript | les entretiens qui deviennent de l'audio ou de la vidéo | $16/mois à l'année pour 10 heures de média | oui, 8 intervenants et plus | Descript, qui s'en sert pour entraîner ses modèles sauf refus explicite |
Voie 1. Le taper vous-même
Idéal pour : les extraits courts, l'audio catastrophique, et les documents où vous devez entendre chaque hésitation.
Personne dans le logiciel n'a envie que vous sachiez combien de temps cela prend, voici donc trois estimations venant de gens qui vendent de la transcription et n'ont donc aucun intérêt à exagérer l'effort en votre faveur. SpeakWrite parle d'« environ quatre fois la durée de l'audio ». Le guide d'Otter dit « 3 à 6 heures par heure d'audio ». Le PDG de Happy Scribe, en septembre 2025, donne un ratio de travail de 4:1, « jusqu'à 6:1 voire 8:1 pour les transcriptions complexes », la relecture ajoutant « encore 25 à 50 % » par-dessus.
Aucun des trois ne cite d'étude, alors prenez ces chiffres pour ce qu'ils sont : une estimation de métier, cohérente, donnée par des gens qui font cela tous les jours. Comptez une journée de travail complète pour un entretien d'une heure, davantage si deux personnes se coupent la parole.
Dans ces conditions, pourquoi le faire encore à la main ? Trois vraies raisons. Les extraits très courts se tapent plus vite qu'ils ne s'envoient et se nettoient. Un enregistrement fait dans un bar, au téléphone, à travers un masque ou avec un accent marqué peut mettre en échec tous les modèles de cette page, et vous passerez la journée à réparer les suppositions de la machine au lieu d'écrire les vôtres. Et en recherche qualitative, transcrire c'est analyser : ceux qui tapent leurs propres entretiens remarquent des choses qu'ils n'auraient jamais vues en survolant une transcription propre.
Si vous le faites à la main, ne le faites pas avec un lecteur multimédia d'un côté et un traitement de texte de l'autre. oTranscribe est un éditeur gratuit et open source conçu pour cette seule tâche : le lecteur audio et le texte sont dans la même fenêtre, vous ne changez donc jamais d'application, et le clavier commande la pause et le retour arrière sans que vos mains le quittent. Le projet est sous licence MIT, et son dépôt recevait encore des commits le 10 août 2026, ce qui n'est pas le cas de la plupart des outils gratuits de sa génération. Votre fichier reste sur votre ordinateur.
Choisissez votre style avant de commencer, parce qu'en changer à mi-parcours gâche toute la séance.
- Le verbatim intégral garde chaque « euh », chaque faux départ et chaque répétition. L'analyse conversationnelle en a besoin. Personne d'autre.
- Le verbatim aménagé supprime les tics et les bafouillages et conserve tout ce qui a du sens. C'est la norme en journalisme et dans la plupart des recherches.
- La version éditée corrige la grammaire et les phrases inachevées pour en faire de la prose lisible. Bien pour des questions-réponses publiées, mauvais pour tout ce que vous citerez plus tard comme parole.
Voie 2. Les options gratuites
Les trois sont réellement gratuites, et aucun des huit articles actuellement bien classés sur ce sujet n'en mentionne une seule. Elles ont aussi de vraies limites, alors lisez les conditions d'échec avant d'y engager un après-midi.
Transcrire dans Word
Idéal pour : à peu près tous ceux qui paient déjà Microsoft 365 sans avoir remarqué que cette fonction existe.
Ouvrez Word dans un navigateur, allez dans Accueil, cliquez sur la flèche à côté de Dicter, choisissez Transcrire, et envoyez le fichier. La documentation de Microsoft fixe les limites : « Les utilisateurs disposant d'un abonnement Microsoft 365 peuvent transcrire au maximum 300 minutes d'audio téléversé par mois », et 30 000 minutes avec une licence Copilot. La fonction accepte les formats .wav, .mp4, .m4a et .mp3, ne tourne que dans Edge et Chrome, exige une connexion, et sépare les intervenants automatiquement. Le traitement prend à peu près la durée de l'enregistrement. Le résultat atterrit dans un dossier « Fichiers transcrits » sur votre OneDrive, et vous pouvez insérer des passages isolés ou la transcription entière directement dans le document.
Cinq heures par mois, gratuitement, avec séparation des intervenants, pour un produit que des dizaines de millions de gens paient déjà. C'est la chose la plus sous-utilisée de cette catégorie.
Les inconvénients, du plus fréquent au plus rare. C'est un traitement en ligne : Microsoft indique que « Vos fichiers audio sont envoyés à Microsoft et utilisés uniquement pour vous fournir ce service », engagement clair mais qui suppose quand même que le fichier quitte votre machine. Cela ne marche que dans la version navigateur, pas dans l'application de bureau. Et une limite de 200 Mo par fichier circule un peu partout, y compris dans les réponses du support de Microsoft, mais elle ne figure pas sur la page de documentation actuelle, nous n'allons donc pas l'énoncer comme un fait. Découpez les longs enregistrements si le vôtre refuse de partir.
Les sous-titres automatiques de YouTube
Idéal pour : une intervention, un cours ou une table ronde déjà sur YouTube, ou que vous acceptez de publier.
Si la vidéo existe sur YouTube, vous avez peut-être déjà une transcription. Cliquez sur « Afficher la transcription » dans la description, et le texte apparaît dans un panneau déroulant, horodaté, chaque ligne cliquable pour sauter à cet endroit de la vidéo. S'il s'agit de votre propre mise en ligne, YouTube Studio vous donnera le fichier de sous-titres lui-même : Sous-titres, choisissez la vidéo, Modifier à côté de la langue, Options, Télécharger les sous-titres.
Google publie la liste des langues qui reçoivent des sous-titres automatiques, et elle est longue : de l'afrikaans au zoulou, avec une soixantaine d'entrées. Google publie aussi, avec une franchise inhabituelle, les cas où cela échoue. Les sous-titres n'apparaissent pas pour un audio trop complexe à traiter, pour les langues non prises en charge, quand « La vidéo est trop longue », en cas de « mauvaise qualité sonore ou si YouTube ne reconnaît pas la parole », après une « longue période de silence au début », et pour « plusieurs intervenants dont les paroles se chevauchent ou plusieurs langues en même temps ». Ce dernier cas est la description de la plupart des entretiens. Et l'avertissement sur la précision vient de Google : « Les sous-titres automatiques peuvent déformer le contenu parlé en raison de mauvaises prononciations, d'accents, de dialectes ou de bruits de fond. »
Il existe une astuce bien connue qui consiste à mettre en ligne une vidéo privée ou non répertoriée uniquement pour en récolter les sous-titres. Elle marche souvent. Nous n'allons pas la recommander, pour deux raisons : Google ne documente pas si le statut de confidentialité influence la génération des sous-titres, donc le comportement peut changer sans préavis, et mettre l'entretien d'une source sur YouTube, c'est le donner à Google. Pour vos propres enregistrements de cours, aucun problème. Pour quoi que ce soit de sensible, non.
Whisper en local
Idéal pour : les enregistrements qui ne doivent pas quitter votre ordinateur, et pour vingt fichiers d'un coup.
OpenAI a publié Whisper comme modèle ouvert, et l'écosystème qui l'entoure est aujourd'hui la meilleure option gratuite de cette catégorie. Rien n'est envoyé, rien n'est décompté, et la qualité sur un audio propre est assez proche des services payants pour que la plupart des gens cessent de voir la différence.
Le plus simple est de passer par une interface graphique. Buzz est gratuit et open source, tourne sur Mac, Windows et Linux, accepte un fichier ou un lien YouTube, et exporte du texte brut ou des sous-titres. MacWhisper est l'option Mac soignée, en freemium, et vaut son prix si vous faites cela chaque semaine (téléchargez-le uniquement depuis macwhisper.com, le site prévenant lui-même que des copies malveillantes circulent). Sous les deux se trouve whisper.cpp, qui n'a besoin d'aucune dépendance, tourne sur processeur seul, et est fortement optimisé sur Apple Silicon, où Core ML peut rendre l'encodeur « plus de 3 fois plus rapide qu'une exécution sur CPU seul ».
Le choix du modèle est la seule décision à prendre, et l'arbitrage se fait entre vitesse et précision. Le modèle large compte 1550M paramètres et demande environ 10 Go de VRAM. turbo est une version optimisée de large-v3, à peu près huit fois plus rapide avec, selon OpenAI, « une perte de précision minime ». À l'autre bout, tiny tourne sur n'importe quoi et se trompe constamment sur les noms propres. Une règle empirique de praticien, sur Hacker News en juin 2026 : « medium est souvent le bon compromis entre précision et vitesse en anglais, surtout si on enchaîne avec une passe de post-traitement. »
Calez vos attentes sur ceux qui font tourner cela tous les jours plutôt que sur la démo. Comme l'écrivait l'un d'eux en août 2026 : « Ça peut très bien marcher comme première passe que quelqu'un reprend derrière, mais pas tout seul. » C'est le résumé honnête de toutes les voies de cette page, gratuites ou payantes, et la raison pour laquelle aucune ne supprime l'étape de relecture.
La vraie faiblesse, c'est l'identification des intervenants. Whisper seul vous rend un mur de texte indifférencié, et c'est ainsi depuis 2023, quand quelqu'un résumait cela sur Hacker News par « La seule chose qui manque à Whisper, c'est la diarisation ». Trois ans plus tard, la solution reste un outillage à ajouter : WhisperX pour des horodatages au mot près plus la diarisation, ou whisper-diarization. Les deux fonctionnent. Les deux ajoutent une installation, un téléchargement de modèle et une licence à lire, et un développeur a quitté WhisperX en juillet 2026 précisément à cause de la licence du modèle d'intervenants dont il dépend. Pour un entretien à deux enregistré sur des canaux séparés, vous contournez tout le problème en transcrivant chaque canal séparément.
Si vous préférez ne rien installer, le même modèle est disponible sur l'API d'OpenAI à $0.006 la minute, soit 36 cents pour une heure d'audio. C'est une voie payante, mais elle a sa place ici parce qu'elle est la moins chère de la page de deux ordres de grandeur, et parce que gpt-4o-mini-transcribe, plus économique, se situe à la moitié de ce prix. Vous revenez au téléversement, évidemment.
La technique du re-speaking
Idéal pour : rien, honnêtement, mais on nous pose sans cesse la question.
L'astuce : ouvrir la saisie vocale de Google Docs ou Dicter dans Word, faire jouer votre enregistrement à voix haute, et laisser le microphone l'attraper. Cela marche à moitié. La reconnaissance est faite pour une personne qui parle en direct à distance de conversation, donc un haut-parleur de téléphone posé de l'autre côté du bureau perd des mots, la ponctuation s'effondre, et la session a tendance à s'arrêter dès que vous changez de fenêtre. La documentation de Google ne dit rien des enregistrements, de la lecture audio ni des périphériques audio virtuels : rien de tout cela n'est un usage pris en charge.
La version qui marche vraiment est franchement fastidieuse : écouter au casque et répéter ce que vous entendez, clairement, dans le microphone. Les transcripteurs professionnels appellent cela le re-speaking et c'est une vraie technique. Elle tourne à peu près au temps réel plus les corrections, comptez donc une heure et demie pour une heure. Sachant que Transcrire dans Word fait le même travail sans surveillance et gratuitement, c'est désormais un plan B pour les gens sans abonnement Microsoft 365 et sans possibilité d'installer un logiciel.
Voie 3. Les services
Ils font le travail en quelques minutes, mettent en forme le résultat, identifient les intervenants et exportent quelque chose que vous pouvez transmettre. La raison de payer n'est pas la précision : un modèle local en est proche. La raison de payer, c'est la mise en forme, l'identification des intervenants et l'export que vous devriez sinon assembler à la main sur chaque fichier.
Transkriptor
Idéal pour : faire tout le travail pour le moins d'argent.
Prix : une offre gratuite avec 90 minutes pour démarrer. Lite est à $9.99 par mois pour 300 minutes. Pro est à $19.99 par mois, ou $99.99 pour l'année, ce qui revient à $8.33 par mois et comprend 2 400 minutes par mois. Team coûte $30 par siège, ou $240 par an.
Faites le calcul et la position devient évidente : Pro couvre quarante heures d'enregistrement par mois pour le prix d'un sandwich. Si vous êtes doctorant avec vingt entretiens, ou journaliste avec une pile de bandes en retard, aucun autre service de cette page ne joue dans la même gamme. Il gère plus de 100 langues, identifie plusieurs intervenants avec des étiquettes modifiables, exporte en TXT, SRT et Word (sa page consacrée aux entretiens mentionne aussi le PDF), et fait ce que vous feriez sinon à la main : résumés, discussion avec une IA à propos de la transcription, traduction.
Deux choses à dire franchement. Sa page dédiée aux entretiens promet « 99 % de précision », tandis que sa page sur les cours dit du même produit qu'il « fournit des transcriptions précises à 99 % la plupart du temps ». La seconde version est l'honnête, et cela reste un chiffre de vendeur, pas une mesure. Par ailleurs, la phrase « Vos données ne seront pas utilisées à des fins d'entraînement » figure dans la liste des fonctions Pro, pas en haut du site, ce qui veut dire que les offres gratuite et Lite ne portent aucune promesse de ce genre. Si vous envoyez quoi que ce soit de sensible, c'est un argument pour payer plutôt que pour essayer gratuitement.
Otter
Idéal pour : les réunions et entretiens que vous animez et que vous enregistrez en direct.
Prix : l'offre gratuite Basic donne 300 minutes par mois, plafonnées à 30 minutes par conversation, et trois imports de fichiers pour toute la durée de vie du compte. Pro coûte $16.99 par mois, ou $8.33 par mois en facturation annuelle, avec 1 200 minutes d'enregistrement, dix imports par mois et un plafond de 90 minutes par réunion. Business est à $30, ou $19.99 à l'année, avec réunions illimitées et quatre heures par réunion.
Relisez cette offre gratuite, parce que tous les comparatifs présentent Otter comme un moyen gratuit de transcrire un entretien. Il ne l'est pas. Trois téléversements, à vie. Otter est fait pour s'asseoir dans un appel en direct sur Zoom, Meet ou Teams et transcrire à mesure que les gens parlent, et à ce jeu il est excellent : le texte apparaît à l'écran pendant la conversation et se corrige à mesure que le contexte arrive. Un intervieweur sourd décrivait cette autocorrection en direct sur Hacker News comme « une aide énorme », un usage qu'aucun service de téléversement de fichiers ne peut égaler. Donnez-lui en revanche un enregistrement fait sur un dictaphone et vous l'utilisez à contre-emploi.
Deux autres limites à connaître avant de vous engager. La page tarifaire nomme six langues : anglais, espagnol, français, allemand, japonais et chinois. Et les exports en Basic et en Pro se limitent au mp3 et au txt. SRT, DOCX et PDF sont des fonctions Business, donc si vous avez besoin de sous-titres ou d'un document mis en forme, le vrai prix est $19.99 par mois, pas $8.33.
Notta
Idéal pour : le travail multilingue et les longs enregistrements.
Prix : la version gratuite donne 120 minutes par mois avec un plafond de trois minutes par enregistrement, ce qui en fait une démo plutôt qu'une offre. Pro coûte $97.99 par an, environ $8.17 par mois, pour 1 800 minutes par mois et jusqu'à cinq heures par enregistrement. Business est à $199.99 par an pour de la transcription illimitée.
Le plafond de cinq heures par enregistrement en Pro est le plus élevé ici et compte pour qui enregistre des séances d'une journée. Notta est certifié SOC 2 Type II et ISO 27001, identifie les intervenants, produit des notes horodatées, et se connecte à Zoom, Meet, Teams et Webex. Il vient de Tokyo et se montre particulièrement fort en japonais, ce qui est la raison de le préférer à Transkriptor si c'est votre langue de travail. Sa page tarifaire n'indique ni un nombre total de langues ni une liste de formats d'export, et nous n'avons trouvé nulle part sur son site une déclaration sur l'usage des enregistrements pour entraîner des modèles. L'absence d'affirmation n'est une promesse dans aucun sens.
Rev
Idéal pour : la transcription qui doit être juste, et pour payer au fichier plutôt qu'au mois.
Prix : la transcription par IA coûte $0.25 la minute, soit $15.00 l'heure d'audio. La transcription humaine coûte $1.99 la minute, soit $119.40 l'heure. Des abonnements existent pour le volume : Essentials à $25.49 par siège et par mois en facturation annuelle pour 5 000 minutes d'IA, Pro à $47.99 pour 10 000.
La transcription humaine est un produit différent de tout le reste de cette page, et elle mérite d'être traitée comme tel. Rev annonce pour elle « plus de 99 % de précision, livré en 12 heures ou moins », contre « plus de 95 % de précision en cinq minutes ou moins » pour la version IA. L'écart paraît petit jusqu'à ce qu'on le compte. Une heure de conversation représente environ 9 000 mots, donc 95 % vous laissent quelque 450 mots faux à retrouver, et ils se concentrent exactement là où se trouve le sens : les noms propres, les chiffres et les termes techniques. Si la transcription part dans un dossier judiciaire, à l'antenne, ou dans une citation publiée qu'un avocat lira, $119 vous rachètent un après-midi de vérification et une catégorie de risque.
Côté humain, l'histoire de la confidentialité est la plus solide des options payantes : les transcripteurs « font l'objet d'une sélection rigoureuse, avec vérification d'identité et accords de confidentialité », ce qui est un contrôle réel et rare.
Côté machine, il faut lire attentivement, et c'est l'exemple le plus net de cette page de la raison pour laquelle une page marketing n'est pas un document. La page sécurité de Rev dit « nous n'entraînerons jamais de LLM externes sur vos données ». Ses conditions de service, en vigueur depuis le 15 mai 2026, disent autre chose : « Votre contenu client sera analysé par nos modèles de reconnaissance vocale et par les autres modèles d'intelligence artificielle de Rev et pourra servir à l'entraînement continu de ces modèles ». L'exclusion posée là porte sur l'entraînement génératif, pas sur l'entraînement en général, et les conditions n'offrent aucun moyen de refuser. Les deux phrases sont vraies en même temps, et toute la différence tient dans le mot externe. Votre entretien ne finira pas dans le modèle de fondation de quelqu'un d'autre. Il finira peut-être bien dans celui de Rev.
Descript
Idéal pour : un entretien qui sera monté en podcast ou en vidéo.
Prix : la version gratuite donne une heure de média par mois. Hobbyist coûte $16 par personne et par mois en facturation annuelle, ou $24 au mois, pour 10 heures de média. Creator est à $24 à l'année, ou $35 au mois, pour 30. Business est à $50 à l'année pour 40.
Descript n'est pas vraiment un service de transcription, ce qui explique sa dernière place. C'est un éditeur où la transcription tient lieu de montage : supprimez une phrase dans le texte et l'audio part avec, coupez les tics de langage d'une seule commande, corrigez une phrase mal dite en la retapant. Pour un entretien destiné à être publié en audio ou en vidéo, cela réunit deux métiers en un. Il transcrit 25 langues et détecte 8 intervenants ou plus.
Attention à l'unité. Descript facture des heures de média, qui couvrent le montage et l'export et pas seulement la transcription, donc dix heures par mois ne font pas dix heures d'entretien si vous comptez aussi les monter.
Sa politique de confidentialité liste bien « l'entraînement de nos modèles d'intelligence artificielle » parmi les finalités de traitement, mais le contrôle est meilleur que cette phrase ne le laisse penser : le réglage « Share Data with Descript » est désactivé par défaut, donc l'entraînement n'a lieu que si vous l'activez. C'est l'inverse d'Otter et de Rev, où l'entraînement est l'état par défaut sans aucun interrupteur. Il faut le reconnaître.
Ce qui se passe mal en pratique
Tous les vendeurs de cette page annoncent un chiffre entre 95 % et 99 %. Aucun ne publie un test que vous puissiez refaire. Voici plutôt ce que disent la recherche indépendante et les gens qui font cela tous les jours, ce qui est plus utile, parce que les erreurs ne sont pas réparties au hasard. Elles tombent exactement sur les mots que vous comptiez citer.
Les accents. L'évaluation de Whisper selon les accents la plus citée est celle de Graham et Roll, parue dans JASA Express Letters en février 2024. Leur conclusion, dans leurs mots : « Les résultats révèlent une reconnaissance supérieure de l'anglais américain par rapport aux accents britannique et australien, avec des performances comparables pour l'anglais canadien », et « les accents anglais natifs présentent une précision supérieure aux accents non natifs ». Ils ont aussi observé des taux d'erreur qui suivent la langue maternelle du locuteur et son niveau d'anglais. Si vous interrogez des gens qui ont appris l'anglais adultes, votre transcription sera mesurablement moins bonne que la démo que vous avez essayée, et l'outil ne vous le dira pas.
Les noms propres et le jargon. C'est la première source de temps de relecture, et la seule chose qu'aucun modèle ne peut deviner. Un développeur le décrivait sur Hacker News en juillet 2026 : « Genre OpenBao qui ressort en open bowel parfois, lol. Ça oblige à un sacré nettoyage. » Remplacez par le nom de famille de votre source, les sigles de votre domaine et le nom de l'entreprise sur laquelle vous écrivez. Les services qui permettent de fournir un vocabulaire personnalisé avant traitement vous feront gagner plus de temps qu'un point de précision affiché.
Le silence. Celui-là surprend. Les modèles de reconnaissance vocale peuvent inventer du texte là où il n'y en a pas. Dans « Careless Whisper: Speech-to-Text Hallucination Harms », présenté à ACM FAccT en juin 2024, des chercheurs de Cornell, de l'université de Washington, de NYU et de l'université de Virginie ont analysé plus de 13 000 extraits audio et trouvé qu'environ 1 % des transcriptions de Whisper contenaient des phrases entièrement hallucinées. Le déclencheur qu'ils ont identifié, ce sont les pauses : « Les pauses et silences plus longs entre les mots sont plus susceptibles de déclencher des hallucinations nuisibles », ce qui frappe le plus durement les personnes ayant des troubles de la parole. Ce défaut a son folklore chez les praticiens, qui le reconnaissent aux formules toutes faites que le modèle produit à partir de rien. « Le classique "Thank you for watching!" », comme l'écrivait un commentateur de Hacker News en février 2026 ; quelqu'un qui avait passé des milliers d'heures d'audio dans Whisper rapportait la même chose sous la forme « please like and subscribe ». Les deux sont des artefacts d'un modèle entraîné sur beaucoup de vidéo en ligne, et les deux apparaissent dans le silence.
Il existe une parade concrète, et elle vaut ses dix minutes. Coupez les silences avant de transcrire, ou passez l'audio dans une détection d'activité vocale pour que le modèle ne reçoive que de la parole. Pas de pause, pas de phrase inventée. Quand couper n'est pas possible, la règle est plus simple encore : si une ligne de votre transcription se lit trop bien, ou remercie quelqu'un, vérifiez-la contre l'audio avant qu'elle n'aille où que ce soit.
Qui a dit quoi. L'identification des intervenants est partout plus faible que la transcription, en gratuit comme en payant. Deux voix de hauteur proche, un moment où l'on se coupe la parole, quelqu'un qui arrive en cours de route : les étiquettes dérivent, et elles dérivent en silence. Quel que soit l'outil, vérifiez par sondage les changements d'intervenant autour de chaque citation que vous comptez publier.
La conséquence pratique de ces quatre points : une transcription automatique est un brouillon consultable, pas une source. Chaque passage que vous comptez citer est réécouté et vérifié contre l'audio. Cette dernière passe prend des minutes plutôt que des heures, et c'est l'étape qui sépare une transcription sur laquelle travailler d'une transcription publiable.
Qui s'entraîne sur votre enregistrement
Nous avons lu ces documents le 27 août 2026. Ils changent, donc les dates comptent.
| Service | S'entraîne sur votre enregistrement ? | Ce que disent ses propres documents | Document |
|---|---|---|---|
| Otter | Oui, sans possibilité de refus | « entraînement de notre technologie d'IA propriétaire sur des enregistrements audio dépersonnalisés et sur des transcriptions (qui peuvent contenir des informations personnelles) ». Cite séparément des « prestataires d'étiquetage de données qui fournissent des services d'annotation et utilisent les données que nous partageons pour créer des données d'entraînement et d'évaluation » | Politique de confidentialité, en vigueur au 16 juin 2026 |
| Rev | Oui, sans possibilité de refus | « Votre contenu client sera analysé par nos modèles de reconnaissance vocale et par les autres modèles d'intelligence artificielle de Rev et pourra servir à l'entraînement continu de ces modèles » | Conditions de service, en vigueur au 15 mai 2026 |
| Descript | Seulement si vous l'activez | « l'entraînement de nos modèles d'intelligence artificielle » figure parmi les finalités de traitement, mais le réglage « Share Data with Descript » est désactivé par défaut | Politique de confidentialité, 14 avril 2025 ; page sécurité |
| Transkriptor | Non sur Pro, avec une garantie écrite | « Vos données ne seront pas utilisées à des fins d'entraînement » figure parmi les fonctions de l'offre Pro. C'est le seul service abordable de cette page à mettre par écrit une promesse de non-entraînement, et une raison de plus de choisir l'offre payante pour des enregistrements sensibles. Conservation : gardées « seulement le temps nécessaire », et « certaines données peuvent subsister dans les sauvegardes » | Page tarifaire, politique de confidentialité |
| Notta | Non précisé | Certifié SOC 2 Type II et ISO 27001. Nous n'avons trouvé aucune déclaration sur l'entraînement à partir des enregistrements des utilisateurs, ni sur sa page tarifaire, ni sur ses pages confidentialité et sécurité | notta.ai |
| Whisper en local | Non | rien à déclarer. Le fichier ne bouge pas | sans objet |
Trois lectures honnêtes de ce tableau.
« Dépersonnalisé » travaille beaucoup dans la phrase d'Otter. Retirer les identifiants de compte d'un fichier audio ne retire ni la voix, ni les noms prononcés à l'intérieur, ni rien de ce qui a été dit.
La page marketing n'est pas le document. Otter comme Rev publient une phrase rassurante, étroitement vraie et largement mal comprise. La page confidentialité et sécurité d'Otter dit « Aucune donnée client ne sera utilisée pour entraîner » les modèles de ses prestataires d'IA, ce qui est une promesse au sujet d'autres entreprises, pas au sujet d'Otter. La page sécurité de Rev exclut les LLM externes tandis que ses conditions autorisent l'entraînement continu des modèles de Rev. Dans les deux cas, le texte qui engage est celui qui porte une date d'entrée en vigueur.
Et rien de tout cela n'est caché. C'est public, écrit en phrases simples, et pas un seul article bien classé sur ce sujet n'en cite un mot.
Consentir à être enregistré et consentir au téléversement sont deux questions distinctes
Ceci n'est pas un conseil juridique. Le droit de l'enregistrement est vraiment compliqué et dépend de la juridiction : ce qui suit est un panneau indicateur, pas une décision.
Sur l'enregistrement, la référence qu'utilisent réellement les journalistes est le Reporters Committee for Freedom of the Press. Son guide indique que « La loi fédérale exige le consentement d'au moins une partie avant d'enregistrer une conversation en personne, téléphonique ou électronique », en vertu de la loi fédérale sur les écoutes, 18 U.S.C. §§ 2510 et 2511. À quoi s'ajoute : « Environ 11 États exigent principalement le consentement de toutes les parties pour un enregistrement. Il s'agit de la Californie, du Delaware, de la Floride, de l'Illinois, du Maryland, du Massachusetts, du Michigan (au moins pour les enregistrements réalisés par un tiers étranger à la conversation), du Montana, du New Hampshire, de la Pennsylvanie et de Washington. » Quelques États coupent la poire en deux : le Missouri et l'Oregon exigent le consentement de tous pour les conversations en personne seulement, le Connecticut et le Nevada pour les appels téléphoniques seulement. Pour un appel entre deux États, le guide conseille de « supposer que la loi la plus stricte s'applique ».
Les précautions de langage dans cette citation sont volontaires. « Environ » et « principalement » sont là parce que ces lois comportent des exceptions, et c'est pourquoi les chiffres ronds et assurés que vous verrez dans les extraits de recherche valent moins que le guide lui-même. Des avocats écrivant sur les preneurs de notes automatiques en février 2026 ajoutent le point opérationnel : lisez les conditions, la politique de confidentialité et la politique de conservation du prestataire avant que le fichier ne parte.
Sur le téléversement, il n'existe le plus souvent aucune loi, et c'est précisément pour cela qu'il appelle une décision plutôt qu'une habitude. Rien ne vous empêche d'envoyer à un prestataire de transcription un entretien légalement enregistré. Savoir si vous devez le faire est une question sur la promesse que vous avez faite à la personne sur la bande.
Trois règles pratiques qui ne coûtent rien.
Dites-le à voix haute au début de l'enregistrement. « J'enregistre, et je passerai l'enregistrement dans un service de transcription automatique » prend quatre secondes, reste sur la bande pour toujours, et transforme une supposition en consentement. Si la personne hésite, vous avez appris quelque chose d'important très tôt.
Mettez-le dans le formulaire de consentement si vous faites de la recherche, et vérifiez d'abord ce qu'autorise votre établissement. Une validation éthique couvre le traitement des données que vous avez décrit, et « un service de transcription en ligne tiers » est une étape de traitement des données. Les enregistrements de participants comptent comme des données identifiantes en tant que telles, et c'est ainsi qu'un comité d'éthique universitaire les traitera, quoi que dise la transcription. Les établissements ne sont pas d'accord entre eux sur ce point : les bibliothèques de Virginia Tech indiquent que « Plusieurs outils de transcription, dont otter.ai et NVivo transcription, ne sont pas recommandés par la DSI pour les chercheurs de Virginia Tech », tandis que d'autres comités acceptent la politique de confidentialité publiée par un prestataire comme suffisante. Autrement dit, la réponse pour vous tient dans une question de cinq minutes à votre service recherche, pas dans le jugement d'un article. Nommer le prestataire, la durée de conservation et la procédure de suppression, c'est un paragraphe de travail au stade du projet et un problème insoluble après.
Gardez une voie qui ne sort jamais des murs. Whisper en local demande un après-midi d'installation, une fois. L'avoir sous la main évite que la réponse à « est-ce que je peux vraiment téléverser ça ? » soit oui par défaut.
Obtenir une transcription utilisable
Les horodatages font la différence entre une transcription et un document. Sans eux, vérifier une citation revient à parcourir une heure d'audio. Tous les services payants d'ici les produisent ; Rev synchronise ses transcriptions vérifiées par des humains avec l'audio pour chaque paragraphe ; Whisper les produit nativement, et WhisperX les descend au niveau du mot.
Les étiquettes d'intervenants doivent être corrigées avant tout le reste. Renommez « Intervenant 1 » et « Intervenant 2 » avec de vrais noms dès la première passe, tant que vous vous rappelez qui était assis où, et tout le fichier devient consultable par personne.
Choisissez votre style une fois pour toutes. Verbatim intégral pour l'analyse conversationnelle, verbatim aménagé pour presque tout le reste, version éditée uniquement pour des questions-réponses publiées. Changer en cours de route produit un document dont plus personne ne peut citer un extrait en sécurité.
Exportez dans le format attendu par l'outil suivant. DOCX pour l'édition et le codage, SRT ou VTT pour les sous-titres, TXT pour la recherche et pour alimenter autre chose, PDF seulement pour envoyer à quelqu'un qui ne modifiera rien. Vérifiez avant de payer : Otter réserve SRT, DOCX et PDF à son offre Business.
Faites la passe audio sur les citations. Réécoutez chaque passage que vous publierez. C'est l'assurance la plus rapide de cette page.
Et le plus grand gain de tous se joue avant tout cela : enregistrez mieux. Un téléphone posé sur la table entre deux personnes, dans une pièce sans ventilateur ni machine à café, bat toutes les fonctions de précision vendues par n'importe quel prestataire. Si vous menez des entretiens régulièrement, un micro-cravate bon marché améliorera vos transcriptions plus que le passage d'une offre gratuite à une offre payante.
Comment nous avons vérifié
Nous n'avons pas réalisé de test de précision en conditions réelles, et nous n'allons pas laisser croire le contraire. Lisez les comparatifs classés au-dessus de celui-ci et vous trouverez des chiffres assurés (« jusqu'à 99 % », « plafonne à 85 % ») publiés par des entreprises qui se sont classées premières, sans fichier de test, sans méthode et sans donnée brute. Des chiffres invérifiables valent moins que pas de chiffres du tout.
Ce que nous avons fait à la place, le 27 août 2026.
- Lu la page tarifaire actuelle de chaque service présenté et relevé directement dessus les prix et les quotas de minutes, au lieu de recopier des chiffres trouvés dans d'autres articles.
- Lu la documentation d'assistance de Microsoft pour Transcrire et Dicter, et les pages d'aide de Google sur les sous-titres automatiques de YouTube et la saisie vocale de Docs, pour les limites et les conditions d'échec citées plus haut.
- Lu les politiques de confidentialité, les pages sécurité et les conditions de service d'Otter, Descript, Rev, Transkriptor et Notta, en les citant mot pour mot, ce qui a fait apparaître l'écart entre la page sécurité de Rev et son contrat.
- Confronté nos conclusions à une autorité indépendante plutôt qu'aux seuls vendeurs : l'examen des outils de transcription par la Freedom of the Press Foundation, mis à jour le 2 juin 2026.
- Vérifié l'état de l'outillage open source via l'API de GitHub : whisper, whisper.cpp, WhisperX, Buzz, whisper-diarization et oTranscribe sont tous actifs et aucun n'est archivé, les commits les plus récents datant d'août 2026.
- Tiré les résultats sur les accents et les hallucinations de la recherche publiée (JASA Express Letters, février 2024 ; ACM FAccT, juin 2024) plutôt que du marketing des vendeurs.
- Extrait des commentaires datés de praticiens sur Hacker News via son API de recherche publique, si bien que chaque citation d'ici a un lien et une date que vous pouvez ouvrir.
Quatre points que nous n'avons pas pu vérifier, signalés plutôt que gommés. Le texte intégral de l'article JASA est payant depuis notre position, donc les résultats sur les accents viennent de son résumé. La page tarifaire de Transkriptor ne dit pas si ses 90 minutes gratuites sont un quota unique ou mensuel. La documentation entreprise d'Otter, qui décrit peut-être une possibilité de refus dont les comptes ordinaires ne disposent pas, n'a pas voulu s'ouvrir pour nous. Et Reddit était inaccessible depuis notre environnement de recherche, si bien que les voix de la communauté citées ici viennent uniquement de Hacker News, ce qui penche du côté technique.
Un chiffre que nous refusons délibérément de publier : le temps nécessaire pour nettoyer une transcription automatique, par heure d'audio. Plusieurs articles en citent un, aucun ne le source, et la valeur réelle va de quelques minutes sur un cours propre en solo à la plus grande partie d'un après-midi sur un entretien bruyant à trois voix.
La concurrence
Les outils que nous avons regardés sans les classer, avec la raison.
Sonix, Trint, Happy Scribe, TranscribeMe, GoTranscript, Scribie et Temi sont installés et plusieurs sont bons. Ils occupent le même terrain que les cinq services ci-dessus, à des prix voisins ou supérieurs, et les ajouter aurait rallongé la page sans rendre la décision plus simple. Sonix et Happy Scribe méritent un coup d'œil si vous avez besoin de beaucoup de multilingue.
TurboScribe, ScreenApp, VEED et la bande des outils en ligne se classent très bien sur « audio en texte » et se résument le plus souvent à une offre gratuite au quota court derrière une inscription obligatoire. Si vous avez un fichier court et aucun compte nulle part, ils font le travail. Pour un entretien d'une heure, c'est une moins bonne affaire que Word.
Les preneurs de notes de réunion, c'est-à-dire Fireflies, Fathom, Jamie et les autres, transcrivent votre agenda plutôt que vos fichiers. Si votre « entretien » est un appel Zoom que vous animez, regardez cette catégorie et Otter. Si c'est un enregistrement fait sur un dictaphone, ils ne sont pas faits pour ça.
MAXQDA, NVivo et ATLAS.ti intègrent la transcription à un logiciel d'analyse qualitative. Si vous codez déjà vos données dans l'un d'eux, servez-vous de ce que vous avez payé. Sinon, n'achetez pas un logiciel d'analyse pour obtenir une transcription.
Speechmatics, AssemblyAI et Deepgram sont des API pour intégrer tout cela dans votre propre produit. Vraie qualité, mauvaise forme pour quelqu'un qui a un fichier et une échéance.
Les applications de dictée reviennent sans cesse dans les comparatifs de transcription et ne devraient pas s'y trouver. Wispr Flow, Voicy et les outils intégrés de Windows et de Mac écrivent votre parole en direct. Ils ne traitent pas un enregistrement que vous avez déjà, qui est le sujet de cette page. Si c'était cela que vous cherchiez, commencez par dicter dans ChatGPT ou par le comparatif Mac.
Et maintenant
Prenez les trente premières minutes de votre vrai enregistrement, celui qui est brouillon, avec la climatisation et les deux personnes qui parlent en même temps, et passez-les dans les 90 minutes gratuites de Transkriptor. Pas un échantillon propre, pas le fichier de démo de quelqu'un. Trente minutes de votre pire audio vous diront en cinq minutes si une transcription automatique, quelle qu'elle soit, tient le coup sur vos accents, vos noms propres et votre jargon, et c'est la seule question qui décide si vous devez payer pour cela. Si la réponse est non, vous savez désormais qu'il faut budgéter Rev ou un après-midi avec oTranscribe. Et si l'enregistrement n'aurait jamais dû être téléversé, installez plutôt Whisper en local et gardez cette voie prête.
Questions fréquentes
Combien de temps faut-il pour transcrire un entretien d'une heure ?
À la main, 4 à 6 heures pour la plupart des gens, et jusqu'à 8 si l'audio est difficile ou si plusieurs personnes parlent en même temps, plus 25 à 50 % pour la relecture. Avec un service d'IA, le traitement prend quelques minutes, puis vous passez un temps imprévisible à corriger les noms propres, les termes et les étiquettes d'intervenants. Nous ne mettrons pas de chiffre sur cette seconde partie, parce qu'elle dépend entièrement de votre audio et que personne n'a publié de valeur digne d'être répétée. Avec un service humain comme Rev, 12 heures d'attente et presque aucun travail de votre part.
Quel est le meilleur moyen gratuit de transcrire un entretien ?
Si vous payez Microsoft 365, Transcrire dans Word : 300 minutes par mois, séparation des intervenants comprise, rien à installer. Sinon, ou si l'enregistrement est confidentiel, Whisper en local via Buzz ou MacWhisper. Si l'audio est déjà une vidéo YouTube publique, cliquez sur « Afficher la transcription » et c'est réglé.
Peut-on transcrire un fichier audio dans Microsoft Word ?
Oui, uniquement dans Word pour le web, par Accueil, Dicter, Transcrire. Les abonnés Microsoft 365 disposent de 300 minutes d'audio téléversé par mois, en .wav, .mp4, .m4a ou .mp3, dans Edge ou Chrome, avec les intervenants séparés automatiquement.
Otter est-il vraiment gratuit ?
Son offre gratuite donne 300 minutes par mois pour les réunions en direct que vous enregistrez dans Otter, mais seulement trois imports de fichiers pour toute la vie du compte. Si votre entretien est un fichier venant d'un enregistreur, l'offre gratuite ne fera le travail que trois fois.
Faut-il une autorisation pour envoyer un enregistrement à un service de transcription ?
Juridiquement, dans la plupart des endroits, aucune autorisation distincte n'est requise au-delà du consentement nécessaire pour enregistrer. Éthiquement, et dans toute recherche encadrée par un comité d'éthique, oui : la personne a consenti à être enregistrée par vous, pas à ce que sa voix soit traitée par un tiers susceptible de la conserver et de s'en servir pour entraîner ses modèles. Dites-le sur la bande, ou écrivez-le dans le formulaire de consentement. La Freedom of the Press Foundation va plus loin pour les matériaux à risque et recommande « de renoncer complètement à la transcription si votre audio, entre de mauvaises mains, peut mettre des gens en danger. »
Est-il légal d'enregistrer un entretien ?
Cela dépend de l'endroit où se trouve chacun. Aux États-Unis, la loi fédérale exige le consentement d'au moins une partie. Environ onze États exigent le consentement de tous, dont la Californie, la Floride, l'Illinois, le Maryland, le Massachusetts, la Pennsylvanie et Washington. Pour les appels entre États, supposez que la loi la plus stricte s'applique. Ceci est un panneau indicateur, pas un conseil juridique, et le Reporters Committee for Freedom of the Press tient à jour le détail État par État.
Quelle est vraiment la précision de la transcription par IA ?
Sur un audio propre en anglais américain, assez bonne pour que l'essentiel de votre travail porte sur la ponctuation et les noms propres. La précision baisse mesurablement sur les accents non natifs et non américains, baisse encore sur les paroles qui se chevauchent, et échoue d'une manière très particulière sur les noms propres et le vocabulaire technique. Les modèles peuvent aussi insérer du texte jamais prononcé, surtout pendant les silences : des travaux évalués par les pairs l'ont constaté dans environ 1 % des transcriptions de Whisper. Traitez toute transcription comme un brouillon et vérifiez les citations contre l'audio.
Quels outils identifient les intervenants ?
Transkriptor, Otter, Notta, Descript (8 et plus) et Transcrire dans Word le font tous automatiquement. Les transcriptions humaines de Rev le font de façon fiable. Whisper en local, seul, ne le fait pas : il vous faut WhisperX ou un module équivalent.
Comment transcrire un cours enregistré sur mon téléphone ?
Transférez le fichier sur un ordinateur et envoyez-le à Transcrire dans Word si vous avez Microsoft 365, ou passez-le dans Buzz en local. Si le cours dure plus de cinq heures, vérifiez le plafond par enregistrement avant de payer quoi que ce soit : l'offre Pro de Notta accepte cinq heures par fichier, plusieurs concurrents s'arrêtent avant.
Quelle différence entre un logiciel de transcription et un logiciel de dictée ?
La transcription transforme en texte un enregistrement que vous avez déjà. La dictée transforme votre parole en direct en texte dans l'application où vous travaillez. Ce sont deux produits différents, et les outils excellents dans l'un sont en général inutiles dans l'autre.
Commentaires
Pas encore de commentaires. Posez une question ou dites-nous ce qui a marché pour vous.