Transcription automatique de séance : comment elle fonctionne, où elle se trompe et comment bien l'installer
Un outil de transcription transforme ce qui se dit en séance en texte, puis souvent en compte rendu. Voici comment il fonctionne, ce qui fait baisser sa qualité, les erreurs à repérer en relisant et les réglages simples qui changent le résultat.
Pays concernés : France
Transcription brute et compte rendu, deux textes différents
La transcription brute est le texte mot à mot de la séance. Elle est longue, pleine d'hésitations et de phrases inachevées. Pour 45 minutes, elle fait plusieurs pages. Le compte rendu est une synthèse courte rédigée à partir d'elle. C'est lui qui va dans le dossier, une fois relu.
- Contenu
- Transcription brute. Tout ce qui a été dit, dans l'ordre
- Compte rendu. Thèmes, évolution, points à reprendre
- Erreurs possibles
- Transcription brute. Mots mal reconnus, oubliés ou inventés
- Compte rendu. Celles de la transcription, plus des raccourcis de synthèse
- Usage
- Transcription brute. Vérifier ce qui a été dit exactement
- Compte rendu. Suivre le patient d'une séance à l'autre
Une erreur de transcription peut passer dans le compte rendu sans que rien ne la signale. Pour une vue d'ensemble de la prise de notes par IA, lisez notre article sur la prise de notes par IA en séance. Ici, on s'arrête sur la transcription elle-même.
Comment la machine passe du son au texte
La reconnaissance vocale
Le modèle découpe le signal sonore en petits morceaux et calcule, pour chaque passage, la suite de mots la plus probable. Whisper, un modèle très utilisé publié en 2022, a par exemple appris sur environ 680 000 heures d'audio trouvé sur internet. Le mot important est « probable ». Le modèle ne comprend pas la séance. Quand le son est mauvais, il ne laisse pas de blanc. Il propose un mot plausible, parfois faux, et rien dans le texte ne montre qu'il a hésité.
La séparation des voix
Pour savoir qui a dit quoi, une autre étape regroupe les passages qui ont les mêmes caractéristiques de voix et les attribue à un locuteur. Elle marche bien quand chacun parle à son tour avec des voix distinctes. Elle se trompe plus souvent quand deux voix se ressemblent, quand on s'interrompt, ou quand une troisième personne est présente.
Du texte au compte rendu
Un modèle de langage lit ensuite la transcription et rédige le compte rendu. Il peut se tromper à son tour, par exemple en résumant trop vite un passage nuancé. Les erreurs des deux étapes s'additionnent. La HAS résume la démarche attendue par l'acronyme A.V.E.C. (apprendre, vérifier, estimer, communiquer) dans ses premières clefs d'usage de l'IA générative en santé (octobre 2025). Le projet de guide HAS et CNIL sur l'IA en contexte de soins (document de travail du 16 février 2026) demande au professionnel de garder une supervision humaine et de confronter le résultat de l'outil à son propre raisonnement clinique.
Ce qui fait baisser la qualité en séance
- Distance au micro
- Ce qui se passe. La voix lointaine se mêle au bruit et à l'écho. Une voix basse, celle d'un patient qui pleure par exemple, se perd vite.
- Que faire. Placer l'appareil entre vous deux, plus près de celui qui parle bas.
- Bruit de fond
- Ce qui se passe. Ventilation, rue, machine à bruit blanc, vibrations de la table.
- Que faire. Éloigner l'appareil des sources de bruit, couper les notifications.
- Accents
- Ce qui se passe. Plus d'erreurs sur les manières de parler moins présentes dans les données d'apprentissage.
- Que faire. Relire ces séances avec plus d'attention.
- Voix d'enfants
- Ce qui se passe. Nettement moins bien reconnues que celles des adultes.
- Que faire. Vérifier en priorité les passages où l'enfant s'exprime.
- Silences longs
- Ce qui se passe. Ils favorisent les phrases inventées.
- Que faire. Relire de près ce qui suit une longue pause.
- Voix qui se chevauchent
- Ce qui se passe. Une seule voix est gardée, ou les deux sont mélangées.
- Que faire. En séance de couple ou de famille, s'attendre à des attributions à corriger.
- Vocabulaire spécialisé
- Ce qui se passe. Médicaments, tests, sigles, prénoms rares sont remplacés par des mots plus courants.
- Que faire. Vérifier chacun de ces mots.
Les études disponibles portent surtout sur l'anglais. Elles montrent des tendances, pas la performance d'un outil précis en français. En 2020, une étude publiée dans PNAS a testé cinq systèmes grand public (Amazon, Apple, Google, IBM, Microsoft). Le taux moyen de mots erronés était de 35 % pour les locuteurs afro-américains, contre 19 % pour les locuteurs blancs. En 2024, des chercheurs ont montré (conférence AIES) que les bonnes performances de Whisper sur les adultes ne se retrouvent pas chez les enfants. Même après un entraînement complémentaire sur des voix d'enfants anglophones, il restait environ 9 % de mots erronés sur leur corpus de test.
Pour les orthophonistes et les neuropsychologues, une précaution de plus. Ces modèles sont faits pour produire un texte correct. On peut donc s'attendre à ce qu'ils lissent une partie de ce qui vous intéresse cliniquement, comme une paraphasie, un bégaiement ou une erreur de prononciation. Quand la forme exacte de ce que dit le patient fait partie du bilan, gardez votre propre relevé.
Les erreurs typiques et comment les repérer
Les mots qui manquent
Une étude publiée en 2018 dans JAMA Network Open a analysé 217 documents dictés par 144 médecins américains avec un logiciel de reconnaissance vocale de l'époque. Le texte de la machine contenait 7,4 erreurs pour 100 mots. L'erreur la plus fréquente était le mot oublié (34,7 % des erreurs), devant le mot ajouté (27 %). Après relecture humaine, le taux tombait à 0,3 % dans les documents signés. Les outils ont progressé depuis, mais la leçon reste. Le mot qui manque ne se voit pas, et la relecture change tout.
La négation qui disparaît
À l'oral, on laisse souvent tomber le « ne ». Le patient dit « j'ai pas envie de recommencer ». Toute la négation repose alors sur un mot court, prononcé vite. Si ce « pas » est perdu, la phrase dit le contraire. L'étude de 2018 cite d'ailleurs un « no » ajouté par erreur, qui inversait un constat clinique. Vérifiez en priorité les phrases sur les idées suicidaires, la consommation, le traitement et les violences.
Les phrases inventées
En 2024, Allison Koenecke et ses collègues ont présenté à la conférence ACM FAccT une étude sur Whisper, le modèle de reconnaissance vocale d'OpenAI. Ils ont fait transcrire 13 140 extraits audio en anglais issus d'AphasiaBank, une base qui réunit des personnes aphasiques et des personnes sans trouble du langage.
- 1,4 % des transcriptions contenaient des phrases entières absentes de l'audio.
- 38 % de ces inventions comportaient des contenus nuisibles, comme de la violence, des associations fausses ou une autorité inventée (un « merci d'avoir regardé », un lien vers un site officiel).
- Les inventions étaient plus fréquentes chez les personnes aphasiques (1,7 % contre 1,2 %) et liées à une part plus longue de silences.
Un nouveau test en décembre 2023 montrait une amélioration (12 des 187 extraits concernés produisaient encore une invention), mais les auteurs concluent que le modèle invente toujours de façon régulière et reproductible. Une séance de thérapie contient beaucoup de silences. Une phrase du compte rendu qui ne vous rappelle rien doit être vérifiée.
Les noms, les chiffres et les voix inversées
Un nom de médicament mal reconnu peut devenir un mot courant ou un autre médicament au nom voisin. Dans l'étude de 2018, les médicaments représentaient 2,3 % des erreurs. Les prénoms des proches, les dosages et les dates posent le même problème. Autre piège, une de vos questions attribuée au patient peut lui prêter une idée qu'il n'a pas exprimée.
Le compte rendu sans transcription
Si le micro n'était pas actif ou mal placé, la transcription peut être presque vide. Selon l'outil, un compte rendu peut quand même être produit à partir de quelques bribes, et il aura l'air correct. Une séance de 45 minutes ne tient pas en dix lignes de transcription.
La relecture en trois minutes
- Vérifiez que la transcription couvre toute la séance.
- Relisez chaque négation sur un sujet à risque.
- Vérifiez médicaments, dosages, prénoms et dates.
- Retrouvez dans la transcription toute phrase qui ne vous rappelle rien.
- Vérifiez qu'aucune de vos phrases n'est attribuée au patient.
- Ajoutez ce que la machine ne peut pas savoir, comme le non-verbal et votre analyse.
Faites-la le jour même. Plus tard, vous ne saurez plus distinguer une phrase inventée d'un détail oublié.
Installer son cabinet pour une bonne transcription
- Position. Entre vous et le patient, à découvert, sur une surface stable. Ni dans une poche, ni derrière un écran. Sur un téléphone, le micro principal est souvent en bas.
- Téléphone ou ordinateur. Le téléphone se place facilement entre les deux fauteuils (mode Ne pas déranger, batterie chargée). L'ordinateur, souvent posé sur le bureau, est plus loin du patient et son ventilateur peut s'entendre. Un micro externe aide dans une grande pièce ou en séance familiale.
- Téléconsultation. Avec un casque, la voix du patient n'est pas dans la pièce. Selon l'outil, seule votre voix peut être captée. Vérifiez lors d'un essai que les deux voix apparaissent.
- Test d'une minute. Asseyez-vous dans le fauteuil du patient et parlez une minute à voix normale, puis à voix basse. Faites de même depuis votre fauteuil, puis lisez la transcription. Si la voix basse manque, rapprochez l'appareil. Refaites ce test à chaque changement de pièce ou d'appareil.
- Dire à voix haute ce qui compte. Le projet de guide HAS et CNIL note que ces outils peuvent demander d'adapter un peu sa pratique, par exemple en disant à voix haute une partie de l'examen. En séance, une reformulation (« si je résume, vous avez repris le traitement lundi ») aide le patient et donne à la transcription une version claire du point important.
Transcription en direct ou dictée après la séance ?
- Ce qui est capté
- Transcription en direct. Ce que disent le patient et le praticien
- Dictée après la séance. Votre résumé, avec vos mots
- Qualité du son
- Transcription en direct. Dépend de la pièce et des voix
- Dictée après la séance. Une seule voix proche du micro, en général plus fiable
- Situations adaptées
- Transcription en direct. Séances individuelles où le détail compte
- Dictée après la séance. Patient qui refuse, jeunes enfants, groupes
Beaucoup de praticiens combinent les deux, et ajoutent une courte dictée après une séance transcrite pour y mettre leur lecture clinique.
Ce que dit le droit en France
Informer le patient. Le RGPD (article 13) impose d'informer la personne quand on recueille ses données. Pour un outil d'IA dans le soin courant, le projet de guide HAS et CNIL estime qu'une information loyale, accompagnée d'un droit d'opposition, suffit en principe. Il précise qu'un consentement peut être nécessaire au titre du code civil quand la voix d'une personne est captée. Les modalités pratiques sont dans notre article sur le consentement du patient à la prise de notes par IA.
Données de santé et secret. Une transcription contient des données de santé, catégorie particulière de données au sens du RGPD (article 9), couvertes par le secret professionnel. Voir notre article sur le secret professionnel face à l'IA.
Hébergement. Les données de santé confiées à un prestataire doivent l'être à un hébergeur certifié HDS (article L1111-8 du code de la santé publique). Demandez à l'éditeur où l'audio devient du texte, combien de temps l'audio et la transcription sont gardés, et si les données servent à entraîner des modèles. Le projet de guide HAS et CNIL recommande de faire lister les sous-traitants et leur localisation dans le contrat. Plus de détails dans notre article sur l'hébergement HDS.
Garder la transcription brute, ou seulement le compte rendu ?
Aucun texte ne tranche cette question. Trois règles générales aident à décider.
- Garder le moins possible. Le RGPD veut des données « adéquates, pertinentes et limitées à ce qui est nécessaire » (article 5). Une transcription mot à mot contient bien plus que ce dont le suivi a besoin, y compris des informations sur des tiers.
- Tout ce que vous gardez peut être demandé. Le patient peut obtenir une copie des données que vous conservez sur lui (article 15 du RGPD), transcription comprise, avec ses erreurs. Voir notre article sur l'accès du patient à son dossier.
- La transcription sert à vérifier. Tant que le compte rendu n'est pas relu, elle est le seul moyen de savoir ce qui a été dit.
Une règle simple. Le compte rendu validé va dans le dossier et suit les durées de conservation du dossier patient. La transcription brute sert à la relecture, et vous ne la gardez que pour une raison claire. Vérifiez ce que votre outil conserve par défaut et si vous pouvez supprimer une transcription.
Comment fonctionne Delta
Pendant la séance, Delta retranscrit ce qui se dit, puis prépare un compte rendu que vous relisez et corrigez. Vous pouvez aussi dicter vos observations juste après la séance. L'audio sert uniquement à produire la transcription et n'est pas conservé. Le compte rendu tient compte de votre spécialité et de votre approche thérapeutique. Il s'ajoute au dossier du patient, où vous voyez l'évolution propre à votre approche au fil des séances, par exemple en addictologie l'évolution de la consommation sur plusieurs mois. Delta rédige aussi vos comptes rendus de bilan, courriers et attestations.
Les données sont hébergées en France, chez un hébergeur certifié pour les données de santé (HDS). Le traitement par l'IA, transcription comprise, s'effectue sur des serveurs situés en France. Le nom du patient et les informations qui permettent de l'identifier sont pseudonymisés avant le passage par l'IA. Aucun fichier audio n'est conservé, les données ne servent jamais à entraîner des modèles, et elles sont chiffrées en transit et au repos.
Questions fréquentes
La transcription automatique d'une séance est-elle fiable ?
Dans de bonnes conditions (micro bien placé, pièce calme, voix d'adultes), elle restitue l'essentiel de ce qui se dit. Elle se trompe davantage avec les voix basses, les enfants, les accents, les voix qui se chevauchent et les longs silences. Relisez toujours les négations, les noms et les chiffres.
Faut-il un micro spécial pour retranscrire une séance ?
En général non. Un téléphone posé entre vous et le patient suffit dans un cabinet de taille habituelle. Un micro externe aide dans une grande pièce ou en séance familiale.
L'IA peut-elle inventer des phrases qui n'ont pas été dites ?
Oui. Une étude présentée en 2024 à la conférence ACM FAccT a trouvé des phrases inventées dans 1,4 % des transcriptions produites par Whisper, plus souvent quand l'audio contenait de longs silences.
La transcription fonctionne-t-elle en téléconsultation ?
Oui, si l'outil capte aussi la voix du patient. Avec un casque, ce n'est pas toujours le cas. Faites un essai avant.
Dois-je garder la transcription brute dans le dossier ?
Aucun texte ne l'impose. Le RGPD demande de ne garder que ce qui est nécessaire, et le patient peut obtenir une copie de tout ce que vous conservez. Le compte rendu validé suffit en général au dossier.
Que faire si le patient refuse la transcription ?
Vous ne transcrivez pas la séance, et son refus ne change rien à sa prise en charge. Prenez vos notes comme d'habitude, ou dictez vos observations après son départ.
Sources
- Koenecke A., Choi A. S. G., Mei K. X., Schellmann H., Sloane M., « Careless Whisper: Speech-to-Text Hallucination Harms », ACM FAccT 2024 (arXiv)
- Zhou L. et coll., « Analysis of Errors in Dictated Clinical Documents Assisted by Speech Recognition Software and Professional Transcriptionists », JAMA Network Open, 2018
- Koenecke A. et coll., « Racial disparities in automated speech recognition », PNAS, 2020
- Attia A. A. et coll., « Kid-Whisper: Towards Bridging the Performance Gap in Automatic Speech Recognition for Children VS. Adults », AIES 2024
- Radford A. et coll., « Robust Speech Recognition via Large-Scale Weak Supervision », 2022 (arXiv)
- HAS et CNIL, « Accompagner le bon usage des systèmes d'intelligence artificielle en contexte de soins », document de travail du 16 février 2026
- HAS, « Premières clefs d'usage de l'IA générative en santé », octobre 2025
- CNIL, texte du RGPD, chapitre II (articles 5 et 9)
- CNIL, texte du RGPD, chapitre III (articles 13 et 15)
Essayer Delta pendant 14 jours
Delta retranscrit vos séances et prépare un compte rendu adapté à votre approche, que vous relisez avant qu'il rejoigne le dossier.
Essayer gratuitement