Synthèse vocale

  • Concept
  • Débutant
  • Transversal
  • Toujours utilisé

En bref

La synthèse vocale transforme un texte écrit en parole audible, générée artificiellement par un ordinateur.

Définition complète

La synthèse vocale (ou Text-to-Speech, littéralement « du texte vers la parole ») est une technologie qui convertit un texte écrit en une voix audible produite artificiellement par un ordinateur, sans intervention d’une voix humaine enregistrée pour l’occasion. Le système analyse le texte, en déduit la prononciation, le rythme et l’intonation, puis génère un fichier audio.

Par exemple, un GPS lit à voix haute « tournez à droite dans 200 mètres » sans qu’un humain ait enregistré cette phrase exacte à l’avance : le texte est produit dynamiquement en fonction de l’itinéraire, puis transformé en voix par le moteur de synthèse. Attention : la synthèse vocale (texte vers voix) ne doit pas être confondue avec la reconnaissance vocale (voix vers texte), qui fait exactement l’inverse.

À quoi ça sert

La synthèse vocale sert à rendre l’information accessible à l’oral, ce qui est précieux pour les personnes malvoyantes ou ayant des difficultés de lecture, mais aussi pour toute situation où lire un écran n’est pas pratique, comme au volant d’une voiture ou en cuisinant les mains occupées.

Elle permet aussi aux entreprises d’automatiser des messages vocaux sans avoir à faire enregistrer chaque phrase par un comédien : un serveur vocal, une annonce en gare ou un message d’attente téléphonique peuvent être générés automatiquement à partir d’un simple texte, et modifiés rapidement en cas de changement d’information.

Enfin, la synthèse vocale ouvre des usages créatifs : doublage automatique de vidéos, création de livres audio à partir de textes, ou assistants vocaux capables de lire à voix haute un email ou un article de presse.

Cas d'usage typiques

– Guider un conducteur : un GPS annonce les directions à voix haute sans quitter la route des yeux.
– Rendre un site accessible : un lecteur d’écran lit à voix haute le contenu d’une page pour une personne malvoyante.
– Automatiser un standard téléphonique : un serveur vocal interactif annonce les horaires d’ouverture ou le solde d’un compte.
– Créer un livre audio : un texte est transformé automatiquement en version audio sans recourir à un comédien.
– Doubler une vidéo : une formation en ligne est traduite et doublée automatiquement dans plusieurs langues.
– Faire parler un assistant vocal : un haut-parleur connecté lit à voix haute la météo ou les actualités du jour.

Ce que tu sauras faire

Savoir identifier les situations où la synthèse vocale apporte un vrai bénéfice (accessibilité, automatisation, mains libres) et distinguer cette technologie de la reconnaissance vocale.

Mises en situation

Situation 1 : un site municipal accessible aux malvoyants

Contexte : Une mairie souhaite rendre son site internet accessible aux personnes malvoyantes.

Application : Le site est équipé d’un module de synthèse vocale qui lit à voix haute chaque page au clic, en respectant l’ordre logique du contenu.

Résultat attendu : Les démarches administratives en ligne (demande d’acte, horaires des services) deviennent accessibles à un public plus large, conformément aux obligations d’accessibilité numérique.

Situation 2 : le service client d’une entreprise de transport

Contexte : Une société de transport reçoit de nombreux appels pour connaître les horaires de bus en temps réel.

Application : Un serveur vocal utilise la synthèse vocale pour annoncer automatiquement les prochains passages, générés à partir des données en temps réel du réseau.

Résultat attendu : Les usagers obtiennent une réponse immédiate sans attendre un conseiller, qui reste disponible pour les demandes plus complexes.

Situation 3 : un organisme de formation qui exporte ses vidéos

Contexte : Un organisme de formation souhaite proposer ses vidéos pédagogiques en anglais et en espagnol sans recruter de comédiens.

Application : Le texte des vidéos est traduit puis lu par une synthèse vocale dans chaque langue, synchronisée avec les images d’origine.

Résultat attendu : L’organisme élargit son audience à l’international pour un coût très inférieur à un doublage traditionnel, même si la qualité reste à vérifier avant diffusion.

Application guidée : choisir entre voix humaine et synthèse vocale

Contexte : Une entreprise doit enregistrer le message d’accueil de son standard téléphonique, qui changera probablement de contenu tous les mois (promotions, horaires de fêtes).

Question : Vaut-il mieux faire enregistrer une voix humaine ou utiliser une synthèse vocale pour ce message ?

Résultat attendu : Recommander la synthèse vocale pour un message amené à changer fréquemment, car elle permet de modifier le texte en quelques minutes sans reprogrammer une séance d’enregistrement, en réservant la voix humaine enregistrée aux messages fixes et à forte valeur de marque.

Application guidée : repérer les limites d’une synthèse vocale

Contexte : Un livre audio généré par synthèse vocale prononce mal certains mots techniques et sigles propres au métier de l’entreprise.

Question : Comment expliquer ce défaut, et comment l’améliorer sans tout réenregistrer ?

Résultat attendu : Comprendre que le moteur de synthèse ne connaît pas le vocabulaire spécifique du métier et propose d’ajouter un lexique personnalisé (prononciations correctes des sigles et termes techniques) au logiciel de synthèse plutôt que de changer d’outil.

Pour bien le retenir

L'analogie

La synthèse vocale, c’est comme un traducteur qui lirait à voix haute n’importe quel document qu’on lui tend, instantanément, sans jamais l’avoir lu auparavant. Il ne le connaît pas par cœur : il déchiffre le texte au fur et à mesure et le restitue à voix haute avec une intonation adaptée.

« La synthèse vocale lit à voix haute un texte qu’elle n’a jamais vu auparavant, en temps réel. »

Pièges à éviter

À ne pas confondre avec

Une confusion fréquente consiste à mélanger synthèse vocale et reconnaissance vocale : la première transforme du texte en voix, la seconde transforme de la voix en texte. Ce sont deux technologies complémentaires mais totalement différentes dans leur fonctionnement.

Autre piège : croire qu’une synthèse vocale moderne prononce toujours parfaitement tous les mots. Les noms propres, sigles et vocabulaires très techniques restent des sources d’erreurs fréquentes, qu’il faut vérifier avant toute diffusion publique.

Enfin, certains pensent que la synthèse vocale remplace totalement l’enregistrement humain dans tous les contextes. Pour des messages à forte valeur émotionnelle ou de marque (publicité, message de bienvenue), une voix humaine reste souvent préférable à une voix générée.

Évolution historique

Apparition : Recherches dès les années 1950-1960, démocratisation grand public dans les années 1980-1990

Quels changements depuis l’arrivée de l’IA ?

Avant, les voix de synthèse étaient produites en assemblant de courts fragments sonores enregistrés à l’avance, ce qui donnait des voix reconnaissables et souvent métalliques, avec des intonations peu naturelles. Aujourd’hui, les techniques d’intelligence artificielle génèrent des voix beaucoup plus naturelles, capables de reproduire des intonations émotionnelles, et même de cloner la voix d’une personne réelle à partir de quelques minutes d’enregistrement, ce qui pose de nouvelles questions éthiques et de propriété de la voix.

Évolution historique

Années 1930-1950 : premières machines expérimentales capables de produire une voix synthétique de façon très rudimentaire.

Années 1980-1990 : démocratisation de la synthèse vocale par assemblage de sons enregistrés, avec des voix reconnaissables et robotiques.

Années 2000 : généralisation dans les serveurs vocaux d’entreprise et les premiers assistants de navigation GPS.

Années 2016-2020 : apparition de la synthèse vocale par réseaux de neurones, avec des voix nettement plus naturelles.

Années 2020 : essor du clonage vocal et des voix expressives générées par IA, avec un encadrement légal qui commence à se mettre en place.