Audio Tags ElevenLabs : Le Guide Complet pour Contrôler Émotions, Rythme et Accents
Le tag d’intonation s’écrit entre crochets [] dans votre transcript, avant la phrase.
- Syntaxe : placez
[angry]juste avant la phrase à interpréter. - Superposition : combinez
[tired]+[upset]pour des nuances. - Dialogue :
[sarcastically]définit une personnalité claire. - Réactions :
[laughs]ou[sighs]créent un effet physique. - Précision garantie : le contrôle explicite évite l’ambiguïté du contexte.
Maîtriser le contrôle des émotions et du contexte émotionnel avec les audio tags
Les audio tags émotionnels sont la méthode la plus directe pour injecter une intention dans une phrase. Contrairement au SSML, qui nécessite des balises XML complexes et n’est pas supporté par le modèle Eleven v3, ces tags s’écrivent simplement entre crochets [] dans votre transcript. Ils agissent comme des instructions de jeu pour le synthétiseur vocal, à la manière des outils de synthèse vocale qui lisent un texte en audio.
- Syntaxe des tags : placez
[sad],[angry]ou[happily]juste avant la phrase à interpréter, en respectant l’ordre logique de lecture. - Combinaisons pour nuances : superposez
[tired]+[upset]pour créer une lassitude irritée, ou[excitedly]+[whispers]pour une révélation complice. - Tags de dialogue explicites : utilisez un marqueur comme
[sarcastically]ou[British accent]pour définir une personnalité claire et obtenir des résultats plus prévisibles qu’avec le simple contexte narratif. - Réactions humaines réalistes : insérez
[laughs],[clears throat]ou[sighs]dans le flux de la phrase pour créer un effet de présence physique.
Contexte narratif vs tags explicites
Le modèle Eleven v3 peut percevoir une émotion implicite via le contexte narratif de votre script. Par exemple, décrire une scène triste peut suffire à adoucir le ton. Cependant, pour un contrôle rigoureux et reproductible, l’annotation explicite reste recommandée. Elle évite les ambiguïtés et garantit que l’intention dramatique est respectée à la milliseconde près, tout comme le texte en audio gratuit qui repose sur une conversion fiable.
Exemples d’émotions superposées
Pour une performance riche, superposez une réaction physique et un état mental. Par exemple : [frustrated sigh] combiné à [awe] peut signifier une résignation mêlée d’émerveillement. Cette méthode permet de nuancer des dialogues complexes. Dans un script, la phrase “Je n’arrive pas à y croire” peut être balisée [happily] ou [sorrowful] ; le résultat audio sera radicalement différent. Pour des tests de prononciation, notez que le modèle lit 3.5 comme “three point five”, mais analysera “I’m fine” avec une signification différente selon le tag placé avant.
Audio tags ElevenLabs : fonctionnement, syntaxe et catégories essentielles

Les audio tags ElevenLabs sont la méthode native pour diriger la performance vocale d’Eleven Multilingual v2 et des modèles v3. Leur syntaxe repose sur des crochets [] placés directement dans le transcript, là où l’effet doit se produire. Cette approche inline remplace intégralement le SSML, non supporté par le modèle v3, et offre une précision bien supérieure aux seuls signes de ponctuation, comparable à la précision des outils pour convertir texte en parole.
Vous pouvez insérer plusieurs tags par phrase sans conflit. Le moteur les interprète séquentiellement pour construire la courbe émotionnelle du passage. Un tag de réaction suivi d’un tag de livraison fonctionne parfaitement : [sighs][rushed] On n’a plus le temps, viens ! La combinaison reste possible sur l’ensemble des catégories, y compris les accents et les caractéristiques de personnage, à condition que la voix sélectionnée puisse les performer.
Les cinq catégories d’audio tags disponibles
- Émotions [sad], [angry], [happily], [sorrowful], [awe] modulent le ressenti général.
- Livraison et pacing [whispers], [shouts], [softly], [rushed], [deliberate] contrôlent volume et rythme.
- Réactions humaines non-verbales [laughs], [clears throat], [sighs], [gulps] ajoutent du réalisme.
- Accents et dialectes [British accent], [Southern accent] singularisent une voix.
- Caractéristiques de personnage [sarcastically], [timidly], [stammers] définissent une personnalité.
Le bouton “Enhance” de l’interface génère automatiquement ces tags via LLM pour enrichir votre script d’un simple clic. Pour un contrôle manuel fin, insérez les crochets directement au cœur de vos répliques, comme dans l’exemple d’intonation hésitante : [stammers] Je… je ne pensais pas que ça arriverait.
Contrôler la livraison, le rythme et le pacing avec précision
Les tags de débit et de rythme ( [rushed], [slows down], [deliberate] )
La vitesse d’élocution transforme radicalement la perception d’une phrase. Les audio tags ElevenLabs permettent d’ajuster ce paramètre finement, sans toucher au paramètre de stabilité de la voix.
- [rushed] Accélère le débit pour une urgence immédiate.
- [rapid-fire] Effet mitraillette, idéal pour l’excitation.
- [slows down] Ralentit progressivement pour un effet dramatique.
- [deliberate] Chaque mot pesé, pour une autorité calme.
- [stammers] Bégaiement pour la vulnérabilité ou le mensonge.
- [drawn out] Étire les voyelles, parfait pour la tension.
- [repeats] Répète un mot-clé pour insister malgré soi.
- [timidly] Débit hésitant, volume réduit, nervosité palpable.
Cette maîtrise du rythme et des émotions est essentielle pour produire des contenus audio naturels, notamment lorsqu’on souhaite écouter l’anglais par synthèse vocale.
Contrôler les pauses et l’emphase avec les tags et la ponctuation
Le silence est un outil narratif puissant. La balise [pause] crée un blanc sonore, mais attention : sa durée maximale naturelle est plafonnée à 3 secondes. Au-delà, le lecteur audio pourrait considérer la pause comme une erreur et forcer la reprise.
- [breathes] Inspiration audible pour la transition d’émotion.
- [continues after a beat] Reprise après un silence court et lourd de sens.
- [emphasized] Place un accent tonique fort sur le mot suivant.
- [stress on next word] Variante plus subtile de l’emphase.
La ponctuation fonctionne en synergie avec les tags. Une capitalisation ciblée (“C’était une journée TRÈS longue”) appuie un mot sans tag explicite. Les ellipses (…) génèrent un suspense naturel, tandis que les points de suspension longs indiquent une réflexion hésitante. Pour un rythme précis, combinez ces signes avec vos tags : le modèle vocal interprète la ponctuation comme une indication de phrasé, pas seulement de grammaire.
Notez qu’un nombre décimal comme 3.5 sera prononcé “three point five” la ponctuation dans les chiffres n’est jamais convertie en pause. Structurez vos scripts en conséquence pour éviter les surprises.
Dialogues multi-personnages et narration : performance vocale par personnage
Structurer un dialogue multi-personnages avec des tags par réplique
Pour donner vie à un échange entre plusieurs personnages, la méthode la plus efficace consiste à assigner une voix distincte à chaque locuteur via le paramètre multi-voix, puis à baliser chaque réplique individuellement.
– Format speaker : écrivez `Speaker 1: [excitedly]` puis le texte, suivi de `Speaker 2: [curiously]` pour alterner les tons sans ambiguïté.
– Tags par ligne : appliquez `[whispers]`, `[sighs]` ou `[laughs]` sur chaque phrase pour enrichir la performance sans surcharger le script.
– Interactions naturelles : insérez des réactions comme `[interrupting]`, `[surprised]` ou `[coughing]` pour créer un effet de réel.
– Exemple Tom/Emma : commencez par `Tom: [hesitant]` *”Je ne suis pas sûr que ce soit une bonne idée.”* puis `Emma: [encouraging]` *”Allez, on tente le coup !”*.
Techniques de storytelling avec les tags narratifs
Au-delà du dialogue, les audio tags transforment la narration en un outil de mise en scène sonore. Utilisez `[drawn out]` pour étirer un mot et créer du suspense ou de la tension sur une révélation clé. Alternez entre `[whisper]` et `[shouting]` pour refléter la conscience situationnelle du narrateur, passant d’un secret murmuré à une alarme urgente.
Le même texte peut changer radicalement de sens selon les tags : *”I’m fine”* prononcé avec `[sad]` trahit une tristesse cachée, tandis qu’avec `[angry]` il devient un rejet cinglant. En combinant un rythme rapide avec `[rushed]` et une réaction comme `[gulps]`, vous obtenez des performances crédibles qui captivent l’auditeur. Pour les voix off, ces tags s’intègrent parfaitement dans les pipelines API, garantissant une expressivité émotionnelle cohérente à grande échelle.
Bonnes pratiques : sélection de la voix, accents et contrôle de la ponctuation
Dans Eleven v3, le choix de la voix est le paramètre le plus important avant même les tags. Une voix sérieuse et grave ne performera jamais correctement un tag `[giggles]` ou `[mischievously]`. Pire, au lieu de jouer l’émotion, le modèle peut lire le tag à voix haute. Privilégiez des voix avec une large gamme expressive (IVC) et adaptez toujours le tag au caractère naturel du speaker.
Les tags d’accent restent la solution idéale pour distinguer des personnages : `[British accent]` suffit à créer une voix singulière dans un dialogue. Pour le contrôle fin, la ponctuation agit comme complément aux tags. Par exemple, `[pause]` dure environ 3 secondes maximum, tandis que l’utilisation de points de suspension crée des pauses brèves. Une date comme `01/02/2023` sera prononcée “January second” ou “the first of February” selon le contexte.
Adoptez une boucle itérative : ajustez les descriptions, ajoutez des indices émotionnels contextuels dans le script, testez, puis supprimez les guides émotionnels superflus après validation. Cette méthode affine la livraison sans surcharger le modèle de données contradictoires.
Artefact API, exemples de scripts et résolution des problèmes courants
| Contexte d’utilisation | Exemples de tags | Résultat attendu |
|---|---|---|
| Hésitation et nervosité | [hesitant][nervous] | Voix tremblante, pauses marquées |
| Suspense et urgence | [whispering][pause][rushed] | Chuchotement puis débit rapide |
| Fatigue et résignation | [sigh] après une longue phrase | Soupir audible en fin de réplique |
| Frustration contenue | [frustrated sigh] | Expiration sonore, ton tendu |
| Dialogue à deux voix | [excitedly] + [curiously] | Contraste émotionnel entre speakers |
Exemples de scripts complets avec audio tags combinés
- [hesitant][nervous] I… I’m not sure this is going to work. [gulps] anxiété palpable dès la première syllabe.
- [whispering][pause] Did you hear that? [rushed] Hide! Now! montée de tension progressive.
- “It was a VERY long day [sigh] … nobody listens anymore.” lassitude marquée par un soupir placé stratégiquement.
- [frustrated sigh] script court où un seul tag exprime tout un état émotionnel.
- Dialogue 2 speakers [excitedly] pour Tom, [curiously] pour Emma, [impressed] en réaction.
API Text to Speech : intégration des tags dans vos pipelines
Les audio tags fonctionnent à l’identique via l’API Text to Speech, avec les mêmes syntaxes que dans l’interface web. Vous placez les tags inline dans votre script, et la performance est rendue dans l’audio généré. Cela ouvre des applications concrètes : pipelines audiobooks automatisés, voix off publicitaires personnalisées, ou applications TTS émotionnellement expressives à grande échelle.
Deux limites à connaître : la balise [pause] est limitée à 3 secondes maximum, et l’option “break time” se révèle instable si elle est trop utilisée. Pour des pauses plus longues, fractionnez votre script en plusieurs requêtes API.
Pourquoi mes tags sont lus à voix haute ? Voix incompatibles et erreurs
- Voix incompatible avec tag le tag est lu littéralement au lieu d’être interprété.
- Voix douce + [shouts] échec de performance garanti, la voix ne peut pas monter en intensité.
- IVC nécessaires pour v3 elles offrent la gamme émotionnelle requise pour les tags.
- PVC non optimisées pour le modèle v3, préférez les IVC ou les voix design.
