Passer au contenu
megapromotingDiscutons
Produits Voice Studio

Production vocale Instrument specializat

À partir d’un texte, une voix pour votre contenu.

Un studio pour générer, écouter et télécharger des contenus vocaux via des modèles text-to-speech. L’interface réunit le choix de la voix et les réglages utiles à la production.

  1. 1Text și voce
  2. 2Generare audio
  3. 3Ascultare și export
Schemă explicativă ·Voice Studio

Voice Studio

De l’information au travail accompli.

01

Vous préparez le texte

Vous rédigez le contenu et choisissez la voix autorisée pour l’utilisation.

02

Reglezi

Vous ajustez les paramètres et les options disponibles du modèle vocal.

03

Revizuiești

Vous écoutez, corrigez et téléchargez le contenu pour le projet.

Là où il devient utile.

Narațiune

Matériaux explicatifs, présentations et contenu audio.

Producție

Un flux de génération et de révision pour les équipes de contenu.

Experimentare

Comparaison des interprétations d’un texte avant utilisation.

L’outil utilise les modèles vocaux des fournisseurs intégrés. Les coûts, les droits sur les voix et les règles du fournisseur s’appliquent.

Voice Studio en détail

Ce que vous pouvez faire avec ce projet.

Voice Studio est la chaîne du texte au fichier audio : vous écrivez le texte, vous choisissez la voix, vous ajoutez des marqueurs d’émotion et des pauses, vous réglez le modèle, vous écoutez, vous corrigez et vous téléchargez. Le fournisseur est ElevenLabs — nous le nommons explicitement, parce que c’est ce qui détermine quelles voix peuvent être utilisées, combien cela coûte et ce que vous avez le droit de faire du résultat.

La partie invisible, et en fait la raison pour laquelle l’outil existe : la clé API n’atteint jamais le navigateur. L’interface n’envoie que le texte vers une fonction serveur propre, et celle-ci détient la clé et communique avec ElevenLabs. Sans cette couche, toute page qui génère de la voix expose sa clé à quiconque ouvre la console du navigateur.

Ce n’est pas Grai. Grai est de la recherche sur les modèles vocaux, sans produit. Voice Studio est de la production avec fournisseur intégré, disponible aujourd’hui. Les deux ne partagent aucun code.

01

Quatre modèles, choisis pour des compromis différents

Eleven v3 pour l’expressivité et les marqueurs d’émotion, Multilingual v2 pour la stabilité, Turbo v2.5 pour le coût, Flash v2.5 pour une latence minimale. Ce ne sont pas quatre variantes d’une même chose : v3 accepte des marqueurs que les autres ignorent, et Flash sacrifie la nuance à la vitesse.

02

Des marqueurs de jeu d’acteur, pas seulement du texte

Sur Eleven v3, vous pouvez insérer dans le texte 14 états d’émotion (de [excited] et [whispers] jusqu’à [sarcastic] et [tired]), 9 marqueurs non verbaux et de pause ([laughs], [sighs], [clears throat], [pause], [breathes]) et 7 de restitution ([rushed], [drawn out], [singing], [muttering], [quietly]). Ils s’insèrent à la position du curseur, parce que l’emplacement compte autant que le marqueur.

03

Réglages visibles dans le résultat

Stabilité, similarité avec la voix source, exagération du style, vitesse entre 0,7 et 1,2, plus l’impulsion du locuteur. Sur v3, la stabilité n’est pas un curseur continu, mais trois niveaux — Créatif, Naturel, Robuste — parce que le modèle se comporte de manière discrète, non continue, et qu’un curseur fin suggérerait un contrôle qui n’existe pas.

04

Cinq formats d’export, dont un pour la téléphonie

MP3 à 44,1 kHz 128 ou 192 kbps, MP3 22 kHz 32 kbps pour des fichiers plus petits, PCM 44,1 kHz pour un WAV brut qui s’intègre dans un montage, et μ-law 8 kHz — le format de téléphonie, si le matériel arrive dans un IVR ou dans un central téléphonique.

05

Huit langues forcées, ou détection depuis le texte

Roumain, russe, anglais, ukrainien, français, italien, espagnol, allemand — ou laissé en automatique. Forcer la langue compte dans les textes mixtes, où la détection automatique se trompe précisément sur les noms propres.

Données et fonctionnement

Ce qui entre dans le système. Ce qu'il faut vérifier.

La clé se trouve en un seul endroit
Dans une variable d’environnement chiffrée sur le serveur, jamais dans le code, dans git ou dans le frontend. Le navigateur appelle seulement notre propre fonction. La clé ne reçoit chez ElevenLabs que l’autorisation de synthèse, pas l’accès à tout le compte, plus une limite mensuelle de caractères — car la vraie protection d’une clé ne tient pas à son secret, mais à la quantité de dommages qu’elle peut causer si elle fuite.
Le texte arrive chez le fournisseur
C’est l’implication directe du recours à un fournisseur externe : le texte que vous donnez à synthétiser part chez ElevenLabs. Un texte contenant des données personnelles, des prix non publiés ou des informations client ne se transmet pas sans autorisation. Ce n’est pas une formalité — c’est la seule décision de conformité que l’outil transfère à l’utilisateur.
Les voix sont clonées, donc il faut un consentement
Les voix fixées dans l’interface ne sont pas des voix de bibliothèque, mais des voix clonées à partir d’échantillons de personnes réelles, créées via l’interface de clonage d’ElevenLabs. Cela signifie que ce n’est pas une question de licence produit, mais de consentement de la personne. En République de Moldova, la loi 195/2024 traite la voix comme donnée biométrique à partir du 23 août 2026.
Rien n’est conservé
Les générations restent dans la mémoire de l’onglet du navigateur, au maximum les 12 dernières, et disparaissent au rechargement. Il n’existe aucune base de données, aucun historique sur le serveur, aucun compte. La réponse audio est servie avec Cache-Control: no-store.
Ce que vous avez le droit de faire avec le résultat
L’abonnement ElevenLabs accorde un droit d’usage commercial sur le matériau généré, mais leur politique d’utilisation interdit explicitement d’utiliser la sortie pour entraîner, tester ou construire un système concurrent. En pratique : le fichier audio peut aller dans un matériel client ; il ne peut pas devenir des données d’entraînement pour un modèle propre.

De l'exploration à l'implémentation

Comment nous préparons un projet avec Voice Studio.

01

Nous clarifions le matériel et son public

Un spot radio, une narration de présentation et un message IVR ont des exigences différentes en matière de format, de rythme et de longueur. Le format d’export se choisit ici, pas à la fin.

02

Nous réglons d’abord les droits de voix

Quelle voix est utilisée et sur quelle base d’accord. Si une nouvelle voix est nécessaire, le clonage exige des échantillons et le consentement de la personne, pas seulement un fichier audio.

03

Nous générons, nous écoutons et nous corrigeons le texte, pas les réglages

La plupart des problèmes de prononciation se résolvent en réécrivant le texte, pas en bougeant les curseurs : les abréviations sont développées, les nombres sont écrits en lettres là où c’est ambigu, et les noms propres sont testés isolément avant d’être placés dans la phrase.

04

Nous remettons le fichier et consignons ce qui est permis

Export vérifié, plus une note sur la voix utilisée et les limites d’utilisation — afin que le matériau puisse être réutilisé dans six mois sans rouvrir la discussion sur les droits.

Des questions qui méritent d’être clarifiées.

Quel fournisseur utilisez-vous ?

ElevenLabs. Notre fonction serveur appelle directement api.elevenlabs.io, le point de terminaison de synthèse. Ce n’est pas un fournisseur abstrait : les voix disponibles, le coût, les formats de sortie et les règles d’utilisation du résultat en dépendent.

Quelles voix puis-je utiliser ?

Celles fixées dans l’interface, qui sont des voix clonées à partir des échantillons fournis — pas des voix de bibliothèque. Une nouvelle voix se crée en téléversant des échantillons via l’interface de clonage d’ElevenLabs, avec leur limite de 11 MB par fichier ; au-delà, nous recomprimons automatiquement en mono 22 kHz 64 kbps. La partie non technique est celle qui compte : cloner la voix d’une personne exige l’accord de cette personne. En République de Moldova, la voix est une donnée biométrique à partir du 23 août 2026, donc un enregistrement public n’autorise rien.

Combien de texte puis-je envoyer à la fois ?

5.000 caractères par requête, plafond imposé par nous, pas par le fournisseur. La raison est le coût : une requête erronée avec un texte cent fois plus long, c’est une facture, pas une erreur. La fonction a 60 secondes d’exécution, ce qui est suffisant pour un bloc de cette taille.

Dans quels formats exporte-t-il ?

MP3 à 44,1 kHz 128 kbps (par défaut) ou 192 kbps, MP3 22 kHz 32 kbps pour une petite taille, PCM 44,1 kHz pour du WAV brut, et μ-law 8 kHz pour la téléphonie. Le dernier est celui que l’on oublie, puis on découvre que le matériau sonne mal dans le central téléphonique.

Puis-je utiliser l’audio généré pour entraîner une voix propre ?

Non. L’abonnement ElevenLabs vous donne un droit d’usage commercial sur le matériau, mais leur politique d’utilisation interdit explicitement d’utiliser la sortie pour entraîner, tester ou développer un système concurrent. Un fichier livré à un client est en ordre ; le même fichier comme données d’entraînement pour un modèle propre ne l’est pas. C’est une distinction qui se paie si on l’ignore, et c’est la raison pour laquelle Grai ne s’entraîne sur rien de ce qui sort d’ici.

Est-ce que ce que j’ai généré est conservé quelque part ?

Non. L’historique vit dans la mémoire de l’onglet, au maximum 12 générations, et disparaît au rechargement. Il n’y a ni compte, ni base de données, ni stockage sur le serveur ; la réponse audio est explicitement marquée comme non cacheable. Si vous voulez le fichier, vous le téléchargez à ce moment-là.

Puis-je l’utiliser moi-même ?

Pas aujourd’hui. Le déploiement est derrière l’authentification Vercel et, en option, derrière un jeton d’accès supplémentaire demandé comme en-tête à chaque requête. C’est un outil de travail interne pour la production de matériaux, pas un service avec inscription. Ce que nous livrons, c’est le matériau audio, pas l’accès au panneau.

Exemple illustratif

La narration d’un matériau de présentation, en deux langues

Un scénario d’utilisation, sans données client ni résultats commerciaux attribués.

Situation initiale

Le texte d’une présentation de produit, qui doit être lu en roumain et en russe par la même voix, avec la même énergie.

Comment ça fonctionne

Eleven v3 est choisi pour son expressivité et la langue est forcée explicitement à chaque variante, au lieu d’être laissée à la détection automatique — dans les textes avec des noms propres, la détection se trompe exactement là où cela s’entend le plus. La stabilité est réglée sur Natural ; les pauses sont marquées dans le texte avec [pause] et [short pause] à la position exacte, et non à la fin de la phrase. On écoute et on corrige le texte, pas les curseurs.

Rezultatul

Deux fichiers MP3 à 44,1 kHz, même voix, même énergie, téléchargés au moment de la génération. Si le matériau doit être intégré dans un montage, on prend du PCM au lieu du MP3, afin de ne pas compresser deux fois.

Ce este necesar:Vocea trebuie să fie una pentru care există acordul persoanei clonate. Textul nu trebuie să conțină informație care nu are voie să ajungă la un furnizor extern.

Possibilités de collaboration

Voice Studio, dans le contexte de votre organisation.

Traitement du contenu audio

Projets de transcription et de génération vocale sur des matériaux pour lesquels il existe des droits d’utilisation et une finalité documentée.

Entreprises privées

Nous définissons un pilote autour d’un processus réel : utilisateurs, données, intégrations, coûts et critères d’acceptation. L’extension suit après l’évaluation du résultat.

Institutions et entreprises publiques

Nous établissons les exigences d’accessibilité, d’hébergement, de protection des données et d’interopérabilité. Toute connexion avec des services AGE ou STISC nécessite la validation de l’éligibilité, de l’accès et des approbations.

Ce sont des scénarios d’adaptation, non des déclarations sur des contrats ou partenariats existants. Les fonctions proposées sont confirmées dans le périmètre de travail du projet.

Discuter d'un pilote

Faisant partie d’un écosystème.

Qu'est-ce que vous voudriez voir mieux fonctionner ?

Racontez-nous votre processus. Ensemble, nous décidons ce qui vaut la peine d'être construit, ce que nous pouvons connecter et comment nous vérifions le résultat.

Discutons