Vous préparez le texte
Vous rédigez le contenu et choisissez la voix autorisée pour l’utilisation.
Production vocale Instrument specializat
Un studio pour générer, écouter et télécharger des contenus vocaux via des modèles text-to-speech. L’interface réunit le choix de la voix et les réglages utiles à la production.
Voice Studio
Vous rédigez le contenu et choisissez la voix autorisée pour l’utilisation.
Vous ajustez les paramètres et les options disponibles du modèle vocal.
Vous écoutez, corrigez et téléchargez le contenu pour le projet.
Matériaux explicatifs, présentations et contenu audio.
Un flux de génération et de révision pour les équipes de contenu.
Comparaison des interprétations d’un texte avant utilisation.
L’outil utilise les modèles vocaux des fournisseurs intégrés. Les coûts, les droits sur les voix et les règles du fournisseur s’appliquent.
Voice Studio en détail
Voice Studio est la chaîne du texte au fichier audio : vous écrivez le texte, vous choisissez la voix, vous ajoutez des marqueurs d’émotion et des pauses, vous réglez le modèle, vous écoutez, vous corrigez et vous téléchargez. Le fournisseur est ElevenLabs — nous le nommons explicitement, parce que c’est ce qui détermine quelles voix peuvent être utilisées, combien cela coûte et ce que vous avez le droit de faire du résultat.
La partie invisible, et en fait la raison pour laquelle l’outil existe : la clé API n’atteint jamais le navigateur. L’interface n’envoie que le texte vers une fonction serveur propre, et celle-ci détient la clé et communique avec ElevenLabs. Sans cette couche, toute page qui génère de la voix expose sa clé à quiconque ouvre la console du navigateur.
Ce n’est pas Grai. Grai est de la recherche sur les modèles vocaux, sans produit. Voice Studio est de la production avec fournisseur intégré, disponible aujourd’hui. Les deux ne partagent aucun code.
Eleven v3 pour l’expressivité et les marqueurs d’émotion, Multilingual v2 pour la stabilité, Turbo v2.5 pour le coût, Flash v2.5 pour une latence minimale. Ce ne sont pas quatre variantes d’une même chose : v3 accepte des marqueurs que les autres ignorent, et Flash sacrifie la nuance à la vitesse.
Sur Eleven v3, vous pouvez insérer dans le texte 14 états d’émotion (de [excited] et [whispers] jusqu’à [sarcastic] et [tired]), 9 marqueurs non verbaux et de pause ([laughs], [sighs], [clears throat], [pause], [breathes]) et 7 de restitution ([rushed], [drawn out], [singing], [muttering], [quietly]). Ils s’insèrent à la position du curseur, parce que l’emplacement compte autant que le marqueur.
Stabilité, similarité avec la voix source, exagération du style, vitesse entre 0,7 et 1,2, plus l’impulsion du locuteur. Sur v3, la stabilité n’est pas un curseur continu, mais trois niveaux — Créatif, Naturel, Robuste — parce que le modèle se comporte de manière discrète, non continue, et qu’un curseur fin suggérerait un contrôle qui n’existe pas.
MP3 à 44,1 kHz 128 ou 192 kbps, MP3 22 kHz 32 kbps pour des fichiers plus petits, PCM 44,1 kHz pour un WAV brut qui s’intègre dans un montage, et μ-law 8 kHz — le format de téléphonie, si le matériel arrive dans un IVR ou dans un central téléphonique.
Roumain, russe, anglais, ukrainien, français, italien, espagnol, allemand — ou laissé en automatique. Forcer la langue compte dans les textes mixtes, où la détection automatique se trompe précisément sur les noms propres.
Données et fonctionnement
De l'exploration à l'implémentation
Un spot radio, une narration de présentation et un message IVR ont des exigences différentes en matière de format, de rythme et de longueur. Le format d’export se choisit ici, pas à la fin.
Quelle voix est utilisée et sur quelle base d’accord. Si une nouvelle voix est nécessaire, le clonage exige des échantillons et le consentement de la personne, pas seulement un fichier audio.
La plupart des problèmes de prononciation se résolvent en réécrivant le texte, pas en bougeant les curseurs : les abréviations sont développées, les nombres sont écrits en lettres là où c’est ambigu, et les noms propres sont testés isolément avant d’être placés dans la phrase.
Export vérifié, plus une note sur la voix utilisée et les limites d’utilisation — afin que le matériau puisse être réutilisé dans six mois sans rouvrir la discussion sur les droits.
ElevenLabs. Notre fonction serveur appelle directement api.elevenlabs.io, le point de terminaison de synthèse. Ce n’est pas un fournisseur abstrait : les voix disponibles, le coût, les formats de sortie et les règles d’utilisation du résultat en dépendent.
Celles fixées dans l’interface, qui sont des voix clonées à partir des échantillons fournis — pas des voix de bibliothèque. Une nouvelle voix se crée en téléversant des échantillons via l’interface de clonage d’ElevenLabs, avec leur limite de 11 MB par fichier ; au-delà, nous recomprimons automatiquement en mono 22 kHz 64 kbps. La partie non technique est celle qui compte : cloner la voix d’une personne exige l’accord de cette personne. En République de Moldova, la voix est une donnée biométrique à partir du 23 août 2026, donc un enregistrement public n’autorise rien.
5.000 caractères par requête, plafond imposé par nous, pas par le fournisseur. La raison est le coût : une requête erronée avec un texte cent fois plus long, c’est une facture, pas une erreur. La fonction a 60 secondes d’exécution, ce qui est suffisant pour un bloc de cette taille.
MP3 à 44,1 kHz 128 kbps (par défaut) ou 192 kbps, MP3 22 kHz 32 kbps pour une petite taille, PCM 44,1 kHz pour du WAV brut, et μ-law 8 kHz pour la téléphonie. Le dernier est celui que l’on oublie, puis on découvre que le matériau sonne mal dans le central téléphonique.
Non. L’abonnement ElevenLabs vous donne un droit d’usage commercial sur le matériau, mais leur politique d’utilisation interdit explicitement d’utiliser la sortie pour entraîner, tester ou développer un système concurrent. Un fichier livré à un client est en ordre ; le même fichier comme données d’entraînement pour un modèle propre ne l’est pas. C’est une distinction qui se paie si on l’ignore, et c’est la raison pour laquelle Grai ne s’entraîne sur rien de ce qui sort d’ici.
Non. L’historique vit dans la mémoire de l’onglet, au maximum 12 générations, et disparaît au rechargement. Il n’y a ni compte, ni base de données, ni stockage sur le serveur ; la réponse audio est explicitement marquée comme non cacheable. Si vous voulez le fichier, vous le téléchargez à ce moment-là.
Pas aujourd’hui. Le déploiement est derrière l’authentification Vercel et, en option, derrière un jeton d’accès supplémentaire demandé comme en-tête à chaque requête. C’est un outil de travail interne pour la production de matériaux, pas un service avec inscription. Ce que nous livrons, c’est le matériau audio, pas l’accès au panneau.
Exemple illustratif
Un scénario d’utilisation, sans données client ni résultats commerciaux attribués.
Le texte d’une présentation de produit, qui doit être lu en roumain et en russe par la même voix, avec la même énergie.
Eleven v3 est choisi pour son expressivité et la langue est forcée explicitement à chaque variante, au lieu d’être laissée à la détection automatique — dans les textes avec des noms propres, la détection se trompe exactement là où cela s’entend le plus. La stabilité est réglée sur Natural ; les pauses sont marquées dans le texte avec [pause] et [short pause] à la position exacte, et non à la fin de la phrase. On écoute et on corrige le texte, pas les curseurs.
Deux fichiers MP3 à 44,1 kHz, même voix, même énergie, téléchargés au moment de la génération. Si le matériau doit être intégré dans un montage, on prend du PCM au lieu du MP3, afin de ne pas compresser deux fois.
Ce este necesar:Vocea trebuie să fie una pentru care există acordul persoanei clonate. Textul nu trebuie să conțină informație care nu are voie să ajungă la un furnizor extern.
Possibilités de collaboration
Projets de transcription et de génération vocale sur des matériaux pour lesquels il existe des droits d’utilisation et une finalité documentée.
Nous définissons un pilote autour d’un processus réel : utilisateurs, données, intégrations, coûts et critères d’acceptation. L’extension suit après l’évaluation du résultat.
Nous établissons les exigences d’accessibilité, d’hébergement, de protection des données et d’interopérabilité. Toute connexion avec des services AGE ou STISC nécessite la validation de l’éligibilité, de l’accès et des approbations.
Ce sont des scénarios d’adaptation, non des déclarations sur des contrats ou partenariats existants. Les fonctions proposées sont confirmées dans le périmètre de travail du projet.
Discuter d'un piloteNous construisons des agents qui prennent et passent des appels, utilisent les informations de l'entreprise et travaillent avec vos systèmes.
PlatformăGrai est notre direction de recherche pour la synthèse vocale et les modèles adaptés aux langues d'ici.
Cercetare & dezvoltareUn outil de capture, de transcription et d'organisation des publicités radio.
Instrument specializatRacontez-nous votre processus. Ensemble, nous décidons ce qui vaut la peine d'être construit, ce que nous pouvons connecter et comment nous vérifions le résultat.