Sie bereiten den Text vor
Sie schreiben das Material und wählen die zur Nutzung autorisierte Stimme.
Producție vocală Instrument specializat
Ein Studio für das Erzeugen, Anhören und Herunterladen von Sprachmaterialien über Text-to-Speech-Modelle. Die Oberfläche vereint die Auswahl der Stimme und die für die Produktion nützlichen Einstellungen.
Voice Studio
Sie schreiben das Material und wählen die zur Nutzung autorisierte Stimme.
Sie passen die Parameter und die dem Sprachmodell verfügbaren Optionen an.
Sie hören an, korrigieren und laden das Material für das Projekt herunter.
Erklärungsmaterialien, Präsentationen und Audioinhalte.
Ein Erstellungs- und Prüfablauf für Content-Teams.
Vergleich der Interpretationen eines Textes vor der Nutzung.
Das Werkzeug verwendet Sprachmodelle integrierter Anbieter. Es gelten die Kosten, die Rechte an den Stimmen und die Regeln des Anbieters.
Voice Studio im Detail
Voice Studio ist die Kette von Text zu Audiodatei: Sie schreiben den Text, wählen die Stimme, setzen Emotions- und Pausenmarkierungen, passen das Modell an, hören an, korrigieren und laden herunter. Der Anbieter ist ElevenLabs — wir nennen ihn beim Namen, weil das bestimmt, welche Stimmen verwendet werden können, wie viel es kostet und was Sie mit dem Ergebnis tun dürfen.
Der Teil, den man nicht sieht und der eigentlich der Grund ist, warum das Werkzeug existiert: Der API-Schlüssel gelangt nie in den Browser. Die Oberfläche sendet nur den Text an eine eigene Serverfunktion, und diese besitzt den Schlüssel und spricht mit ElevenLabs. Ohne diese Schicht legt jede Seite, die Sprache erzeugt, ihren Schlüssel jedem offen, der die Browserkonsole öffnet.
Es ist nicht Grai. Grai ist Sprachmodellforschung ohne Produkt. Voice Studio ist Produktion mit integriertem Anbieter, heute verfügbar. Die beiden teilen keinen Code.
Eleven v3 für Ausdrucksstärke und Emotionsmarkierungen, Multilingual v2 für Stabilität, Turbo v2.5 für Kosten, Flash v2.5 für minimale Latenz. Es sind nicht vier Varianten desselben: v3 akzeptiert Markierungen, die die anderen ignorieren, und Flash opfert Nuance für Geschwindigkeit.
In Eleven v3 können Sie 14 Emotionszustände in den Text einfügen (von [excited] und [whispers] bis [sarcastic] und [tired]), 9 nichtverbale und Pausenmarkierungen ([laughs], [sighs], [clears throat], [pause], [breathes]) und 7 Markierungen zur Darbietung ([rushed], [drawn out], [singing], [muttering], [quietly]). Sie werden an der Cursorposition eingefügt, denn der Ort zählt genauso viel wie die Markierung.
Stabilität, Ähnlichkeit mit der Quellstimme, Stilübertreibung, Geschwindigkeit zwischen 0,7 und 1,2, plus Sprecher-Boost. Auf v3 ist Stabilität kein kontinuierlicher Regler, sondern drei Stufen — Kreativ, Natürlich, Robust —, weil sich das Modell diskret und nicht kontinuierlich verhält und ein feiner Regler eine nicht vorhandene Kontrolle andeuten würde.
MP3 mit 44,1 kHz und 128 oder 192 kbps, MP3 22 kHz 32 kbps für kleine Dateien, PCM 44,1 kHz für rohes WAV, das in einen Schnitt eingeht, und μ-law 8 kHz — das Telefonieformat, falls das Material in ein IVR oder eine Telefonanlage gelangt.
Rumänisch, Russisch, Englisch, Ukrainisch, Französisch, Italienisch, Spanisch, Deutsch — oder auf automatisch belassen. Das Erzwingen der Sprache ist bei gemischten Texten wichtig, bei denen die automatische Erkennung ausgerechnet bei Eigennamen falsch liegt.
Daten und Funktionsweise
Von der Erkundung zur Implementierung
Ein Radiospot, eine Präsentationsnarration und eine IVR-Nachricht haben unterschiedliche Anforderungen an Format, Tempo und Länge. Das Exportformat wird hier gewählt, nicht am Ende.
Welche Stimme verwendet wird und auf welcher Grundlage der Zustimmung. Wenn eine neue Stimme benötigt wird, erfordert das Klonen Proben und die Einwilligung der Person, nicht nur eine Audiodatei.
Die meisten Ausspracheprobleme werden durch Umschreiben des Textes gelöst, nicht durch Bewegen der Regler: Abkürzungen werden aufgelöst, Zahlen werden dort in Buchstaben geschrieben, wo es mehrdeutig ist, und Eigennamen werden isoliert getestet, bevor sie in einen Satz eingesetzt werden.
Der geprüfte Export sowie eine Notiz zur verwendeten Stimme und zu den Nutzungsgrenzen — damit das Material in sechs Monaten erneut verwendet werden kann, ohne die Diskussion über Rechte neu zu beginnen.
ElevenLabs. Unsere Serverfunktion ruft direkt api.elevenlabs.io auf, den Synthese-Endpunkt. Das ist kein abstrakter Anbieter: Von ihm hängen die verfügbaren Stimmen, die Kosten, die Ausgabeformate und die Nutzungsregeln für das Ergebnis ab.
Die in der Oberfläche festgelegten, das heißt aus bereitgestellten Proben geklonte Stimmen — keine Bibliotheksstimmen. Eine neue Stimme wird erstellt, indem Proben über die Klonoberfläche von ElevenLabs hochgeladen werden, mit deren Limit von 11 MB pro Datei; darüber hinaus recomprimieren wir automatisch auf Mono 22 kHz 64 kbps. Der nicht technische Teil ist der, der zählt: Das Klonen der Stimme einer Person erfordert die Zustimmung dieser Person. In der Republik Moldau ist die Stimme ab dem 23. August 2026 biometrische Daten, daher autorisiert eine öffentliche Aufnahme nichts.
5.000 Zeichen pro Anfrage, von uns festgelegte Obergrenze, nicht vom Anbieter. Der Grund sind die Kosten: Eine fehlerhafte Anfrage mit einem hundertmal längeren Text ist eine Rechnung, keine Fehlermeldung. Die Funktion hat eine Ausführungszeit von 60 Sekunden, was für einen Block dieser Größe ausreichend ist.
MP3 bei 44,1 kHz 128 kbps (Standard) oder 192 kbps, MP3 22 kHz 32 kbps für kleine Größe, PCM 44,1 kHz für rohes WAV und μ-law 8 kHz für Telefonie. Letzteres ist das, was man vergisst und dann feststellt, dass das Material in der Telefonanlage schlecht klingt.
Nein. Das ElevenLabs-Abonnement gibt Ihnen das kommerzielle Nutzungsrecht am Material, aber deren Nutzungsrichtlinie verbietet ausdrücklich die Verwendung der Ausgabe zum Trainieren, Testen oder Entwickeln eines konkurrierenden Systems. Eine an einen Kunden gelieferte Datei ist in Ordnung; dieselbe Datei als Trainingsdaten für ein eigenes Modell nicht. Es ist eine Unterscheidung, die bezahlt wird, wenn sie ignoriert wird, und das ist der Grund, warum Grai nicht auf irgendetwas trainiert wird, das von hier ausgeht.
Nein. Der Verlauf lebt im Speicher des Tabs, höchstens 12 Generierungen, und verschwindet beim Neuladen. Es gibt kein Konto, keine Datenbank und keine Speicherung auf dem Server; die Audioantwort wird ausdrücklich als nicht cachebar markiert. Wenn Sie die Datei wollen, laden Sie sie in diesem Moment herunter.
Nicht heute. Das Deployment liegt hinter der Vercel-Authentifizierung und optional hinter einem zusätzlichen Zugangstoken, das bei jeder Anfrage als Header verlangt wird. Es ist ein internes Arbeitsinstrument für die Produktion von Materialien, kein Dienst mit Registrierung. Wir liefern das Audiomaterial, nicht den Zugang zum Panel.
Beispiel zur Veranschaulichung
Ein Nutzungsszenario, ohne Kundendaten oder zugeordnete kommerzielle Ergebnisse.
Der Text einer Produktpräsentation, die von derselben Stimme auf Rumänisch und Russisch mit derselben Energie gelesen werden muss.
Eleven v3 wird für Ausdruckskraft gewählt, und die Sprache wird bei jeder Variante ausdrücklich erzwungen, statt sie der automatischen Erkennung zu überlassen — in Texten mit Eigennamen wählt die Erkennung genau dort falsch, wo es am deutlichsten zu hören ist. Die Stabilität wird auf Natural gesetzt; Pausen werden im Text mit [pause] und [short pause] an der genauen Position markiert, nicht am Satzende. Man hört zu und korrigiert den Text, nicht die Schieberegler.
Zwei MP3-Dateien bei 44,1 kHz, dieselbe Stimme, dieselbe Energie, im Moment der Generierung heruntergeladen. Wenn das Material in einen Schnitt eingehen soll, wird PCM statt MP3 verwendet, damit nicht zweimal komprimiert wird.
Ce este necesar:Vocea trebuie să fie una pentru care există acordul persoanei clonate. Textul nu trebuie să conțină informație care nu are voie să ajungă la un furnizor extern.
Möglichkeiten der Zusammenarbeit
Transkriptions- und Sprachgenerierungsprojekte auf Materialien, für die Nutzungsrechte und ein dokumentierter Zweck vorliegen.
Wir definieren einen Pilot rund um einen realen Prozess: Nutzer, Daten, Integrationen, Kosten und Abnahmekriterien. Die Erweiterung erfolgt nach der Bewertung des Ergebnisses.
Wir legen die Anforderungen an Zugänglichkeit, Hosting, Datenschutz und Interoperabilität fest. Jede Verbindung mit AGE- oder STISC-Diensten erfordert die Validierung der Berechtigung, des Zugriffs und der Genehmigungen.
Dies sind Anpassungsszenarien, keine Aussagen über bestehende Verträge oder Partnerschaften. Die vorgeschlagenen Funktionen werden im Arbeitsbereich des Projekts bestätigt.
Discută un pilotWir entwickeln Agenten, die Anrufe annehmen und tätigen, die Informationen des Unternehmens nutzen und mit Ihren Systemen arbeiten.
PlatformăGrai ist unsere Forschungsrichtung für Sprachsynthese und an die hier verwendeten Sprachen angepasste Modelle.
Cercetare & dezvoltareEin Werkzeug zur Erfassung, Transkription und Organisation von Radiowerbung.
Instrument specializatErzählen Sie uns von Ihrem Prozess. Gemeinsam legen wir fest, was sich zu bauen lohnt, was wir anbinden können und wie wir das Ergebnis prüfen.