Zum Inhalt springen
megapromotingLassen Sie uns sprechen
Produkte Voice Studio

Producție vocală Instrument specializat

Aus Text eine Stimme für Ihr Material.

Ein Studio für das Erzeugen, Anhören und Herunterladen von Sprachmaterialien über Text-to-Speech-Modelle. Die Oberfläche vereint die Auswahl der Stimme und die für die Produktion nützlichen Einstellungen.

  1. 1Text și voce
  2. 2Generare audio
  3. 3Ascultare și export
Schemă explicativă ·Voice Studio

Voice Studio

Von der Information zur erledigten Arbeit.

01

Sie bereiten den Text vor

Sie schreiben das Material und wählen die zur Nutzung autorisierte Stimme.

02

Reglezi

Sie passen die Parameter und die dem Sprachmodell verfügbaren Optionen an.

03

Revizuiești

Sie hören an, korrigieren und laden das Material für das Projekt herunter.

Wo es nützlich wird.

Narațiune

Erklärungsmaterialien, Präsentationen und Audioinhalte.

Producție

Ein Erstellungs- und Prüfablauf für Content-Teams.

Experimentare

Vergleich der Interpretationen eines Textes vor der Nutzung.

Das Werkzeug verwendet Sprachmodelle integrierter Anbieter. Es gelten die Kosten, die Rechte an den Stimmen und die Regeln des Anbieters.

Voice Studio im Detail

Was Sie mit diesem Projekt tun können.

Voice Studio ist die Kette von Text zu Audiodatei: Sie schreiben den Text, wählen die Stimme, setzen Emotions- und Pausenmarkierungen, passen das Modell an, hören an, korrigieren und laden herunter. Der Anbieter ist ElevenLabs — wir nennen ihn beim Namen, weil das bestimmt, welche Stimmen verwendet werden können, wie viel es kostet und was Sie mit dem Ergebnis tun dürfen.

Der Teil, den man nicht sieht und der eigentlich der Grund ist, warum das Werkzeug existiert: Der API-Schlüssel gelangt nie in den Browser. Die Oberfläche sendet nur den Text an eine eigene Serverfunktion, und diese besitzt den Schlüssel und spricht mit ElevenLabs. Ohne diese Schicht legt jede Seite, die Sprache erzeugt, ihren Schlüssel jedem offen, der die Browserkonsole öffnet.

Es ist nicht Grai. Grai ist Sprachmodellforschung ohne Produkt. Voice Studio ist Produktion mit integriertem Anbieter, heute verfügbar. Die beiden teilen keinen Code.

01

Vier Modelle, gewählt für unterschiedliche Kompromisse

Eleven v3 für Ausdrucksstärke und Emotionsmarkierungen, Multilingual v2 für Stabilität, Turbo v2.5 für Kosten, Flash v2.5 für minimale Latenz. Es sind nicht vier Varianten desselben: v3 akzeptiert Markierungen, die die anderen ignorieren, und Flash opfert Nuance für Geschwindigkeit.

02

Schauspielmarkierungen, nicht nur Text

In Eleven v3 können Sie 14 Emotionszustände in den Text einfügen (von [excited] und [whispers] bis [sarcastic] und [tired]), 9 nichtverbale und Pausenmarkierungen ([laughs], [sighs], [clears throat], [pause], [breathes]) und 7 Markierungen zur Darbietung ([rushed], [drawn out], [singing], [muttering], [quietly]). Sie werden an der Cursorposition eingefügt, denn der Ort zählt genauso viel wie die Markierung.

03

Einstellungen, die sich im Ergebnis zeigen

Stabilität, Ähnlichkeit mit der Quellstimme, Stilübertreibung, Geschwindigkeit zwischen 0,7 und 1,2, plus Sprecher-Boost. Auf v3 ist Stabilität kein kontinuierlicher Regler, sondern drei Stufen — Kreativ, Natürlich, Robust —, weil sich das Modell diskret und nicht kontinuierlich verhält und ein feiner Regler eine nicht vorhandene Kontrolle andeuten würde.

04

Fünf Exportformate, darunter eines für Telefonie

MP3 mit 44,1 kHz und 128 oder 192 kbps, MP3 22 kHz 32 kbps für kleine Dateien, PCM 44,1 kHz für rohes WAV, das in einen Schnitt eingeht, und μ-law 8 kHz — das Telefonieformat, falls das Material in ein IVR oder eine Telefonanlage gelangt.

05

Acht erzwingbare Sprachen oder Erkennung aus dem Text

Rumänisch, Russisch, Englisch, Ukrainisch, Französisch, Italienisch, Spanisch, Deutsch — oder auf automatisch belassen. Das Erzwingen der Sprache ist bei gemischten Texten wichtig, bei denen die automatische Erkennung ausgerechnet bei Eigennamen falsch liegt.

Daten und Funktionsweise

Was in das System eingeht. Was geprüft werden muss.

Der Schlüssel liegt an nur einem Ort
In einer verschlüsselten Umgebungsvariable auf dem Server, niemals im Code, in git oder im Frontend. Der Browser ruft nur unsere eigene Funktion auf. Der Schlüssel erhält bei ElevenLabs nur die Erlaubnis zur Synthese, keinen Zugriff auf das gesamte Konto, plus ein monatliches Zeichenlimit — denn der wirkliche Schutz eines Schlüssels ist nicht sein Geheimnis, sondern wie viel Schaden er anrichten kann, wenn er herauskommt.
Der Text gelangt zum Anbieter
Das ist die direkte Folge der Nutzung eines externen Anbieters: Der Text, den Sie zur Synthese übergeben, geht an ElevenLabs. Ein Text mit personenbezogenen Daten, unveröffentlichten Preisen oder Kundeninformationen wird nicht ohne Autorisierung gesendet. Das ist keine Formalität — es ist die einzige Compliance-Entscheidung, die das Tool an den Benutzer überträgt.
Die Stimmen sind geklont, daher ist Einwilligung erforderlich
Die in der Oberfläche hinterlegten Stimmen sind keine Bibliotheksstimmen, sondern geklonte Stimmen aus Proben realer Personen, erstellt über die Klon-Oberfläche von ElevenLabs. Das bedeutet, dass es nicht um eine Produktlizenz geht, sondern um die Zustimmung der Person. In der Republik Moldau behandelt das Gesetz Nr. 195/2024 die Stimme ab dem 23. August 2026 als biometrische Daten.
Nichts wird gespeichert
Die Generierungen bleiben im Speicher des Browser-Tabs, höchstens die letzten 12, und verschwinden beim Neuladen. Es gibt keine Datenbank, keinen Verlauf auf dem Server, kein Konto. Die Audioantwort wird mit Cache-Control: no-store bereitgestellt.
Was Sie mit dem Ergebnis tun dürfen
Das ElevenLabs-Abonnement gewährt das Recht zur kommerziellen Nutzung des generierten Materials, aber die Nutzungsrichtlinie verbietet ausdrücklich die Verwendung der Ausgabe zum Trainieren, Testen oder Aufbau eines konkurrierenden Systems. Praktisch: Die Audiodatei kann in ein Kundenmaterial eingehen; sie kann nicht zu Trainingsdaten für ein eigenes Modell werden.

Von der Erkundung zur Implementierung

So bereiten wir ein Projekt mit Voice Studio vor.

01

Wir klären das Material und wer es anhört

Ein Radiospot, eine Präsentationsnarration und eine IVR-Nachricht haben unterschiedliche Anforderungen an Format, Tempo und Länge. Das Exportformat wird hier gewählt, nicht am Ende.

02

Wir klären zuerst die Sprachrechte

Welche Stimme verwendet wird und auf welcher Grundlage der Zustimmung. Wenn eine neue Stimme benötigt wird, erfordert das Klonen Proben und die Einwilligung der Person, nicht nur eine Audiodatei.

03

Wir generieren, hören an und korrigieren den Text, nicht die Einstellungen

Die meisten Ausspracheprobleme werden durch Umschreiben des Textes gelöst, nicht durch Bewegen der Regler: Abkürzungen werden aufgelöst, Zahlen werden dort in Buchstaben geschrieben, wo es mehrdeutig ist, und Eigennamen werden isoliert getestet, bevor sie in einen Satz eingesetzt werden.

04

Wir übergeben die Datei und halten fest, was erlaubt ist

Der geprüfte Export sowie eine Notiz zur verwendeten Stimme und zu den Nutzungsgrenzen — damit das Material in sechs Monaten erneut verwendet werden kann, ohne die Diskussion über Rechte neu zu beginnen.

Fragen, die sich lohnen, geklärt zu werden.

Welchen Anbieter verwenden Sie?

ElevenLabs. Unsere Serverfunktion ruft direkt api.elevenlabs.io auf, den Synthese-Endpunkt. Das ist kein abstrakter Anbieter: Von ihm hängen die verfügbaren Stimmen, die Kosten, die Ausgabeformate und die Nutzungsregeln für das Ergebnis ab.

Welche Stimmen kann ich verwenden?

Die in der Oberfläche festgelegten, das heißt aus bereitgestellten Proben geklonte Stimmen — keine Bibliotheksstimmen. Eine neue Stimme wird erstellt, indem Proben über die Klonoberfläche von ElevenLabs hochgeladen werden, mit deren Limit von 11 MB pro Datei; darüber hinaus recomprimieren wir automatisch auf Mono 22 kHz 64 kbps. Der nicht technische Teil ist der, der zählt: Das Klonen der Stimme einer Person erfordert die Zustimmung dieser Person. In der Republik Moldau ist die Stimme ab dem 23. August 2026 biometrische Daten, daher autorisiert eine öffentliche Aufnahme nichts.

Wie viel Text kann ich auf einmal senden?

5.000 Zeichen pro Anfrage, von uns festgelegte Obergrenze, nicht vom Anbieter. Der Grund sind die Kosten: Eine fehlerhafte Anfrage mit einem hundertmal längeren Text ist eine Rechnung, keine Fehlermeldung. Die Funktion hat eine Ausführungszeit von 60 Sekunden, was für einen Block dieser Größe ausreichend ist.

In welchen Formaten exportiert es?

MP3 bei 44,1 kHz 128 kbps (Standard) oder 192 kbps, MP3 22 kHz 32 kbps für kleine Größe, PCM 44,1 kHz für rohes WAV und μ-law 8 kHz für Telefonie. Letzteres ist das, was man vergisst und dann feststellt, dass das Material in der Telefonanlage schlecht klingt.

Kann ich das generierte Audio verwenden, um eine eigene Stimme zu trainieren?

Nein. Das ElevenLabs-Abonnement gibt Ihnen das kommerzielle Nutzungsrecht am Material, aber deren Nutzungsrichtlinie verbietet ausdrücklich die Verwendung der Ausgabe zum Trainieren, Testen oder Entwickeln eines konkurrierenden Systems. Eine an einen Kunden gelieferte Datei ist in Ordnung; dieselbe Datei als Trainingsdaten für ein eigenes Modell nicht. Es ist eine Unterscheidung, die bezahlt wird, wenn sie ignoriert wird, und das ist der Grund, warum Grai nicht auf irgendetwas trainiert wird, das von hier ausgeht.

Wird irgendwo gespeichert, was ich generiert habe?

Nein. Der Verlauf lebt im Speicher des Tabs, höchstens 12 Generierungen, und verschwindet beim Neuladen. Es gibt kein Konto, keine Datenbank und keine Speicherung auf dem Server; die Audioantwort wird ausdrücklich als nicht cachebar markiert. Wenn Sie die Datei wollen, laden Sie sie in diesem Moment herunter.

Kann ich es selbst verwenden?

Nicht heute. Das Deployment liegt hinter der Vercel-Authentifizierung und optional hinter einem zusätzlichen Zugangstoken, das bei jeder Anfrage als Header verlangt wird. Es ist ein internes Arbeitsinstrument für die Produktion von Materialien, kein Dienst mit Registrierung. Wir liefern das Audiomaterial, nicht den Zugang zum Panel.

Beispiel zur Veranschaulichung

Die Erzählung eines Präsentationsmaterials, in zwei Sprachen

Ein Nutzungsszenario, ohne Kundendaten oder zugeordnete kommerzielle Ergebnisse.

Ausgangssituation

Der Text einer Produktpräsentation, die von derselben Stimme auf Rumänisch und Russisch mit derselben Energie gelesen werden muss.

Wie es funktioniert

Eleven v3 wird für Ausdruckskraft gewählt, und die Sprache wird bei jeder Variante ausdrücklich erzwungen, statt sie der automatischen Erkennung zu überlassen — in Texten mit Eigennamen wählt die Erkennung genau dort falsch, wo es am deutlichsten zu hören ist. Die Stabilität wird auf Natural gesetzt; Pausen werden im Text mit [pause] und [short pause] an der genauen Position markiert, nicht am Satzende. Man hört zu und korrigiert den Text, nicht die Schieberegler.

Rezultatul

Zwei MP3-Dateien bei 44,1 kHz, dieselbe Stimme, dieselbe Energie, im Moment der Generierung heruntergeladen. Wenn das Material in einen Schnitt eingehen soll, wird PCM statt MP3 verwendet, damit nicht zweimal komprimiert wird.

Ce este necesar:Vocea trebuie să fie una pentru care există acordul persoanei clonate. Textul nu trebuie să conțină informație care nu are voie să ajungă la un furnizor extern.

Möglichkeiten der Zusammenarbeit

Voice Studio, im Kontext Ihrer Organisation.

Verarbeitung von Audioinhalten

Transkriptions- und Sprachgenerierungsprojekte auf Materialien, für die Nutzungsrechte und ein dokumentierter Zweck vorliegen.

Private Unternehmen

Wir definieren einen Pilot rund um einen realen Prozess: Nutzer, Daten, Integrationen, Kosten und Abnahmekriterien. Die Erweiterung erfolgt nach der Bewertung des Ergebnisses.

Institutionen und staatliche Unternehmen

Wir legen die Anforderungen an Zugänglichkeit, Hosting, Datenschutz und Interoperabilität fest. Jede Verbindung mit AGE- oder STISC-Diensten erfordert die Validierung der Berechtigung, des Zugriffs und der Genehmigungen.

Dies sind Anpassungsszenarien, keine Aussagen über bestehende Verträge oder Partnerschaften. Die vorgeschlagenen Funktionen werden im Arbeitsbereich des Projekts bestätigt.

Discută un pilot

Teil eines Ökosystems.

Was sollte bei Ihnen besser laufen?

Erzählen Sie uns von Ihrem Prozess. Gemeinsam legen wir fest, was sich zu bauen lohnt, was wir anbinden können und wie wir das Ergebnis prüfen.

Lassen Sie uns sprechen