Zum Inhalt springen
megapromotingLassen Sie uns sprechen

Expertise · Transkription und Übersetzung

Sprache zu Text, auf Rumänisch und Russisch, mit vor der ersten Sekunde Audio aufgezeichneter Zustimmung.

Wir transkribieren Audio in Echtzeit oder aus einer Datei, übersetzen in Kundengesprächen zwischen Rumänisch und Russisch und liefern den Text mit Zeitmarken, Audio-Export und einer Spur der Zustimmung. Die Spracherkennung betreiben wir über Anbieter, über unser Gateway; das eigene Rumänisch-Modell ist Forschung, kein Produkt.

Bereits gebautDouă implementări proprii, ambele deschise și citate. Prima e o aplicație de transcriere în flux, cu backend Express de 3.378 de linii în 25 de fișiere și 37 de teste pe care le-am rulat azi — toate trec; ea conține partea pe care nimeni nu o construiește din entuziasm: o poartă de consimțământ care refuză captura când nu există acord înregistrat. A doua rulează în producție, la clienți reali: mesajele vocale primite pe canalele de mesagerie sunt transcrise, iar răspunsul scris de un operator în română este rescris în limba clientului înainte de a pleca. Ce NU intră în „delivered” și e scris ca atare în pagină: modelul propriu de recunoaștere și sinteză în română este cercetare — nu are demonstrație publică, nu are interfață de programare, iar pe acuratețe în română pierde față de sistemele comerciale mari. Serviciul se vinde pe ce rulează, nu pe ce studiem.

Transkription scheint ein gelöstes Problem zu sein, bis Sie sie auf Rumänisch anwenden, mit zwei Sprechern, die sich unterbrechen, schnell gesprochenen Zahlen und einem Kunden, der mitten im Satz ins Russische wechselt. Dann treten die drei echten Probleme auf: Welches Modell wählen Sie für die Sprache vor Ihnen, wie wissen Sie, wo ein Sprechabschnitt endet, und wer hat Ihnen erlaubt, aufzuzeichnen. Wir kümmern uns um alle drei, und das letzte behandeln wir als ein Codierungsproblem, nicht als einen Absatz in einer Richtlinie.

In unserer Streaming-Transkriptionsanwendung erhält der Browser niemals den Schlüssel des Anbieters. Er fordert vom Backend ein Einmal-Token an, standardmäßig 15 Minuten gültig, mit dem die Transkriptionsverbindung geöffnet wird; die Route, die das Token ausstellt, ist standardmäßig geschlossen und kann nur durch eine explizite Einstellung außerhalb der Produktion geöffnet werden, gerade weil es die Route ist, über die Geld verbraucht wird. Über die Rohtranskription läuft eine Analyse durch ein Sprachmodell mit einer Liste von Ausweichmodellen in Reihenfolge, damit die Nichtverfügbarkeit eines Modells die Sitzung nicht stoppt.

Das Zustimmungs-Gateway ist der Teil, den wir besonders pflegen. Bevor ein Stück Audio akzeptiert wird, fordert der Server einen nicht widerrufenen Zustimmungsdatensatz für die jeweilige Sitzung an. Wenn keiner vorhanden ist, antwortet er mit 451 und einer Nachricht auf Rumänisch. Wenn die Datenbank nicht antwortet, verweigert er alles — 503, nicht „durchlassen“. Bereits verifizierte Sitzungen laufen über einen Zehn-Minuten-Cache, damit ein kurzer Ausfall eine laufende Aufzeichnung nicht unterbricht. Es ist so geschrieben, dass es nicht durch einen Konfigurationsfehler umgangen werden kann.

Der Teil, der bereits bei Kunden läuft, ist ein anderer und weniger spektakulär: Auf Messaging-Kanälen wird eine eingehende Sprachnachricht zu Text, und die Sprache wird durch Abstimmung über die letzten acht Nachrichten der Unterhaltung ausgewählt, nicht durch Raten anhand des Audios. Umgekehrt wird, wenn ein Kollege auf Rumänisch antwortet, sein Text in die Sprache des Kunden mit strengen Anweisungen umgeschrieben — er fügt keine Informationen hinzu, erfindet keine Preise oder Fristen, widerspricht dem Operator nicht und behandelt den Text des Operators strikt als zu übertragende Daten, niemals als Anweisungen für das Modell.

Was dazugehört

Die Arbeit, nach Bestandteilen

Die vor dem Audio geprüfte Zustimmung

Die Zustimmungsprüfung verlangt einen nicht widerrufenen Eintrag im Zustimmungsregister für die aktuelle Sitzung. Ohne ihn: 451, mit Meldung auf Rumänisch. Bei ausgefallener Datenbank: 503, also Ablehnung, kein Durchlass. Bereits geprüfte Sitzungen laufen über einen 10-Minuten-Cache, damit die Prüfung die Datenbank nicht bei jedem Audiostück belastet.

Einmaliges Token, der Schlüssel bleibt auf dem Server

Die Seite fordert vom Backend ein Token für die Echtzeit-Transkription an, standardmäßig 900 Sekunden gültig, und öffnet damit die Verbindung zum Anbieter. Der Kontoschlüssel gelangt niemals in den Browser. Die Anfrage an den Anbieter hat ein Timeout von 30 Sekunden, und dessen Überschreitung gibt einen ausdrücklichen Fehler zurück, keine endlose Wartezeit.

Transkription im Stream, mit der aus dem Kontext gewählten Sprache

In der Produktion wird auf den Messaging-Kanälen die Sprache der Sprachnachricht per Abstimmung über die letzten acht Nachrichten der Unterhaltung bestimmt — Russisch, wenn es dominiert, sonst Rumänisch — und erst danach wird die Erkennung aufgerufen, mit ausdrücklich übergebenem Sprachhinweis. Das Dateiformat wird anhand der ersten 12 Bytes erkannt, nicht anhand der Erweiterung, da Sprachnachrichten auf Meta-Kanälen als `ogg` ankommen, unabhängig davon, wie sie benannt sind.

Übersetzung Operator → Kunde, mit im Prompt formulierten Grenzen

Wenn ein Kollege in einem internen Thread auf Rumänisch antwortet, wird die Nachricht an den Kunden in die Sprache des Kunden umgeschrieben. Die Regeln sind im Code ausdrücklich: Es werden keine Informationen hinzugefügt, keine Details, Preise, Zeiten oder Versprechen erfunden, der Operator wird nicht widersprochen, und der Text des Operators wird strikt als zu übermittelnde Daten behandelt, niemals als Anweisungen für das Modell — eine Maßnahme gegen Prompt-Injection, keine Stilformulierung.

Analyse über dem Transkript, mit Ersatzmodellen in Reihenfolge

Über dem resultierenden Text läuft eine Analyse mit einem Sprachmodell, mit einer geordneten Liste alternativer Modelle im Code, damit eine Nichtverfügbarkeit die Qualität verschlechtert, nicht die Sitzung stoppt. Das Analysemodell kann aus der Konfiguration geändert werden, ohne erneute Inbetriebnahme.

Audioexport in drei Formaten, mit ausdrücklichem Fehlschlag

WAV wird ohne externe Werkzeuge erzeugt. FLAC und MP3 erfordern `ffmpeg`; wenn es fehlt, antwortet der Server mit 501 samt Grund, und wenn der Prozess hängen bleibt, wird er nach 60 Sekunden gestoppt und gibt 504 mit den ersten zweitausend Zeichen des Fehlers zurück. Ein fehlgeschlagener Export sagt warum.

Getrennte Zählung von Kontingent und Kosten

Die verbrauchten Minuten werden atomar über eine Prozedur in der Datenbank abgezogen, und die Kosten werden in einem separaten Register beim Anbieter geschrieben. Es sind zwei verschiedene Dinge und sie gehen unterschiedlich kaputt: Wenn der Kosten-Eintrag nicht mit der Sitzung verknüpft werden kann, wird er unverknüpft gespeichert, damit die Kosteninformation nicht verloren geht.

Drei Verkehrsschwellen, pro Benutzer und nicht pro Adresse

Das Ausstellen von Token, die Analyse und der Export haben getrennte Limits, und der Zählschlüssel ist der authentifizierte Benutzer, wenn vorhanden, nicht die IP-Adresse — sonst würde ein einzelner aggressiver Benutzer hinter einem gemeinsamen Netz das Kontingent aller seiner Kollegen aufbrauchen.

Transkription auf den Messaging-Kanälen, im bestehenden Ablauf

Die vom Kunden empfangene Sprachnachricht wird im selben Gespräch zu Text, ohne dass jemand ein anderes Werkzeug öffnet. Erkennung und Synthese laufen über unser Gateway, nicht direkt zum Anbieter, also erscheint der Verbrauch am selben Ort wie der Rest.

Wie es aussieht

Der Weg, Schritt für Schritt.

01

Wir stellen das Recht zu registrieren fest, vor jedem Code

Wer spricht, wer informiert wird, wer zustimmt, wer die Aufzeichnung aufbewahrt und wie lange. Das Ergebnis ist kein Dokument, das in einer Schublade liegt, sondern die Konfiguration des Gates: was genau „bestehende Einwilligung“ in der Kundensituation bedeutet und was geschieht, wenn sie fehlt.

02

Wir wählen die Kette nach Sprache und Tonbedingungen

Rumänisch und Russisch verhalten sich unterschiedlich, ebenso ein Tischmikrofon im Vergleich zu einem komprimierten Telefonanruf. Die Wahl des Modells, der Sprachkennung und der Segmentierungsstrategie erfolgt anhand von Stichproben aus dem echten Material des Kunden, nicht anhand einer sauberen Demo.

03

Wir setzen den Ablauf zusammen und brechen ihn absichtlich

Token, Verbindung, Transkription, Analyse, Export. Danach prüfen wir die Fälle, die wirklich passieren: fehlende Zustimmung, Datenbank mitten in der Sitzung ausgefallen, abgelaufenes Token, `ffmpeg` nicht vorhanden, Anbieter nicht verfügbar. Jeder Fall muss eine Meldung ausgeben, die sagt, was kaputtgegangen ist.

04

Wir liefern mit aktivierten Zählern und Limits

Minutenzählung, Kostenregister, Verkehrsschwellen pro Benutzer und Protokolle. Ohne sie wird der erste Vorfall aus der Erinnerung besprochen.

IntrareVerificareDeciziePublicareNimic nu trece mai departe neverificat.ORDINEA E ARGUMENTUL
Cinci pași, în ordinea în care se execută: acordul verificat în registru (fără el, drumul se oprește aici); jetonul de unică folosință emis de server, cu cheia rămasă pe server; transcrierea în flux la furnizor; analiza peste transcript, cu modele de rezervă în ordine; exportul textului și al audio-ului. Primul pas e singurul care poate opri tot restul, și e desenat ca poartă, nu ca etapă.

Die Daten

Was wir anfassen, wo die Daten liegen und wie lange sie bleiben

Die Fragen, die jede Person mit einem Datenschutzbeauftragten stellt — hier gestellt, bevor er sie stellt.

Einwilligungsregister
Eine Zeile pro Sitzung, mit Arbeitsbereich, Sitzungs-ID und Widerrufszeitpunkt, leer solange die Einwilligung gültig ist. Die Prüfung sucht genau nach dem Fehlen eines Widerrufs. Es ist die einzige Wahrheitsquelle für das Recht, Audio aufzuzeichnen, und sie wird vor jeder Sitzung abgefragt, nicht nur bei der Anmeldung.
Audio, Transkript und Analyse
Das Roh-Audio läuft über die Transkriptionsverbindung zum Anbieter; was bei uns bleibt, ist das Transkript, die Zeitmarken und das Ergebnis der Analyse, plus die vom Benutzer angeforderten Exporte. Was genau aufbewahrt wird und wie lange, wird pro Projekt vor der ersten Aufnahme festgelegt — für einen Vorstand, eine medizinische Besprechung und einen Verkaufsgespräch sind die Antworten nicht dieselben.
Wohin das Audio geht und zu wem
Zu den Anbietern für Spracherkennung und zum Analysemodell, über unser Gateway. Ihre Liste wird vor dem Start im Vertrag mit den jeweiligen Namen festgehalten, denn ein nicht deklarierter Unterauftragsverarbeiter ist ein rechtliches Problem, kein technisches Versäumnis.
Das Verbrauchsregister
Die verbrauchten Minuten werden atomar in der Datenbank abgezogen, und die Kosten werden separat geschrieben, pro Sitzung und pro Anbieter. Es sind zwei getrennte Register, gerade damit ein Fehler in einem das andere nicht verfälscht.
Was wir nicht berühren
Wir trainieren keine Modelle auf den Aufzeichnungen des Kunden und verwenden die Ausgabe eines Sprachanbieters nicht, um ein konkurrierendes Modell aufzubauen oder zu testen — das ist in den Bedingungen des von uns verwendeten Anbieters ausdrücklich verboten, und es ist eine Grenze, die wir auch dort einhalten, wo es technisch bequem wäre.

Ein Fall

Eine Sitzung, die nicht startet, und warum das das richtige Verhalten ist

Die Ausgangslage

Ein Besprechungsszenario mit mehreren Teilnehmern, in dem die Transkription im Browser hätte starten sollen und die Aufzeichnung hätte aufbewahrt werden sollen. Die Situation, in der die meisten Transkriptionswerkzeuge ausfallen: Jemand drückt „aufzeichnen“, bevor die Einwilligung der Teilnehmer irgendwo festgehalten wurde.

Was wir gebaut haben

Ich habe die Prüfung der Einwilligung in den Anfrageweg gelegt, nicht auf einen Warnbildschirm. Der Server sucht eine nicht widerrufene Einwilligungszeile für die aktuelle Sitzung, bevor er das erste Stück Audio akzeptiert. Ich habe auch das Verhalten im Fehlerfall bewusst festgelegt: Wenn die Datenbank, die die Einwilligungen hält, nicht antwortet, wird die Anfrage mit 503 abgelehnt, nicht durchgelassen. Bereits geprüfte Sitzungen bleiben zehn Minuten im Cache, damit ein kurzer Ausfall eine laufende Aufnahme nicht unterbricht. Die Route, die Tokens an den Anbieter ausgibt, ist standardmäßig geschlossen und kann nur über eine explizite Einstellung außerhalb der Produktion geöffnet werden.

Was dabei herauskam

Ohne festgehaltene Einwilligung gibt die Erfassung 451 mit einer Nachricht auf Rumänisch zurück, und das Ereignis wird mit Sitzung und Arbeitsbereich protokolliert. Das Verhalten ist durch Tests abgedeckt, die ohne Datenbank laufen, indem die Prüfung injiziert wird. Die Backend-Suite hat 37 Tests; beim heutigen Lauf bestehen alle.

Was der Fall nicht sagt

Die Anwendung ist nicht veröffentlicht — sie läuft bei uns, hat keine Seite, auf der Sie sich anmelden können, und das Recht, ein bestimmtes Gespräch aufzuzeichnen, bleibt beim Kunden: Wir setzen es technisch durch, wir erteilen es nicht. Und noch eine Grenze: Das Tor prüft das Vorhandensein der Einwilligung, nicht ihre rechtliche Qualität. Wenn der Einwilligungstext schlecht formuliert ist, wird der Code ihn genau so anwenden.

Fragen

Was uns die Leute fragen, bevor sie anrufen

In welchen Sprachen transkribieren Sie?

Wir arbeiten mit Rumänisch und Russisch, weil das die Sprachen sind, in denen unsere echten Probleme auftreten und die wir mit eigenem Material prüfen können. Andere Sprachen sind technisch über dieselben Anbieter möglich, aber bevor wir etwas versprechen, machen wir einen Test mit Ihren Aufnahmen — eine Sprache funktioniert oder funktioniert nicht je nach Audio, nicht nach der Liste auf der Anbieterseite.

Haben Sie ein eigenes Modell zur Spracherkennung für Rumänisch?

In der Forschung, nicht im Produkt, und es ist wichtig, diese beiden nicht zu verwechseln. Die eigene Richtung hat keine öffentliche Demo, keine Programmierschnittstelle und keine Telefonie, und bei der Erkennungsgenauigkeit für Rumänisch zeigen unsere Messungen, dass wir gegenüber großen kommerziellen Systemen zurückliegen. Wir veröffentlichen das, weil es unser eigenes Ergebnis ist, gewonnen auf unserem eigenen Testsystem. Der Dienst, den wir heute verkaufen, läuft über Anbieter, über unser Gateway.

Wer darf ein Gespräch aufzeichnen und was machen Sie, wenn er es nicht darf?

Das Recht wird je nach Situation mit dem Kunden vor der Installation festgelegt — das ist nichts, was wir übertragen können. Was wir tun, ist, es im Code durchzusetzen: Ohne eine aufgezeichnete Einwilligung für die aktuelle Sitzung lehnt der Server die Erfassung mit 451 und einer Nachricht auf Rumänisch ab. Wenn die Datenbank, die die Einwilligungen hält, nicht antwortet, lehnt er auch dann mit 503 ab. Es gibt keine Konfiguration, die das Fehlen der Einwilligung in stilles Durchlassen verwandelt.

Kommt mein Anbieter-Schlüssel im Browser an?

Nein. Die Seite fordert vom Backend einen Einmal-Token für die Transkriptionssitzung an, standardmäßig 900 Sekunden gültig, und öffnet damit die Verbindung. Der Kontoschlüssel bleibt auf dem Server. Außerdem ist die Route, die Tokens ausgibt, standardmäßig geschlossen und kann nur über eine explizite Einstellung außerhalb der Produktion geöffnet werden, weil es die Route ist, die Geld verbraucht.

Wie genau ist die Transkription?

Es hängt mehr vom Audio als vom Modell ab: Mikrofon, Überschneidungen, Zahlen, Eigennamen, Hintergrundrauschen. Wir geben Ihnen keinen Prozentsatz, bevor wir Ihr Material hören, weil ein von einem Produktblatt übernommener Prozentsatz nichts über Ihre Sitzungen aussagt. Was wir tun, ist ein Test mit echten Aufnahmen, mit offen gelegten Fehlern — in der Regel scheitert es an Zahlen und Namen, nicht an Sätzen.

Übersetzen Sie Gespräche in Echtzeit zwischen Operator und Kunde?

Ja, und es läuft bereits in der Produktion in einem Sinn: Der Kollege schreibt die Antwort auf Rumänisch, und die Nachricht geht in der Sprache des Kunden an den Kunden. Die Regeln sind im Code strikt — keine hinzugefügten Informationen, keine erfundenen Preise oder Fristen, kein Widerspruch zum Operator. Die umgekehrte Richtung, vom Kunden zum Operator, wird heute durch die Transkription von Sprachnachrichten gelöst; die automatische Übersetzung des Kundentextes zum Operator ist nicht überall aktiviert, und das sagen wir vorher, nicht nachher.

Welche Audioformate akzeptieren Sie und was bekomme ich zurück?

Das Format wird am Inhalt der Datei erkannt, nicht an der Erweiterung — WAV, OGG, MP3 und M4A werden ausdrücklich behandelt, und Sprachnachrichten aus Messaging-Kanälen kommen in der Regel als OGG an. Sie erhalten das Transkript, die Analyse, falls verlangt, und exportiertes Audio: WAV ohne Abhängigkeiten, FLAC und MP3, wenn `ffmpeg` auf dem Server vorhanden ist. Wenn nicht, sagt der Server das mit einem eigenen Code, statt allgemein zu scheitern.

Verwenden Sie unsere Aufnahmen, um Ihre Modelle zu trainieren?

Nein. Außerdem verwenden wir die Ausgabe von Sprachanbietern auch nicht, um ein konkurrierendes Modell zu trainieren oder zu testen — ihre Nutzungsbedingungen verbieten das ausdrücklich, und wir halten uns auch in unserer eigenen Forschungsrichtung daran, dort, wo es bequem gewesen wäre, es nicht zu tun.

Was passiert, wenn der Transkriptionsanbieter mitten in einer Sitzung ausfällt?

Die Sitzung wird mit einem Fehler beendet, der die Ursache nennt, nicht mit einem leeren Bildschirm. Für die Analyse gibt es im Code eine geordnete Liste von Ersatzmodellen, daher verschlechtert sich dort bei Nichtverfügbarkeit die Qualität, statt den Ablauf zu stoppen. Für die Spracherkennung in Echtzeit haben wir keine automatische Redundanz zwischen Anbietern, und das ist eine echte Grenze, keine Auslassung.

Worauf die obigen Aussagen beruhen (14 Quellen)
  1. Termenii furnizorului de voce interzic antrenarea sau testarea unui model concurent pe ieșirea lorhttps://elevenlabs.io/use-policy · 2026-09-06

13 davon sind Code und Dateien aus unseren Repositories. Wir veröffentlichen weder ihren Namen noch die Zeile: zusammen, auf einer einzigen Seite, würden sie zu genau beschreiben, wie Systeme gebaut sind, die nicht nur uns gehören. Wir gehen sie mit Ihnen durch, im Repository, auf Anfrage — die Überprüfung bleibt möglich, sie findet nur in einem Gespräch statt.

Was sollte bei Ihnen besser laufen?

Erzählen Sie uns von Ihrem Prozess. Gemeinsam legen wir fest, was sich zu bauen lohnt, was wir anbinden können und wie wir das Ergebnis prüfen.

Lassen Sie uns sprechen