Expertise · Transkription und Übersetzung
Sprache zu Text, auf Rumänisch und Russisch, mit vor der ersten Sekunde Audio aufgezeichneter Zustimmung.
Wir transkribieren Audio in Echtzeit oder aus einer Datei, übersetzen in Kundengesprächen zwischen Rumänisch und Russisch und liefern den Text mit Zeitmarken, Audio-Export und einer Spur der Zustimmung. Die Spracherkennung betreiben wir über Anbieter, über unser Gateway; das eigene Rumänisch-Modell ist Forschung, kein Produkt.
Bereits gebautDouă implementări proprii, ambele deschise și citate. Prima e o aplicație de transcriere în flux, cu backend Express de 3.378 de linii în 25 de fișiere și 37 de teste pe care le-am rulat azi — toate trec; ea conține partea pe care nimeni nu o construiește din entuziasm: o poartă de consimțământ care refuză captura când nu există acord înregistrat. A doua rulează în producție, la clienți reali: mesajele vocale primite pe canalele de mesagerie sunt transcrise, iar răspunsul scris de un operator în română este rescris în limba clientului înainte de a pleca. Ce NU intră în „delivered” și e scris ca atare în pagină: modelul propriu de recunoaștere și sinteză în română este cercetare — nu are demonstrație publică, nu are interfață de programare, iar pe acuratețe în română pierde față de sistemele comerciale mari. Serviciul se vinde pe ce rulează, nu pe ce studiem.
Transkription scheint ein gelöstes Problem zu sein, bis Sie sie auf Rumänisch anwenden, mit zwei Sprechern, die sich unterbrechen, schnell gesprochenen Zahlen und einem Kunden, der mitten im Satz ins Russische wechselt. Dann treten die drei echten Probleme auf: Welches Modell wählen Sie für die Sprache vor Ihnen, wie wissen Sie, wo ein Sprechabschnitt endet, und wer hat Ihnen erlaubt, aufzuzeichnen. Wir kümmern uns um alle drei, und das letzte behandeln wir als ein Codierungsproblem, nicht als einen Absatz in einer Richtlinie.
In unserer Streaming-Transkriptionsanwendung erhält der Browser niemals den Schlüssel des Anbieters. Er fordert vom Backend ein Einmal-Token an, standardmäßig 15 Minuten gültig, mit dem die Transkriptionsverbindung geöffnet wird; die Route, die das Token ausstellt, ist standardmäßig geschlossen und kann nur durch eine explizite Einstellung außerhalb der Produktion geöffnet werden, gerade weil es die Route ist, über die Geld verbraucht wird. Über die Rohtranskription läuft eine Analyse durch ein Sprachmodell mit einer Liste von Ausweichmodellen in Reihenfolge, damit die Nichtverfügbarkeit eines Modells die Sitzung nicht stoppt.
Das Zustimmungs-Gateway ist der Teil, den wir besonders pflegen. Bevor ein Stück Audio akzeptiert wird, fordert der Server einen nicht widerrufenen Zustimmungsdatensatz für die jeweilige Sitzung an. Wenn keiner vorhanden ist, antwortet er mit 451 und einer Nachricht auf Rumänisch. Wenn die Datenbank nicht antwortet, verweigert er alles — 503, nicht „durchlassen“. Bereits verifizierte Sitzungen laufen über einen Zehn-Minuten-Cache, damit ein kurzer Ausfall eine laufende Aufzeichnung nicht unterbricht. Es ist so geschrieben, dass es nicht durch einen Konfigurationsfehler umgangen werden kann.
Der Teil, der bereits bei Kunden läuft, ist ein anderer und weniger spektakulär: Auf Messaging-Kanälen wird eine eingehende Sprachnachricht zu Text, und die Sprache wird durch Abstimmung über die letzten acht Nachrichten der Unterhaltung ausgewählt, nicht durch Raten anhand des Audios. Umgekehrt wird, wenn ein Kollege auf Rumänisch antwortet, sein Text in die Sprache des Kunden mit strengen Anweisungen umgeschrieben — er fügt keine Informationen hinzu, erfindet keine Preise oder Fristen, widerspricht dem Operator nicht und behandelt den Text des Operators strikt als zu übertragende Daten, niemals als Anweisungen für das Modell.