Zum Inhalt springen
megapromotingLassen Sie uns sprechen
Produkte Grai

Cercetare vocală Cercetare & dezvoltare

Eine Stimme, gebaut für die Art, wie wir sprechen.

Grai ist unsere Forschungsrichtung für Sprachsynthese und Modelle, die an die hier verwendeten Sprachen angepasst sind. Wir arbeiten an Aussprache, Ausdruck und der Verbindung zwischen dem Sprachmodell und den Konversationsanwendungen.

  1. 1Date autorizate
  2. 2Model și evaluare
  3. 3Sinteză vocală
Schemă explicativă ·Grai

Grai

Von der Information zur erledigten Arbeit.

01

Daten und Sprache

Aufbereitung und Bewertung des verwendeten Sprachmaterials mit den erforderlichen Rechten.

02

Model

Experimente zu Aussprache, Rhythmus und Ausdruckskraft.

03

Aplicație

Bewertung des Modells in Gesprächsszenarien und Zugriff per API.

Wo es nützlich wird.

Română

Aufmerksamkeit für Aussprache und Sprechrhythmus, auch in lokalen Kontexten.

Mehrsprachige Experimente

Forschung und Bewertung für Rumänisch und Russisch.

Sprachagenten

Kallina ist die Agentenplattform; Grai ist eine eigenständige Entwicklungsrichtung des Sprachmodells.

Wir präsentieren ein Forschungsprojekt mit Ergebnissen, die iterativ bewertet werden. Die Verfügbarkeit eines Modells für die Produktion wird separat bestätigt.

Grai im Detail

Was Sie mit diesem Projekt tun können.

Grai ist unser Forschungsprojekt zu rumänischer Sprache per Stimme. Es ist kein Produkt, nicht käuflich und hat keinen Button zum Ausprobieren. Es ist ein Versuch zu verstehen, warum Rumänisch von bestehenden Sprachsystemen schlecht bedient wird und wie viel es kosten würde, es besser zu bedienen.

Die Architektur, die wir untersuchen, ist kaskadiert, nicht nativ duplex: Spracherkennung → Sprachmodell → Synthese, drei getrennte Komponenten. Erkennung und Synthese laufen lokal, auf dem Prozessor; das Sprachmodell ist austauschbar und befindet sich außerhalb der Maschine, hinter einem OpenAI-kompatiblen Gateway. Die Wahl ist bewusst und hat einen Preis, den wir messen.

Die wichtige Unterscheidung: Grai untersucht Sprache. Kallina organisiert Gespräche und Aktionen. Voice Studio erzeugt Audiodateien mit integrierten Anbietern. Es sind drei verschiedene Dinge, und das einzige davon, das Forschung ist, ist Grai.

01

Was wir untersuchen: die Erkennung auf Rumänisch, gemessen auf FLEURS

Das Protokoll ist festgelegt und deklariert: 200 Äußerungen pro Sprache aus dem FLEURS-Testset, gleichmäßig zufällig mit dem Seed 20260831 ausgewählt, Streaming-Entschlüsselung mit Cache-Bewusstsein — nicht Offline-Entschlüsselung auf der ganzen Datei, die einfacher ist und schönere Zahlen liefert. Das eigene Ergebnis auf dem Standardfenster von 1120 ms: 26,31% Wortfehlerrate auf Rumänisch, 9,30% auf Russisch.

02

Wohin die Zeit in einem Gespräch geht

Wir messen jedes Segment mit zwei beobachteten Enden, nicht berechneten. Nach der veröffentlichten Aufschlüsselung ist das Sprachmodell mit Abstand der größte Anteil: 2180 ms, gegenüber 92 ms Erkennung und 305 ms Synthese. Die nützliche Schlussfolgerung ist, dass die Geschwindigkeit bei einem Sprachgespräch nicht durch die Optimierung der Erkennung gewonnen wird — sie ist ohnehin fast kostenlos. Sie wird beim Sprachmodell gewonnen.

03

Die Zahlen brechen genau dort auseinander, wo auch das echte Gespräch auseinanderbricht

Wir haben die Stichprobe in Äußerungen mit Ziffern und ohne aufgeteilt. Ohne Ziffern: 25,08% Fehler. Mit Ziffern: 30,37%. Der Unterschied von über fünf Punkten ist die nützlichste Beobachtung der Studie, denn genau dort liegen die Business-Fälle — Telefonnummern, Beträge, Daten, Bestellnummern. Ein System, das bei Prosa gut klingt, kann bei einer Bestellung unbrauchbar sein.

04

Die Erkennung des Gesprächsendes, die das eigentliche Problem der Unterbrechung ist

Eine feste Schweigeschwelle ist der übliche Fehler. Nach unserer eigenen Messung führt eine feste Schwelle bei 820 ms zu gleichem Fehler; bei Prosodie bei 560 ms. Die korrekte Abbruchrate liegt bei 52% — praktisch eine Münze, und wir sagen das, weil es der Punkt ist, von dem das vorgeschlagene Training ausgeht, nicht ein Ergebnis, mit dem wir prahlen.

05

Das Dateninventar, mit seinen Lizenzen

Wir haben sieben Korpora für Rumänisch inventarisiert und für jedes die Lizenz und ob kommerzielle Nutzung erlaubt ist, notiert. Die praktische Schlussfolgerung: Die größten Ressourcen für Rumänisch sind nicht kommerziell, und der saubere Weg bleibt VoxPopuli unter CC0 — 89 Stunden — plus von uns aufgezeichnete Stimme, mit Rechtsübertragung und biometrischer Einwilligung. In der Republik Moldau behandelt das Gesetz 195/2024 die Stimme als biometrische Daten und ist seit dem 23. August 2026 in Kraft.

Daten und Funktionsweise

Was in das System eingeht. Was geprüft werden muss.

Die Stimme ist biometrische Daten
In der Republik Moldau ist das Gesetz 195/2024 seit dem 23. August 2026 in Kraft und stuft die Stimme als biometrische Daten ein. Praktisch: Eine öffentliche Aufnahme autorisiert nicht die Nutzung der Stimmidentität von irgendjemandem. Jedes Projekt, das eine Stimme klont, erfordert ausdrückliche Einwilligung und Rechtsübertragung, nicht nur Zugriff auf die Datei.
Die Lizenzen der Korpora entscheiden, was gebaut werden kann
Von den sieben für Rumänisch inventarisierten Korpora sind zwei der größten ausdrücklich nicht kommerziell, und eines ist hinter einer Zugangsschranke geschlossen. Ein auf nicht kommerziellen Daten trainiertes Modell kann nicht in ein Produkt gelangen, ganz gleich, wie gut es klingt. Deshalb wird das Lizenzinventar vor dem Training erstellt, nicht danach.
Die Synthesekomponente, auf die sich alles stützt, ist am Ende ihrer Lebensdauer
Das in der Kaskade verwendete Synthesemodell wurde von seinen Autoren archiviert: ohne Entwicklung und ohne offiziellen Support, und ihr Werkzeug zum Erstellen von Stimmen wurde am 31. August 2026 geschlossen. Die Gewichte bleiben verfügbar und das Modell läuft weiterhin lokal, erhält aber nichts mehr. Dadurch rückt die eigene Synthese aus „vielleicht später“ in den kritischen Pfad, und das ist eine Planänderung, die wir lieber aussprechen, als sie zu verbergen.
Der Evaluationsdatensatz wird nicht mit dem Trainingsdatensatz vermischt
Das ist die grundlegende Regel und sie wird am häufigsten verletzt. Ein Vergleich ist nur sinnvoll, wenn Modellversion, Text, Seed und Kriterium gleich bleiben. Unsere Studie vermerkt, dass wir selbst auf unserer eigenen Website einen Messfehler gemacht haben: Eine Latenzzahl von 455 ms startete die Stoppuhr nach der Erkennung, maß also etwas anderes als angedeutet; der tatsächliche Wert war ungefähr fünfmal höher.

Von der Erkundung zur Implementierung

Wie wir ein Projekt mit Grai vorbereiten.

01

Wir legen fest, was genau gemessen wird, bevor wir messen

Die Sprache, die Textart, das Publikum, die Hörbedingungen und vor allem, wo die Stoppuhr startet. Die meisten Latenzzahlen auf dem Markt sind nicht vergleichbar, weil sie unterschiedliche Segmente desselben Gesprächs messen.

02

Wir bauen einen Testdatensatz, der den schweren Teil enthält

Eigennamen, Ortschaften, Abkürzungen und, obligatorisch, Zahlen. Der Unterschied von über fünf Punkten zwischen Äußerungen mit Zahlen und solchen ohne ist der Grund, warum ein Testdatensatz nur aus Prosa nichts über einen Geschäftsfall aussagt.

03

Wir prüfen die Lizenz vor jedem Training

Für jedes Korpus: wem es gehört, welche Lizenz es trägt, ob es die kommerzielle Nutzung erlaubt und ob es die abgeleitete Arbeit abdeckt. Für aufgezeichnete Stimme: biometrische Einwilligung und schriftliche Abtretung.

04

Wir veröffentlichen auch das Ergebnis, das uns nicht passt

Bei der Genauigkeit auf Rumänisch liegen wir hinter großen kommerziellen Systemen. Das steht auf unserer eigenen Website in der Vergleichstabelle, wo die Zeilen Dritter als angegeben und unsere als gemessen markiert sind. Ein Vergleich, bei dem Sie immer Erster sind, ist ein Vergleich, den niemand glauben sollte.

Fragen, die sich lohnen, geklärt zu werden.

Kann ich Grai heute in einem Projekt verwenden?

Nein. Es gibt keine öffentliche Demo, keine öffentliche API, keine Telefonie-Integration, kein natives Duplex und keine Stimmklonung im Produkt. Alle fünf sind in unserer eigenen Roadmap als fehlend aufgeführt. Wenn Sie einen Sprachagenten brauchen, der jetzt funktioniert, ist die Antwort Kallina, nicht Grai; wenn Sie eine Audiodatei brauchen, ist es Voice Studio.

Was wurde tatsächlich gemessen und wie gut ist das Ergebnis?

Bei der Erkennung auf Rumänisch 26,31% Wortfehlerrate auf dem standardmäßigen Fenster von 1120 ms, mit 95%-Konfidenzintervall zwischen 24,07 und 28,60; auf Russisch 9,30%. Protokoll: 200 Äußerungen pro Sprache aus FLEURS, Seed 20260831, Streaming-Dekodierung. Wie gut es ist: es ist nicht gut. Unsere eigene, in der Vergleichstabelle geschriebene Schlussfolgerung ist, dass wir bei der Genauigkeit auf Rumänisch hinter den kommerziellen Systemen zurückliegen, mit einem Faktor von fünf bis neun. Rumänisch ist mit derselben Konfiguration fast dreimal schwerer zu erkennen als Russisch, was genau das Problem ist, das wir untersuchen.

Warum geht Zeit verloren und wo ließe sie sich gewinnen?

Auf der gemessenen Aufschlüsselung nimmt das Sprachmodell 2180 ms des Ablaufs ein, die Erkennung 92 ms und die Synthese 305 ms. Die Erkennung ist praktisch kostenlos; die Synthese fast ebenso. Wer eine schnellere Sprachkonversation will, muss das Sprachmodell angreifen — durch ein kleineres Modell, durch Streaming der Antwort oder durch kürzere Antworten. Hier müssen wir auch mit uns selbst ehrlich sein: Die auf der Website veröffentlichten Segmentwerte addieren sich nicht zum auf demselben Bildschirm veröffentlichten Gesamtwert, und die Differenz beträgt etwa eine halbe Sekunde. Die Aufschlüsselung ist die, der wir vertrauen; der aggregierte Gesamtwert muss vor der Zitierung neu berechnet werden.

Warum eine Kaskadenarchitektur und nicht nativ Duplex?

Weil Sie in der Kaskade jede Komponente separat austauschen und Erkennung und Synthese lokal, auf dem Prozessor, ohne GPU, halten können. Der Preis ist die Verkettungslatenz und die Tatsache, dass das Sprachmodell, das den größten Teil der Verzögerung ausmacht, außerhalb des Geräts liegt. Natives Duplex ist eine Richtung, nichts, was wir haben — es steht auf der Liste von „gibt es noch nicht“.

Wie viel würde es kosten, besser zu sein?

Die Roadmap schlägt drei Trainingsläufe unter insgesamt 1.200 Dollar vor: Erkennung für Rumänisch auf VoxPopuli CC0, 89 Stunden, ungefähr 50 Stunden H100, rund 500 Dollar; ein End-of-Turn-Detektor für Rumänisch, etwa 2.000 eigene Beispiele, unter 100 Dollar; eine eigene Stimme, 500-800 Dollar. Das dritte ist nicht durch Geld blockiert, sondern durch Daten — und durch die Tatsache, dass das Synthesemodell, auf das wir uns gestützt haben, von seinen Autoren archiviert wurde. Die Zielzahl für das erste Training, etwa 21%, ist eine Extrapolation aus den auf Griechisch und Bulgarisch erzielten Verbesserungen, keine Messung.

Kann es die Stimme einer Person reproduzieren?

Die untersuchte Methode ist inverse Optimierung auf eingefrorenen Gewichten, keine Klonung aus wenigen Sekunden: 6–30 Minuten Material pro Stimme, etwa 3.000 Optimierungsschritte, 2,6 GB Spitzenspeicher, wobei das gelieferte Artefakt in der Größenordnung von Kilobyte liegt. Aber es ist nicht im Produkt, und es ist wichtig zu sagen, warum es nicht nur eine technische Frage ist: In der Republik Moldau ist die Stimme ab dem 23. August 2026 ein biometrisches Datum. Ohne ausdrückliche Einwilligung und Abtretung lautet die Frage nicht, ob es möglich ist, sondern dass es nicht gemacht wird.

Warum veröffentlichen Sie Zahlen, die Sie in ein schlechtes Licht stellen?

Weil es sonst keinen Sinn hätte, sie überhaupt zu veröffentlichen. Eine Tabelle, in der Sie immer Erster werden, ist eine Marketingtabelle. Unsere markiert die Zeilen Dritter als angegeben und nur unsere als gemessen, und die unter ihr geschriebene Schlussfolgerung sagt, dass wir verlieren. Es muss jedoch auch klar gesagt werden, was niemand von außen tun kann: Der Code, der diese Messungen erzeugt hat, ist nicht öffentlich und begleitet die Website nicht, daher können die Zahlen heute von einem Dritten nicht reproduziert werden. Behandeln Sie sie als interne Messungen, nicht als unabhängig verifizierte Ergebnisse.

Beispiel zur Veranschaulichung

Warum stolpert ein Sprachagent genau bei der Telefonnummer

Ein Nutzungsszenario, ohne Kundendaten oder zugeordnete kommerzielle Ergebnisse.

Ausgangssituation

Ein Sprachagent auf Rumänisch bewältigt eine eröffnende Unterhaltung gut und macht genau dann Fehler, wenn der Kunde eine Telefonnummer oder einen Betrag diktiert.

Wie es funktioniert

Wir haben die Stichprobe von 200 FLEURS-Äußerungen in zwei Teile geteilt: 163 ohne Ziffern und 37 mit Ziffern, dann separat gemessen.

Rezultatul

25,08% Fehlerrate ohne Ziffern, 30,37% mit Ziffern — über fünf Prozentpunkte Unterschied, und bei der Rohtranskription, ohne Normalisierung, wächst die Kluft auf über elf Punkte. Das ist kein Eindruck: Es ist der Teil der Daten, in dem die Erkennung versagt, und genau der Teil, von dem ein Business-Case abhängt.

Ce este necesar:Un set de test care conține efectiv partea grea. Un set format din proză curată nu ar fi arătat niciodată această diferență, iar sistemul ar fi părut mai bun decât e.

Möglichkeiten der Zusammenarbeit

Grai, im Kontext Ihrer Organisation.

Verarbeitung von Audioinhalten

Transkriptions- und Sprachgenerierungsprojekte auf Materialien, für die Nutzungsrechte und ein dokumentierter Zweck vorliegen.

Private Unternehmen

Wir definieren einen Pilot rund um einen realen Prozess: Nutzer, Daten, Integrationen, Kosten und Abnahmekriterien. Die Erweiterung erfolgt nach der Bewertung des Ergebnisses.

Institutionen und staatliche Unternehmen

Wir legen die Anforderungen an Zugänglichkeit, Hosting, Datenschutz und Interoperabilität fest. Jede Verbindung mit AGE- oder STISC-Diensten erfordert die Validierung der Berechtigung, des Zugriffs und der Genehmigungen.

Dies sind Anpassungsszenarien, keine Aussagen über bestehende Verträge oder Partnerschaften. Die vorgeschlagenen Funktionen werden im Arbeitsbereich des Projekts bestätigt.

Discută un pilot

Teil eines Ökosystems.

Was sollte bei Ihnen besser laufen?

Erzählen Sie uns von Ihrem Prozess. Gemeinsam legen wir fest, was sich zu bauen lohnt, was wir anbinden können und wie wir das Ergebnis prüfen.

Lassen Sie uns sprechen