Daten und Sprache
Aufbereitung und Bewertung des verwendeten Sprachmaterials mit den erforderlichen Rechten.
Cercetare vocală Cercetare & dezvoltare
Grai ist unsere Forschungsrichtung für Sprachsynthese und Modelle, die an die hier verwendeten Sprachen angepasst sind. Wir arbeiten an Aussprache, Ausdruck und der Verbindung zwischen dem Sprachmodell und den Konversationsanwendungen.
Grai
Aufbereitung und Bewertung des verwendeten Sprachmaterials mit den erforderlichen Rechten.
Experimente zu Aussprache, Rhythmus und Ausdruckskraft.
Bewertung des Modells in Gesprächsszenarien und Zugriff per API.
Aufmerksamkeit für Aussprache und Sprechrhythmus, auch in lokalen Kontexten.
Forschung und Bewertung für Rumänisch und Russisch.
Kallina ist die Agentenplattform; Grai ist eine eigenständige Entwicklungsrichtung des Sprachmodells.
Wir präsentieren ein Forschungsprojekt mit Ergebnissen, die iterativ bewertet werden. Die Verfügbarkeit eines Modells für die Produktion wird separat bestätigt.
Grai im Detail
Grai ist unser Forschungsprojekt zu rumänischer Sprache per Stimme. Es ist kein Produkt, nicht käuflich und hat keinen Button zum Ausprobieren. Es ist ein Versuch zu verstehen, warum Rumänisch von bestehenden Sprachsystemen schlecht bedient wird und wie viel es kosten würde, es besser zu bedienen.
Die Architektur, die wir untersuchen, ist kaskadiert, nicht nativ duplex: Spracherkennung → Sprachmodell → Synthese, drei getrennte Komponenten. Erkennung und Synthese laufen lokal, auf dem Prozessor; das Sprachmodell ist austauschbar und befindet sich außerhalb der Maschine, hinter einem OpenAI-kompatiblen Gateway. Die Wahl ist bewusst und hat einen Preis, den wir messen.
Die wichtige Unterscheidung: Grai untersucht Sprache. Kallina organisiert Gespräche und Aktionen. Voice Studio erzeugt Audiodateien mit integrierten Anbietern. Es sind drei verschiedene Dinge, und das einzige davon, das Forschung ist, ist Grai.
Das Protokoll ist festgelegt und deklariert: 200 Äußerungen pro Sprache aus dem FLEURS-Testset, gleichmäßig zufällig mit dem Seed 20260831 ausgewählt, Streaming-Entschlüsselung mit Cache-Bewusstsein — nicht Offline-Entschlüsselung auf der ganzen Datei, die einfacher ist und schönere Zahlen liefert. Das eigene Ergebnis auf dem Standardfenster von 1120 ms: 26,31% Wortfehlerrate auf Rumänisch, 9,30% auf Russisch.
Wir messen jedes Segment mit zwei beobachteten Enden, nicht berechneten. Nach der veröffentlichten Aufschlüsselung ist das Sprachmodell mit Abstand der größte Anteil: 2180 ms, gegenüber 92 ms Erkennung und 305 ms Synthese. Die nützliche Schlussfolgerung ist, dass die Geschwindigkeit bei einem Sprachgespräch nicht durch die Optimierung der Erkennung gewonnen wird — sie ist ohnehin fast kostenlos. Sie wird beim Sprachmodell gewonnen.
Wir haben die Stichprobe in Äußerungen mit Ziffern und ohne aufgeteilt. Ohne Ziffern: 25,08% Fehler. Mit Ziffern: 30,37%. Der Unterschied von über fünf Punkten ist die nützlichste Beobachtung der Studie, denn genau dort liegen die Business-Fälle — Telefonnummern, Beträge, Daten, Bestellnummern. Ein System, das bei Prosa gut klingt, kann bei einer Bestellung unbrauchbar sein.
Eine feste Schweigeschwelle ist der übliche Fehler. Nach unserer eigenen Messung führt eine feste Schwelle bei 820 ms zu gleichem Fehler; bei Prosodie bei 560 ms. Die korrekte Abbruchrate liegt bei 52% — praktisch eine Münze, und wir sagen das, weil es der Punkt ist, von dem das vorgeschlagene Training ausgeht, nicht ein Ergebnis, mit dem wir prahlen.
Wir haben sieben Korpora für Rumänisch inventarisiert und für jedes die Lizenz und ob kommerzielle Nutzung erlaubt ist, notiert. Die praktische Schlussfolgerung: Die größten Ressourcen für Rumänisch sind nicht kommerziell, und der saubere Weg bleibt VoxPopuli unter CC0 — 89 Stunden — plus von uns aufgezeichnete Stimme, mit Rechtsübertragung und biometrischer Einwilligung. In der Republik Moldau behandelt das Gesetz 195/2024 die Stimme als biometrische Daten und ist seit dem 23. August 2026 in Kraft.
Daten und Funktionsweise
Von der Erkundung zur Implementierung
Die Sprache, die Textart, das Publikum, die Hörbedingungen und vor allem, wo die Stoppuhr startet. Die meisten Latenzzahlen auf dem Markt sind nicht vergleichbar, weil sie unterschiedliche Segmente desselben Gesprächs messen.
Eigennamen, Ortschaften, Abkürzungen und, obligatorisch, Zahlen. Der Unterschied von über fünf Punkten zwischen Äußerungen mit Zahlen und solchen ohne ist der Grund, warum ein Testdatensatz nur aus Prosa nichts über einen Geschäftsfall aussagt.
Für jedes Korpus: wem es gehört, welche Lizenz es trägt, ob es die kommerzielle Nutzung erlaubt und ob es die abgeleitete Arbeit abdeckt. Für aufgezeichnete Stimme: biometrische Einwilligung und schriftliche Abtretung.
Bei der Genauigkeit auf Rumänisch liegen wir hinter großen kommerziellen Systemen. Das steht auf unserer eigenen Website in der Vergleichstabelle, wo die Zeilen Dritter als angegeben und unsere als gemessen markiert sind. Ein Vergleich, bei dem Sie immer Erster sind, ist ein Vergleich, den niemand glauben sollte.
Nein. Es gibt keine öffentliche Demo, keine öffentliche API, keine Telefonie-Integration, kein natives Duplex und keine Stimmklonung im Produkt. Alle fünf sind in unserer eigenen Roadmap als fehlend aufgeführt. Wenn Sie einen Sprachagenten brauchen, der jetzt funktioniert, ist die Antwort Kallina, nicht Grai; wenn Sie eine Audiodatei brauchen, ist es Voice Studio.
Bei der Erkennung auf Rumänisch 26,31% Wortfehlerrate auf dem standardmäßigen Fenster von 1120 ms, mit 95%-Konfidenzintervall zwischen 24,07 und 28,60; auf Russisch 9,30%. Protokoll: 200 Äußerungen pro Sprache aus FLEURS, Seed 20260831, Streaming-Dekodierung. Wie gut es ist: es ist nicht gut. Unsere eigene, in der Vergleichstabelle geschriebene Schlussfolgerung ist, dass wir bei der Genauigkeit auf Rumänisch hinter den kommerziellen Systemen zurückliegen, mit einem Faktor von fünf bis neun. Rumänisch ist mit derselben Konfiguration fast dreimal schwerer zu erkennen als Russisch, was genau das Problem ist, das wir untersuchen.
Auf der gemessenen Aufschlüsselung nimmt das Sprachmodell 2180 ms des Ablaufs ein, die Erkennung 92 ms und die Synthese 305 ms. Die Erkennung ist praktisch kostenlos; die Synthese fast ebenso. Wer eine schnellere Sprachkonversation will, muss das Sprachmodell angreifen — durch ein kleineres Modell, durch Streaming der Antwort oder durch kürzere Antworten. Hier müssen wir auch mit uns selbst ehrlich sein: Die auf der Website veröffentlichten Segmentwerte addieren sich nicht zum auf demselben Bildschirm veröffentlichten Gesamtwert, und die Differenz beträgt etwa eine halbe Sekunde. Die Aufschlüsselung ist die, der wir vertrauen; der aggregierte Gesamtwert muss vor der Zitierung neu berechnet werden.
Weil Sie in der Kaskade jede Komponente separat austauschen und Erkennung und Synthese lokal, auf dem Prozessor, ohne GPU, halten können. Der Preis ist die Verkettungslatenz und die Tatsache, dass das Sprachmodell, das den größten Teil der Verzögerung ausmacht, außerhalb des Geräts liegt. Natives Duplex ist eine Richtung, nichts, was wir haben — es steht auf der Liste von „gibt es noch nicht“.
Die Roadmap schlägt drei Trainingsläufe unter insgesamt 1.200 Dollar vor: Erkennung für Rumänisch auf VoxPopuli CC0, 89 Stunden, ungefähr 50 Stunden H100, rund 500 Dollar; ein End-of-Turn-Detektor für Rumänisch, etwa 2.000 eigene Beispiele, unter 100 Dollar; eine eigene Stimme, 500-800 Dollar. Das dritte ist nicht durch Geld blockiert, sondern durch Daten — und durch die Tatsache, dass das Synthesemodell, auf das wir uns gestützt haben, von seinen Autoren archiviert wurde. Die Zielzahl für das erste Training, etwa 21%, ist eine Extrapolation aus den auf Griechisch und Bulgarisch erzielten Verbesserungen, keine Messung.
Die untersuchte Methode ist inverse Optimierung auf eingefrorenen Gewichten, keine Klonung aus wenigen Sekunden: 6–30 Minuten Material pro Stimme, etwa 3.000 Optimierungsschritte, 2,6 GB Spitzenspeicher, wobei das gelieferte Artefakt in der Größenordnung von Kilobyte liegt. Aber es ist nicht im Produkt, und es ist wichtig zu sagen, warum es nicht nur eine technische Frage ist: In der Republik Moldau ist die Stimme ab dem 23. August 2026 ein biometrisches Datum. Ohne ausdrückliche Einwilligung und Abtretung lautet die Frage nicht, ob es möglich ist, sondern dass es nicht gemacht wird.
Weil es sonst keinen Sinn hätte, sie überhaupt zu veröffentlichen. Eine Tabelle, in der Sie immer Erster werden, ist eine Marketingtabelle. Unsere markiert die Zeilen Dritter als angegeben und nur unsere als gemessen, und die unter ihr geschriebene Schlussfolgerung sagt, dass wir verlieren. Es muss jedoch auch klar gesagt werden, was niemand von außen tun kann: Der Code, der diese Messungen erzeugt hat, ist nicht öffentlich und begleitet die Website nicht, daher können die Zahlen heute von einem Dritten nicht reproduziert werden. Behandeln Sie sie als interne Messungen, nicht als unabhängig verifizierte Ergebnisse.
Beispiel zur Veranschaulichung
Ein Nutzungsszenario, ohne Kundendaten oder zugeordnete kommerzielle Ergebnisse.
Ein Sprachagent auf Rumänisch bewältigt eine eröffnende Unterhaltung gut und macht genau dann Fehler, wenn der Kunde eine Telefonnummer oder einen Betrag diktiert.
Wir haben die Stichprobe von 200 FLEURS-Äußerungen in zwei Teile geteilt: 163 ohne Ziffern und 37 mit Ziffern, dann separat gemessen.
25,08% Fehlerrate ohne Ziffern, 30,37% mit Ziffern — über fünf Prozentpunkte Unterschied, und bei der Rohtranskription, ohne Normalisierung, wächst die Kluft auf über elf Punkte. Das ist kein Eindruck: Es ist der Teil der Daten, in dem die Erkennung versagt, und genau der Teil, von dem ein Business-Case abhängt.
Ce este necesar:Un set de test care conține efectiv partea grea. Un set format din proză curată nu ar fi arătat niciodată această diferență, iar sistemul ar fi părut mai bun decât e.
Möglichkeiten der Zusammenarbeit
Transkriptions- und Sprachgenerierungsprojekte auf Materialien, für die Nutzungsrechte und ein dokumentierter Zweck vorliegen.
Wir definieren einen Pilot rund um einen realen Prozess: Nutzer, Daten, Integrationen, Kosten und Abnahmekriterien. Die Erweiterung erfolgt nach der Bewertung des Ergebnisses.
Wir legen die Anforderungen an Zugänglichkeit, Hosting, Datenschutz und Interoperabilität fest. Jede Verbindung mit AGE- oder STISC-Diensten erfordert die Validierung der Berechtigung, des Zugriffs und der Genehmigungen.
Dies sind Anpassungsszenarien, keine Aussagen über bestehende Verträge oder Partnerschaften. Die vorgeschlagenen Funktionen werden im Arbeitsbereich des Projekts bestätigt.
Discută un pilotWir entwickeln Agenten, die Anrufe annehmen und tätigen, die Informationen des Unternehmens nutzen und mit Ihren Systemen arbeiten.
PlatformăAPI-Zugriff auf KI-Modelle über eine gemeinsame Schnittstelle.
PlatformăEin Studio zur Generierung, zum Anhören und Herunterladen von Sprachmaterialien über Text-to-Speech-Modelle.
Instrument specializatErzählen Sie uns von Ihrem Prozess. Gemeinsam legen wir fest, was sich zu bauen lohnt, was wir anbinden können und wie wir das Ergebnis prüfen.