Données et langue
Préparation et évaluation du matériel vocal utilisé avec les droits nécessaires.
Recherche vocale Cercetare & dezvoltare
Grai est notre orientation de recherche pour la synthèse vocale et des modèles adaptés aux langues utilisées ici. Nous travaillons sur la prononciation, l’expressivité et le lien entre le modèle vocal et les applications conversationnelles.
Grai
Préparation et évaluation du matériel vocal utilisé avec les droits nécessaires.
Expériences sur la prononciation, le rythme et l’expressivité.
Évaluation du modèle dans des scénarios conversationnels et accès via API.
Attention à la prononciation et au rythme de la parole, y compris dans des contextes locaux.
Recherche et évaluation pour le roumain et le russe.
Kallina est la plateforme d’agents ; Grai est une direction distincte de développement du modèle vocal.
Nous présentons un projet de recherche, avec des résultats évalués de manière itérative. La disponibilité d’un modèle pour la production est confirmée séparément.
Grai en détail
Grai est notre projet de recherche sur la voix en roumain. Ce n’est pas un produit, il ne s’achète pas et il n’a pas de bouton pour l’essayer. C’est une tentative de comprendre pourquoi le roumain est mal servi par les systèmes vocaux existants et combien il en coûterait pour qu’il soit mieux servi.
L’architecture que nous étudions est en cascade, et non duplext native : reconnaissance → modèle de langage → synthèse, trois composants séparés. La reconnaissance et la synthèse s’exécutent localement, sur le processeur ; le modèle de langage est interchangeable et se trouve hors de la machine, derrière une passerelle compatible OpenAI. Le choix est délibéré et a un coût que nous mesurons.
La distinction qui compte : Grai explore la voix. Kallina organise la conversation et les actions. Voice Studio produit des fichiers audio avec des fournisseurs intégrés. Ce sont trois choses différentes, et la seule d’entre elles qui relève de la recherche est Grai.
Le protocole est fixé et déclaré : 200 énoncés par langue du jeu de test FLEURS, choisis uniformément au hasard avec la graine 20260831, décodage en flux avec prise en compte du cache — et non un décodage hors ligne sur le fichier entier, qui est plus facile et donne des chiffres plus flatteurs. Notre résultat propre sur la fenêtre par défaut de 1120 ms : 26,31 % de taux d’erreur sur les mots en roumain, 9,30 % en russe.
Nous mesurons chaque segment avec deux extrémités observées, et non calculées. Dans la décomposition publiée, le modèle de langage est de loin la plus grande part : 2180 ms, contre 92 ms de reconnaissance et 305 ms de synthèse. La conclusion utile est que, pour une conversation vocale, la vitesse ne se gagne pas en optimisant la reconnaissance — elle est déjà presque gratuite. Elle se gagne sur le modèle de langage.
Nous avons divisé l’échantillon en énoncés avec chiffres et sans chiffres. Sans chiffres : 25,08 % d’erreur. Avec chiffres : 30,37 %. La différence de plus de cinq points est l’observation la plus utile de l’étude, car c’est précisément là que vivent les cas métier — numéros de téléphone, montants, dates, numéros de commande. Un système qui sonne bien sur la prose peut être inutilisable sur une commande.
Un seuil fixe de silence est l’erreur habituelle. Sur notre mesure propre, un seuil fixe atteint une erreur égale à 820 ms ; sur la prosodie, à 560 ms. Le taux de coupure correcte est de 52 % — pratiquement pile ou face, et nous le disons parce que c’est le point de départ de l’entraînement proposé, pas un résultat dont nous nous vantons.
J’ai inventorié sept corpus pour le roumain et j’ai noté pour chacun la licence et s’il permet un usage commercial. La conclusion pratique : les plus grandes ressources pour le roumain sont non commerciales, et la voie propre reste VoxPopuli sous CC0 — 89 heures — plus une voix enregistrée par nous, avec cession des droits et consentement biométrique. En République de Moldavie, la Loi 195/2024 traite la voix comme une donnée biométrique et est en vigueur depuis le 23 août 2026.
Données et fonctionnement
De l'exploration à l'implémentation
La langue, le type de texte, le public, les conditions d’écoute et, surtout, où démarre le chronomètre. La plupart des chiffres de latence sur le marché ne sont pas comparables parce qu’ils mesurent des segments différents de la même conversation.
Noms propres, localités, abréviations et, obligatoirement, des chiffres. L’écart de plus de cinq points entre les énoncés avec chiffres et ceux sans chiffres est la raison pour laquelle un jeu de test composé uniquement de prose ne dit rien sur un cas d’affaires.
Pour chaque corpus : qui en est le propriétaire, quelle licence il porte, s’il permet un usage commercial et s’il couvre l’œuvre dérivée. Pour la voix enregistrée : consentement biométrique et cession écrite.
En précision en roumain, nous perdons face aux grands systèmes commerciaux. C’est écrit sur notre propre site, dans le tableau de comparaison, où les lignes des tiers sont marquées comme déclarées et les nôtres comme mesurées. Une comparaison dans laquelle vous arrivez toujours premier est une comparaison que personne ne devrait croire.
Non. Il n’existe pas de démonstration publique, il n’existe pas d’API publique, il n’existe pas d’intégration téléphonique, il n’existe pas de duplex natif et le clonage vocal n’est pas dans le produit. Les cinq sont indiqués comme absents dans notre propre feuille de route. Si vous avez besoin d’un agent vocal qui fonctionne maintenant, la réponse est Kallina, pas Grai ; si vous avez besoin d’un fichier audio, c’est Voice Studio.
En reconnaissance en roumain, 26,31 % de taux d’erreur sur les mots avec la fenêtre par défaut de 1120 ms, avec un intervalle de confiance de 95 % entre 24,07 et 28,60 ; en russe, 9,30 %. Protocole : 200 énoncés par langue issus de FLEURS, graine 20260831, décodage en flux. À quel point c’est bon : ce n’est pas bon. Notre propre conclusion, écrite dans le tableau de comparaison, est qu’en précision en roumain nous perdons face aux systèmes commerciaux, avec un facteur de cinq à neuf. Le roumain est presque trois fois plus difficile à reconnaître que le russe avec la même configuration, ce qui est précisément le problème que nous étudions.
Dans la décomposition mesurée, le modèle de langage prend 2180 ms du trajet, la reconnaissance 92 ms et la synthèse 305 ms. La reconnaissance est pratiquement gratuite ; la synthèse presque autant. Qui veut une conversation vocale plus rapide doit s’attaquer au modèle de langage — par un modèle plus petit, par le streaming de la réponse ou par le raccourcissement des réponses. Ici, nous devons aussi être honnêtes avec nous-mêmes : les chiffres de segment publiés sur le site ne s’additionnent pas au total publié sur le même écran, et l’écart est d’environ une demi-seconde. La décomposition est celle en laquelle nous avons confiance ; le total agrégé doit être recalculé avant d’être cité.
Parce qu’en cascade, vous pouvez changer chaque composant séparément et vous pouvez garder la reconnaissance et la synthèse en local, sur le processeur, sans GPU. Le prix, c’est la latence d’enchaînement et le fait que le modèle de langage, qui constitue la plus grande partie du retard, se trouve en dehors de la machine. Le duplex natif est une direction, pas quelque chose que nous avons — il est sur la liste des « n’existe pas encore ».
La feuille de route propose trois entraînements à moins de 1.200 dollars au total : reconnaissance pour le roumain sur VoxPopuli CC0, 89 heures, environ 50 heures de H100, autour de 500 dollars ; un détecteur de fin de tour pour le roumain, environ 2.000 exemples propres, moins de 100 dollars ; une voix propre, 500-800 dollars. Le troisième n’est pas bloqué par l’argent, mais par les données — et par le fait que le modèle de synthèse sur lequel nous nous appuyions a été archivé par ses auteurs. Le chiffre cible pour le premier entraînement, autour de 21 %, est une extrapolation des améliorations obtenues sur le grec et le bulgare, pas une mesure.
La méthode étudiée est une optimisation inverse sur des poids gelés, pas un clonage en quelques secondes : 6-30 minutes de matériau par voix, environ 3.000 pas d’optimisation, 2,6 GB de mémoire de pointe, l’artéfact livré étant de l’ordre du kilooctet. Mais ce n’est pas dans le produit, et il est important de dire pourquoi ce n’est pas seulement une question technique : en République de Moldova, la voix est une donnée biométrique depuis le 23 août 2026. Sans consentement explicite et cession, la question n’est pas de savoir si c’est possible, mais qu’il ne faut pas le faire.
Parce que sinon il n’aurait aucun sens de les publier du tout. Un tableau dans lequel vous arrivez toujours premier est un tableau de marketing. Le nôtre marque les lignes des tiers comme déclarées et seulement les nôtres comme mesurées, et la conclusion écrite dessous dit que nous perdons. Il faut toutefois dire clairement aussi ce qu’aucun externe ne peut faire : le code qui a produit ces mesures n’est pas public et n’accompagne pas le site, donc les chiffres ne peuvent pas être reproduits par un tiers aujourd’hui. Traitez-les comme des mesures internes, et non comme des résultats vérifiés indépendamment.
Exemple illustratif
Un scénario d’utilisation, sans données client ni résultats commerciaux attribués.
Un agent vocal en roumain gère bien une conversation d’ouverture et se trompe précisément lorsque le client dicte un numéro de téléphone ou une somme.
Nous avons réparti l’échantillon de 200 énoncés FLEURS en deux : 163 sans chiffres et 37 avec chiffres, puis nous avons mesuré séparément.
25,08 % taux d’erreur sans chiffres, 30,37 % avec chiffres — plus de cinq points d’écart, et sur la transcription brute, sans normalisation, l’écart dépasse onze points. Ce n’est pas une impression : c’est la partie des données où la reconnaissance cède, et c’est exactement la partie dont dépend un cas d’affaires.
Ce este necesar:Un set de test care conține efectiv partea grea. Un set format din proză curată nu ar fi arătat niciodată această diferență, iar sistemul ar fi părut mai bun decât e.
Possibilités de collaboration
Projets de transcription et de génération vocale sur des matériaux pour lesquels il existe des droits d’utilisation et une finalité documentée.
Nous définissons un pilote autour d’un processus réel : utilisateurs, données, intégrations, coûts et critères d’acceptation. L’extension suit après l’évaluation du résultat.
Nous établissons les exigences d’accessibilité, d’hébergement, de protection des données et d’interopérabilité. Toute connexion avec des services AGE ou STISC nécessite la validation de l’éligibilité, de l’accès et des approbations.
Ce sont des scénarios d’adaptation, non des déclarations sur des contrats ou partenariats existants. Les fonctions proposées sont confirmées dans le périmètre de travail du projet.
Discuter d'un piloteNous construisons des agents qui prennent et passent des appels, utilisent les informations de l'entreprise et travaillent avec vos systèmes.
PlatformăAccès API à des modèles IA par une interface commune.
PlatformăUn studio pour générer, écouter et télécharger des matériaux vocaux avec des modèles text-to-speech.
Instrument specializatRacontez-nous votre processus. Ensemble, nous décidons ce qui vaut la peine d'être construit, ce que nous pouvons connecter et comment nous vérifions le résultat.