Dati e lingua
La preparazione e la valutazione del materiale vocale utilizzato con i diritti necessari.
Cercetare vocală Cercetare & dezvoltare
Grai è la nostra direzione di ricerca per la sintesi vocale e i modelli adattati alle lingue utilizzate qui. Lavoriamo sulla pronuncia, sull’espressività e sul legame tra il modello vocale e le applicazioni conversazionali.
Grai
La preparazione e la valutazione del materiale vocale utilizzato con i diritti necessari.
Esperimenti per pronuncia, ritmo ed espressività.
La valutazione del modello in scenari conversazionali e l’accesso tramite API.
Attenzione alla pronuncia e al ritmo del parlato, anche in contesti locali.
Ricerca e valutazione per romeno e russo.
Kallina è la piattaforma di agenti; Grai è una direzione distinta di sviluppo del modello vocale.
Presentiamo un progetto di ricerca, con risultati che vengono valutati iterativamente. La disponibilità di un modello per la produzione viene confermata separatamente.
Grai in dettaglio
Grai è il nostro progetto di ricerca sulla voce in romeno. Non è un prodotto, non si può acquistare e non ha un pulsante per provarlo. È un tentativo di capire perché il romeno sia servito male dagli attuali sistemi vocali e quanto costerebbe servirlo meglio.
L’architettura che studiamo è in cascata, non duplex nativa: riconoscimento → modello di linguaggio → sintesi, tre componenti separate. Il riconoscimento e la sintesi girano in locale, sul processore; il modello di linguaggio è sostituibile e sta fuori dalla macchina, dietro un gateway compatibile con OpenAI. La scelta è deliberata e ha un costo che misuriamo.
La distinzione che conta: Grai esplora la voce. Kallina organizza la conversazione e le azioni. Voice Studio produce file audio con fornitori integrati. Sono tre cose diverse, e l’unica tra esse che è ricerca è Grai.
Il protocollo è fissato e dichiarato: 200 enunciati per lingua dal set di test FLEURS, scelti in modo uniforme e casuale con il seme 20260831, decodifica in streaming con awareness della cache — non decodifica offline sull’intero file, che è più semplice e produce cifre più belle. Il risultato proprio sulla finestra predefinita di 1120 ms: 26,31% di tasso di errore sulle parole in romeno, 9,30% in russo.
Misuriamo ogni segmento con due capi osservati, non calcolati. Nella ripartizione pubblicata, il modello di linguaggio è di gran lunga la fetta più grande: 2180 ms, contro 92 ms di riconoscimento e 305 ms di sintesi. La conclusione utile è che, per una conversazione vocale, la velocità non si ottiene ottimizzando il riconoscimento — esso è già quasi gratuito. Si ottiene sul modello di linguaggio.
Abbiamo diviso il campione in enunciati con cifre e senza. Senza cifre: 25,08% di errore. Con cifre: 30,37%. La differenza di oltre cinque punti è l’osservazione più utile dello studio, perché è proprio lì che vivono i casi business — numeri di telefono, importi, date, numeri d’ordine. Un sistema che suona bene sulla prosa può essere inutilizzabile su un ordine.
Una soglia fissa di silenzio è l’errore abituale. Sulla nostra misurazione, una soglia fissa arriva all’errore uguale a 820 ms; sulla prosodia, a 560 ms. Il tasso di taglio corretto è 52% — praticamente una moneta lanciata, e lo diciamo perché è il punto da cui parte l’addestramento proposto, non un risultato di cui vantarci.
Abbiamo inventariato sette corpus per il romeno e abbiamo annotato per ciascuno la licenza e se consente l’uso commerciale. La conclusione pratica: le risorse più grandi per il romeno non sono commerciali, e la strada pulita resta VoxPopuli sotto CC0 — 89 ore — più voce registrata da noi, con cessione dei diritti e consenso biometrico. Nella Repubblica di Moldova, la Legge 195/2024 tratta la voce come dato biometrico ed è in vigore dal 23 agosto 2026.
Dati e funzionamento
Dall’esplorazione all’implementazione
La lingua, il tipo di testo, il pubblico, le condizioni di ascolto e, soprattutto, dove parte il cronometro. La maggior parte delle cifre di latenza sul mercato non è confrontabile perché misura segmenti diversi della stessa conversazione.
Nomi propri, località, abbreviazioni e, obbligatoriamente, numeri. La differenza di oltre cinque punti tra le enunciazioni con cifre e quelle senza è il motivo per cui un set di test composto solo da prosa non dice nulla su un caso di business.
Per ogni corpus: chi lo possiede, quale licenza porta, se consente l’uso commerciale e se copre il lavoro derivato. Per la voce registrata: consenso biometrico e cessione scritta.
In accuratezza in romeno perdiamo rispetto ai grandi sistemi commerciali. È scritto sul nostro stesso sito, nella tabella di confronto, dove le righe delle terze parti sono marcate come dichiarate e le nostre come misurate. Un confronto in cui si esce sempre primi è un confronto che nessuno dovrebbe credere.
No. Non esiste una demo pubblica, non esiste un’API pubblica, non esiste integrazione telefonica, non esiste duplex nativo e la clonazione vocale non è nel prodotto. Tutti e cinque sono elencati come assenti nella nostra stessa roadmap. Se vi serve un voice agent che funzioni adesso, la risposta è Kallina, non Grai; se vi serve un file audio, è Voice Studio.
Nel riconoscimento in romeno, 26,31% di tasso di errore sulle parole sulla finestra predefinita di 1120 ms, con intervallo di confidenza 95% tra 24,07 e 28,60; in russo 9,30%. Protocollo: 200 enunciazioni per lingua da FLEURS, seme 20260831, decodifica in streaming. Quanto è buono: non è buono. La nostra conclusione, scritta nella tabella di confronto, è che in accuratezza in romeno perdiamo rispetto ai sistemi commerciali, con un fattore da cinque a nove. Il romeno è quasi tre volte più difficile da riconoscere del russo con la stessa configurazione, ed è proprio il problema che stiamo studiando.
Nella scomposizione misurata, il modello di linguaggio prende 2180 ms del percorso, il riconoscimento 92 ms e la sintesi 305 ms. Il riconoscimento è praticamente gratuito; la sintesi quasi uguale. Chi vuole una conversazione vocale più veloce deve intervenire sul modello di linguaggio — con un modello più piccolo, con lo streaming della risposta o accorciando le risposte. Qui dobbiamo essere onesti anche con noi stessi: i numeri di segmento pubblicati sul sito non si sommano al totale pubblicato sullo stesso schermo, e la differenza è di circa mezzo secondo. La scomposizione è quella di cui ci fidiamo; il totale aggregato va ricalcolato prima di essere citato.
Perché in cascata si può cambiare ciascun componente separatamente e si possono tenere riconoscimento e sintesi in locale, sul processore, senza GPU. Il prezzo è la latenza di concatenazione e il fatto che il modello di linguaggio, che è la parte più grande del ritardo, sta fuori dalla macchina. Il duplex nativo è una direzione, non qualcosa che abbiamo — è nella lista di «non esiste ancora».
La roadmap propone tre addestramenti sotto i 1.200 dollari in totale: riconoscimento per il romeno su VoxPopuli CC0, 89 ore, circa 50 ore di H100, intorno a 500 dollari; un rilevatore di fine turno per il romeno, circa 2.000 campioni propri, sotto 100 dollari; una voce propria, 500-800 dollari. Il terzo non è bloccato dai soldi, ma dai dati — e dal fatto che il modello di sintesi su cui ci basavamo è stato archiviato dai suoi autori. La cifra obiettivo per il primo addestramento, intorno al 21%, è un’extrapolazione dai miglioramenti ottenuti sul greco e sul bulgaro, non una misurazione.
Il metodo studiato è l’ottimizzazione inversa su pesi congelati, non la clonazione da pochi secondi: 6-30 minuti di materiale per voce, circa 3.000 passi di ottimizzazione, 2,6 GB di memoria di picco, con l’artefatto consegnato dell’ordine dei kilobyte. Ma non è nel prodotto, ed è importante dire perché non è solo una questione tecnica: nella Repubblica Moldova la voce è dato biometrico dal 23 agosto 2026. Senza consenso esplicito e cessione, la domanda non è se si possa, ma che non si fa.
Perché altrimenti non avrebbe senso pubblicarle affatto. Una tabella in cui risultate sempre primi è una tabella di marketing. La nostra marca le righe dei terzi come dichiarate e solo le nostre come misurate, e la conclusione scritta sotto dice che perdiamo. Bisogna però dire chiaramente anche ciò che nessuno dall’esterno può fare: il codice che ha prodotto queste misurazioni non è pubblico e non accompagna il sito, quindi i numeri non possono essere riprodotti da un terzo oggi. Trattateli come misurazioni interne, non come risultati verificati indipendentemente.
Esempio illustrativo
Uno scenario di utilizzo, senza dati del cliente o risultati commerciali attribuiti.
Un voice agent in romeno gestisce bene una conversazione di apertura e sbaglia proprio quando il cliente detta un numero di telefono o una somma.
Abbiamo diviso il campione di 200 enunciati FLEURS in due: 163 senza cifre e 37 con cifre, poi li abbiamo misurati separatamente.
25,08% di tasso di errore senza cifre, 30,37% con cifre — oltre cinque punti di differenza, e sulla trascrizione grezza, senza normalizzazione, il divario cresce a oltre undici punti. Non è un’impressione: è la parte dei dati in cui il riconoscimento cede, ed è esattamente la parte da cui dipende un caso di business.
Ce este necesar:Un set de test care conține efectiv partea grea. Un set format din proză curată nu ar fi arătat niciodată această diferență, iar sistemul ar fi părut mai bun decât e.
Possibilità di collaborazione
Progetti di trascrizione e generazione vocale su materiali per i quali esistono diritti d’uso e un obiettivo documentato.
Definiamo un pilot attorno a un processo reale: utenti, dati, integrazioni, costi e criteri di accettazione. L’estensione segue dopo la valutazione del risultato.
Stabiliamo i requisiti di accessibilità, hosting, protezione dei dati e interoperabilità. Ogni connessione con servizi AGE o STISC richiede la validazione dell’ammissibilità, dell’accesso e delle approvazioni.
Questi sono scenari di adattamento, non dichiarazioni su contratti o partenariati esistenti. Le funzioni proposte si confermano nell’ambito di lavoro del progetto.
Discută un pilotSviluppiamo agenti che rispondono e avviano chiamate, usano le informazioni dell'attività e lavorano con i vostri sistemi.
PlatformăAccesso API ai modelli AI tramite un’interfaccia comune.
PlatformăUno studio per la generazione, l’ascolto e il download di materiali vocali tramite modelli text-to-speech.
Instrument specializatRaccontaci il tuo processo. Insieme stabiliamo cosa vale la pena costruire, cosa possiamo collegare e come verifichiamo il risultato.