Vai al contenuto
megapromotingParliamone
Prodotti Grai

Cercetare vocală Cercetare & dezvoltare

Una voce costruita per il modo in cui parliamo.

Grai è la nostra direzione di ricerca per la sintesi vocale e i modelli adattati alle lingue utilizzate qui. Lavoriamo sulla pronuncia, sull’espressività e sul legame tra il modello vocale e le applicazioni conversazionali.

  1. 1Date autorizate
  2. 2Model și evaluare
  3. 3Sinteză vocală
Schemă explicativă ·Grai

Grai

Dall’informazione al lavoro svolto.

01

Dati e lingua

La preparazione e la valutazione del materiale vocale utilizzato con i diritti necessari.

02

Model

Esperimenti per pronuncia, ritmo ed espressività.

03

Aplicație

La valutazione del modello in scenari conversazionali e l’accesso tramite API.

Dove diventa utile.

Română

Attenzione alla pronuncia e al ritmo del parlato, anche in contesti locali.

Esperimenti multilingue

Ricerca e valutazione per romeno e russo.

Agenti vocali

Kallina è la piattaforma di agenti; Grai è una direzione distinta di sviluppo del modello vocale.

Presentiamo un progetto di ricerca, con risultati che vengono valutati iterativamente. La disponibilità di un modello per la produzione viene confermata separatamente.

Grai in dettaglio

Cosa potete fare con questo progetto.

Grai è il nostro progetto di ricerca sulla voce in romeno. Non è un prodotto, non si può acquistare e non ha un pulsante per provarlo. È un tentativo di capire perché il romeno sia servito male dagli attuali sistemi vocali e quanto costerebbe servirlo meglio.

L’architettura che studiamo è in cascata, non duplex nativa: riconoscimento → modello di linguaggio → sintesi, tre componenti separate. Il riconoscimento e la sintesi girano in locale, sul processore; il modello di linguaggio è sostituibile e sta fuori dalla macchina, dietro un gateway compatibile con OpenAI. La scelta è deliberata e ha un costo che misuriamo.

La distinzione che conta: Grai esplora la voce. Kallina organizza la conversazione e le azioni. Voice Studio produce file audio con fornitori integrati. Sono tre cose diverse, e l’unica tra esse che è ricerca è Grai.

01

Ciò che studiamo: il riconoscimento in romeno, misurato su FLEURS

Il protocollo è fissato e dichiarato: 200 enunciati per lingua dal set di test FLEURS, scelti in modo uniforme e casuale con il seme 20260831, decodifica in streaming con awareness della cache — non decodifica offline sull’intero file, che è più semplice e produce cifre più belle. Il risultato proprio sulla finestra predefinita di 1120 ms: 26,31% di tasso di errore sulle parole in romeno, 9,30% in russo.

02

Dove va il tempo in una conversazione

Misuriamo ogni segmento con due capi osservati, non calcolati. Nella ripartizione pubblicata, il modello di linguaggio è di gran lunga la fetta più grande: 2180 ms, contro 92 ms di riconoscimento e 305 ms di sintesi. La conclusione utile è che, per una conversazione vocale, la velocità non si ottiene ottimizzando il riconoscimento — esso è già quasi gratuito. Si ottiene sul modello di linguaggio.

03

Le cifre si rompono esattamente dove si rompe anche la conversazione reale

Abbiamo diviso il campione in enunciati con cifre e senza. Senza cifre: 25,08% di errore. Con cifre: 30,37%. La differenza di oltre cinque punti è l’osservazione più utile dello studio, perché è proprio lì che vivono i casi business — numeri di telefono, importi, date, numeri d’ordine. Un sistema che suona bene sulla prosa può essere inutilizzabile su un ordine.

04

Il rilevamento della fine del turno, che è il vero problema dell’interruzione

Una soglia fissa di silenzio è l’errore abituale. Sulla nostra misurazione, una soglia fissa arriva all’errore uguale a 820 ms; sulla prosodia, a 560 ms. Il tasso di taglio corretto è 52% — praticamente una moneta lanciata, e lo diciamo perché è il punto da cui parte l’addestramento proposto, non un risultato di cui vantarci.

05

L’inventario dei dati, con le sue licenze

Abbiamo inventariato sette corpus per il romeno e abbiamo annotato per ciascuno la licenza e se consente l’uso commerciale. La conclusione pratica: le risorse più grandi per il romeno non sono commerciali, e la strada pulita resta VoxPopuli sotto CC0 — 89 ore — più voce registrata da noi, con cessione dei diritti e consenso biometrico. Nella Repubblica di Moldova, la Legge 195/2024 tratta la voce come dato biometrico ed è in vigore dal 23 agosto 2026.

Dati e funzionamento

Ciò che entra nel sistema. Ciò che deve essere verificato.

La voce è dato biometrico
Nella Repubblica di Moldova, la Legge 195/2024 è in vigore dal 23 agosto 2026 e inquadra la voce come dato biometrico. In pratica: una registrazione pubblica non autorizza l’uso dell’identità vocale di nessuno. Qualsiasi progetto che cloni una voce richiede consenso esplicito e cessione, non solo accesso al file.
Le licenze dei corpus decidono cosa si può costruire
Tra i sette corpus inventariati per il romeno, due dei più grandi sono esplicitamente non commerciali, e uno è chiuso dietro un gate di accesso. Un modello addestrato su dati non commerciali non può finire in un prodotto, indipendentemente da quanto bene suoni. Per questo l’inventario delle licenze viene fatto prima dell’addestramento, non dopo.
La componente di sintesi su cui si basa tutto è a fine vita
Il modello di sintesi usato in cascata è stato archiviato dai suoi autori: senza sviluppo e senza supporto ufficiale, e il loro strumento per costruire voci è stato chiuso il 31 agosto 2026. I pesi restano disponibili e il modello continua a funzionare localmente, ma non riceve più nulla. Questo sposta la sintesi propria da «forse più tardi» a percorso critico, ed è un cambio di piano che preferiamo dire piuttosto che nascondere.
Il set di valutazione non si mescola con quello di addestramento
È la regola elementare ed è la più spesso violata. Un confronto ha senso solo se conserva la versione del modello, il testo, il seme e il criterio. Il nostro studio nota che abbiamo commesso noi stessi un errore di misurazione sul nostro sito: una cifra di latenza di 455 ms avviava il cronometro dopo il riconoscimento, quindi misurava qualcosa di diverso da quanto suggeriva; la cifra reale era circa cinque volte più alta.

Dall’esplorazione all’implementazione

Come prepariamo un progetto con Grai.

01

Stabiliamo che cosa si misura, prima di misurare

La lingua, il tipo di testo, il pubblico, le condizioni di ascolto e, soprattutto, dove parte il cronometro. La maggior parte delle cifre di latenza sul mercato non è confrontabile perché misura segmenti diversi della stessa conversazione.

02

Costruiamo un set di test che contenga la parte difficile

Nomi propri, località, abbreviazioni e, obbligatoriamente, numeri. La differenza di oltre cinque punti tra le enunciazioni con cifre e quelle senza è il motivo per cui un set di test composto solo da prosa non dice nulla su un caso di business.

03

Verifichiamo la licenza prima di qualsiasi addestramento

Per ogni corpus: chi lo possiede, quale licenza porta, se consente l’uso commerciale e se copre il lavoro derivato. Per la voce registrata: consenso biometrico e cessione scritta.

04

Pubbliciamo anche il risultato che non ci conviene

In accuratezza in romeno perdiamo rispetto ai grandi sistemi commerciali. È scritto sul nostro stesso sito, nella tabella di confronto, dove le righe delle terze parti sono marcate come dichiarate e le nostre come misurate. Un confronto in cui si esce sempre primi è un confronto che nessuno dovrebbe credere.

Domande che meritano di essere chiarite.

Posso usare Grai in un progetto oggi?

No. Non esiste una demo pubblica, non esiste un’API pubblica, non esiste integrazione telefonica, non esiste duplex nativo e la clonazione vocale non è nel prodotto. Tutti e cinque sono elencati come assenti nella nostra stessa roadmap. Se vi serve un voice agent che funzioni adesso, la risposta è Kallina, non Grai; se vi serve un file audio, è Voice Studio.

Che cosa è stato misurato effettivamente e quanto è buono il risultato?

Nel riconoscimento in romeno, 26,31% di tasso di errore sulle parole sulla finestra predefinita di 1120 ms, con intervallo di confidenza 95% tra 24,07 e 28,60; in russo 9,30%. Protocollo: 200 enunciazioni per lingua da FLEURS, seme 20260831, decodifica in streaming. Quanto è buono: non è buono. La nostra conclusione, scritta nella tabella di confronto, è che in accuratezza in romeno perdiamo rispetto ai sistemi commerciali, con un fattore da cinque a nove. Il romeno è quasi tre volte più difficile da riconoscere del russo con la stessa configurazione, ed è proprio il problema che stiamo studiando.

Perché si perde tempo e dove si guadagnerebbe?

Nella scomposizione misurata, il modello di linguaggio prende 2180 ms del percorso, il riconoscimento 92 ms e la sintesi 305 ms. Il riconoscimento è praticamente gratuito; la sintesi quasi uguale. Chi vuole una conversazione vocale più veloce deve intervenire sul modello di linguaggio — con un modello più piccolo, con lo streaming della risposta o accorciando le risposte. Qui dobbiamo essere onesti anche con noi stessi: i numeri di segmento pubblicati sul sito non si sommano al totale pubblicato sullo stesso schermo, e la differenza è di circa mezzo secondo. La scomposizione è quella di cui ci fidiamo; il totale aggregato va ricalcolato prima di essere citato.

Perché un’architettura a cascata e non duplex nativo?

Perché in cascata si può cambiare ciascun componente separatamente e si possono tenere riconoscimento e sintesi in locale, sul processore, senza GPU. Il prezzo è la latenza di concatenazione e il fatto che il modello di linguaggio, che è la parte più grande del ritardo, sta fuori dalla macchina. Il duplex nativo è una direzione, non qualcosa che abbiamo — è nella lista di «non esiste ancora».

Quanto costerebbe per essere migliore?

La roadmap propone tre addestramenti sotto i 1.200 dollari in totale: riconoscimento per il romeno su VoxPopuli CC0, 89 ore, circa 50 ore di H100, intorno a 500 dollari; un rilevatore di fine turno per il romeno, circa 2.000 campioni propri, sotto 100 dollari; una voce propria, 500-800 dollari. Il terzo non è bloccato dai soldi, ma dai dati — e dal fatto che il modello di sintesi su cui ci basavamo è stato archiviato dai suoi autori. La cifra obiettivo per il primo addestramento, intorno al 21%, è un’extrapolazione dai miglioramenti ottenuti sul greco e sul bulgaro, non una misurazione.

Può riprodurre la voce di una persona?

Il metodo studiato è l’ottimizzazione inversa su pesi congelati, non la clonazione da pochi secondi: 6-30 minuti di materiale per voce, circa 3.000 passi di ottimizzazione, 2,6 GB di memoria di picco, con l’artefatto consegnato dell’ordine dei kilobyte. Ma non è nel prodotto, ed è importante dire perché non è solo una questione tecnica: nella Repubblica Moldova la voce è dato biometrico dal 23 agosto 2026. Senza consenso esplicito e cessione, la domanda non è se si possa, ma che non si fa.

Perché pubblicate cifre che vi mettono in cattiva luce?

Perché altrimenti non avrebbe senso pubblicarle affatto. Una tabella in cui risultate sempre primi è una tabella di marketing. La nostra marca le righe dei terzi come dichiarate e solo le nostre come misurate, e la conclusione scritta sotto dice che perdiamo. Bisogna però dire chiaramente anche ciò che nessuno dall’esterno può fare: il codice che ha prodotto queste misurazioni non è pubblico e non accompagna il sito, quindi i numeri non possono essere riprodotti da un terzo oggi. Trattateli come misurazioni interne, non come risultati verificati indipendentemente.

Esempio illustrativo

Perché un voice agent si inceppa proprio sul numero di telefono

Uno scenario di utilizzo, senza dati del cliente o risultati commerciali attribuiti.

Situazione iniziale

Un voice agent in romeno gestisce bene una conversazione di apertura e sbaglia proprio quando il cliente detta un numero di telefono o una somma.

Come funziona

Abbiamo diviso il campione di 200 enunciati FLEURS in due: 163 senza cifre e 37 con cifre, poi li abbiamo misurati separatamente.

Rezultatul

25,08% di tasso di errore senza cifre, 30,37% con cifre — oltre cinque punti di differenza, e sulla trascrizione grezza, senza normalizzazione, il divario cresce a oltre undici punti. Non è un’impressione: è la parte dei dati in cui il riconoscimento cede, ed è esattamente la parte da cui dipende un caso di business.

Ce este necesar:Un set de test care conține efectiv partea grea. Un set format din proză curată nu ar fi arătat niciodată această diferență, iar sistemul ar fi părut mai bun decât e.

Possibilità di collaborazione

Grai, nel contesto della vostra organizzazione.

Elaborazione del contenuto audio

Progetti di trascrizione e generazione vocale su materiali per i quali esistono diritti d’uso e un obiettivo documentato.

Imprese private

Definiamo un pilot attorno a un processo reale: utenti, dati, integrazioni, costi e criteri di accettazione. L’estensione segue dopo la valutazione del risultato.

Istituzioni e società statali

Stabiliamo i requisiti di accessibilità, hosting, protezione dei dati e interoperabilità. Ogni connessione con servizi AGE o STISC richiede la validazione dell’ammissibilità, dell’accesso e delle approvazioni.

Questi sono scenari di adattamento, non dichiarazioni su contratti o partenariati esistenti. Le funzioni proposte si confermano nell’ambito di lavoro del progetto.

Discută un pilot

Parte di un ecosistema.

Cosa vorresti che funzionasse meglio?

Raccontaci il tuo processo. Insieme stabiliamo cosa vale la pena costruire, cosa possiamo collegare e come verifichiamo il risultato.

Parliamone