İçeriğe atla
megapromotingHadi konuşalım
Ürünler Grai

Ses araştırması Cercetare & dezvoltare

Konuşma biçimimize göre kurulmuş bir ses.

Grai, ses sentezi ve burada kullanılan dillere uyarlanmış modeller için araştırma yönümüzdür. Telaffuz, ifade gücü ve ses modeli ile konuşma uygulamaları arasındaki bağlantı üzerinde çalışıyoruz.

  1. 1Date autorizate
  2. 2Model și evaluare
  3. 3Sinteză vocală
Schemă explicativă ·Grai

Grai

Bilgiden yapılmış işe.

01

Veri ve dil

Gerekli haklarla kullanılan ses materyalinin hazırlanması ve değerlendirilmesi.

02

Model

Telaffuz, ritim ve ifade gücü için deneyler.

03

Aplicație

Modelin konuşma senaryolarındaki değerlendirilmesi ve API üzerinden erişim.

Nerede faydalı olur.

Română

Yerel bağlamlar dahil konuşmanın telaffuzuna ve ritmine dikkat.

Çok dilli deneyler

Rumence ve Rusça için araştırma ve değerlendirme.

Sesli ajanlar

Kallina ajan platformudur; Grai ise ses modelinin geliştirilmesine yönelik ayrı bir yöndür.

Araştırma aşamasında olan, sonuçları yinelemeli olarak değerlendirilen bir proje sunuyoruz. Bir modelin üretim için uygunluğu ayrıca doğrulanır.

Grai ayrıntıda

Bu proje ile neler yapabilirsiniz.

Grai, Rumence ses üzerine araştırma projemizdir. Bir ürün değildir, satın alınamaz ve denemek için bir butonu yoktur. Rumencenin mevcut ses sistemleri tarafından neden kötü hizmet gördüğünü ve daha iyi hizmet verilmesinin ne kadara mal olacağını anlamaya yönelik bir denemedir.

İncelediğimiz mimari kaskatlıdır, doğal ikili değildir: tanıma → dil modeli → sentez, üç ayrı bileşen. Tanıma ve sentez yerelde, işlemcide çalışır; dil modeli değiştirilebilirdir ve makinenin dışında, OpenAI uyumlu bir gateway'in arkasında durur. Seçim bilinçlidir ve ölçtüğümüz bir bedeli vardır.

Önemli ayrım: Grai sesi araştırır. Kallina sohbeti ve eylemleri düzenler. Voice Studio, entegre sağlayıcılarla ses dosyaları üretir. Bunlar üç farklı şeydir ve bunların içinde araştırma olan tek şey Grai'dir.

01

Ne araştırıyoruz: FLEURS üzerinde ölçülen Rumence tanıma

Protokol sabitlenmiş ve ilan edilmiştir: FLEURS test setinden dil başına 200 okuma, 20260831 tohumu ile eşit olasılıkla rastgele seçilmiştir, akış halinde cache farkındalığıyla çözülür — tüm dosya üzerinde çevrimdışı çözümleme değil, çünkü bu daha kolaydır ve daha güzel sayılar verir. 1120 ms varsayılan pencerede kendi sonucumuz: Rumencede %26,31 kelime hata oranı, Rusçada %9,30.

02

Bir konuşmada zaman nereye gidiyor

Her segmenti hesaplanan değil, gözlenen iki uçta ölçüyoruz. Yayınlanan dağılımda dil modeli açık ara en büyük parçadır: 2180 ms, buna karşılık 92 ms tanıma ve 305 ms sentez. Yararlı sonuç şudur ki, sesli bir konuşmada hız, tanımayı optimize ederek kazanılmaz — o zaten neredeyse ücretsizdir. Dil modelinde kazanılır.

03

Sayılar, gerçek konuşmanın da bozulduğu yerde tam olarak bozulur

Örneklemi sayılı ve sayısız okumalara ayırdık. Sayısız: %25,08 hata. Sayılı: %30,37. Beş puandan fazla fark, çalışmanın en yararlı gözlemidir; çünkü iş vakalarının yaşadığı yer tam da orasıdır — telefon numaraları, tutarlar, tarihler, sipariş numaraları. Düz yazıda iyi gelen bir sistem, bir siparişte kullanılmaz hale gelebilir.

04

Söz sırası sonunun algılanması, kesintinin gerçek sorunu

Sabit bir sessizlik eşiği yaygın hatadır. Kendi ölçümümüzde sabit bir eşik 820 ms'de eşit hata oranına ulaşır; prozodide 560 ms'de. Doğru kesme oranı %52'dir — pratikte yazı tura, ve bunu söylüyoruz çünkü önerilen eğitimin başladığı nokta budur, övündüğümüz bir sonuç değil.

05

Veri envanteri, lisanslarıyla birlikte

Romence için yedi korpusu envanterledim ve her biri için lisansı ile ticari kullanıma izin verip vermediğini not ettim. Pratik sonuç: Romence için en büyük kaynaklar ticari değildir, temiz yol ise CC0 altındaki VoxPopuli — 89 saat — artı hak devri ve biyometrik onamla tarafımızca kaydedilen sestir. Moldova Cumhuriyeti’nde 195/2024 sayılı Kanun, sesi biyometrik veri olarak ele alır ve 23 Ağustos 2026 tarihinden beri yürürlüktedir.

Veri ve çalışma

Sisteme ne girer. Ne doğrulanmalıdır.

Ses biyometrik veridir
Moldova Cumhuriyeti’nde 195/2024 sayılı Kanun 23 Ağustos 2026 tarihinden beri yürürlüktedir ve sesi biyometrik veri olarak sınıflandırır. Pratikte: kamuya açık bir kayıt, kimsenin ses kimliğinin kullanılmasını yetkilendirmez. Bir sesi kopyalayan her proje, yalnızca dosyaya erişim değil, açık onam ve hak devri gerektirir.
Korpus lisansları ne inşa edilebileceğini belirler
Romence için envanterlenen yedi korpusun içinden en büyük olanlardan ikisi açıkça ticari değildir ve biri erişim kapısının arkasında kapalıdır. Ticari olmayan verilerle eğitilen bir model, ne kadar iyi ses çıkarsa çıksın, bir ürüne dönüşemez. Bu nedenle lisans envanteri, eğitimden önce yapılır, sonra değil.
Üzerinde her şeyin dayandığı sentez bileşeni ömür sonuna geldi
Kaskadda kullanılan sentez modeli yazarları tarafından arşivlendi: geliştirme yok ve resmî destek yok, ayrıca ses oluşturma araçları 31 Ağustos 2026 tarihinde kapatıldı. Ağırlıklar hâlâ kullanılabilir ve model yerelde çalışmaya devam ediyor, ancak artık hiçbir şey almıyor. Bu, kendi sentezimizi “belki sonra”dan kritik yola taşıyor ve bunu saklamaktansa söylemeyi tercih ettiğimiz bir plan değişikliği.
Değerlendirme kümesi eğitim kümesiyle karıştırılmaz
Bu temel bir kuraldır ve en sık ihlal edilen de budur. Bir karşılaştırma, ancak model sürümünü, metni, tohumu ve ölçütü koruyorsa anlamlıdır. Çalışmamız, kendi sitemizde ölçüm hatası yaptığımızı not eder: 455 ms’lik bir gecikme değeri kronometreyi tanımadan sonra başlatıyordu, yani ima ettiğinden farklı bir şeyi ölçüyordu; gerçek değer yaklaşık beş kat daha yüksekti.

Keşiften uygulamaya

Grai ile bir proje nasıl hazırlanır.

01

Ölçmeden önce neyin ölçüldüğünü belirleriz

Dil, metin türü, hedef kitle, dinleme koşulları ve, en önemlisi, kronometrenin nerede başladığı. Pazardaki gecikme değerlerinin çoğu karşılaştırılabilir değildir, çünkü aynı konuşmanın farklı bölümlerini ölçerler.

02

Zor kısmı içeren bir test seti kurarız

Özel adlar, yerleşim yerleri, kısaltmalar ve zorunlu olarak sayılar. Rakamlarla söylenen ve söylenmeyen ifadeler arasındaki beş puandan büyük fark, yalnızca düz yazıdan oluşan bir test setinin bir iş vakası hakkında hiçbir şey söylememesinin nedenidir.

03

Her türlü eğitimden önce lisansı doğrularız

Her korpus için: kime ait olduğu, hangi lisansı taşıdığı, ticari kullanıma izin verip vermediği ve türetilmiş çalışmayı kapsayıp kapsamadığı. Kaydedilmiş ses için: biyometrik onam ve yazılı hak devri.

04

Bizim hoşumuza gitmeyen sonucu da yayımlarız

Romence doğrulukta büyük ticari sistemlerin gerisinde kalıyoruz. Bu, kendi sitemizdeki karşılaştırma tablosunda yazıyor; orada üçüncü taraf satırları beyan edilmiş, bizimkiler ise ölçülmüş olarak işaretlenmiş. Her zaman birinci çıktığınız bir karşılaştırma, kimsenin inanması gerekmeyen bir karşılaştırmadır.

Netleştirilmesi gereken sorular.

Grai’yi bugün bir projede kullanabilir miyim?

Hayır. Halka açık demo yok, halka açık API yok, telefon entegrasyonu yok, yerel duplex yok ve ses klonlama üründe yok. Bu beşinin tamamı kendi yol haritamızda eksik olarak listelenmiştir. Şu anda çalışan bir ses ajanına ihtiyacınız varsa yanıt Kallina’dır, Grai değil; bir ses dosyasına ihtiyacınız varsa Voice Studio’dur.

Gerçekte ne ölçüldü ve sonuç ne kadar iyi?

Romence tanımada, varsayılan 1120 ms pencerede kelime hata oranı %26,31; %95 güven aralığı 24,07 ile 28,60 arasında; Rusçada %9,30. Protokol: FLEURS’ten dil başına 200 söyleyiş, 20260831 tohumu, akış halinde çözümleme. Ne kadar iyi olduğu: iyi değil. Karşılaştırma tablosunda yazılı kendi sonucumuz, Romence doğrulukta ticari sistemlerin gerisinde kaldığımız ve farkın beş ile dokuz kat arasında olduğu yönünde. Aynı yapılandırmayla Romence, Rusçadan neredeyse üç kat daha zor tanınıyor; bu da tam olarak incelediğimiz sorun.

Zaman nerede kaybediliyor ve nerede kazanılabilir?

Ölçülen dağılıma göre, dil modeli yoldan 2180 ms alıyor, tanıma 92 ms ve sentez 305 ms. Tanıma pratikte ücretsiz; sentez neredeyse aynı. Daha hızlı bir voice conversation isteyen, dil modeline saldırmalı — daha küçük modelle, yanıtın akış halinde verilmesiyle ya da yanıtların kısaltılmasıyla. Burada kendimize karşı da dürüst olmalıyız: sitede yayımlanan segment rakamları aynı ekranda yayımlanan toplamla toplanmıyor ve fark yaklaşık yarım saniye. Güvendiğimiz bölüm dağılımdır; yayımlanan toplam, alıntılanmadan önce yeniden hesaplanmalıdır.

Neden native duplex yerine cascaded architecture?

Çünkü cascaded yapıda her bileşeni ayrı değiştirebilirsiniz ve tanıma ile sentezi GPU olmadan yerelde, işlemcide tutabilirsiniz. Bedeli zincirleme gecikme ve gecikmenin en büyük kısmı olan dil modelinin makinenin dışında kalmasıdır. Native duplex bir yönelimdir, sahip olduğumuz bir şey değil — „henüz yok“ listesindedir.

Daha iyi olması için ne kadar harcanır?

Yol haritası toplamda 1.200 doların altında üç eğitim öneriyor: Romence için VoxPopuli CC0 üzerinde tanıma, 89 saat, yaklaşık 50 saat H100, yaklaşık 500 dolar; Romence için bir turn-end detector, yaklaşık 2.000 kendi örneğimiz, 100 doların altında; kendi sesimiz, 500-800 dolar. Üçüncüsü para yüzünden değil, veri yüzünden bloke; ayrıca dayandığımız sentez modelinin yazarları tarafından arşivlenmiş olması nedeniyle. İlk eğitim için hedef rakam, yaklaşık %21, Yunanca ve Bulgarcada elde edilen iyileştirmelerden yapılan bir ekstrapolasyondur, bir ölçüm değil.

Bir kişinin sesini yeniden üretebilir mi?

İncelenen yöntem, birkaç saniyeden klonlama değil, dondurulmuş ağırlıklar üzerinde ters optimizasyondur: ses başına 6-30 dakika materyal, yaklaşık 3.000 optimizasyon adımı, 2,6 GB tepe bellek, teslim edilen artefakt kilobayt mertebesindedir. Ancak üründe değildir ve bunun nedeninin yalnızca teknik bir mesele olmadığını söylemek önemlidir: Moldova Cumhuriyeti’nde ses, 23 Ağustos 2026’dan itibaren biyometrik veridir. Açık rıza ve devir olmadan soru bunun yapılıp yapılamayacağı değil, yapılmamasıdır.

Neden sizi kötü gösteren rakamları yayımlıyorsunuz?

Çünkü aksi halde bunları hiç yayımlamanın bir anlamı olmazdı. Sürekli birinci çıktığınız bir tablo, bir pazarlama tablosudur. Bizimki üçüncü taraf satırlarını beyan edilmiş, yalnızca kendi satırlarımızı ölçülmüş olarak işaretler ve altına yazılan sonuç kaybettiğimizi söyler. Yine de açıkça söylemek gerekir ki dışarıdan kimsenin yapamayacağı bir şey var: bu ölçümleri üreten kod kamuya açık değil ve siteye eşlik etmiyor; dolayısıyla rakamlar bugün bir üçüncü tarafça yeniden üretilemez. Bunları bağımsız doğrulanmış sonuçlar olarak değil, iç ölçümler olarak değerlendirin.

İllüstratif örnek

Bir voice agent neden tam telefon numarasında takılır

Müşteri verisi veya atfedilen ticari sonuçlar olmadan bir kullanım senaryosu.

İlk durum

Romence bir voice agent açılış konuşmasını iyi yönetir ve müşteri bir telefon numarası ya da bir tutar dikte ettiğinde tam orada hata yapar.

Nasıl çalışır

200 FLEURS söyleyişlik örneği ikiye ayırdık: rakamsız 163 ve rakamlı 37, ardından ayrı ayrı ölçtük.

Rezultatul

25,08% hata oranı rakamsız, 30,37% rakamlarla — beş puanlık farkın üzerinde ve ham transkripsiyonda, normalizasyon olmadan, uçurum on bir puanın üzerine çıkıyor. Bu bir izlenim değil: tanımanın başarısız olduğu veri kısmı ve bir iş vakasının tam olarak buna dayanması.

Ce este necesar:Un set de test care conține efectiv partea grea. Un set format din proză curată nu ar fi arătat niciodată această diferență, iar sistemul ar fi părut mai bun decât e.

İş birliği olanakları

Grai, kuruluşunuz bağlamında.

Ses içeriğinin işlenmesi

Kullanım hakları bulunan ve belgelenmiş bir amacı olan materyaller üzerinde transkripsiyon ve ses üretimi projeleri.

Özel şirketler

Gerçek bir süreç etrafında bir pilot tanımlıyoruz: kullanıcılar, veriler, entegrasyonlar, maliyetler ve kabul kriterleri. Sonucun değerlendirilmesinden sonra genişleme gelir.

Kamu kurumları ve şirketleri

Erişilebilirlik, barındırma, veri koruması ve birlikte çalışabilirlik gereksinimlerini belirliyoruz. AGE veya STISC hizmetleriyle herhangi bir bağlantı, uygunluk, erişim ve onayların doğrulanmasını gerektirir.

Bunlar uyarlama senaryolarıdır, mevcut sözleşmeler veya ortaklıklar hakkında beyanlar değildir. Önerilen işlevler projenin çalışma alanında doğrulanır.

Bir pilotu konuşalım

Bir ekosistemin parçası.

Neyin daha iyi çalışmasını isterdiniz?

Bize sürecinizi anlatın. Neyin kurulmaya değer olduğuna, neyi bağlayabileceğimize ve sonucu nasıl doğrulayacağımıza birlikte karar verelim.

Hadi konuşalım