Veri ve dil
Gerekli haklarla kullanılan ses materyalinin hazırlanması ve değerlendirilmesi.
Ses araştırması Cercetare & dezvoltare
Grai, ses sentezi ve burada kullanılan dillere uyarlanmış modeller için araştırma yönümüzdür. Telaffuz, ifade gücü ve ses modeli ile konuşma uygulamaları arasındaki bağlantı üzerinde çalışıyoruz.
Grai
Gerekli haklarla kullanılan ses materyalinin hazırlanması ve değerlendirilmesi.
Telaffuz, ritim ve ifade gücü için deneyler.
Modelin konuşma senaryolarındaki değerlendirilmesi ve API üzerinden erişim.
Yerel bağlamlar dahil konuşmanın telaffuzuna ve ritmine dikkat.
Rumence ve Rusça için araştırma ve değerlendirme.
Kallina ajan platformudur; Grai ise ses modelinin geliştirilmesine yönelik ayrı bir yöndür.
Araştırma aşamasında olan, sonuçları yinelemeli olarak değerlendirilen bir proje sunuyoruz. Bir modelin üretim için uygunluğu ayrıca doğrulanır.
Grai ayrıntıda
Grai, Rumence ses üzerine araştırma projemizdir. Bir ürün değildir, satın alınamaz ve denemek için bir butonu yoktur. Rumencenin mevcut ses sistemleri tarafından neden kötü hizmet gördüğünü ve daha iyi hizmet verilmesinin ne kadara mal olacağını anlamaya yönelik bir denemedir.
İncelediğimiz mimari kaskatlıdır, doğal ikili değildir: tanıma → dil modeli → sentez, üç ayrı bileşen. Tanıma ve sentez yerelde, işlemcide çalışır; dil modeli değiştirilebilirdir ve makinenin dışında, OpenAI uyumlu bir gateway'in arkasında durur. Seçim bilinçlidir ve ölçtüğümüz bir bedeli vardır.
Önemli ayrım: Grai sesi araştırır. Kallina sohbeti ve eylemleri düzenler. Voice Studio, entegre sağlayıcılarla ses dosyaları üretir. Bunlar üç farklı şeydir ve bunların içinde araştırma olan tek şey Grai'dir.
Protokol sabitlenmiş ve ilan edilmiştir: FLEURS test setinden dil başına 200 okuma, 20260831 tohumu ile eşit olasılıkla rastgele seçilmiştir, akış halinde cache farkındalığıyla çözülür — tüm dosya üzerinde çevrimdışı çözümleme değil, çünkü bu daha kolaydır ve daha güzel sayılar verir. 1120 ms varsayılan pencerede kendi sonucumuz: Rumencede %26,31 kelime hata oranı, Rusçada %9,30.
Her segmenti hesaplanan değil, gözlenen iki uçta ölçüyoruz. Yayınlanan dağılımda dil modeli açık ara en büyük parçadır: 2180 ms, buna karşılık 92 ms tanıma ve 305 ms sentez. Yararlı sonuç şudur ki, sesli bir konuşmada hız, tanımayı optimize ederek kazanılmaz — o zaten neredeyse ücretsizdir. Dil modelinde kazanılır.
Örneklemi sayılı ve sayısız okumalara ayırdık. Sayısız: %25,08 hata. Sayılı: %30,37. Beş puandan fazla fark, çalışmanın en yararlı gözlemidir; çünkü iş vakalarının yaşadığı yer tam da orasıdır — telefon numaraları, tutarlar, tarihler, sipariş numaraları. Düz yazıda iyi gelen bir sistem, bir siparişte kullanılmaz hale gelebilir.
Sabit bir sessizlik eşiği yaygın hatadır. Kendi ölçümümüzde sabit bir eşik 820 ms'de eşit hata oranına ulaşır; prozodide 560 ms'de. Doğru kesme oranı %52'dir — pratikte yazı tura, ve bunu söylüyoruz çünkü önerilen eğitimin başladığı nokta budur, övündüğümüz bir sonuç değil.
Romence için yedi korpusu envanterledim ve her biri için lisansı ile ticari kullanıma izin verip vermediğini not ettim. Pratik sonuç: Romence için en büyük kaynaklar ticari değildir, temiz yol ise CC0 altındaki VoxPopuli — 89 saat — artı hak devri ve biyometrik onamla tarafımızca kaydedilen sestir. Moldova Cumhuriyeti’nde 195/2024 sayılı Kanun, sesi biyometrik veri olarak ele alır ve 23 Ağustos 2026 tarihinden beri yürürlüktedir.
Veri ve çalışma
Keşiften uygulamaya
Dil, metin türü, hedef kitle, dinleme koşulları ve, en önemlisi, kronometrenin nerede başladığı. Pazardaki gecikme değerlerinin çoğu karşılaştırılabilir değildir, çünkü aynı konuşmanın farklı bölümlerini ölçerler.
Özel adlar, yerleşim yerleri, kısaltmalar ve zorunlu olarak sayılar. Rakamlarla söylenen ve söylenmeyen ifadeler arasındaki beş puandan büyük fark, yalnızca düz yazıdan oluşan bir test setinin bir iş vakası hakkında hiçbir şey söylememesinin nedenidir.
Her korpus için: kime ait olduğu, hangi lisansı taşıdığı, ticari kullanıma izin verip vermediği ve türetilmiş çalışmayı kapsayıp kapsamadığı. Kaydedilmiş ses için: biyometrik onam ve yazılı hak devri.
Romence doğrulukta büyük ticari sistemlerin gerisinde kalıyoruz. Bu, kendi sitemizdeki karşılaştırma tablosunda yazıyor; orada üçüncü taraf satırları beyan edilmiş, bizimkiler ise ölçülmüş olarak işaretlenmiş. Her zaman birinci çıktığınız bir karşılaştırma, kimsenin inanması gerekmeyen bir karşılaştırmadır.
Hayır. Halka açık demo yok, halka açık API yok, telefon entegrasyonu yok, yerel duplex yok ve ses klonlama üründe yok. Bu beşinin tamamı kendi yol haritamızda eksik olarak listelenmiştir. Şu anda çalışan bir ses ajanına ihtiyacınız varsa yanıt Kallina’dır, Grai değil; bir ses dosyasına ihtiyacınız varsa Voice Studio’dur.
Romence tanımada, varsayılan 1120 ms pencerede kelime hata oranı %26,31; %95 güven aralığı 24,07 ile 28,60 arasında; Rusçada %9,30. Protokol: FLEURS’ten dil başına 200 söyleyiş, 20260831 tohumu, akış halinde çözümleme. Ne kadar iyi olduğu: iyi değil. Karşılaştırma tablosunda yazılı kendi sonucumuz, Romence doğrulukta ticari sistemlerin gerisinde kaldığımız ve farkın beş ile dokuz kat arasında olduğu yönünde. Aynı yapılandırmayla Romence, Rusçadan neredeyse üç kat daha zor tanınıyor; bu da tam olarak incelediğimiz sorun.
Ölçülen dağılıma göre, dil modeli yoldan 2180 ms alıyor, tanıma 92 ms ve sentez 305 ms. Tanıma pratikte ücretsiz; sentez neredeyse aynı. Daha hızlı bir voice conversation isteyen, dil modeline saldırmalı — daha küçük modelle, yanıtın akış halinde verilmesiyle ya da yanıtların kısaltılmasıyla. Burada kendimize karşı da dürüst olmalıyız: sitede yayımlanan segment rakamları aynı ekranda yayımlanan toplamla toplanmıyor ve fark yaklaşık yarım saniye. Güvendiğimiz bölüm dağılımdır; yayımlanan toplam, alıntılanmadan önce yeniden hesaplanmalıdır.
Çünkü cascaded yapıda her bileşeni ayrı değiştirebilirsiniz ve tanıma ile sentezi GPU olmadan yerelde, işlemcide tutabilirsiniz. Bedeli zincirleme gecikme ve gecikmenin en büyük kısmı olan dil modelinin makinenin dışında kalmasıdır. Native duplex bir yönelimdir, sahip olduğumuz bir şey değil — „henüz yok“ listesindedir.
Yol haritası toplamda 1.200 doların altında üç eğitim öneriyor: Romence için VoxPopuli CC0 üzerinde tanıma, 89 saat, yaklaşık 50 saat H100, yaklaşık 500 dolar; Romence için bir turn-end detector, yaklaşık 2.000 kendi örneğimiz, 100 doların altında; kendi sesimiz, 500-800 dolar. Üçüncüsü para yüzünden değil, veri yüzünden bloke; ayrıca dayandığımız sentez modelinin yazarları tarafından arşivlenmiş olması nedeniyle. İlk eğitim için hedef rakam, yaklaşık %21, Yunanca ve Bulgarcada elde edilen iyileştirmelerden yapılan bir ekstrapolasyondur, bir ölçüm değil.
İncelenen yöntem, birkaç saniyeden klonlama değil, dondurulmuş ağırlıklar üzerinde ters optimizasyondur: ses başına 6-30 dakika materyal, yaklaşık 3.000 optimizasyon adımı, 2,6 GB tepe bellek, teslim edilen artefakt kilobayt mertebesindedir. Ancak üründe değildir ve bunun nedeninin yalnızca teknik bir mesele olmadığını söylemek önemlidir: Moldova Cumhuriyeti’nde ses, 23 Ağustos 2026’dan itibaren biyometrik veridir. Açık rıza ve devir olmadan soru bunun yapılıp yapılamayacağı değil, yapılmamasıdır.
Çünkü aksi halde bunları hiç yayımlamanın bir anlamı olmazdı. Sürekli birinci çıktığınız bir tablo, bir pazarlama tablosudur. Bizimki üçüncü taraf satırlarını beyan edilmiş, yalnızca kendi satırlarımızı ölçülmüş olarak işaretler ve altına yazılan sonuç kaybettiğimizi söyler. Yine de açıkça söylemek gerekir ki dışarıdan kimsenin yapamayacağı bir şey var: bu ölçümleri üreten kod kamuya açık değil ve siteye eşlik etmiyor; dolayısıyla rakamlar bugün bir üçüncü tarafça yeniden üretilemez. Bunları bağımsız doğrulanmış sonuçlar olarak değil, iç ölçümler olarak değerlendirin.
İllüstratif örnek
Müşteri verisi veya atfedilen ticari sonuçlar olmadan bir kullanım senaryosu.
Romence bir voice agent açılış konuşmasını iyi yönetir ve müşteri bir telefon numarası ya da bir tutar dikte ettiğinde tam orada hata yapar.
200 FLEURS söyleyişlik örneği ikiye ayırdık: rakamsız 163 ve rakamlı 37, ardından ayrı ayrı ölçtük.
25,08% hata oranı rakamsız, 30,37% rakamlarla — beş puanlık farkın üzerinde ve ham transkripsiyonda, normalizasyon olmadan, uçurum on bir puanın üzerine çıkıyor. Bu bir izlenim değil: tanımanın başarısız olduğu veri kısmı ve bir iş vakasının tam olarak buna dayanması.
Ce este necesar:Un set de test care conține efectiv partea grea. Un set format din proză curată nu ar fi arătat niciodată această diferență, iar sistemul ar fi părut mai bun decât e.
İş birliği olanakları
Kullanım hakları bulunan ve belgelenmiş bir amacı olan materyaller üzerinde transkripsiyon ve ses üretimi projeleri.
Gerçek bir süreç etrafında bir pilot tanımlıyoruz: kullanıcılar, veriler, entegrasyonlar, maliyetler ve kabul kriterleri. Sonucun değerlendirilmesinden sonra genişleme gelir.
Erişilebilirlik, barındırma, veri koruması ve birlikte çalışabilirlik gereksinimlerini belirliyoruz. AGE veya STISC hizmetleriyle herhangi bir bağlantı, uygunluk, erişim ve onayların doğrulanmasını gerektirir.
Bunlar uyarlama senaryolarıdır, mevcut sözleşmeler veya ortaklıklar hakkında beyanlar değildir. Önerilen işlevler projenin çalışma alanında doğrulanır.
Bir pilotu konuşalımÇağrı alan ve çağrı başlatan, işletmenin bilgisini kullanan ve sistemlerinizle çalışan ajanlar kuruyoruz.
PlatformăOrtak bir arayüz üzerinden yapay zekâ modellerine API erişimi.
PlatformăMetinden sese modelleriyle ses materyali üretmek, dinlemek ve indirmek için bir stüdyo.
Instrument specializatBize sürecinizi anlatın. Neyin kurulmaya değer olduğuna, neyi bağlayabileceğimize ve sonucu nasıl doğrulayacağımıza birlikte karar verelim.