Freya, Türkiye’nin ilk yerli açık kaynak Türkçe ses modelini yayınladı

183.2 milyon parametreye sahip FreyaTTS, güçlü bir ekran kartına ihtiyaç duymadan sıradan bir dizüstü bilgisayarın işlemcisinde gerçek zamanlı çalışabiliyor.

Freya, Türkiye’deki veri merkezlerinde sıfırdan eğitilen açık kaynak kodlu ilk yerli Türkçe ses modeli FreyaTTS’i tanıttı.

183.2 milyon parametreye sahip FreyaTTS, güçlü bir ekran kartına ihtiyaç duymadan sıradan bir dizüstü bilgisayarın işlemcisinde (CPU) bile gerçek zamanlı veya gerçek zamandan daha hızlı çalışabiliyor. Model, yazılı Türkçeyi önce ses birimlerine (fonem) ayırma adımını atlayarak 92 karakterlik Türkçe karakter setini doğrudan işleyip sese dönüştürüyor. Diffusion Transformer tabanlı yapısıyla bir cümleyi baştan sona 32 adımda üretiyor.

FreyaTTS, açık kaynak olarak yayımlanan 495 cümlelik test setinde %8 kelime hatası yaptı. Freya’nın paylaştığı verilere göre model, aynı testte %11.1 hata veren yaklaşık 470 milyon parametrelik XTTS-v2'nin ve %24.3 hata veren 336 milyon parametrelik F5-TTS’in önüne geçti. Anadili Türkçe olan 7 kişinin katıldığı dinleme testinde ise doğallık açısından kendi boyutundaki açık kaynaklı modellerden daha iyi performans gösterdi.

FreyaTTS, tek bir RTX 4090 ekran kartında sunucu modunda bir saniyede 65.2 saniyelik ses üreterek konuşmayı gerçek zamandan yaklaşık 65 kat hızlı sentezledi. Bu hız, 2 milyar parametreli VoxCPM2'nin 2.6 katına denk gelirken model belleğin yalnızca üçte birini kullandı. Modeli hiçbir dış sistemden ağırlık aktarmadan sıfırdan eğittiklerini belirten girişim, FreyaTTS’in Çin ya da ABD kaynaklı sistemler üzerine ince ayar yapmadan geliştirildiğini açıkladı.

Modelin geliştiricileri arasında; Ahmet Erdem Pamuk, Ömer Yentür, Tunga Bayrak, Yavuz Alp Sencer Öztürk ve Mustafa Yavuz’dan oluşan Freya ekibi yer aldı. Ekip, çalışmanın ayrıntılarını arXiv’de yayımladığı teknik raporda paylaştı. FreyaTTS’in eğitim ve çıkarım kodlarıyla kıyaslama seti de Apache-2.0 lisansıyla açık kaynak olarak yayınlandı.

LinkedIn hesabından yaptığı paylaşımla FreyaTTS’i duyuran Freya Kurucu Ortağı ve CEO’su Tunga Bayrak, “Dünyada sıfırdan foundational ses modeli üretebilen ülke sayısı 10'du. Bugün 11 oldu. Diffusion Transformer bazlı Freya TTS’i açık kaynak olarak yayınlamanın gururunu yaşıyoruz. Türkiye’nin ilk yerli, sıfırdan pre-train edilmiş açık kaynak foundational Türkçe ses modeli. Türkiye’deki veri merkezlerimizde, aylarca süren çalışmayla sıfırdan tasarlandı ve eğitildi. Hedefimiz net: ülkemizin yapay zekada dünyaya yön veren ilk 5 ülkeden biri olması.” dedi.

İlginizi çekebilir

© 2023 swipeline.co, Tüm Haklar Saklıdır.