antalia-1-foundation / README.tr.md
cloud0day3's picture
Upload README.tr.md with huggingface_hub
302c104 verified
|
Raw History Blame Contribute Delete
8.94 kB
metadata
language:
  - tr
license: openrail
license_name: antalia-openrail-m
license_link: LICENSE.md
library_name: antalia
pipeline_tag: text-to-speech
tags:
  - text-to-speech
  - turkish
  - flow-matching
  - rectified-flow
  - foundation-model
  - safetensors
datasets:
  - google/fleurs

Antalia 1 Foundation

Antalia 1'in arkasındaki, yalnızca açık veriyle sıfırdan eğitilmiş konuşmacıdan bağımsız Türkçe akustik model.

İnce ayarlı ses Dinle Kod Makale Külliyat Lisans

English: README.md

Geliştirme durduruldu. Başkaları https://github.com/0daycloud/antalia deposundaki kodla kendi izinli Türkçe seslerini ince ayarlayabilsin diye olduğu gibi yayımlandı. İletişim: sezgin@patientdesk.ai veya GitHub issues.

Bir bakışta

Nedir Antalia 1'in temel modeli: 24 kHz, 100 bantlı log-mel spektrogramlar üzerinde ~300 milyon parametreli, karakter koşullu bir düzeltilmiş akış modeli.
Konuşmacı Yok. Konuşmacı koşullaması bulunmaz; çıktının sesi Common Voice katkıcılarının belirsiz bir ortalamasıdır ve örnekleme tohumuyla değişir.
Boyut 299,6 milyon parametre, fp32 safetensors, 1,20 GB.
Eğitim verisi Common Voice 26.0 Türkçe (CC0) ve FLEURS Türkçe (CC-BY-4.0), 61.469 süzülmüş klip, 67,55 saat. Başka hiçbir şey.
Anlaşılırlık 120 istemlik turkish-v2 setinde tek tohumda CER 0,1835. Bir anlaşılırlık tabanı, ürün sesi değil.
Ne için Aşağıdaki referans zinciriyle yeni bir izinli Türkçe sese ince ayar yapmak için.
Lisans Ağırlıklar: Antalia OpenRAIL-M (LICENSE.md); modeli kullanan veya yeniden dağıtan her şeyde yazarlara atıf zorunludur. Kod: Apache-2.0.

Dinleyin

Her iki kayıt da konuşmacı kimliği 0 ile, yani koşulsuz yolla yapay zekâ tarafından üretilmiştir. İnce ayar aşamalarının ne kattığını duyabilmeniz için her biri ince ayarlı Antalia 1'in aynı cümlesiyle eşlenmiştir. Daha fazlası örnek sitesinde.

İstemKayıtlar
Sabah güneşi sessiz sokağın taşlarına yavaşça vuruyordu.
Genel
Temel model, koşulsuz

Antalia 1, 8'den en iyisi · CER 0,00 · Benz. 0,972
Size yardımcı olabilmem için randevu tarihini paylaşır mısınız?
Sesli asistan
Temel model, koşulsuz

Antalia 1, 8'den en iyisi · CER 0,00 · Benz. 0,959

Hızlı başlangıç

git clone https://github.com/0daycloud/antalia
cd antalia
uv sync            # veya: pip install -e .

# Vokoder: BigVGAN yeniden dağıtılmaz. Sabitlenmiş commit + tek satırlık hub yaması.
git clone https://github.com/NVIDIA/BigVGAN /opt/bigvgan
git -C /opt/bigvgan checkout 7d2b454564a6c7d014227f635b7423881f14bdac
patch -d /opt/bigvgan -p4 < scripts/patches/bigvgan-huggingface-hub-1.patch
export PYTHONPATH=/opt/bigvgan

python scripts/synthesize-crossflow.py \
  --checkpoint cloud0day3/antalia-1-foundation \
  --vocoder nvidia/bigvgan_v2_24khz_100band_256x \
  --sway -0.8 --steps 32 --mel-clamp 5.0 \
  --text "Bugün hava çok güzel, dışarıda yürüyüş yapmak istiyorum." \
  --output foundation.wav

Yeni bir sese ince ayar için configs/crossflow/ altındaki referans zincirini izleyin: foundation-speaker-v2.json → candidate-b-speaker-v1.json → cfg-foundation-v1.json → candidate-consistency-v1.json → candidate-b-timbre-adapter-v2.json. Bu zincirin üzerinde çalıştırıldığı ses külliyatı açıktır: antalia-voice-corpus (5,008 saat, CC-BY-4.0).

Eğitim verisi

Kaynak Kullanılan klip Lisans
Common Voice 26.0 Türkçe (doğrulanmış, süzülmüş) 59.593 CC0-1.0
FLEURS Türkçe 1.876 CC-BY-4.0

Toplam 61.469 klip / 67,55 saat. Süzme: zorunlu Türkçe Whisper-large-v3 transkript denetimi (kabul edilenlerde ortanca CER 0, p90 0,111), etkin ses, seviye, kırpılma ve SNR eşikleri, konuşmacı başına üst sınır, konuşmacı ayrık doğrulama bölümü. 120.407 doğrulanmış CV klibinden elenenler: 7.098 yetersiz etkin ses, 1.449 transkript uyumsuzluğu, 356 çok kısa, 351 düşük seviye, 5 düşük SNR, 4 kırpılma. Klip kimlikleri ve sağlama toplamlarını içeren süzgeç manifestleri kod deposunda; sesin kendisi yeniden barındırılmaz.

Eğitim

Sıfırdan başlatma; tek A100-80GB üzerinde 100.000 güncelleme; AdamW, 2.000 ısınma güncellemesiyle 1e-4'ten 1e-5'e azalan öğrenme oranı, ağırlık sönümü 0,01, gradyan kırpma 1,0, EMA 0,9999; yığın başına 6.000 mel karesi (≤32 örnek, klip başına ≤24 s); süre kaybı ağırlığı 0,1; 256 eğitim kaydı (89.966 kare) üzerinde ölçülen bant başına mel ortalama/standart sapma normalizasyonu, ±5'te kırpılmış. Bant başına normalizasyon olmadan yapılan iki önceki temel eğitim ıraksadı ve terk edildi.

Kalite

120 istemlik turkish-v2 setinde, tek tohum, 32 Euler adımı, rehberliksiz:

Ölçüt Temel model Antalia 1 (tek tohum)
CER ort. 0,1835 0,0528
CER p90 0,4049 0,1348
WER ort. 0,3952 0,1297

Bu, örneklenmiş sesli, konuşmacıdan bağımsız bir model için anlaşılırlık tabanıdır; tek başına ürün sesi olarak kullanılamaz.

Dosyalar

Dosya Amaç
model.safetensors EMA ağırlıkları, fp32, 299.623.013 parametre. SHA-256 89ecf310a14333c6bd5a754360cee2207027dd23b2a0171984a32c423afcfcd1
config.json antalia-crossflow-release-v1 yayın biçimi: mimari, mel istatistikleri, karakter sözlüğü, vokoder işaretçisi, köken bilgisi
LICENSE.md Antalia OpenRAIL-M

Vokoder: yükleyicinin indirdiği nvidia/bigvgan_v2_24khz_100band_256x (MIT).

Mimari

16 Transformer bloğu (boyut 768, 12 baş, SwiGLU FFN 3072); mel kareleri üzerinde öz dikkat, karakterler üzerinde çapraz dikkat ve akış zaman adımından sıfır başlatılmış adaLN modülasyonu; 4 bloklu ConvNeXt tarzı karakter kodlayıcı; skaler log toplam süre başlığı. Belirlenimci Türkçe metin normalleştirici; harf girdisi.

Kısıtlar

  • Koşulsuz ses kimliği rastgeledir ve tohumlar arasında kararsızdır.
  • Uzun girdiler süre başlığı tarafından eksik bütçelenir; cümle parçalama kullanın.
  • Sayılar, yabancı adlar ve kısaltmalar en yüksek hata oranlarına sahiptir.
  • Yalnızca Türkçe. Ezberleme denetimi yapılmadı.

Lisans ve kullanım

Ağırlıklar: Antalia Open RAIL-M (LICENSE.md): taklit yok, açıklanmamış sentetik konuşma yok, dolandırıcılık veya otomatik arama yok. Modelin veya türevlerinin her dağıtımı ile bunları kullanan her ürün, hizmet veya yayın, bu depoya ya da kod deposuna bağlantıyla birlikte Sezgin Saygili, Emre Kaplaner, Oncel Ozgul ve Fikri San Koktas (Patientdesk.ai) tarafından geliştirilen "Antalia 1"e atıfta bulunmalıdır. Kod: Apache-2.0.

Atıf

@misc{antalia1_2026,
  title  = {Antalia 1: An Open Turkish Text-to-Speech Model from a Rights-Clean Pipeline},
  author = {Saygili, Sezgin and Kaplaner, Emre and Ozgul, Oncel and Koktas, Fikri San},
  year   = {2026},
  note   = {Technical report},
  url    = {https://huggingface.co/cloud0day3/antalia-1-foundation}
}