Google DeepMind, Gemini 3.8 Flash TTS ve Gemini 3.8 Flash-Lite TTS modellerini duyurdu. Resmi yazıya göre bu modeller, sabit hazır seslerden çıkıp doğal dil istemleriyle özel karakter sesleri oluşturmayı ve sahne diyalogunu satır satır yönetmeyi hedefliyor. Erişim Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook ve Google Vids üzerinden genişletiliyor.
Flash ve Flash-Lite farkı
Flash TTS derin yaratıcı yönlendirme ve karakter tasarımı için konumlandırılıyor: oyun, sesli kitap, podcast ve etkileşimli medyada sıfırdan ses üretimi; aksan, tempo, diyalekt kayması ve backchanneling gibi ince kontroller. Flash-Lite TTS yüksek hacimli dublaj, ses içeriği üretimi ve ifade gücü olan ses ajanları için maliyet/ölçek odaklı. DeepMind, modellerin 3.5 Live Translate, 3.5 Transcribe, 3.8 Live ve 3.8 Live Extended Thinking gibi Gemini Audio ailesini tamamladığını belirtiyor.
Ses tasarımı, kopyalama ve sahne yönetimi
Flash TTS ile 100’den fazla dil ve diyalektte rol, aksan ve ses karakteristiği doğal dil istemleriyle tanımlanabiliyor. 2.000’den fazla üretime hazır ses kütüphanesi; 30 saniyelik örnekten tutarlı ses profili kopyalama (onay kaydı, SynthID filigranı ve C2PA kimlik bilgileriyle) listeleniyor. Her iki modelde satır satır performans yönlendirmesi, uzun formda ses kalitesini koruma ve tek betikten iki konuşmacılı sahne düzenleme vurgulanıyor. Hume AI Voice Design Benchmark’ta Flash TTS genel skorda 71,4 ile #1; Overall Quality Index’te Flash #1, Flash-Lite #2 gösteriliyor.
Güvenlik ve erişim
Ses kopyalamada referans konuşmacıyla eşleşen sözlü onay kaydı isteniyor; üretilen tüm Gemini Audio klipleri SynthID ile işaretleniyor. Flash TTS AI Studio, Gemini API ve Gemini Enterprise ile Notebook/Vids’te; Flash-Lite geliştiricilerde API/AI Studio’da, enterprise API yakında, herkese Google Vids’te sunuluyor. AI Studio üzerinden ses kopyalama Illinois, Texas, EEA, UK, İsviçre ve Hindistan’da kullanılamıyor.
Kaynak: Google DeepMind — Gemini 3.8 text-to-speech says hello
Henüz yorum yok. İlk yorumu siz yapın!