CANLI
xAI, Imagine API’yi 2.0’a Yükseltmeye Hazırlanıyor: Görüntü ve Video Tek…·Microsoft MAI-Cyber-1-Flash’ı Duyurdu·Moonshot AI, Kimi K3 Model Ağırlıklarını ve Teknik Raporunu Açık…
24 Sep 2026 · 20:45 GMT+3
Ai Haber – Türkiyenin Yapay Zeka Haber Portalı
MODEL HABERLERI SAYI #2.683 24 Eyl 2026 · Perşembe ● SON DAKİKA

Google DeepMind Gemini 3.8 Flash TTS ve Flash-Lite TTS: doğal dil ile ses tasarımı

Google DeepMind, Gemini 3.8 Flash TTS ve Gemini 3.8 Flash-Lite TTS modellerini duyurdu.

AiHaber Editör
Editör
2DK

★ Hızlı Özet

  • Google DeepMind, Gemini 3.8 Flash TTS ve Gemini 3.8 Flash-Lite TTS modellerini duyurdu.
  • Flash ve Flash-Lite farkı Flash TTS derin yaratıcı yönlendirme ve karakter tasarımı için konumlandırılıyor: oyun, sesli kitap, podcast ve et…
  • Ses tasarımı, kopyalama ve sahne yönetimi Flash TTS ile 100’den fazla dil ve diyalektte rol, aksan ve ses karakteristiği doğal dil istemleri…
  • Güvenlik ve erişim Ses kopyalamada referans konuşmacıyla eşleşen sözlü onay kaydı isteniyor; üretilen tüm Gemini Audio klipleri SynthID ile …

Google DeepMind, Gemini 3.8 Flash TTS ve Gemini 3.8 Flash-Lite TTS modellerini duyurdu. Resmi yazıya göre bu modeller, sabit hazır seslerden çıkıp doğal dil istemleriyle özel karakter sesleri oluşturmayı ve sahne diyalogunu satır satır yönetmeyi hedefliyor. Erişim Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook ve Google Vids üzerinden genişletiliyor.

Flash ve Flash-Lite farkı

Flash TTS derin yaratıcı yönlendirme ve karakter tasarımı için konumlandırılıyor: oyun, sesli kitap, podcast ve etkileşimli medyada sıfırdan ses üretimi; aksan, tempo, diyalekt kayması ve backchanneling gibi ince kontroller. Flash-Lite TTS yüksek hacimli dublaj, ses içeriği üretimi ve ifade gücü olan ses ajanları için maliyet/ölçek odaklı. DeepMind, modellerin 3.5 Live Translate, 3.5 Transcribe, 3.8 Live ve 3.8 Live Extended Thinking gibi Gemini Audio ailesini tamamladığını belirtiyor.

Ses tasarımı, kopyalama ve sahne yönetimi

Flash TTS ile 100’den fazla dil ve diyalektte rol, aksan ve ses karakteristiği doğal dil istemleriyle tanımlanabiliyor. 2.000’den fazla üretime hazır ses kütüphanesi; 30 saniyelik örnekten tutarlı ses profili kopyalama (onay kaydı, SynthID filigranı ve C2PA kimlik bilgileriyle) listeleniyor. Her iki modelde satır satır performans yönlendirmesi, uzun formda ses kalitesini koruma ve tek betikten iki konuşmacılı sahne düzenleme vurgulanıyor. Hume AI Voice Design Benchmark’ta Flash TTS genel skorda 71,4 ile #1; Overall Quality Index’te Flash #1, Flash-Lite #2 gösteriliyor.

Güvenlik ve erişim

Ses kopyalamada referans konuşmacıyla eşleşen sözlü onay kaydı isteniyor; üretilen tüm Gemini Audio klipleri SynthID ile işaretleniyor. Flash TTS AI Studio, Gemini API ve Gemini Enterprise ile Notebook/Vids’te; Flash-Lite geliştiricilerde API/AI Studio’da, enterprise API yakında, herkese Google Vids’te sunuluyor. AI Studio üzerinden ses kopyalama Illinois, Texas, EEA, UK, İsviçre ve Hindistan’da kullanılamıyor.

Kaynak: Google DeepMind — Gemini 3.8 text-to-speech says hello

— Paylaş

Beğendiysen yay.

Yapay Zeka Sohbetlerinde
Sosyal Medyada

Tartışma

Bu habere emoji ile tepki ver

Hizli:

Henüz yorum yok. İlk yorumu siz yapın!

Yapıcı ve saygılı yorumlar bekliyoruz. Topluluk kuralları