CANLI
xAI, Imagine API’yi 2.0’a Yükseltmeye Hazırlanıyor: Görüntü ve Video Tek…·Microsoft MAI-Cyber-1-Flash’ı Duyurdu·Moonshot AI, Kimi K3 Model Ağırlıklarını ve Teknik Raporunu Açık…
24 Sep 2026 · 20:03 GMT+3
Ai Haber – Türkiyenin Yapay Zeka Haber Portalı
ÇIN TEKNOLOJISI SAYI #2.683 24 Eyl 2026 · Perşembe

Qwen-Audio-3.1: ASR, TTS, Realtime yükseltmesi; TTS-Next ve ASR-Next

Alibaba’nın Qwen ekibi, 23 Eylül 2026 civarında Qwen-Audio-3.1 ses modeli ailesini duyurdu.

AiHaber Editör
Editör
5DK 8OKUMA

★ Hızlı Özet

  • Alibaba’nın Qwen ekibi, 23 Eylül 2026 civarında Qwen-Audio-3.1 ses modeli ailesini duyurdu.
  • ASR ve ASR-Next: tanıma ile ses anlama Alibaba Cloud Model Studio belgelerine göre qwen-audio-3.1-asr-flash, kısa konuşma tanıma için tasarl…
  • The Decoder ve aibase haberlerine göre ASR tarafında çok dilli/lehçe tanıma güçlendi; yerel parlatma dolgu sözcükleri ve tekrarları otomatik…
  • TTS ve TTS-Next: sentezden AudioGen’e Resmi Qwen-Audio-3.1-TTS teknik sayfasına göre model, 12,5 Hz düşük kare hızında konuşma tokenizer’ı v…

Alibaba’nın Qwen ekibi, 23 Eylül 2026 civarında Qwen-Audio-3.1 ses modeli ailesini duyurdu. Üç temel hat — konuşma tanıma (ASR), metinden konuşma (TTS) ve gerçek zamanlı etkileşim (Realtime) — yükseltildi; buna ek olarak ses üretimi için TTS-Next ve ses anlama için ASR-Next eklendi. Toplam beş model, anlama–üretim–etkileşim–yaratma yığınını kapsıyor. Qwen’e göre TTS yaklaşık yüzde 70, Realtime yaklaşık yüzde 85, ASR ise yüzde 95’e varan oranlarda ucuzladı.

ASR ve ASR-Next: tanıma ile ses anlama

Alibaba Cloud Model Studio belgelerine göre qwen-audio-3.1-asr-flash, kısa konuşma tanıma için tasarlanmış; çok dilli ve Çin bölgesel lehçe tanımayı, bağlam güçlendirmeyi, noktalama ve metin normalleştirmeyi, kontrol edilebilir ASR/AST çıktısını, yerel (native) deşifre/parlatma ile endüstriyel çok kişili rol bazlı deşifreyi destekliyor. QwenCloud üzerindeki qwen-audio-3.1-asr-flash-filetrans varyantı toplantı deşifresi, içerik üretimi ve çağrı analizi gibi çevrimdışı senaryolar için konumlandırılıyor; konuşmacı ayrımı, sıcak kelime/bağlam güçlendirme ve gürültülü ortamlarda kararlılık vurgulanıyor.

The Decoder ve aibase haberlerine göre ASR tarafında çok dilli/lehçe tanıma güçlendi; yerel parlatma dolgu sözcükleri ve tekrarları otomatik temizleyerek daha temiz deşifre üretiyor. Yeni ASR-Next, çok konuşmacılı ASR’de konuşmacı etiketleri, zaman damgaları ve hizalı deşifre sunuyor; duygu, ortam ve makine seslerini anlayarak ses betimleme, olay konumlama ile ses soru–yanıt/akıl yürütme hedefliyor.

TTS ve TTS-Next: sentezden AudioGen’e

Resmi Qwen-Audio-3.1-TTS teknik sayfasına göre model, 12,5 Hz düşük kare hızında konuşma tokenizer’ı ve beş aşamalı eğitim paradigması kullanıyor; serbest doğal dil talimatları ile rol, duygu, stil, hız, tını ve aksanı kontrol ediyor, 86 ince taneli satır içi etiketle ifade geçişleri ve gülme/nefes gibi sözel olmayan olaylara izin veriyor. 16 dil (yedisi yeni) ve 20 Çin lehçe bölgesi; tek geçişte yaklaşık 3 dakikaya kadar uzun form sentez; gürültülü/yankılı referanslara karşı dayanıklılık ve 48 kHz çıkış için vokoder süper çözünürlük belirtiliyor. Sayfada Artificial Analysis Text-to-Speech Leaderboard’da birinci sırada olduğu da yer alıyor.

Model Studio’daki qwen-audio-3.1-tts-next, klasik TTS’in ötesinde bir AudioGen modeli: metin, zaman damgası ve referans ses girdilerinden tek geçişte insan sesi, ses efektleri ve ortam sesini birleştiriyor. Desteklenen diller Çince ve İngilizce; çıktı WAV/MP3/PCM (akışsız); en fazla 3.000 karakter girdi; podcast’te istek başına en fazla 240 saniye, diğer senaryolarda 120 saniye; en fazla 3 referans klip (her biri ≤30 sn, ≤10 MB; WAV/MP3/OGG Opus). qwen-audio-3.1-tts-flash ise düşük gecikmeli akışlı sentez, talimat takibi ve duygu/ton/kişilik/hız/ses düzeyi etiket kontrolü için konumlandırılıyor.

Realtime: tam çift yönlü konuşma

QwenCloud’daki qwen-audio-3.1-realtime-plus, yeni nesil tam çift yönlü (full-duplex) ses modeli olarak tanımlanıyor; konuşma dili muhakemesi, çok turlu talimat takibi, empatik iletişim, gürültüye dayanıklılık, çok partili konuşma ve gerçek zamanlı bağlam ile kesinti/sıra alma vurgulanıyor. Çok dilli sohbet ve araç kullanımı (bilgi tabanı, iş sistemleri) destekleniyor. Model Studio notuna göre metin ve ses girdi/çıktı, function calling, web araması ve ses klonlama mevcut; varsayılan ses longanqian_v3.1; bağlam penceresi 262.144 token. Qwen/The Decoder aktarımına göre aynı anda konuşup dinleyebiliyor, her an kesilebiliyor; düşük ruh hali algılandığında tempo yavaşlayıp daha empatik yanıt verebiliyor.

Test sonuçları, erişim ve entegrasyonlar

aibase’in aktardığı açıklamaya göre ASR tek modelde 30 dili ve 16 Çin lehçesini destekliyor; akışlı tanımada ilk kelime yanıt süresi yaklaşık 160 milisaniye. Rol bazlı deşifrede konuşmacı etiketi, zaman damgası ve metin birlikte çıkıyor. Testlerde ASR, açık kaynak lehçe test setlerinde ortalama yüzde 4,55, Qwen’in kendi Çin lehçesi setinde ortalama yüzde 10,38 karakter hata oranı (CER) elde etti; lehçeden standart Mandarin’e çeviride ortalama anlamsal cümle doğruluğu yüzde 82,10 oldu. Dört test setindeki sekiz metrikte ASR-Flash-Next beşinde, ASR-Flash üçünde birinci sıraya yerleşti ve önceki Fun-ASR kademeli sistemini geride bıraktı.

Realtime modeli çok öğretmenli damıtma (multi-teacher distillation) mimarisiyle tam çift yönlü etkileşim sağlıyor; konuşma sırasında dil değiştirme, duygu anlama ve araç çağırma destekleniyor. Realtime şu anda Qoder ve Qwen Office gibi ajanlara ve Qwen AI gözlüğü gibi akıllı donanımlara entegre. API’ler Qwen AI platformunda yayında; ASR-Next API’si ise yakında açılacak.

Kaynak: Alibaba Cloud Model Studio — qwen-audio-3.1-tts-next; qwen-audio-3.1-asr-flash; qwen-audio-3.1-realtime-plus; qwen-audio-3.1-tts-flash; QwenCloud Realtime-Plus; QwenCloud ASR-Flash-Filetrans; The Decoder (23 Eylül 2026); aibase (23 Eylül 2026); aibase

— Paylaş

Beğendiysen yay.

Yapay Zeka Sohbetlerinde
Sosyal Medyada

Tartışma

Bu habere emoji ile tepki ver

Hizli:

Henüz yorum yok. İlk yorumu siz yapın!

Yapıcı ve saygılı yorumlar bekliyoruz. Topluluk kuralları