habr.com
87%
559
Qwen-Audio-3.0-TTS: что в релизе Alibaba уже работает, а что пока обещание
Команда Qwen выкатила Qwen-Audio-3.0-TTS - облачную модель Alibaba для синтеза речи, сразу в двух версиях: Flash под низкую задержку и Plus под качество тембра. В анонсе много громких чисел: 16 языков с русским, первое место в Artificial Analysis, клонирование по шумной записи, три минуты аудио за один проход. Ниже - разбор релиза так, как его стоит читать перед внедрением: где заявленная возможность уже подтверждена документацией и API, а где это пока маркетинговая формулировка, за которой не стоит готовой инфраструктуры. Расхождений между блогом, техстраницей и API-справкой хватает, и часть из них важно поймать заранее.