品玩9月23日讯,千问大模型官方今天宣布,千问正式发布Qwen-Audio-3.1系列语音大模型,对ASR、TTS和Realtime三大核心模型进行全面升级,同时推出音频创作模型Qwen-Audio-3.1-TTS-Next和音频理解模型Qwen-Audio-3.1-ASR-Next,五款模型形成覆盖"理解-生成-交互-创作"的完整音频能力栈。
ASR支持30种语言与16种方言识别,新增转写润色功能,首字响应约160毫秒;TTS支持跨语言音色合成与情绪控制;TTS-Next可统一生成人声、音效与环境音;Realtime支持全双工交互并可调用Agent工具。全线降价,TTS降幅约70%,Realtime降幅约85%,ASR降幅达95%。





0 条评论
请「登录」后评论