品玩6月4日讯,微软近日宣布正式推出新一代文本转语音模型MAI-Voice-2。该模型作为目前表现最出色的语音合成技术,已在保真度、语言覆盖、说话人一致性及情感范围等多个维度实现显著提升,旨在为品牌助手、有声读物及无障碍服务等对语音质量要求严苛的场景提供核心支持。
MAI-Voice-2将语言支持从单一英语扩展至15种语言,并保留了与英语同等的自然度与表现力。其核心功能包括通过情感标签实现的精细情感控制(如悲伤、耳语、兴奋等),以及仅需5至60秒参考音频即可实现的零样本语音生成。为确保负责任的部署,系统内置了基于授权的同意机制,仅允许合成获得许可的授权声音。
在性能方面,对比测试显示MAI-Voice-2的受欢迎程度较前代高出72%。模型在长篇内容中能保持稳定的说话人身份,并支持印地语-英语、西班牙语-英语等语言对的自然语码转换。目前,该模型已在Azure Foundry上线,并正集成至VSCode及Dynamics 365 Contact Center等产品中。





0 条评论
请「登录」后评论