首页 > 评测 通义百聆— 阿里通义推出的企业级语音基座大模型
通义百聆— 阿里通义推出的企业级语音基座大模型
通义百聆是什么
通义百聆是阿里巴巴通义实验室自主研发的企业级语音基础大模型,深度融合 fun-asr 语音识别与 fun-cosyvoice 语音合成两大核心模型,专为多噪、多语、多场景的复杂语音交互环境打造。依托创新的 context 增强架构,显著抑制生成幻觉,有效根治跨语种混淆问题;支持热词实时注入与垂直领域术语高精度识别。语音合成方面,具备跨语种音色克隆能力,声音还原度处于行业前列。模型基于海量真实业务音频数据训练,已深度适配金融、教育、制造、互联网、畜牧等十余个行业,开箱即用,助力企业敏捷构建高性能语音应用。
通义百聆迎来重磅升级:Fun-CosyVoice3 模型发布后,首包响应延迟下降50%,中英文混合文本识别准确率提升至原有两倍;全面支持9种主流语言、18种方言口音,并新增跨语种克隆与细粒度情感调控能力;具备 zero-shot 音色复刻功能,让语音合成更高效、更拟真。与此同时,Fun-ASR 模型性能全面跃升——在强噪声环境下识别准确率达93%;支持31种语言自由混说及广泛方言覆盖;首次集成歌词与说唱节奏识别能力;流式识别首字延迟压缩至160ms,实现更准、更快、更稳的语音转写体验。
责任编辑:
文章来源:http://www.jingmeijuzi.com/2025/1218/183.shtml
