品玩

科技创新者的每日必读

打开APP
关闭
业界动态

四项全进Top 5、两项第二!百融BR-Voice再获IEEE SLT 2026挑战赛验证

shuohang

发布于 1小时前

此前,百融 BR-Voice 在 INTERSPEECH 2026 拿下了全球第三、94.84%的准确率。

近日,百融又一次站上国际赛场——IEEE SLT 2026 旗舰会议体系下的 SmartGlasses 挑战赛。

在本次国际赛场上:BR-Voice四项任务全部进全球Top 5,两个 SLU 任务都是第二名。

如果说 INTERSPEECH 那次,百融证明的是"复杂长对话里能否听懂"——这一次的 SmartGlasses 挑战赛,百融证明的是"穿戴场景、多人说话、真实环境下,能否实现从听清到听懂的端到端贯通"。

两场国际赛事,两个不同维度,百融都交出了硬指标答卷。

01 “国际赛场”的含金量

IEEE SLT是IEEE语音与语言处理领域的旗舰Workshop之一。

本届挑战赛的全名是"IEEE SLT 2026 SmartGlasses 挑战赛",由西北工业大学 ASLP 实验室联合华为、希尔贝壳、上海交大、南京大学、中国科学技术大学、南洋理工大学、Rokid 等多家单位共同发起。核心命题聚焦于第一视角(穿戴)场景下的多说话人语音识别与理解。

77 支队伍参赛,覆盖国内外高校、科研机构、企业和开发者团队。

赛事的含金量,来自三个维度:会议级别(旗舰会议体系)、主办方(学界 + 业界头部联手)、赛题难度(穿戴场景 + 多人 + 真实环境)。

02 四项任务,全部全球TOP 5

赛制是两大赛道 × 两项任务。

Track 1:双人对话理解——单会话平均 5.2 分钟,场景覆盖餐厅、商场、街道、车内、火车站、办公室、机场、家庭,共8类。

Track 2:多人会议理解——单会话平均 19 分钟,3 到 8 人参与,场景以办公室为主。

每条赛道都同步开两项子任务:TSA-ASR(带时间戳的说话人属性语音识别,指标 tcpCER,越低越好)、SLU(口语语言理解,指标 Accuracy,越高越好)。

最终排名:

Track 1 TSA-ASR:全球第四

Track 1 SLU:全球第二

Track 2 TSA-ASR:全球第四

Track 2 SLU:全球第二

四项任务全部 Top 5,两个 SLU 都是第二。这是百融 BR-Voice 在穿戴场景下的硬指标背书。

03 63% 的错误率,意味着什么

本届赛事组委会给出的几组核心数据,清晰揭示了穿戴场景下语音 AI 的真实难度。

数据集规模。整个比赛用了 106.98 小时四通道音频、714 个独立对话,全部在真实物理场景下用智能眼镜采集。数据均为真实场景采集,非合成构造,意味着背景噪声、说话人声学条件、空间混响等不可控因素全部存在。

重叠率。 说话人重叠是穿戴式多人语音处理的核心难点。Track 1 双人对话平均重叠率 7.5%,高重叠会话最高 35%。Track 2 多人会议平均重叠率 13.6%,极端高重叠会话接近 45%——意味着接近一半的时间里,多人同时发声。

参会人数与错误率的关系。 同样一句话,在 3 人会议里说,tcpCER 平均 15.5%;4 人会议升至 31.9%;5 人会议达 49.3%;6-8 人会议平均错误率超过 63%。参会人数每增加 1 人,识别错误率呈非线性增长。

这就是为什么 Track 2 的纯声学推理题准确率不足 65%。组委会披露,所有参赛系统都呈现一致的梯度:语义题 > 声学-语义联合题 > 纯声学题。Track 1 头部系统的语义题准确率接近 90%,到 Track 2 部分系统语义题突破 90%,但纯声学推理题准确率仍不足 65%。

这条梯度揭示了当前音频大模型的能力分层:"会思考"已较为成熟,"会听声"仍是核心短板。

百融在 IEEE SLT 2026 拿下的两个第二,均出在 SLU 任务上,也就是"听懂"那一层。

04 端到端,不只是"百融的选择"

本届赛事还有一个关键的技术观察:所有有效提交均采用端到端大模型方案,统一建模范式,一次性完成转写、时间戳、说话人归因输出,替代了传统的级联方案。

端到端已从"百融的选择",演进为"整个赛道的共识"。

但同样是端到端,百融和部分参赛队伍的技术路径并不相同。

第一种路径:把 ASR、说话人归因、SLU 拆开做。 每个环节单独建模型、单独调优。环节增多时,各环节的误差会逐级放大,最终"理解"准确率可能远低于单环节最优。

第二种路径:用一套完整的端到端方案,从"听清"到"听懂"一次性完成。 这是百融的做法,也是 BR-Voice 一直以来的技术路线。2017 年立项,2018 年第一版上线,2019-2020 年绝大部分人听不出是 AI,2026 年在 IEEE SLT 2026 拿下两个 SLU 第二。

两种路径的本质区别:

拆开做,优化对象是"中间环节"的局部指标;但在真实任务中,各环节误差逐级放大,最终结果可能远低于单环节最优。

端到端,优化对象是"最终结果"的全局指标;所有环节联合优化、所有环节一起进步。

这种面向最终任务结果优化的思路,也与百融长期强调的结果导向形成呼应。客户购买的,不是各环节的局部最优,而是端到端的整体最优。

05 我们的解题思路

BR-Voice 在本届赛事中的表现,源于其端到端架构下的 4 项核心能力。

第一,4 通道多说话人归因。 智能眼镜是 4 通道麦克风阵列,需同步还原"谁在说话、说了什么、什么时候说的"三个维度的信息。组委会披露,各参赛队伍对 4 通道的处理路径差异显著:单通道输入、通道均值融合、波束成形、GSS 语音分离等方案各有优劣。BR-Voice 的端到端架构,以智能眼镜采集的四通道原始音频作为输入,在保留多通道空间声学信息的基础上,通过统一的多模态大模型直接生成包含说话人标签、时间戳和转写文本的结构化结果,无需在模型输入端进行预先的通道融合或单通道化处理,从而减少传统多通道融合过程中空间信息及说话人相关声学特征的损失,并提升复杂多人交互场景下的说话人归属与语音识别能力——这正是百融在端到端路线上的具体实践,也是与各参赛队伍在技术路径上的关键差异。

第二,真实物理场景的鲁棒性。 本届赛事数据集均为真实物理场景采集,非合成构造。BR-Voice 长期在真实电话网络数据上训练,信息密度比互联网语音低 50%——电话网络数据虽非穿戴场景,但其低信噪比、远场、压缩损伤等特征,使其成为语音鲁棒性训练的"高难度样本"。叠加穿戴场景下的真实采集数据,BR-Voice 对噪声、口音、距离、混响等不可控因素,具备深度鲁棒性。

第三,声学-语义联合推理。 本届赛事组委会披露,"声学-语义联合题"是所有题型中表现居中的一类——既不像纯语义题那么好做,也不像纯声学题那么难。BR-Voice 端到端架构的核心优势,在于 Token 级的声学-语义联合表征:声学信号和语义信号在统一表征空间内被同时处理,完成跨模态联合推理,避免了传统 ASR→LLM→TTS 链式方案中声学信息向文本转换时的不可逆损失。

第四,响应延迟 <500ms 的工程化能力。 端到端的工程落地,要求模型部署、推理优化、长上下文管理、流式输出等关键环节全部打通。BR-Voice 的端到端响应延迟在 <500ms,在 19 分钟的会议中能持续以流式方式输出结果,在说话人频繁切换时仍能保持上下文一致性与稳定的说话人归因。

这 4 项能力,单独看是百融 BR-Voice 在不同技术维度上的积累;合起来,构成了 BR-Voice 与其他参赛队伍在端到端能力上的核心技术代差。

06 为什么 SLU 第二,比名次更重要

四项任务全部 Top 5,但更值得关注的,是两个 SLU 任务都拿了第二。

SLU 是"理解",不是"转写"。TSA-ASR主要关注语音内容的准确转写以及说话人与时间信息的正确对齐,而SLU进一步关注语音内容所承载的语义信息及上下文关系。对于TSA-ASR中的局部转写错误,后续语义理解模块仍可结合上下文信息进行一定程度的纠正或补偿——在 4 通道、19 分钟、多人重叠的会议场景中,机器需要把"谁说了什么、是什么意思、涉及哪些会议决议"准确还原。关键信息一旦理解错误,整个会议决策的可靠性将无从保证。

所以,两个 SLU 任务的第二,更贴近百融希望证明的‘从听清到听懂’。

百融在"理解"这一层拿下双第二,印证了 BR-Voice 的能力定位:不止是"听清",更是"听懂"——从声学信号到语义理解,完成端到端贯通。

07 智能眼镜:BR-Voice 的下一片

本届 SmartGlasses 挑战赛的成绩,也是百融另一条产品线的"入场券"——百语(百融智能硬件全栈服务平台)。

百语的"端 + 云 + 方案"架构,本就为穿戴场景设计:端上是嵌入式 SDK,精准 VAD + 智能降噪,弱网/断网场景下稳定运行;云上是 Agent 层,多维度感知、情绪驱动、长期记忆、声纹联动;方案总集覆盖玩具、耳机、家居、IPC、眼镜等硬件形态。

智能眼镜,正是百语方案总集中"眼镜"这一品类的核心形态。BR-Voice 在 IEEE SLT 2026 拿下两个 SLU 第二,标志着端到端方案在 4 通道、第一视角、真实环境这种严苛评测下,获得了国际权威赛事的独立验证。

对智能眼镜厂商而言,在评估语音方案时,BR-Voice 提供的不仅是技术能力,更是一份经过国际赛事验证的端到端工程答卷。

技术高到天上去,也得落到地上来。智能眼镜,就是 BR-Voice 下一片规模化落地的"地"。

写在最后:下限,往往比上限更重要

上一篇文章里我们写过一句话:"国际赛场证明的是能力上限,这一通电话证明的是能力下限。"

这一篇补一句:国际赛场也证明下限。

77 支参赛队伍、IEEE SLT 2026 旗舰会议体系、SmartGlasses 这一未来语音入口的标志性场景——百融四项任务全部进 Top 5,两个 SLU 任务都是第二名。

这不是某一项技术的"上限",而是"端到端、从听清到听懂、对结果负责"这条路在多场景下的"下限"。

下限,往往比上限更重要。

百融 BR-Voice 团队内部讲过一句话:"技术高到天上去,也得落到地上来。"

落在 IEEE SLT 2026 的赛场上,是四项任务全部 Top 5。 落在上一篇文章的 INTERSPEECH 舞台上,是全球第三、94.84% 准确率。 落在 8,000+ 企业的客服中心里,是 20 分钟不被挂断的耐心。

让每一个具体的人,被认真对待。让每一个具体的场景,被技术接住。

这是百融 9 年来没变过的初心,也是 BR-Voice 一直在交付的结果。

下载品玩App,比99.9%的人更先知道关于「业界动态」的新故事

下载品玩App

比99.9%的人更先知道关于「业界动态」的新故事

iOS版本 Android版本
立即下载
shuohang

这家伙很懒,什么也没留下,却只想留下你!

取消 发布
AI阅读助手
以下有两点提示,请您注意:
1. 请避免输入违反公序良俗、不安全或敏感的内容,模型可能无法回答不合适的问题。
2. 我们致力于提供高质量的大模型问答服务,但无法保证回答的准确性、时效性、全面性或适用性。在使用本服务时,您需要自行判断并承担风险;
感谢您的理解与配合
该功能目前正处于内测阶段,尚未对所有用户开放。如果您想快人一步体验产品的新功能,欢迎点击下面的按钮申请参与内测 申请内测