品玩

科技创新者的每日必读

打开APP
关闭
业界动态

抢占 Agent 时代交互新入口,网易有道推出 AI 原生语音 Agent 网易叭哥说

shuohang

发布于 5小时前

9月8日,网易首个AI原生语音Agent「网易叭哥说」正式上线。这款产品依托有道多年沉淀的语音识别和翻译技术,跳出传统语音输入 “语音转文字” 的工具定位,把人的自然口语直接转化为结构化、可直接复用的高质量文本。希望解决生成式 AI 时代爆发式输入需求下,键盘输入效率跟不上人脑思考速度的行业痛点。

生成式 AI 普及之前,人机交互大多是短句检索、关键词问答,用户输入负荷有限。大模型落地之后,工作流发生本质变化:写提示词、多轮迭代修改指令、输出长段方案,用户给到 AI 的信息密度与输入总量呈指数级上涨。Google 公开数据显示,语音输入平均效率可达键盘的 2.5 倍;而网易叭哥说通过自研 ASR 与语义理解链路深度调优,将口语输出对键盘打字的效率比值提升至 5 倍。

在网易有道相关负责人看来,语音交互的价值,早已不是单纯替代打字、减少敲击键盘的动作,而是压缩 “脑海里产生想法” 到 “指令交付给 AI 执行” 之间的距离。

从 “听写转录” 走向 “意图理解”

长久以来,大众接触到的语音输入产品,底层逻辑都停留在听写:口头禅、重复语句、口误改口、语句跳跃全部原样记录。用户说完一段话,拿到一堆未经整理的原始文本,还需要投入大量时间删改、理顺逻辑、修正口误,本质只是省去敲击键盘,后续编辑成本依旧很高。

叭哥说的核心差异,是从 “听见声音” 进化到 “听懂人的意图”。例如口语表述 “下午三点开会,呃,不对,改成四点,帮我告诉设计团队”,叭哥说会识别修正其中的时间变更指令,自动润色输出 “下午四点开会,请通知设计团队”,产出结果可直接复制用于即时通讯、邮件、文档撰写等真实工作场景。

【网易叭哥说官网】

这一能力来自有道构建的“听清、听懂、写好”全自研技术链路。在听清环节,有道自研 ASR 模型Confucius4-R2T2,即将作为业界开源SOTA的真流式语音识别模型进行发布,主打低延时、高质量,一个模型支持不同的推理粒度,适配不同的场景需求。该模型经过海量数据训练,针对日常对话中的思考卡顿、环境噪声、小声说和实时输入等场景进行了重点优化。

在听懂环节,Confucius4-R2T2具备较强的上下文推理和热词支持能力,可结合前文、当前场景和专业词典理解用户表达,提升同音词、人名、产品名及行业术语的识别准确性,且在多数场景下,热词识别命中率突破 99%;Confucius4-R2T2面对改口、重复和语义补充,能判断最终表达意图。

在写好环节,调用自研润色生成模型,完成断句分层、冗余口语删减、逻辑梳理、表述规范化。整套链路的评判标尺不再是 “逐字识别准确率”,而是输出结果是否可以直接使用—— 这也是 AI 原生语音 Agent 和传统语音听写产品最核心的分水岭。

多语种实时翻译与端侧隐私双落地

语音翻译是有道持续布局十余年的核心技术赛道,大量技术积累也下沉赋能叭哥说产品。产品支持 124 个语种实时语音互译,面向经济、物理、化学、医学等垂直专业领域,翻译精准度可达 98%,覆盖跨语言沟通、跨境会议、外文材料口述整理等多元场景。

伴随 AI 语音能力变强,语音隐私风险也成为行业焦点。人声包含大量个人习惯和真实想法,一旦上云存储,会带来数据泄露、被用于模型训练的隐患。在隐私保护上,叭哥说云端不保留任何语音与文本数据,从源头规避语音原始数据外泄风险,把语音数据主权交还用户。

据官方介绍,网易叭哥说即日起正式开放下载体验。产品将终身免费,希望可以降低 AI 原生语音交互的使用门槛。

下载品玩App,比99.9%的人更先知道关于「业界动态」的新故事

下载品玩App

比99.9%的人更先知道关于「业界动态」的新故事

iOS版本 Android版本
立即下载
shuohang

这家伙很懒,什么也没留下,却只想留下你!

取消 发布
AI阅读助手
以下有两点提示,请您注意:
1. 请避免输入违反公序良俗、不安全或敏感的内容,模型可能无法回答不合适的问题。
2. 我们致力于提供高质量的大模型问答服务,但无法保证回答的准确性、时效性、全面性或适用性。在使用本服务时,您需要自行判断并承担风险;
感谢您的理解与配合
该功能目前正处于内测阶段,尚未对所有用户开放。如果您想快人一步体验产品的新功能,欢迎点击下面的按钮申请参与内测 申请内测