大伙儿估计都有同感,跟 AI 聊天时,总觉着哪儿不对劲,别扭得很。
尤其是直接开语音聊的时候,那种人和机器的隔阂感特别明显。
归根结底,现在的 AI 语音交互还像是在打回合制游戏:你讲完它接话,它说完你闭嘴。
你想自然点插个话、停个顿,根本行不通;它也搞不清你是对着它说,还是跟旁边的人闲聊。
这种交互上的硬伤,直接把 AI 死死按在“答题机器”和“代码工具”的定位上,动弹不得。
上个月,OpenAI 发布了 GPT-Live,号称能边说话边持续接收用户输入,外界评价还不错。
但不少业内人士觉得这没啥稀奇的,毕竟豆包在今年 4 月的语音通话模式里,早就把这功能给升级了。
前两天,豆包又反手把视频通话能力提了一档,接入了原生音视频多模态全双工大模型 SeedRealtime,官方宣称这能提升音视频理解力,还能更好地抗干扰和判断打断时机。
所谓的全模态全双工交互,核心就一件事:针对前面提到的那些别扭之处,特别是回合制对话的毛病,来个大版本迭代。
听着挺诱人,我们立马找了几个真实场景实测一波。
技术再牛、概念再高大上,咱们更在乎的是新能力实不实用,用起来顺不顺手,真遇上事儿能不能帮上忙。
先来个基础测试,看看新版豆包视频电话,到底还是不是那个死板的回合制游戏。
你还真别说,现在的豆包确实机灵了不少。
之前的版本里,它像个单线程生物,耳朵和嘴巴只能用一个:它在说话时,很难听见你的新指令;它在听你说话时,脑子就不转了。
如今好多了,哪怕它正叭叭叭地说个不停,只要捕捉到你的声音,立马刹车,还会根据你的新提问调整回答。
从测试视频里也能看出来,它对人类提问节奏、断句的判断更精准了。
以前你可能只是卡壳一下,话没说完,它却 get 不到,自顾自地开始回答;现在它基本能分辨出你是否说完,对话过程更像是在跟一位小姐姐面对面聊天。
不仅如此,豆姐现在的抗干扰能力也强了不少。
搁以前,它像长了顺风耳,身边有点动静就容易误判为你的新指令,转头去回应杂音;现在它像是有了声纹解锁,基本做到和你一对一私密交流。
此外,我们还发现豆包视频的识别速度相当快。
比如下面这个视频,我们在玩个小游戏,让它帮忙选武将。就咱们那手速,豆包的识别又快又准。
测试中我们发现,哪怕面对编辑部玩游戏,一个人在前头操作,后面坐着一群“狗头军师”指点的情况。
豆包也能完全 hold 住这种多人对话的复杂场景,随时在线听大家伙说话,清晰分辨出是谁在说、说了啥。
就连那位沉浸操作的同事小声嘀咕了一句“怎么冲刺”,都被豆包精准捕捉,顺手给他贴上了一个“不太会玩”的标签。
接下来,我们给豆包加了点难度。刚好编辑部在装测试平台,我们让豆包当个装机高手,指导操作流程。
结果豆包只需简单扫一眼,就知道这台测试平台的进度如何。
紧接着我们发现,豆包不仅能指导装机步骤,还能在误操作时主动提醒。
豆包甚至很有眼力见,实时盯着我的手部动作,在安装内存条时,提前提醒注意正反面,别用蛮力硬怼。
而且我们发现,豆包完全可以全流程跟踪装机这种大型任务。就在我们根据指导装完显卡,以为大功告成准备收工时。
这哥们儿居然查漏补缺了:“你丫的显卡供电线还没接呢!”
甚至连角落里最容易被忽略的主板 CPU 供电线,都被豆包揪了出来,主打一个你随便折腾,哥们兜底。
在这个过程中,我们还发现了豆包强大的记忆功能。
因为全程开着视频,等我们装完测试平台,准备离开影棚时,突然想起有一台测试机不知道放哪了。
于是我想,豆包会不会记得?结果它还真记着呢。
要知道,这不仅是听懂话,简直是 AI 吃了哆啦 A 梦的记忆面包。
我就问,平时跟真人打电话,谁会帮你记随手放的东西?但豆包偏偏就替你盯在眼里了。
如果说装机只是在影棚里的极客游戏,那在人声鼎沸、流程复杂的真实医院里,豆包还顶得住吗?
于是我们把豆包带到了医院,想试试更新后的视频能力能否辅助老人等特殊人群,在大医院独自看病。
到医院门口后,咱两眼一抹黑,问豆包先去哪儿取号。
豆包表示,面前的这个人工挂号窗口,或者边上的自主取号机都可以。
它还贴心建议,如果提前预约好了,人工窗口排队人多,选自助取号更方便。
按照引导取好预约号后,常见的问题是不知道咋上楼找诊室,大医院很容易把人绕晕。但现在,你只要给豆包看一眼,它会告诉你怎么走。
同样的,到了诊室门口,现在很多医院得先签到才能进入排队队列,但不同医院、科室的规则和机器各异,不少人会傻眼,豆包却能一眼告诉你怎么操作。
整个测试下来,从医院大门开始,豆包一步步带我们去自助机取号、找电梯到指定楼层、签到……除了路过的护士小姐姐和路人用奇怪眼光观察世超外,几乎挑不出毛病。
所以在取号、找楼层、识别签到设备这些流程性任务上,豆包已能提供全程陪同帮助。
纵观全程,豆包的视频能力确实有了不小提升。但在我们看来,最有意思的进步并非它能多认几个东西或反应更快,而是它真的在尝试理解语气、声音等,学会了像人一样沟通。
我们也研究了一下,为啥豆包视频能力提升这么快,发现真正的功臣是底层的 SeedRealtime。
以前 AI 所谓的视频通话,本质上是流水线作业:
AI 先听声音转文字,再看屏幕截图,综合处理后生成语音回答。
这种串联思路,每个步骤再快,连起来也显得慢半拍。
但 SeedRealtime 最狠的一点,是将声音、画面、时序与表达全部融入一个端到端模型。
这样一来,看听说在同一套系统里进行,不分步骤前后,AI 就能通过手势和现场画面,秒懂你说的“这个、内个儿”指代什么,也才能精准过滤旁人的杂音。
同样,能持续理解视频里的场景变化,AI 也就分得清啥时候该闭嘴,啥时候能主动开口提醒了。
最后给人的表现就是懂得察言观色,像个真正的人了。
搞明白这些底层逻辑后,你就会发现,豆包这次展现的能力,也是目前整个 AI 行业死磕的方向之一。
隔壁海外大厂们也在提实时语音、多模态交互和思考模型。除了咱们提到的 GPT-Live,OpenAI 还展示了 Thinking Machines,但其功能还在演示阶段,没法让公众随意使用。
所以豆包的这个音视频全双工能力,才是真正开始往我们期待的贾维斯方向进化。
当然,离贾维斯还有距离,现在你还得举着手机,视频通话也受网络、续航等条件限制。
但至少从这次体验看,AI 助手正在从“你问一句、它答一句”,变成一个能边看、边听、边协助的角色。
再多说两句,我们突然觉得手机形态有点制约未来 AI 的能力了。如果视频能力未来能跳出手机,比如用到智能眼镜、手环、AI 小硬件上(当然,得解决续航、散热、网络、算力等问题),或许真是一个全新的原生 AI 世界。
所以,不久的将来,如果看到谁在大街上嘀嘀咕咕,别以为人家魔怔了,或许他正在和豆包打电话呢。
撰文:八戒
编辑:江江 & 面线
美编:焕妍
图片、资料来源:
豆包
















