大伙儿是不是也有同感?每次想跟 AI 好好唠两句,总觉得哪儿都不对劲,浑身别扭。
尤其是直接拿语音跟 AI 沟通的时候,那种人和机器之间的鸿沟,简直肉眼可见。
说到底,现在的 AI 语音交互,玩的就是个回合制:你开口它闭嘴,它说话你听着。
你想自然地插句话、停个顿,门儿都没有;它也搞不清你是对它讲,还是在跟旁边的人聊天。
这种交互上的硬伤,直接把 AI 死死按在答题机和代码工具那摊子里,动弹不得。
上个月,OpenAI 甩出了 GPT-Live,号称能边说边听用户输入,外界评价还挺高。
但不少人撇嘴:这有啥新鲜的?早在今年 4 月,豆包的语音通话模式里,这功能就升级过了。
前两天,豆包又反手把视频通话能力拔高了一截,接入了原生音视频多模态全双工大模型 SeedRealtime,宣称能提升音视频理解力,抗干扰和打断判停也更溜了。
所谓的全模态全双工交互模型,核心就一件事:针对前面提到的那些拧巴处——比如回合制对话的死板,来个大版本迭代。
听着挺带感,咱们立马拉几个真实场景实测一波。
技术再牛、概念再高大上,咱们关心的还是这新玩意儿实不实用。用起来顺不顺手?省不省心?真遇上事儿能不能顶用?
先来个基础的,测测新版豆包视频电话,到底还搁这儿玩回合制吗?
还真别说,这版本的豆包确实精明了不少。以前的视频交互,它像个单线程生物,耳朵和嘴巴只能忙活一个。它要是正说着话,你的新指令它就听不见;它在听你说话时,脑子也就停转了。
现在的豆包好多了,哪怕它正叭叭叭地说个不停,只要捕捉到你的声音,立马刹住车,还会根据你的新提问调整内容。
从测试视频里也能看出来,它对人类提问的断句判断更准了。
以前你可能只是卡壳一下,话没说完,它却 get 不到重点,自顾自地开始回答。现在,它基本能分清你到底说完没,聊起来更像跟个小姐姐面对面谈心。
不仅如此,豆姐的抗干扰能力也强了不少。
以前它像长了顺风耳,周围有点动静,就容易误判是你的新指令,转头去回应杂音。现在嘛,它像是装了声纹解锁,基本做到了和你一对一私聊。
我们还发现,如今豆包视频的识别速度相当硬核。
比如下面这个视频,我们在玩游戏让它帮忙选武将。就咱这手速滑动的幅度,豆包的识别又快又准。
测试中我们还观察到,哪怕是在编辑部打游戏,一个人在前头操作,后面坐着一群“狗头军师”出谋划策。
豆包也能完全 hold 住这种多人对话的复杂场面。它能随时在线监听大家伙的发言,清晰分辨出谁在说话、说了啥。
就连旁边沉浸操作的同事小声嘀咕了一句“怎么冲刺”,都被豆包精准抓包,顺便给这人贴了个“不太会玩”的标签。
接下来,我们给豆包上了点强度。刚好编辑部在装测试平台,我们就让豆包当回装机高手,指导操作步骤。
结果豆包只需简单扫一眼,就知道这台测试平台的进度条走到哪了。
紧接着我们发现,豆包不光能在装机过程中指点迷津,还能在误操作时主动提醒。
豆包甚至超有眼力见,实时盯着我的手部动作。装内存条的时候,提前提醒注意正反面,千万别用蛮力硬怼。
而且我们发现,豆包完全可以全流程跟踪装机这种大型任务。就在我们按它的指导装完显卡,觉得大功告成准备收工时。
这哥们儿居然查漏补缺了:“你丫的显卡供电线还没接呢!”
甚至连角落里最容易被忽略的主板 CPU 供电线,也被豆包揪了出来。主打一个你随便折腾,哥们兜底。
在这个过程中,我们还见识了豆包强大的记忆功能。
因为全程开着视频,等我们把测试平台装完,准备离开影棚时,突然想起有台测试机不知道放哪了。
于是心想,豆包会不会记得?结果它还真记着。
要知道,这不仅是听懂话,简直是 AI 吃了哆啦 A 梦的记忆面包。
我就问,平时跟真人打电话,谁会帮你记随手放的东西?豆包偏偏就帮你盯在眼里了。
如果说装机只是在影棚里的极客游戏,那在人声鼎沸、流程复杂的真实医院里,豆包还顶得住吗?
于是,我们把豆包带到了医院,想试试更新后的视频能力,能否辅助老人等特殊人群在大医院独自看病。
到了医院门口,咱主打一个两眼一抹黑,问豆包先去哪儿取号。
豆包表示,面前的这个人工挂号窗口,或者边上的自助取号机都可以。
它还贴心地建议:如果提前预约好了,人工窗口排队人多,选自助取号更方便。
按照引导取好预约号后,常见难题就是找不到诊室。特别是一些大医院,很容易把病人绕晕。但现在,你只要给豆包看一眼环境,它会告诉你怎么走。
同样的,到了诊室门口,现在很多医院得先签到才能进入排队队列。不同医院、科室的签到规则和机器五花八门,不少人都会傻眼。豆包却能一眼看穿,告诉你怎么操作。
整个测试下来,从医院大门开始,豆包一步步带着我们自助取号、找电梯去指定楼层、签到……除了路过的护士小姐姐和路人会用奇怪的眼神打量世超,几乎挑不出毛病。
所以在取号、找楼层、识别签到设备这些流程性任务上,豆包已经能提供全程陪同的帮助。
总得来看,豆包的视频能力确实有了不小飞跃。但在我们看来,最有意思的进步不是它多认了几个东西,也不是反应更快,而是它真的在尝试理解语气、声音,真正学会了像人一样沟通。
我们也研究了一下,为啥豆包视频能力进步这么快。发现真正的功臣是底层的 SeedRealtime。
以前 AI 所谓的视频通话,本质上是流水线作业:
AI 先听到声音,转成文字,再看屏幕截图,综合处理后生成语音回答。
这种串联思路,每个步骤处理再快,连起来就显得慢半拍。
但 SeedRealtime 最狠的一点,是将声音、画面、时序与表达,全部融合进一个端到端模型。
这么一来,看、听、说在同一套系统里进行,不分步骤也不分先后。AI 能通过手势和现场画面,秒懂你说的“这个、内个儿”指代什么,也能精准过滤掉旁人的杂音。
同样,因为能持续理解视频里的场景变化,AI 也就能分清什么时候该闭嘴,什么时候该主动开口提醒。
最后呈现给人的表现,就是懂得察言观色,像个真正的人了。
搞明白这些底层逻辑后,你就会发现,豆包这次展现的能力,也是目前整个 AI 行业死磕的方向之一。
隔壁海外大厂们也在提实时语音、多模态交互和思考模型。除了前面提到的 GPT-Live,OpenAI 还拿出了 Thinking Machines 露脸,但功能还在演示阶段,没法让公众随手敞开用。
所以,豆包的这个音视频全双工能力,才是真正开始往我们期待的贾维斯方向进化。
当然了,离贾维斯还有段距离。现在你还得举着手机,视频通话也受网络、续航等条件限制。
但至少从这次体验看,AI 助手正在从“你问一句、它答一句”,变成一个能边看、边听、边协助的角色。
再多说两句,我们突然觉得手机形态有点制约未来 AI 的能力发挥。如果视频能力未来能跳出手机,比如用在智能眼镜、手环、AI 小硬件上(当然,得搞定续航、散热、网络、算力等问题),或许真是一个完全崭新的原生 AI 世界。
所以,不久的将来,如果在街上看到有人嘀嘀咕咕,别以为人家魔怔了,或许他正在跟豆包打电话呢。
撰文:八戒
编辑:江江 & 面线
美编:焕妍
图片、资料来源:
豆包







