荣耀 Robot Phone 新品发布会现场,YOYO 智能助手的一段实测演示,让不少看直播的网友眼前一亮。产品经理白晨现场模拟真实使用场景,用极快语速输出一段长达十几秒的复合需求,一连串操作指令密集抛出,而 YOYO 完整接住全部信息,精准读懂背后意图,并且逐项完成对应任务,整套从理解到执行的流程一气呵成,几乎感受不到卡顿,也被网友调侃称为最能接话的机器人手机。

以往绝大多数手机语音助手,更适配简短、单一的指令。如果一次性说出多件事,语速再加快,很容易出现识别不全、理解跑偏,只能完成其中一部分任务,甚至直接响应失败。想要完成多件事,就需要拆分,一条一条重新下达,操作链路繁琐。而本次 YOYO Pro 带来的提升,就体现在超长连续指令的处理能力上,面对十几秒连贯、多任务叠加的口语化需求,不需要用户刻意停顿、拆分,就可以拆解目标,规划执行步骤,完成跨应用的联动操作。

这份能力的背后,依托 Agentic OS 系统级智能体架构,结合端侧大模型,把超长上下文记忆、多步任务规划、意图识别、端侧推理、自动执行多项能力整合在一起。不再停留在简单的一问一答,而是听懂用户一整段口语化表达,自动把里面的多项诉求拆解,梳理先后逻辑,后台自动流转完成整套任务,不用使用者反复切换 APP、反复唤醒助手下达命令。

放在日常场景当中,这样的能力实用性会被充分释放。出门前,一段话说完,完成设置闹钟、调节屏幕、开启对应模式、查询路况、预约出行工具等一系列操作;居家办公的时候,也可以一次性交代多项设置、查询、提醒类需求。不用一项一项手动操作,把细碎的手机操作交给 AI 智能体去处理,降低操作成本。当然,涉及资金、隐私确认类环节,依旧保留人为确认步骤,兼顾便捷与安全。

而 Robot Phone 不只是把 AI 能力做了升级,还给 YOYO 搭配上实体的 “身体”,也就是机身内部的钛合金灵巧云台摄像头。软件 AI 负责思考决策,硬件云台负责物理层面的动作输出,手势识别、镜头跟随、随音乐律动、自动运镜拍摄,让手机拥有具身交互的体验。一个人出门旅拍,不需要找旁人帮忙,只靠语音就可以控制镜头转动、追踪构图,独自也能拍出稳定的画面,这也是机器人手机区别于普通旗舰的核心亮点。

发布会的演示属于理想化的现场测试,也有不少网友提出理性的疑问:现场效果足够亮眼,放到嘈杂的现实生活环境,面对口语里的语气词、语序混乱的日常表达,实际表现还能不能维持同样水准。终端 AI 的能力,终究要回归真实使用场景去打磨,发布会是能力的展示,后续大量普通用户的日常使用,才是真正的考验。

纵观手机行业的发展,语音助手早已不是新鲜事物,但过去很长一段时间,大多局限在查天气、设置闹钟这类简单工作。行业一直在探索,如何让 AI 真正接管复杂的手机操作。荣耀这一次的方向,就是推动 AI 从 “对话工具” 向 “任务执行者” 转变,把多步骤的复杂事务交给智能体自动处理,让手机听懂普通人自然的口语表达,而不是逼迫人去适配机器的指令逻辑。

硬件上的机械云台,是这台机器最吸睛的外观创新;但 YOYO 智能体的进化,才是这台机器人手机的灵魂。未来终端 AI 比拼的,早已不止对话好不好听,更要看能不能读懂复杂诉求,稳定落地完成一连串任务。当繁琐的操作可以浓缩成一句话,人机交互的方式,也正在迎来新一轮的改变。

文/映知

图/网络

作者 映知