辅助级认证来了 智能手机“变天”?

//世界移动通信大会上,人们参观机器人手机。(新华社记者 程敏 摄)
今年5月,工业和信息化部、商务部、市场监管总局等部门联合启动实施《人工智能终端智能化分级》(GB/Z 177—2026)系列国家标准,明确了智能化的概念、等级划分和测试方法,告诉大家“什么是人工智能终端、怎么分级、怎么判定”,是所有品类标准的基础。终端智能化的分级体系,从L1响应级、L2工具级、L3辅助级到L4协同级,智能化水平依次提高,终端更“聪明”。2026年7月17日以来,华为、摩托罗拉、荣耀、vivo、OPPO、小米和阶跃星辰等品牌纷纷宣布,通过了国家人工智能L3级认证。
新的标准将“场景任务闭环”作为核心评价维度,从“单点能力”转向“端到端的任务闭环”对厂商的产品设计思路会带来怎样的改变?当前只有部分新品达到L3级,产业距离L4还有多远?AI手机与AI智能体手机的真正分界线是什么?连日来,记者采访了多位专家对此进行解读。
记者:为什么手机厂商会在此时集中官宣L3?AI手机与AI智能体手机的真正分界线是什么?
工业和信息化部信息通信经济专家委员会委员盘和林:现阶段消费者并不了解AI智能体手机,不知道有什么有吸引力的功能,消费者在选择AI智能体手机的时候,会去看各种排名。如果手机厂商能够获得“首批L3认证”,那么在销售上就有了先发优势。消费者不清楚功能,但一定知道有L3认证的比没有L3认证的手机更加先进,就会偏向于购买有认证的手机。其实,还是为了获得更高的AI智能体手机的市场份额。
传统手机和AI智能体手机的分界线很多,其中最重要的区别,是自主性。传统AI手机没有自主性,所有的APP都需要用户自己打开和使用,而AI智能体手机有自主性,要获得自主性,除了需要AI智能体工具功能之外,还需要解决一个重要的问题:AI智能体需要获得APP调用权限,并在调用的时候保障安全。这一点,其实挺难实现的,因为很多APP都在担心,AI智能体手机获得调用权限可能会导致新的安全风险,也会导致开发者失去对APP的控制权限。
综合开发研究院(中国·深圳)产业经济研究中心主任研究员陈雯璐:L3跟L1、L2重要的区别就是对待指令上,从时间上、空间上是否能够联系上下文进行理解,拆分指令并一一对应的执行。可以理解为L3是一个有记忆、有逻辑的助理。而L1更像是我们设定的闹钟,只要定了那个时间,除非没电,就能一直执行,不会因为环境变化而变化,L2更像给我们有限菜单的饭店,选择是有的,但不多,模式化特点显著。
记者:此前市场上大量“AI手机”存在功能碎片化、宣传虚标等“伪智能”问题,L3国标认证能否从根源上规范行业乱象?
陈雯璐:一般技术发展都走在政策发展的前面,行业一般都会从无序竞争走向有序的良性发展。国际认证是该技术发展到一定阶段的必然产物,认证也能从制度底层大幅约束乱象。过去厂商靠 “接入云端 API、套个大模型壳、外挂独立AI APP”就宣称AI旗舰;国标把感知、认知、工具调用、记忆、多模态生成拆成14项可量化测试指标,必须通过工信部或信通院公开实测发证才算L3,纯云端套壳产品直接被排除,堵住“伪 AI”最大漏洞。
记者:L3级AI认证落地后,会对智能手机行业的产品迭代逻辑产生哪些颠覆性影响?2026年被称为AI Agent手机元年,L3国标认证的落地,是否标志着智能手机正式进入“智能体时代”?
盘和林:新的手机迭代逻辑是以智能体为核心重构系统架构。未来手机的操作系统要围绕智能体来改变,操作系统的底层需要嵌入AI智能体,才能顺利地接管手机的各项APP功能,这必然会带来两个迭代逻辑:一个是智能体和手机系统的嵌合度,生态的融合度,能不能调用更多APP,是智能体要解决的技术课题。另一个是智能体调用APP带来的安全风险,能不能解决这些安全风险,关乎未来AI智能体手机是否能够实现可持续发展。
L3认证,是智能体手机的一个开始,并不能认为等同于智能体时代到来,因为智能体的安全性、使用顺畅度,都需要市场验证,也需要手机APP开发者验证。
记者:目前头部品牌已率先拿下L3认证,这套国标门槛是否会形成行业准入壁垒?会如何影响中小手机厂商的生存空间,行业市场格局是否会进一步走向集中?
陈雯璐:确实会影响中小手机厂商的生存空间。智能手机行业马太效应加剧,排名前五位的品牌国内市场占有率大概率进一步提升,行业进入门槛将越来越高。
记者:L3作为当前落地最高等级,后续L4协同级标准已在规划中,从L3到L4的技术跨越核心是什么?终端AI的终极演进形态会是怎样的?
盘和林:L3辅助级的核心定位是“聪明的私人助理”——能围绕一台终端、一个用户目标,自主拆解任务、调用工具、记住偏好。而L4协同级的关键词是“协同”,问题会自然扩展到多个智能体、多个设备和多个服务主体。L3到L4的关键跨越点,是规则协同,这就又要提到AI智能体获得APP底层调用权限存在的客观挑战和问题。终端AI的终极形态,是独立完成几乎所有的任务,人类告诉手机要什么结果,中间过程都由智能体完成。
陈雯璐:技术跨越点更倾向于聚焦主动预判式自主决策,不用发出指令,该智能体能通过使用者的习惯、思考的逻辑,“想”在人前,自动决策,最终成为一个真正的“智能”助手。
记者:智能体手机距离稳定完成跨应用任务还有多远?
中国信息通信研究院南方分院院长助理、创新发展研究部主任张昊:预计还需要1至2年,也就是到2027年至2028年初,跨应用任务才有可能从“演示可用”走向高并发、高鲁棒性的日常稳定使用。截至2026年年中,行业正处于从受限沙盒测试向泛化日常场景迈进的关键阶段。要真正稳定完成跨应用任务,仍需克服三方面技术障碍。
首先是GUI视觉智能体对APP动态界面的适配能力。当智能体利用视觉大模型识别屏幕,并模拟人类点击界面时,APP频繁更新、弹窗广告、页面改版以及验证码等因素,都可能导致任务执行中断或出现误操作。目前,系统底层仍缺少足够强大的实时容错机制。
其次是长链路任务中的错误累积。一项涉及比价、订票、写入日历和通知打车的复合任务,可能包含十余个操作步骤。如果每一步的成功率均为90%,全流程成功率将下降至35%左右。长上下文推理发生偏移,以及对任务状态的追踪能力不足,是当前需要解决的核心问题。
第三是端侧时延与功耗的制约。复杂的意图拆解和视觉识别需要消耗大量算力。如果一次跨应用任务需要等待10秒至15秒,同时导致手机明显发热,其使用体验将大打折扣。
艾媒咨询CEO兼首席分析师张毅:目前,还没有看到能够较好完成跨应用任务的成熟产品。整体而言,这类产品仍处于实验室研发、原型机验证或小范围测试阶段。要实现规模化商业应用,个人认为至少还需要一年半。
现阶段的主流方案,主要还是依靠读取屏幕信息和模拟点击完成操作,多任务协同能力相对较弱。同时,智能体还面临应用风控拦截、端侧算力与功耗限制,以及意图识别、系统权限和安全等多方面问题。
未来一段时间内,部分产品有机会率先在高频、简单的跨应用场景中实现稳定可用。但手机涉及大量应用和个人信息,尤其可能触及支付等敏感操作,因此不可能一步到位。在现阶段,许多关键环节仍需要用户进行确认。短期内,要实现全场景下稳定、自主的跨应用任务执行,难度仍然较大。
记者:应用生态不开放,会不会成为智能体落地的最大障碍?
张昊:会。商业利益和应用生态形成的壁垒,是现阶段智能体落地面临的深层结构性障碍。不过,这一矛盾也在推动行业探索新的技术和商业路径。
传统移动互联网生态建立在流量和广告模式之上。社交、电商、出行等领域的超级APP拥有各自的数据和服务体系,也会警惕手机厂商的智能体将其“管道化”或“去入口化”。如果用户不再直接打开APP、浏览首页,其原有的广告展示和流量变现模式便会受到影响。因此,部分平台可能通过反爬虫、封禁自动化脚本等方式,限制智能体的自动操作。
张毅:从目前来看,应用生态不开放,确实是制约智能体大规模落地的核心问题之一。超级APP掌握着流量、交易和服务入口。智能体如果绕过应用的原生界面直接调用服务,将对平台的流量分配、广告收入、商业化模式以及数据控制权带来较大挑战。
另一个问题是,目前行业尚未建立统一的互通协议,APP厂商也缺乏分别为各家手机系统单独适配接口的动力。短期来看,通过系统权限、GUI视觉识别和模拟操作等方式,可以在一定程度上实现过渡;但从长期看,行业仍需建立开放、统一的调用标准,同时明确各方的责任边界和利益分配机制。
记者:未来一年,判断智能体手机是否真正落地,应看哪些指标?
张昊:未来一年,判断AI智能体手机是概念炒作还是实现了商业闭环,可以重点关注四项量化指标。
第一是跨应用任务的一次性成功率。在没有提前预演,并存在弹窗、动态界面变化和网络波动等真实干扰的复杂场景中,智能体完成跨应用任务的全流程一次成功率能否达到90%以上,是判断其是否具备日常使用价值的重要指标。目前,行业平均水平约为65%至75%。
第二是系统级智能体的日均调用频次和30天用户留存率。衡量智能体能否从尝鲜功能转变为高频刚需,关键要看用户每天主动调用智能体完成跨应用任务的次数,能否达到日均3次以上,以及用户开启智能体功能后的30天留存率。
第三是安全确权和误操作赔付兜底机制能否建立。一方面,要看涉及支付和隐私信息调用的安全校验机制是否成熟,例如能否采用硬件级双重生物识别;另一方面,当智能体出现错误下单、订错机票等问题时,手机厂商与应用平台能否明确责任归属,并建立相应的商业保险或赔付机制。
第四是端侧能耗和响应时延。复合跨应用任务的平均端到端响应时间能否缩短至3秒以内,以及系统级智能体在后台常驻和执行任务时,手机日均续航衰减能否控制在5%以内,将直接决定相关功能能否进入高频使用场景。
总体而言,L3级测试集中官宣只是AI智能体手机赛道的一声“发令枪”,下一阶段决定竞争结果的,将不再只是模型参数大小,而是谁能率先在体验稳定性、应用生态协同以及安全信任机制方面取得实质性突破。
张毅:在我看来,重点是要关注四方面指标。
首先是跨应用任务端到端的完成率,即智能体究竟能够独立完成多少任务,而不只是实现页面或应用之间的简单跳转。这是衡量其实际能力最直观的指标之一。
其次是头部APP主动开放标准接口的程度。如果主要应用平台愿意开放接口,将直接影响智能体跨应用调用服务的稳定性和覆盖范围。
第三是智能体功能能否形成稳定的日活跃使用量,尤其是能否出现用户可感知、高频且具有刚性需求的应用场景,并进一步成为推动消费者换机的因素。
最后还要关注安全体验和相关指标,包括操作过程能否完整留痕、权限能否一键撤回,以及出现误操作后能否及时停止或纠正等。智能体只有做到安全、透明、可控,才具备真正大规模落地的基础。(深圳商报首席记者 陈小慧 袁静娴)

