Gartner 说代理式 AI 登顶了,可你的 AI 还只会回答问题

Gartner 把代理型 AI 放上 2026 中国技术成熟度曲线的顶点,同期生成式 AI 滑向低谷;微软报告里 Microsoft 365 生态的活跃 Agent 一年增长 15 倍,约六成企业却开始给 AI 开支加限额。数字互相拉扯时,该问自己的 AI 卡在哪一步。一张表讲清会答题和能干活的三个差别,再给出换工具前必问的三句话:接得上、花多少、出错能不能停。

Gartner 说代理式 AI 登顶了,可你的 AI 还只会回答问题

Gartner 在 2026 年 8 月 27 日的新闻稿里,把代理型 AI 放到了 2026 中国技术成熟度曲线的顶点。这个位置叫期望膨胀期,同期生成式 AI 滑向泡沫破裂低谷期。这条消息传得挺广,但很多人看完的第一反应是:那我手里这个 AI 怎么还在等我复制粘贴?

微软在 2026 年 5 月 5 日发布的《工作趋势指数报告》给了另一半答案。这份调查覆盖 10 个国家、2 万名 AI 使用者。在 Microsoft 365 生态里,活跃 Agent 数量同比增长 15 倍,大型企业里是 18 倍。工具在默默换代,只是大部分人的用法还停在问答。

会答题和能干活差在哪

会答题的 AI 像一个电话客服,你描述问题,它回你一段话。能干活的 Agent 更像上门师傅,它自己看现场、带工具、修好了再告诉你换了什么零件。两者都能对话,差别在手上。

具体来说有三个差别:它能不能读到你的文件,能不能操作你电脑上的工具,能不能把结果直接落成一份文件。三条里缺一条,它就只能算一个更聪明的输入框。

为什么今年风向变了

Gartner 那条曲线说的是期望值,意思是资本和厂商的注意力先到位了。观点网在 2026 年 9 月 3 日的报道里引 Gartner 的判断,AI 智能体距离生产成熟期还有 2 到 5 年。热度到了,成熟度还没到,这个落差就是现在的真实状态。

另一边,钱的尺子比技术曲线更硬。据瑞银证券 2026 年 6 月 23 日发布的 AI 研究报告,约六成企业已经开始限制 AI 开支,主要动作是给调用量加限额。会答题的功能再花哨,账算不过来也留不住。

还有一组来自使用者的数字值得看。同一份微软报告里,66% 的受访者说 AI 帮他们把时间挪到了更值钱的活上。省下来的时间去了哪,比榜单上的分数更能说明这东西有没有用。

你的 AI 卡在哪一步

想象一个很常见的早高峰场景。十点要交周报,你把上周的销售表一段段复制给 AI,它回你一段读起来不错的文字。可格式要你自己排,图表要你自己画,最后发邮件的还是你本人。

卡点通常不在模型聪不聪明,而在三件事:它没有你电脑上文件夹的读取权限,没有能操作表格和邮件的工具,也没有固定的输入输出约定。所以每次都得你当那根线,把东西搬来搬去。

仙踪问道在实测里发现一个规律:把权限从只读放开到可写,出错后的麻烦会成倍上升,收益却只有一点点。先从只读的活开始试,返工率反而更低。

换工具时先问哪三个问题

第一问,它能不能接上你现有的东西,比如文件夹、表格和邮件。据亿欧智库 2026 年 5 月的文章引述,MCP 官方工具包的月下载量已经超过 9700 万次,这类接口被广泛采用意味着接得上的概率在提高。

第二问,一次要花多少钱,能不能设上限。企业开始给调用量加限额,个人也一样需要心里有数,尤其是那种挂一整天跑的自动化任务。

第三问,出错之后能不能一键停下、能不能回滚。能停、能退、能查记录,这三样决定了你敢不敢把稍有分量的活交出去。

对比项会答题的助手能调工具的 Agent
输入你复制粘贴过去的文字直接读文件夹和表格
产出一段可用的文字一份改好的文件
出错时你重写一遍停下并说明哪一步出的问题
花钱方式按对话次数算按任务和调用量算

能力溢出的年代该按什么选

各家模型在常见任务上的表现越来越接近之后,挑工具的尺子就从聪明程度转向可用程度。能不能接上你的资料,能不能设成本上限,能不能在出错时停下来,这三个问题比跑分更能决定你用得顺不顺。

换个说法,过去挑 AI 像挑一个聪明的实习生,现在挑 AI 更像挑一个靠谱的同事。聪明是入场券,靠谱才是长期留在工位上的理由。

仙踪问道把这类判断做成了默认设置:常用文件夹只读,写操作要确认,省得每换一个人就重新讲一遍规矩。

如果你手上正好有那种每周重复三次以上的活,可以拿仙踪问道·智能助手试一次,它先把权限切好、把常用工具接上,再让你决定哪些步骤交出去。

这个账号会持续拆解 AI 工具的选型问题,关注之后能看到每条数据的来源和实测过程。你的 AI 最近一次真的帮你干完一整件事是什么?欢迎在评论区聊聊。