news 2026/9/7 11:00:21

ARC-AGI高分背后:harness如何影响模型真实能力评测?

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
ARC-AGI高分背后:harness如何影响模型真实能力评测?

Opus 5 通关 ARC-AGI-3 的消息,今天在几个技术群里几乎同时炸开。很多人第一反应是:模型又进化了,通用人工智能又近了一步。但如果你这半年一直在关注 harness 工程这个词——也就是把模型包进一套完整的执行框架、让它在工具调用和循环反馈里完成任务的工程做法——你大概率会对这个结论保持警觉:这个分数,到底是模型自己考出来的,还是外面那层绳子把它拽上去的?

这不是抬杠。ARC-AGI 系列从设计之初就想做一件非常明确的事:把“背题式智能”和“现场推理能力”分开。它给出的不是知识问答,也不是可以靠着大量相似题训练出来的题型,而是全新的抽象图形转换任务。模型只能从极少量样例里推出隐藏规则,几乎没有任何调用先验知识的机会。按理说,这类基准是最不容易被工程手段污染、最接近“模型本体能力”的测试。可如果连它都在 harness 的加持下出现显著差异,那就意味着我们常用的“模型能力测量”这件事本身,已经开始变形了。

这篇文章想把这个话题拆开。先讲 ARC-AGI-3 到底在考什么,再讲 harness 是怎么改变分数的,最后给你一套可以自己复现的判断框架,用来分辨一次高分里,模型和绳子各占多少。

1. 先搞清楚 ARC-AGI 到底在考什么

1.1 它专门对抗“背题式智能”

ARC-AGI 全称是 Abstraction and Reasoning Corpus,由 François Chollet 提出。它和常规大模型评测最大的区别在于,每一道题都不是从题库里抽取的,而是由一套程序化规则动态生成的。任务通常表现为一组彩色方格组成的输入输出对,一般只给两到四个样例。模型需要从这些样例里发现隐藏的转换规则,然后把规则应用到新的测试输入上。

举个例子来帮助理解。一个任务可能会连续给出三个样例,每个样例左侧是一种图形排列,右侧是经过某种变换后的结果。模型要做的不是记住“第三题答案是哪个图”,而是从这几个例子里推断出“颜色映射关系是什么”“形状发生了旋转还是镜像”“数量是按照什么规律变化的”。规则可以是旋转、对称、计数、填充、颜色映射,也可以是它们的任意组合。这个设计最狠的地方在于任务空间的开放性:因为题目是组合生成的,理论上可以无限扩展,模型没有办法通过“我见过这题”来得分。

所以 ARC-AGI 一直被看作“AGI 试金石”。它考察的不是记忆总量,而是人类最看重的举一反三能力。这也意味着,任何基于大量数据预训练形成的语言先验,在这种任务上几乎全部失效。模型不能靠“读起来像某个学过的问题”来蒙答案,每一步都必须落到真实的规则推理上。

1.2 从 1 到 3,越难意味着什么

这个系列到了 ARC-AGI-2,难度已经明显跳档,很多大模型在它上面的得分远低于在 ARC-AGI-1 上的表现。再到 ARC-AGI-3,按照系列一贯的演进思路,它会进一步压缩样例数量、扩大规则组合空间,并且更有意识地对抗模型在公开数据上的预训练污染。每一代升级,本质上都是在把“能背的东西”再挤出去一点。

从工程角度看,这种迭代对模型提出的是三重考验:第一,样例更少,意味着模型要从更薄弱的信息里归纳规则;第二,规则组合更复杂,意味着搜索空间更大,单次推理很难覆盖所有可能性;第三,污染控制更严格,意味着模型无法依赖训练阶段可能见过的相似题目。换句话说,ARC-AGI-3 想测的,已经不是“模型知道多少”,而是“模型面对一个从未见过的问题,能不能现场想出解法”。

所以当“Opus 5 通关 ARC-AGI-3”这样的消息出现,理论上它传递的信号非常明确:这个模型能在从未见过的规则组合里,完成接近人类的抽象泛化。但这个判断有一个前提——整个评估过程中,模型真的是在“自己想”,而不是被外面那层系统替它想了大半。

2. 你看到的分数,其实是“模型 + 绳子”一起考出来的

2.1 Harness 是什么:一套从系统提示到测试时计算的完整脚手架

Harness 这个词,最近因为 AI 编程工具和 Agent 框架的普及,被越来越多的人挂在嘴边。它不是一个模型文件,而是模型外面那一整圈工程层:系统提示词的模板、工具调用的协议、多步执行与状态管理、失败后的回溯机制、候选答案的搜索与验证流程,以及测试时计算的策略。你可以把它理解成登山时的保护绳和下降器。向导本身是模型,但能不能安全、高效地到达终点,很大程度上取决于身上那套装备,以及装备能不能和人的判断配合好。

过去我们调用模型,方式是“给一个 prompt,拿一个 completion”。现在整个行业已经转向了“给一个目标,让模型在 harness 里逐步逼近”。在这个转变里,harness 承担了大量原本属于人的工作:把大任务拆成小步骤、在关键节点做检查、遇到报错时决定是重试还是换方案、最后把结果整理成可用格式。最近社区里讨论热度很高的 DeepSeek Harness、Codex Harness,本质上就是把这个概念产品化了。它们把“模型 + 工具 + 循环”封装成可安装、可配置的桌面端工具,让用户在命令行或图形界面里直接调度模型完成任务。

你会注意到,这类工具的宣传重点早就不只是“模型多聪明”,而是“模型放进这套 harness 之后,能稳定完成什么任务”。这个转变值得留意:模型能力,正在被重新定义成“可调用性”,而不只是权重本身的表现。

2.2 拆掉绳子,同样的模型会掉很多分

Harness 对评测分数的影响,往往被严重低估。尤其是 ARC 这类需要深度探索的任务,一个完整的 harness 能让模型分数产生非常显著的差异。在不少任务上,这种差距可以从几个百分点一路拉到几十个百分点,具体取决于任务复杂度和 harness 质量。

原因不难解释。裸跑模型通常只能做一次前向推理,按模型最可能的判断输出一个答案。而 harness 可以把这件事变成一整套流程:先生成多种可能的规则解释,再在样例上模拟验证,失败了就回溯重试;可以把复杂任务拆成多个子问题,分步解决;也可以在几套候选方案之间做比较和权衡。这些能力不是模型本身没有,而是单次推理时根本没有机会发挥。

换一个更生活化的比喻:一个数学很好的学生,正常考试和给他一张草稿纸、允许反复检查、允许错了再重算,成绩大概率是不一样的。ARC-AGI 这类评测,本质上给了模型那张草稿纸和重算的机会。草稿纸本身不是学生的知识,但它能让学生把已经会的知识稳定地输出出来。

所以在实际评估里,同样是某个新模型,裸跑和套上完整 harness,成绩可能是两个层级。这也引出一个反直觉的结论:当我们看到“某模型通关 ARC-AGI-3”时,这个分数本质上是“模型 + harness 系统”的联合输出。如果不是报告里写清楚了 harness 的配置,我们其实无法判断模型本体的真实水位。

3. 绳子为什么会反过来捆住模型

3.1 当评测变成了“谁的工程搭得更好”

Harness 参与评测,本身不是问题。问题是,当它成为决定分数的关键变量,评测就会慢慢从“检验模型”变成“检验工程的精妙程度”。

一个实际很常见的场景是:两个团队用同一个模型,其中一个在某个基准上跑出高分,另一个却怎么都复现不出来。差距往往不在模型,而在 harness 里的策略——系统提示词怎么组织、搜索次数设多少、验证器怎么设计、失败后回退多少步。为了让分数好看,团队完全有可能针对评测集做超参调优,直到数字达到预期。

这就像给一辆车换上更强的悬挂、更轻的车身、更宽的轮胎,然后对外宣称发动机本身升级了。如果评测体系不要求公开这些配置,分数的信息价值就会大打折扣。更麻烦的是,这种“工程化高分”通常会有一个共同特征:换一个任务分布,立刻现形。

3.2 绳子变硬的三个信号

Harness 是双刃剑。太松,模型容易跑偏;太硬,就会从辅助变成束缚。结合我在实际项目里的观察,一套 harness 开始反噬模型时,通常会出现三个信号。

第一个信号是模型的探索空间被压缩。如果 harness 把流程规定得过死,要求模型必须按照固定顺序执行,不允许它在发现异常后跳出既定路径,模型就失去了自我纠错的机会。在编程 Agent 场景里特别常见:Agent 已经意识到当前方案有问题了,但 harness 的规则不允许它停下来重新选型,最后只能沿着错误路线走到底。

第二个信号是策略先验取代了模型判断。当系统提示词里塞满了“你必须先这样、再那样、最后那样”,模型的思考空间会被逐步挤占。表面上看输出更规范,实际上推理过程已经被外包给了模板作者。模型成了一个执行器,而不是决策者。这种状态在 benchmark 上可能看不出问题,因为任务结构相对固定;一旦进入真实世界的开放任务,模板覆盖不到的地方就会全面崩溃。

第三个信号是评测结果不可复现。同一个模型、同一批任务,换一个 harness 版本或换一组搜索参数,分数差异巨大。当一次通过需要精确到“当时用的 prompt 模板第三版 + 搜索步数 64 + 验证阈值 0.8”才能复现时,这个分数反映的就不是模型的稳定能力,而是一次工程系统上的偶然成功。

判断一套 harness 是否健康,最简单的做法是看模型有没有机会“推翻自己的初步方案”。如果流程里完全没有这一步,绳子大概率已经收得太紧了。

4. 一套分辨“模型能力”和“绳子能力”的排查框架

4.1 先做四组对照实验

如果你拿到一份“通关”或高分报告,先不要急着下结论。按照下面四组配置做对照实验,基本能把模型和 harness 的贡献拆开:

组别配置想回答的问题
A模型裸跑:一次推理、无搜索、无反思、无工具模型单次判断的原始能力
B模型 + 简单反思循环多一步自我纠错能带来多少提升
C模型 + 完整 harness整套系统的最终成绩
D完整 harness 去掉某个关键模块(如验证器或回溯)每个模块对分数的边际贡献

A 到 C 的差距越大,说明 harness 的工程价值越高,但同时也说明,这个分数越不能单独归功于模型。B 和 D 的分差可以帮你定位问题到底出在推理策略还是执行机制。如果去掉验证器之后分数直接腰斩,那就要警惕:这个成绩依赖的是外部校验,而不是模型内部的推理一致性。反过来,如果去掉验证器分数几乎不变,说明验证器只是摆设,真正起作用的是模型自己。

4.2 用三个迁移性测试过滤水分

对照实验只能证明“有差异”,还不能证明“这个差异真实可用”。我一般还会跑三个迁移性测试。

第一个是分布外测试。把任务集合从基准风格换成另一类风格,看分数掉多少。真正来自模型的推理能力,应该有更强的跨分布保持能力。如果分数只在基准任务分布内坚挺,换一个相似但不同的分布就崩,那更可能是 harness 对任务特征的过拟合。具体做法是:保留同样的模型和 harness,只更换任务来源,观察成绩曲线的变化形态。

第二个是跨模型测试。把同一套 harness 从强模型换到弱模型上,观察它带来的加分是否接近。如果弱模型套上 harness 也能拿到接近强模型的分数,说明加分主要由 harness 提供,模型本体可能只是陪跑。这个测试在模型选型时非常有用,因为它能直接告诉你:你

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/6 10:53:59

FlinkSQL 常用 Join 方式:Regular / Interval / 维表 Join 怎么选

「我的数据空间」实时计算实践笔记 Flink SQL 系列 引言 无论在OLAP领域还是OLTP领域,多表Join都是业务所必备的。在OLTP场景中,日常事务的处理需要使用到Join操作;OLAP场景由于数据量大、字段多,数据通常被分为事实表和维度表以…

作者头像 李华
网站建设 2026/9/5 15:26:17

AI公司盈利背后:大模型推理成本优化与工程化实践

一家从成立之初就把“深度学习”写进基因的公司,能够在 2026 年上半年首次实现盈利,这件事放在整个 AI 行业里,都是一个非常值得拆解的信号。大家通常看到的是“盈利”这个财务结果,但作为长期关注大模型工程落地的开发者&#xf…

作者头像 李华
网站建设 2026/9/5 16:38:33

GNSS 高级篇 04 信号体制:4.3 信号强化技术解析

GNSS 高级篇 4 信号体制 4.3 信号强化技术解析 前面两节讲了信号"是什么"和"怎么共存",这一节我们讲信号"怎么变强"——在真实世界里,GNSS 信号面临着干扰、多径、欺骗等各种威胁,信号体制和接收机技术是怎么应…

作者头像 李华
网站建设 2026/9/5 9:58:35

从Anthropic IPO传闻看Claude API的接入与网络排查

这几天 AI 圈最热的讨论,除了模型能力本身,还有一个消息值得开发者关注:Anthropic 被传正在考虑 IPO,并且可能允许内部人分批套现。这个信息如果只看新闻标题,感觉是财经频道的事,但对你我这种每天调 Claud…

作者头像 李华
网站建设 2026/9/4 15:11:12

VMware Workstation Pro 从零到自动化:虚拟机安装、配置、快照与网络详解

这次我们直接看虚拟机。很多开发者和学生都需要在 Windows 主机上再跑一个 Linux 或 Windows 测试环境,VMware Workstation Pro 就是目前用得最多的桌面级虚拟机软件之一。它解决的问题很具体:不需要重装系统、不需要双系统切换,就能在同一台…

作者头像 李华
网站建设 2026/9/3 3:18:45

微信小程序云开发实战:从0到1搭建校园生活圈

简介:这是一套面向高校学生与小程序开发初学者的实战型校园生活服务类应用源码,基于微信小程序云开发技术构建,无需自建服务器即可快速部署表白墙、失物招领、兼职信息发布及闲置物品买卖四大核心功能,切实解决校园内信息互通与轻…

作者头像 李华