泡泡资讯网

AI智能体最缺的一课,是在正确的时候停下来 最近有人做了一个很有意思的实验:给G

AI智能体最缺的一课,是在正确的时候停下来
最近有人做了一个很有意思的实验:给GPT-5.6 Sol、Claude Fable 5、Grok 4.5和Gemini 3.6 Flash同样的“彩色铅笔”工具,让它们照着《蒙娜丽莎》《星月夜》作画,再完成5个文字命题。4个模型一共画了28张图,每次查看画布,系统都会记录相似度。
结果,8次有目标图的测试中,所有模型的最终成绩,都低于过程中的最佳成绩。它们看见了自己的作品,也反复修改,却集体错过了最好的停笔时刻。
Gemini画《蒙娜丽莎》时,相似度一度达到0.449,经过大约22次自我检查,最终降到0.337。Claude检查了27次,大约第5次之后就基本进入平台期;它完成7幅画的估算成本约160美元,而GPT-5.6 Sol约7.74美元。更多复盘,在这里换来的主要是时间、Token和退化。
这暴露了Agent系统一个容易被忽视的问题:会观察自己,不等于会判断自己。模型可以发现局部瑕疵,却未必知道一次修补会不会破坏整体;可以持续行动,却未必拥有可靠的完成标准。反馈循环如果没有外部评价、最佳版本保留和停止条件,反思就可能变成反复折腾。
这对真正进入工作流的AI尤其重要。写代码、做表格、改合同、运营广告,都可能出现“第六版最好,第十二版反而出错”。企业若只追求更长思考、更高调用次数,成本会上升,错误还会在多轮操作中累积。成熟的Agent应该像可靠的软件系统:保存检查点,比较新旧结果,指标恶化时回滚,达到阈值后主动交付。
当然,这只是一个小型开放实验,SSIM衡量的是结构相似度,不等于艺术质量,也不能据此给模型能力排总榜。
但它给出的工程提醒很清楚:智能不只体现在还能做多少步,也体现在知道哪一步已经足够好。下一轮Agent竞争,停止权会和行动权一样重要。