微信扫码
添加专属顾问
如今,AI代理(Agent)作为一种复合型AI系统,正成为研究的前沿热点。然而,普林斯顿大学的研究人员在最新发表的论文中指出,当前的代理基准测试和评估方法存在严重缺陷,这些缺陷可能会阻碍真正有用的AI代理的开发。本文将深入探讨这项研究的核心发现,并详细介绍研究者提出的创新方法,为AI代理的评估和开发提供新的思路。
01
AI代理评估的现状
研究者指出,目前已有十多个代理基准测试被开发出来,涵盖了网络交互、编程和工具使用等多个领域。同时,许多原本用于评估语言模型的基准测试也被用来评估代理。然而,代理评估与语言模型评估有着根本的区别:
1. 代理通常用于更困难、更现实、更有实际效用的任务,这些任务往往没有单一的正确答案。
2. 代理可以执行更复杂的操作,如使用命令行完成任务。
3. 代理的运行成本可能远高于单次模型调用。例如,SWE-Agent的每次运行成本上限为4美元,相当于数十万个语言模型token。
这些差异导致代理评估面临独特的挑战,需要新的评估框架和方法。
图片由xiumaodalle生成
02
当前代理评估的四大缺陷
1. 盲目追求准确率,忽视成本
研究者发现,当前的代理评估过分关注准确率,而忽视了推理成本这一关键指标。他们通过实验证明,简单地增加模型调用次数就能显著提高准确率。例如:
- 在AlphaCode上,通过100万次重试可以将准确率从接近0%提高到30%以上。
- 在HumanEval基准测试中,研究者提出的简单"升温"策略(gradually increasing temperature)在成本降低50%的情况下,达到了与最先进复杂代理架构相当的准确率。
这张HumanEval结果的帕累托前沿图展示了不同AI代理和模型在HumanEval编程任务上的性能对比,主要从准确率和成本两个维度进行评估。图中的帕累托前沿线显示了在给定成本下能达到的最佳准确率。(需要解释一下:帕累托前沿线(Pareto Frontier)是经济学和决策科学中的一个重要概念,特别在多目标优化问题中,在帕累托最优点上,任何一个目标的改进都无法在不损害其他目标的情况下实现。如果一个解的某个目标的改进会导致其他目标的退化,那么这个解被称为帕累托最优。)值得注意的是,简单的基线方法(如Warming和Retry)在准确率上与复杂代理相当,但成本显著降低。
这一发现暴露出两个严重问题:
1. 最先进的代理系统可能变得不必要的复杂和昂贵。
2. 业界对准确率提升的来源可能得出了错误结论,过分强调了"系统2"思维等复杂方法的作用。
2. 模型开发者和下游开发者需求混淆
研究者指出,当前的基准测试没有区分模型开发者和下游应用开发者的不同需求。他们以NovelQA基准为例说明了这一问题:
NovelQA要求模型一次性回答关于一部小说的所有问题。这种设计有利于评估长上下文模型,但并不反映现实应用场景。在实际使用中,用户更可能逐个提问,这会大大增加检索增强生成(RAG)方法的成本。关于RAG的最佳实践:
研究者的实验显示:
- 在NovelQA上,RAG方法的成本仅为长上下文方法的一半。
- 但在现实场景中,RAG方法的成本可能是长上下文方法的20倍以上。
这种差异可能误导下游开发者对不同方法的选择。
3. 缺乏适当的留出集
研究者分析了17个近期的代理基准,发现许多基准缺乏适当的留出集,(再解释一下:什么是留出集,(hold-out set)是指在机器学习和数据分析中,为了评估模型性能而预留的一部分数据集。留出集用于测试模型的泛化能力,即模型在未见过的数据上的表现,主要用于模型评估和防止模型过拟合)有些甚至完全没有。这可能导致代理过拟合基准测试,而在现实世界中表现不佳。
研究者将代理的泛化能力分为四个级别:
1. 分布特定
2. 任务特定
3. 领域通用
4. 完全通用
他们建议,留出集的设计应与代理的预期泛化级别相匹配。然而,在17个基准中:
- 只有5个具有与其泛化级别相匹配的留出集
- 7个完全没有留出集,也没有计划添加
以WebArena为例,它旨在评估代理在各种网络任务上的表现,应属于领域通用级别。但它缺乏对新网站和任务的留出测试,这可能导致代理只是记住了特定任务的解决方案,而无法泛化到新的网络环境。
4. 评估实践缺乏标准化
研究者在复现WebArena和HumanEval的评估结果时,发现了普遍存在的可重复性问题。这些问题包括:
1. 评估脚本对代理设计做出不适当假设
2. 将语言模型评估基准不加修改地用于代理评估
3. 高昂的评估成本导致难以估计置信区间
4. 对外部因素(如网络环境)的依赖导致微妙错误
5. 缺乏标准化导致评估和开发中出现细微bug
例如,在复现LATS代理的结果时,研究者发现:
- LATS的评估脚本只在部分HumanEval任务上使用真实测试用例,导致一些错误解决方案被标记为正确。
- 这个问题导致LATS的实际准确率比报告的低约3个百分点。
这些问题不仅影响了结果的可靠性,还可能导致对代理能力的过度乐观估计。
03
重新定义AI代理评估
面对这些挑战,研究者提出了一系列创新方法,旨在提高AI代理评估的科学性和实用性。
1. 控制成本的评估方法
研究者提出了一种新的评估方法,将结果可视化为准确率和推理成本的帕累托曲线。这种方法允许同时考虑准确率和成本,为代理设计提供了新的优化空间。
这张图提供了更全面的视角,展示了准确率(y轴,范围从0到1)与API成本(x轴,以2024年4月的美元计,范围从0到140美元)的关系。这个完整的坐标轴让我们能够更清晰地看到各种方法之间在HumanEval编程任务上的差异:
- 大多数方法集中在图的左上角,表明它们在较低成本下就能达到较高的准确率。
- LATS (GPT-4)虽然准确率最高,但成本远高于其他方法,位于图的最右侧。
- 简单的策略(如Warming和Retry)能够以相对较低的成本达到与复杂代理相当的准确率。
- 成本并不总是与性能成正比。例如,LATS (GPT-4)的成本是其他方法的数倍,但准确率提升并不显著。
这些发现表明,通过智能的策略设计,可以在不大幅增加成本的情况下显著提高代理性能。
2. 联合优化准确率和成本
研究者提出了一种联合优化方法,通过权衡固定成本(如超参数优化)和可变成本(每次运行的成本)来设计更高效的代理。
他们基于DSPy框架实现了这一方法,并在HotPotQA基准上进行了测试。结果显示:
- 对于GPT-3.5,联合优化将可变成本降低了53%,同时保持了相似的准确率。
- 对于Llama-3-70B,可变成本降低了41%,准确率保持不变。
这种方法为代理设计提供了新的思路:通过前期投入更多资源进行彻底的优化,可以显著降低后续的运行成本,这也是近期DSPy在很多大厂风靡一时的原因。
3. 区分模型评估和下游评估
研究者强调,模型开发者和下游应用开发者有着不同的评估需求,应该使用不同的基准测试。
- 对于模型评估,应避免使用美元成本这样会随时间变化的指标,而应使用诸如参数数量或训练计算量这样的代理指标。
- 对于下游评估,实际成本才是关键。研究者建议包括输入/输出token数,以便使用者能够根据当前价格重新计算成本。
研究者还开发了一个简单的Web应用,允许用户调整不同语言模型的当前价格,并可视化HumanEval上各代理的成本-准确率权衡。
4. 设计合适的留出集
为防止代理过拟合基准测试,研究者建议根据代理的预期泛化级别设计相应的留出集:
1. 分布特定基准:留出同分布的样本
2. 任务特定基准:留出分布外的样本
3. 领域通用基准:留出全新的任务
4. 完全通用基准:留出全新的领域
例如,对于旨在评估通用网络交互能力的WebArena基准,留出集应该包含训练中没有出现过的网站类型和任务类型。
5. 标准化评估实践
研究者呼吁建立一个专门的代理评估框架,类似于HELM和LM Evaluation Harness这样的语言模型评估框架。这个框架应该:
1. 提供灵活的评估脚本,适应不同的代理设计
2. 将代理评估与语言模型评估明确区分
3. 允许多次运行以估计置信区间
4. 考虑外部因素对评估的影响
5. 建立社区规范,减少细微错误
04
重新审视AI代理性能
这个表格提供了不同AI代理在HumanEval任务上的性能和成本对比。从中我们可以得出以下关键见解:
1. 复杂不等于更好:简单但经过优化的策略(如Warming)可以达到与复杂代理相当或更好的性能,同时大幅降低成本。例如,Warming (GPT-4)达到了93.2%的准确率,成本仅为2.45美元,而LATS (GPT-4)虽然准确率为88.0%,但成本高达134.50美元。
2. 成本意识的重要性:在评估AI代理时,不能只看准确率,还需要考虑成本因素。例如,Escalation策略以仅0.27美元的成本达到了85.0%的准确率,这在资源受限的场景下可能是一个极具吸引力的选择。尽管Token成本在国内一降再降,目前可以忽略,可大模型厂商又不是慈善机构,也有成本的啊,最终价格一定会回到一个合理区间。到那个时候,你的Agent又当如何应对?
3. 模型选择的影响:使用GPT-4的代理普遍比使用GPT-3.5的代理表现更好,但成本也更高。这突显了在选择基础模型时需要权衡性能和成本。
4. 策略优化的潜力:通过智能的策略设计(如Warming、Retry、Escalation),可以在有限预算内显著提升性能。这为AI系统优化开辟了新的研究方向。
普林斯顿大学研究者的工作为AI代理评估和开发领域带来了重要启示:
1. 我们需要超越简单的准确率追求,采用更全面、更贴近实际的评估方法。
2. 成本控制和效率优化应该成为代理开发的核心考虑因素,即便是部署了Agent后续成本问题可能会成为焦点问题,这项研究还没有考虑Prompt的鲁棒性。
3. 评估方法应该能够准确反映代理在现实环境中的表现。
4. 标准化和可重复性对于推动整个领域的进步至关重要,这或许会成为一些头部企业的前进方向。
吸引我给大家介绍这篇文章的是DSPy技术的应用,DSPy在Agent开发方面真的非常具有优势
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业
2026-07-02
不改一行代码,看透 AI Agent 的每一次调用
2026-07-02
AI 不缺智商缺纪律:一场 Harness 工程化实践
2026-07-02
天工 3.2 重磅升级:Skywork Tags 上线,给 Agent 一张工牌,邀其加入你的工作群聊
2026-07-02
Context Infra 会是 AI 领域的下一个热点
2026-07-01
一文了解|SkillScan 智能体技能安全扫描最佳实践
2026-07-01
协作的逆向演进:从 Agent 逻辑重构团队管理
2026-07-01
港科大郭毅可谈Agentic AI时代的核心命题:人机共生,人不可能退场
2026-07-01
Sonnet 5终于来了,然而Opus 4.8现在有点尴尬
2026-04-15
2026-04-07
2026-04-07
2026-04-24
2026-04-17
2026-04-05
2026-04-05
2026-04-14
2026-04-24
2026-04-22
欢迎您使用【53AI 官方网站】(以下简称“本网站”或“我们”)。本《会员服务协议》(以下简称“本协议”)是您(以下简称“会员”或“用户”)与【深圳市博思协创网络科技有限公司】之间关于注册、登录及使用本网站会员服务所订立的法律协议。
在您注册或登录前,请务必审慎阅读、充分理解各条款内容,特别是免除或限制责任的条款、知识产权条款、争议解决条款等。此类条款将以加粗形式提示您注意。 当您通过微信公众号授权、手机验证码验证或其他方式成功登录本网站时,即视为您已完全理解并同意接受本协议的全部内容。
一、 定义
本网站:指由【深圳市博思协创网络科技有限公司】运营的,域名为【53ai.com】的网站及相关移动端页面。
会员服务:指本网站向注册会员提供的知识库文章查阅、内容检索及其他相关增值服务。
知识库内容:指本网站发布的包括但不限于文字、图表、数据、研究报告、行业分析等数字化内容资源。
二、 账号注册与登录
登录方式:本网站支持以下登录方式,您可根据实际情况选择:
微信公众号授权登录:您同意将您的微信OpenID信息授权给本网站,用于创建或关联会员账号。
手机验证码登录:您需提供真实有效的手机号码,并通过短信验证码完成身份验证与登录/注册。
账号安全:您的账号仅限您本人使用,禁止赠与、借用、租用、转让或售卖。因您保管不善导致的账号被盗、密码泄露等损失,由您自行承担。
实名认证:根据相关法律法规要求,我们可能要求您在特定功能下完成实名认证。如您拒绝提供,可能无法使用部分或全部服务。
未成年人保护:若您未满18周岁,请在法定监护人的陪同下阅读本协议,并在征得监护人同意后使用本服务。
三、 服务内容与规范
知识库查阅权限:会员登录后,有权按照其会员等级对应的权限范围,在线浏览、检索本网站知识库中的相关文章及内容。
服务变更:我们有权根据业务发展需要,调整、变更或终止部分服务内容,并将以网站公告、公众号消息等方式提前通知。
禁止行为:您在使用服务时不得实施以下行为:
利用技术手段批量爬取、下载、转存知识库内容;
将知识库内容用于商业目的或未经授权地向第三方传播;
干扰本网站正常运行或侵犯其他用户合法权益;
发布违法违规信息或从事违反公序良俗的活动。
四、 知识产权声明
权利归属:本网站知识库中的排版设计、软件代码等内容的知识产权均归【公司全称】或原权利人所有,受《中华人民共和国著作权法》等法律保护。
有限许可:本网站授予会员一项非独占、不可转让、不可转授权的普通许可,仅限于个人学习、研究之目的在线查阅知识库内容。
侵权追责:未经书面许可,任何单位或个人不得以任何形式复制、转载、摘编、镜像、汇编或以其他方式使用上述内容。一经发现,我们保留追究其法律责任的权利。
五、 个人信息保护
我们重视对您个人信息的保护。关于我们如何收集、使用、存储和保护您的个人信息,请单独阅读 《隐私政策》。
您通过微信公众号授权或手机号验证所提供的信息,我们将严格按照《个人信息保护法》的规定处理,仅用于身份识别、服务提供及安全验证等必要用途。
您可以随时通过网站设置或联系客服行使查阅、更正、删除个人信息及撤回授权同意的权利。
六、 免责声明
内容准确性:知识库内容仅供参考,不构成专业建议。我们不对其完整性、准确性、时效性作任何明示或暗示的保证,您应自行判断并承担使用风险。
不可抗力:因自然灾害、政策法规变化、网络故障、第三方平台接口异常(如微信接口维护、运营商短信通道故障)等不可抗力导致的服务中断或延迟,我们不承担违约责任。
第三方链接:本网站可能包含指向第三方网站的链接,该等网站的内容和服务不受我们控制,请您自行甄别风险。
七、 违约责任
如您违反本协议约定,我们有权视情节采取警告、限制功能、暂停服务、注销账号等措施,并保留要求赔偿损失的权利。
如因您的违约行为导致我们遭受行政处罚、第三方索赔或商誉损失,您应承担全部赔偿责任(包括但不限于罚款、赔偿金、律师费、公证费等)。
八、 法律适用与争议解决
本协议的订立、执行和解释均适用中华人民共和国大陆地区法律。
因本协议产生的或与本协议有关的任何争议,双方应友好协商解决;协商不成的,任何一方均可向【公司所在地】有管辖权的人民法院提起诉讼。
九、 其他
本协议构成双方就本服务达成的完整协议,取代此前任何口头或书面约定。
本协议任一条款被认定为无效或不可执行的,不影响其他条款的效力。
我们对本协议享有最终解释权,并在法律允许的范围内保留随时修改的权利。修改后的协议一经公布即生效,继续使用服务即视为同意修订内容。