PAST-Bench – 普林斯顿推出的个人 Agent 的性能归因基准
PAST-Bench – 普林斯顿推出的个人 Agent 的性能归因基准并不只看表面做法,关键还要理解相关条件、限制和后续影响。
PAST-Bench是什么
PAST-Bench 是普林斯顿大学王梦迪团队推出出的基准测试,用于检验个人 AI Agent 的递归自我改进能力。PAST-Bench通过对比有记忆与无记忆条件下的任务表现,判断 Agent 保存的跨会话经验是否真正改进了后续行为。PAST-Bench 涵盖记忆、流程复用、信息搜集、更新四类能力,共 26 个场景 204 个任务回合。
PAST-Bench的主要功能
- 评估递归自我改进:检验个人 AI Agent 保存的跨会话经验(记忆、技能、任务历史)是否真正改进了后续行为。
- 隔离经验积累效果:区分”得分提升来自经验积累”还是”基础模型变强/Prompt 变化/任务难度”等其他因素。
- 四维能力诊断:覆盖记忆、流程复用、信息搜集、状态更新四大维度,定位 Agent 具体哪类能力有缺陷。
- 机制归因分析:不仅看最终得分,还追踪”存储→检索→应用”的完整路径,判断改进是否有真实路径支撑。
PAST-Bench的技术原理
- 任务族序列设计:Agent 按顺序执行同一任务族的多轮会话。早期会话创造保存经验的机会,后期会话检验这些经验是否被正确使用。
- 匹配对照实验:为每轮后期会话设计对照版本,关闭持久化能力,其他条件完全一致。通过”有记忆得分 – 无记忆得分”得到自我进化差值 Δ。
- 机制证据追踪:运行时记录记忆写入、技能调用、会话检索、状态更新等遥测数据,计算 Mechanism-Evidence Score,验证改进是否遵循预期路径。
- 持久化产物审计:检查 Agent 实际保存的内容(记忆条目、技能文件、会话索引),分析其结构、时效性和可复用性。
如何使用PAST-Bench
- 环境准备:从 GitHub 克隆 PAST-Bench 仓库并安装核心依赖及 Agent 适配器。
- 模型配置:在环境变量中配置所使用模型的 API Key。
- 沙箱构建:执行
past-bench build-image --kind sandbox构建评估所需的 Docker 沙箱镜像。 - 快速验证:用
past-bench evolve运行单个任务族并加上--compare-no-persistence参数做 Smoke Test。 - 完整评估:遍历全部 26 个任务族运行评估,每个任务族自动执行”有持久化”和”无持久化”两组对照实验。
- 结果分析:在
--trace-dir目录下查看sequence_comparison.json,获取 Δ 值和机制证据分数。 - 自定义接入:如需评估自有 Agent,在
agents/目录下实现适配器并确保支持--compare-no-persistence开关即可。
PAST-Bench的核心优势
- 真正的归因能力:PAST-Bench 能精确区分改进来自经验积累是模型本身变强/Prompt 变化/任务变简”。
- 匹配对照实验设计:每个任务族都配有关闭持久化的对照版本,其他条件完全一致,实现有记忆与无记忆的直接因果对比。
- 机制级诊断:提出 Mechanism-Evidence Score,判断 Agent 是否答对,还追踪”存储→检索→应用”的完整路径,识别”碰巧答对”与”真正复用经验”的区别。
- 四维能力拆解:将模糊的自我改进拆分为记忆、流程复用、信息搜集、状态更新四类具体能力,精准定位短板。
- 诊断驱动改进:基于基准暴露的运行时故障,直接催生 Hermes+ 框架,证明其不仅是评估工具,更是 Agent 架构优化的诊断引擎。
PAST-Bench的项目地址
- GitHub仓库:https://github.com/Gen-Verse/PAST-Bench
- arXiv技术论文:https://arxiv.org/pdf/2608.04003
PAST-Bench的同类竞品对比
| 维度 | PAST-Bench | SWE-Bench |
|---|---|---|
| 核心目标 | 检验 Agent 保存的跨会话经验是否真正改进了后续行为 | 检验 Agent 能否一次性正确修复真实 GitHub issue |
| 评估单元 | 一个任务族的多轮会话序列(早期积累 → 后期复用) | 单个独立的代码修复任务 |
| 持久化设计 | 核心设计:支持持久化状态(记忆、技能、会话历史)的开启与关闭 | 无持久化:每个任务都是全新环境,Agent 从零开始 |
| 对照机制 | 匹配对照实验——同一任务族分别运行”有记忆”和”无记忆”版本,精确归因 Δ 值 | 无对照设计——只判断 patch 是否正确,不区分改进来源 |
| 归因粒度 | 机制级:通过 Mechanism-Evidence Score 追踪”存储→检索→应用”的完整路径 | 结果级:只判断最终 patch 是否通过测试用例 |
| 能力覆盖 | 记忆、流程复用、信息搜集、状态更新(4 类跨会话能力) | 代码理解、调试、测试驱动开发(单会话能力) |
| 典型输出 | sequence_comparison.json(含 Δ 值、机制证据分数) | 通过率(Resolved %) |
PAST-Bench的应用场景
- 学术研究:为 Agent 递归自我改进提供标准化、可复现的量化评估环境,支持不同架构的客观对比。
- 框架开发:通过四维能力拆解精准定位 Agent 框架短板,指导架构优化(如 Hermes+ 的诞生)。
- 模型选型:在固定框架下对比不同基座模型的跨会话经验复用表现,识别各模型的能力偏向。
- 持久化验证:测试不同记忆结构和检索策略的实际效果,避免”存了但找不到”或”存了但没用”的无效持久化。
- 产品迭代:区分新版本得分提升是来自”跨会话经验积累”还是”基础模型变强”,确保持久化功能真实产生价值。
相关资讯
-
08.13
《逍遥情缘》中少侠如何打造装备?从收集必备材料开始!
-
08.13
三国乱世霸王赵云如何进行配队-三国乱世霸王赵云配队做法
-
08.13
基于阿里云 Milvus 复刻“高德扫街榜”
-
08.13
ComfyUI 实现 AI 漫剧工业化生产:解决角色一致性与时序画质问题
-
08.13
artlist-artlist,免版税音乐素材平台,库存资源丰富
-
08.13
阿里云可观测 2026 年 7 月产品动态
游戏推荐
推荐专题
热门阅读
-
-
-
- 纳米AI会议纪要写作操作步骤
- 08.13
-
- 即梦AI分身课程讲解视频操作步骤
- 08.13
-
推荐下载
-
-
下载
- |
-
-
下载
- 《行尸走肉第一章》免安装中文汉化硬盘版下载
- 单机|436 MB
- 一款以动作冒险为主题的游戏
-
-
下载
- 《街头霸王X铁拳》免安装中文汉化硬盘版下载
- 单机|111MB
- 一款非常好玩的格斗游戏
-
-
下载
- |
-
-
下载
- 《暗黑破坏神3》免安装繁体中文正式版下载
- 单机|7630 MB
- 一款以角色扮演为主题的游戏
-
-
下载
- 《马克思佩恩3》免安装硬盘版下载
- 单机|27033 MB
- 一款以第三人称射击为主题的游戏