{
  "cs-0309048": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "理论上的 Gödel Machine：运行任务程序，并在内部搜索证明；不是某款已训练的语言模型。",
        "sources": [
          {
            "label": "§3 Formal Description",
            "url": "https://arxiv.org/abs/cs/0309048"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "机器内部的证明搜索器寻找“改写程序会提高效用”的证明，满足条件后执行改写；改写也可以涉及证明搜索器自身。",
        "sources": [
          {
            "label": "§3 Formal Description",
            "url": "https://arxiv.org/abs/cs/0309048"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "机器自身的代码，包括负责寻找改进方案与证明改进有效的程序。",
        "sources": [
          {
            "label": "§3 Formal Description",
            "url": "https://arxiv.org/abs/cs/0309048"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "通过形式证明判断：改写程序的预期效用是否高于继续运行原有搜索。这里的效用是系统预先定义、希望最大化的目标。",
        "sources": [
          {
            "label": "§3 Formal Description",
            "url": "https://arxiv.org/abs/cs/0309048"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "初始程序含任务求解器、公理系统、效用定义和证明搜索器。只有证明某个自修改比继续原搜索更有利后才切换；可改的包括证明搜索机制本身，前提是初始形式系统能够证明所需命题。",
        "sources": [
          {
            "label": "§2.3、§5–6",
            "url": "https://arxiv.org/abs/cs/0309048"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "证明搜索器同时寻找自修改程序及其收益证明。只有证明现在切换优于继续原搜索，才执行代码替换；可被改写的代码也包括证明搜索器自身。",
        "sources": [
          {
            "label": "§3 Formal Description",
            "url": "https://arxiv.org/abs/cs/0309048"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "不适用：理论机器，不以训练数据集定义学习。",
        "sources": [
          {
            "label": "§3 Formal Description",
            "url": "https://arxiv.org/abs/cs/0309048"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "形式证明检查修改的预期效用；不是从评测基准错题诊断。",
        "sources": [
          {
            "label": "§3 Formal Description",
            "url": "https://arxiv.org/abs/cs/0309048"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "理论最优性结论，没有本文 task agent 评测基准测试。",
        "sources": [
          {
            "label": "§3 Formal Description",
            "url": "https://arxiv.org/abs/cs/0309048"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "关键边界是公理的正确性和证明可达性，而非 训练／测试 划分。",
        "sources": [
          {
            "label": "§3 Formal Description",
            "url": "https://arxiv.org/abs/cs/0309048"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "把寻找改进方案、证明改进有效的程序也纳入自修改范围；每次切换都要求形式证明，保证依赖预设公理与可证明性。",
        "sources": [
          {
            "label": "§3 Formal Description",
            "url": "https://arxiv.org/abs/cs/0309048"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2303.11366": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "ALFWorld（通过文字动作完成家居物体操作的交互环境） 使用 GPT-3 执行动作；编程实验以 GPT-4 生成代码，并运行自建单元测试。模型配置随任务变化，不能统一写成一款 语言模型 执行任务的模型。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2303.11366#S3"
          },
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2303.11366#S3.SS0.SSS0.Px3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2303.11366#S4.SS1"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2303.11366#S4.SS3"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2303.11366#S4.SS3.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "固定反思提示让语言模型把失败反馈写成文字经验，下一次执行时读取。算法将执行任务的模型、评估器、reflector 分为角色；§4 没有逐项列出所有角色对应的 API 快照，不能据此断言都用同一个版本。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2303.11366#S3"
          },
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2303.11366#S3.SS0.SSS0.Px3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2303.11366#S4.SS1"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2303.11366#S4.SS3"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2303.11366#S4.SS3.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "跨尝试保留的反思记忆：记录失败原因和下一次的改进建议。模型参数及执行、评估、反思流程固定。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2303.11366#S3"
          },
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2303.11366#S3.SS0.SSS0.Px3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2303.11366#S4.SS1"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2303.11366#S4.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "编程任务运行测试检查代码，问答任务对照答案，交互任务读取环境给出的成功或失败。模型把这些结果与执行过程一起用于反思；不同任务的具体判分方式见展开表格。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2303.11366#S3"
          },
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2303.11366#S3.SS0.SSS0.Px3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2303.11366#S4.SS1"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2303.11366#S4.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "任务执行者、结果评估器、反思器和短期经验缓冲区组成固定流程。失败后把结果转成文字反思再重试；问答/家务设置可保留三条经验，编程设置保留一条，不更新模型参数。",
        "sources": [
          {
            "label": "§4.1–4.3",
            "url": "https://arxiv.org/abs/2303.11366"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "反思器读取本次轨迹、成功/失败信号和此前反思，指出错误动作及下次应采取的替代做法。把文字反思追加到记忆，再从重置后的同一任务重试；不改权重或反思算法。任务成功或达到重试上限后停止；不是先筛选一套新运行框架再部署。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2303.11366#S3"
          },
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2303.11366#S3.SS0.SSS0.Px3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2303.11366#S4.SS1"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2303.11366#S4.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "不做参数训练。ALFWorld（通过文字动作完成家居物体操作的交互环境） 的 134 个环境、HotpotQA（需要结合多份资料作答的多跳问答基准） 的 100 道题在当前题上反思重试。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2303.11366#S4.SS1"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2303.11366#S4.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "动作/问答读取任务结果；编程使用自行生成并通过语法检查的至多 6 个单元测试。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2303.11366#S4.SS1"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2303.11366#S4.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "编程在 HumanEval（根据函数要求生成代码、用测试检查结果的编程基准）、MBPP（Python/Rust）及 LeetcodeHardGym 40 题上，用正式测试判断最终代码。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2303.11366#S4.SS1"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2303.11366#S4.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "动作/问答的反馈与报告来自同题重试；编程把自建测试与正式测试分开。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2303.11366#S4.SS1"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2303.11366#S4.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "把失败原因写成下一次尝试会读取的文字记忆，使同一任务的重试能够利用先前教训；参数和反思流程保持固定。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2303.11366#S3"
          },
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2303.11366#S3.SS0.SSS0.Px3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2303.11366#S4.SS1"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2303.11366#S4.SS3"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2305.16291": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "主实验由 gpt-4-0314 为 Minecraft 游戏编写行动代码，再通过 Mineflayer（让程序控制游戏角色的工具库）执行；gpt-3.5-turbo-0301 辅助问答，text-embedding-ada-002 将技能描述转成可按相似度检索的向量。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/2305.16291#S2"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2305.16291#A1.SS1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2305.16291#S3.SS1"
          },
          {
            "label": "附录A.3",
            "url": "https://arxiv.org/html/2305.16291#A1.SS3.SSS2"
          },
          {
            "label": "附录A.4",
            "url": "https://arxiv.org/html/2305.16291#A1.SS4.SSS1"
          },
          {
            "label": "附录A.5",
            "url": "https://arxiv.org/html/2305.16291#A1.SS5.SSS1"
          },
          {
            "label": "附录B.4",
            "url": "https://arxiv.org/html/2305.16291#A2.SS4.SSS5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "gpt-4-0314 生成并调试技能代码，也负责课程提议和任务成功检查；补充实验将主模型换为 gpt-4-0613。模型参数不更新。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/2305.16291#S2"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2305.16291#A1.SS1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2305.16291#S3.SS1"
          },
          {
            "label": "附录A.3",
            "url": "https://arxiv.org/html/2305.16291#A1.SS3.SSS2"
          },
          {
            "label": "附录A.4",
            "url": "https://arxiv.org/html/2305.16291#A1.SS4.SSS1"
          },
          {
            "label": "附录A.5",
            "url": "https://arxiv.org/html/2305.16291#A1.SS5.SSS1"
          },
          {
            "label": "附录B.4",
            "url": "https://arxiv.org/html/2305.16291#A2.SS4.SSS5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "Minecraft 技能库中的可执行代码，用于保存和复用已学会的动作。模型参数、课程选择、技能检索和验证流程固定。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/2305.16291#S2"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2305.16291#A1.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "读取 Minecraft 中的物品与环境状态、代码报错，以及模型对目标是否完成的检查。环境观察说明实际发生了什么，模型据此判断下一次应怎样修代码。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/2305.16291#S2"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2305.16291#A1.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2305.16291#S3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "自建 Minecraft agent 包含自动课程、代码技能库和失败后修改代码的流程。自动课程选择探索目标，技能库复用已完成的行为，Mineflayer 工具库把代码变成游戏动作；模型参数不更新。",
        "sources": [
          {
            "label": "自动课程、技能库与迁移实验",
            "url": "https://arxiv.org/abs/2305.16291"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "同时读环境状态、代码运行错误和提供批评意见的模型的完成判断，据此修复本轮技能。GPT-4 编写并修改 Mineflayer 可执行技能；课程模块根据已完成和失败任务选择下一目标。每个目标最多修订 4 轮；成功的代码加入技能库，失败目标记录后继续课程。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/2305.16291#S2"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2305.16291#A1.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "Minecraft 在线探索；主实验每次最多 160 轮提示，共 3 次运行。经验是采集、制作和探索时生成的技能代码。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2305.16291#S3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "当前世界的任务状态和代码异常；完成情况由提供批评意见的模型检查。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2305.16291#S3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "另清空背包、重置新世界，测试 4 个未见目标；每目标 3 次尝试，上限 50 轮提示。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2305.16291#S3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "探索曲线来自持续学习；新世界目标实验另测技能迁移，不能把两者混成一套测试。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2305.16291#S3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "把成功行为保存成可检索、可再次执行的代码技能，并让自动课程决定接下来探索什么；经验因此能用于新的 Minecraft 任务。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/2305.16291#S2"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2305.16291#A1.SS1"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2505.22954": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "SWE-bench用Claude 3.5 Sonnet（New）；Polyglot用o3-mini。两者均由档案中的候选 task agent 代码组织执行，模型权重冻结。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2505.22954#S3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2505.22954#S4.SS1"
          },
          {
            "label": "附录C.3",
            "url": "https://arxiv.org/html/2505.22954#A3.SS3"
          },
          {
            "label": "附录D.1",
            "url": "https://arxiv.org/html/2505.22954#A4.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "o1 读取评估日志提出改进问题，父版本 编程 task agent 用 Claude 3.5 Sonnet 实施源码修改。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2505.22954#S3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2505.22954#S4.SS1"
          },
          {
            "label": "附录C.3",
            "url": "https://arxiv.org/html/2505.22954#A3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "coding agent 的代码与 harness，包括任务执行方式和工具使用逻辑。基础模型参数、外层父代选择和评测器固定。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2505.22954#S3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2505.22954#S4.SS1"
          },
          {
            "label": "附录C.3",
            "url": "https://arxiv.org/html/2505.22954#A3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "在 SWE-bench 和 Polyglot 中运行代码测试，判断修复是否成功；诊断者结合测试结果和执行日志提出改进建议。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2505.22954#S3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2505.22954#S4.SS1"
          },
          {
            "label": "附录C.3",
            "url": "https://arxiv.org/html/2505.22954#A3.SS3"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2505.22954#S4.SS2"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2505.22954#S4.SS4"
          },
          {
            "label": "附录E.2",
            "url": "https://arxiv.org/html/2505.22954#A5.SS2"
          },
          {
            "label": "附录E.3",
            "url": "https://arxiv.org/html/2505.22954#A5.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "轻量编程 task agent，只有 Bash 和查看/编辑文件两个工具；输入包括仓库位置、问题和测试框架。",
        "sources": [
          {
            "label": "算法与跨 benchmark/语言迁移",
            "url": "https://arxiv.org/abs/2505.22954"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "独立的 o1 模型诊断评估日志并提出建议，修改者实现新 agent 版本，再运行编程任务。候选必须能编译并保留编辑仓库的能力才能入档；不要求每个后代立即超过父代，较弱版本也可成为后续改进的起点。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2505.22954#S3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2505.22954#S4.SS1"
          },
          {
            "label": "附录C.3",
            "url": "https://arxiv.org/html/2505.22954#A3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "SWE-bench：先 10 题，再加 50 题，强候选扩到共 200 题；Polyglot：10 题门控，再评另外 50 题。",
        "sources": [
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2505.22954#S4.SS2"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2505.22954#S4.SS4"
          },
          {
            "label": "附录E.2",
            "url": "https://arxiv.org/html/2505.22954#A5.SS2"
          },
          {
            "label": "附录E.3",
            "url": "https://arxiv.org/html/2505.22954#A5.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "上述搜索子集的运行日志和成绩用于诊断、采样父代和筛选候选。",
        "sources": [
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2505.22954#S4.SS2"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2505.22954#S4.SS4"
          },
          {
            "label": "附录E.2",
            "url": "https://arxiv.org/html/2505.22954#A5.SS2"
          },
          {
            "label": "附录E.3",
            "url": "https://arxiv.org/html/2505.22954#A5.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "报告同域成绩及 full Polyglot；另将 SWE-bench 进化版本迁移到 Polyglot，反向亦然，并测 Python→其他语言。",
        "sources": [
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2505.22954#S4.SS2"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2505.22954#S4.SS4"
          },
          {
            "label": "附录E.2",
            "url": "https://arxiv.org/html/2505.22954#A5.SS2"
          },
          {
            "label": "附录E.3",
            "url": "https://arxiv.org/html/2505.22954#A5.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "同域扩展集合含搜索题；跨评测基准实验才是该次进化从未接触的任务来源。",
        "sources": [
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2505.22954#S4.SS2"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2505.22954#S4.SS4"
          },
          {
            "label": "附录E.2",
            "url": "https://arxiv.org/html/2505.22954#A5.SS2"
          },
          {
            "label": "附录E.3",
            "url": "https://arxiv.org/html/2505.22954#A5.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "让已有 coding agent 修改自身代码，并保留不同历史分支；暂时分数不高的版本也可能成为后来改进的起点。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2505.22954#S3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2505.22954#S4.SS1"
          },
          {
            "label": "附录C.3",
            "url": "https://arxiv.org/html/2505.22954#A3.SS3"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2511.10395": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "Qwen2.5-7B-Instruct和Qwen2.5-14B-Instruct，经过本文训练后执行AppWorld/BFCL任务。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2511.10395#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2511.10395#S3.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2511.10395#S4.SS1"
          },
          {
            "label": "§5",
            "url": "https://arxiv.org/html/2511.10395#S5"
          },
          {
            "label": "§7.1",
            "url": "https://arxiv.org/html/2511.10395#S7.SS1.SSS2"
          },
          {
            "label": "§7.1",
            "url": "https://arxiv.org/html/2511.10395#S7.SS1.SSS3.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "固定GRPO（比较同一任务多次尝试的奖励，用相对好坏更新模型参数的强化学习方法）训练程序更新Qwen2.5-7B/14B；Self-Questioning的探索和任务合成用Qwen-Plus，任务评分者用Qwen3-235B-A22B。步骤归因另见Self-Attributing配置。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2511.10395#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2511.10395#S3.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2511.10395#S4.SS1"
          },
          {
            "label": "§5",
            "url": "https://arxiv.org/html/2511.10395#S5"
          },
          {
            "label": "§7.1",
            "url": "https://arxiv.org/html/2511.10395#S7.SS1.SSS2"
          },
          {
            "label": "§7.1",
            "url": "https://arxiv.org/html/2511.10395#S7.SS1.SSS3.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "策略模型参数，以及训练中生成的任务和经验；环境接口与训练规则固定。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2511.10395#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2511.10395#S3.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2511.10395#S4.SS1"
          },
          {
            "label": "§5",
            "url": "https://arxiv.org/html/2511.10395#S5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "最终任务结果用于训练；Qwen-Max 另对整条轨迹的各步标记好坏，把最终收益分配到具体步骤。合成任务的评审由 Qwen3-235B-A22B 承担，两种评审角色不同。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2511.10395#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2511.10395#S3.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2511.10395#S4.SS1"
          },
          {
            "label": "§5",
            "url": "https://arxiv.org/html/2511.10395#S5"
          },
          {
            "label": "§7.1",
            "url": "https://arxiv.org/html/2511.10395#S7.SS1.SSS3.Px1"
          },
          {
            "label": "§7.1",
            "url": "https://arxiv.org/html/2511.10395#S7.SS1.SSS3.Px3"
          },
          {
            "label": "§7.1",
            "url": "https://arxiv.org/html/2511.10395#S7.SS1.SSS1"
          },
          {
            "label": "§7.3",
            "url": "https://arxiv.org/html/2511.10395#S7.SS3.SSS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "以可训练 task agent 的行为策略接入 AppWorld（通过多个应用的程序接口完成日常事务的交互基准） 和 BFCL 的工具交互，系统自行构造探索任务、利用已有成功经验导航，并给轨迹分配训练信用。基础工具环境固定，主要训练行为策略，而非随意改底层 API。",
        "sources": [
          {
            "label": "§6.3、§7.1.1–7.1.3",
            "url": "https://arxiv.org/abs/2511.10395"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "Qwen-Max 阅读整条轨迹，给各步标好坏，将步骤贡献与最终任务奖励结合。固定训练程序据此更新 Qwen2.5-7B/14B；合成任务和经验检索帮助收集有效训练经历，模型不自行改写训练算法。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2511.10395#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2511.10395#S3.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2511.10395#S4.SS1"
          },
          {
            "label": "§5",
            "url": "https://arxiv.org/html/2511.10395#S5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "在 AppWorld（通过多个应用的程序接口完成日常事务的交互基准）、BFCL 环境探索后合成任务。消融分别比较 100/200/500 条合成数据；它们不是三套最终测试集。",
        "sources": [
          {
            "label": "§7.1",
            "url": "https://arxiv.org/html/2511.10395#S7.SS1.SSS1"
          },
          {
            "label": "§7.3",
            "url": "https://arxiv.org/html/2511.10395#S7.SS3.SSS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "自建任务由 Qwen3-235B-A22B 评判并去重；经验质量由 语言模型 校验。",
        "sources": [
          {
            "label": "§7.1",
            "url": "https://arxiv.org/html/2511.10395#S7.SS1.SSS1"
          },
          {
            "label": "§7.3",
            "url": "https://arxiv.org/html/2511.10395#S7.SS3.SSS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "AppWorld（通过多个应用的程序接口完成日常事务的交互基准） 任务完成率 TGC；BFCL v3 的 multi-turn split，检查后端状态及执行路径。主实验每题 8 次运行，报告 avg@8/best@8。",
        "sources": [
          {
            "label": "§7.1",
            "url": "https://arxiv.org/html/2511.10395#S7.SS1.SSS1"
          },
          {
            "label": "§7.3",
            "url": "https://arxiv.org/html/2511.10395#S7.SS3.SSS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "§7.1 指定环境与 BFCL 子集，但没有给出可复现的合成题—最终评估题逐题去重清单；不能据环境相同断言题目重叠。",
        "sources": [
          {
            "label": "§7.1",
            "url": "https://arxiv.org/html/2511.10395#S7.SS1.SSS1"
          },
          {
            "label": "§7.3",
            "url": "https://arxiv.org/html/2511.10395#S7.SS3.SSS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "将自主生成任务、利用已有经验探索、判断哪些步骤贡献了奖励接入参数训练，分别处理学习材料、探索效率和训练信号的问题。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2511.10395#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2511.10395#S3.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2511.10395#S4.SS1"
          },
          {
            "label": "§5",
            "url": "https://arxiv.org/html/2511.10395#S5"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2603.19461": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "按任务分开：Polyglot 编程由 o3-mini 执行；论文评审由 GPT-4o 执行；机器人奖励函数由 Claude 4.5 Sonnet 编写并交给模拟器运行；奥数解答评分由 o4-mini 执行。",
        "sources": [
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2603.19461#S5.SS1"
          },
          {
            "label": "§5.3",
            "url": "https://arxiv.org/html/2603.19461#S5.SS3"
          },
          {
            "label": "附录D.1",
            "url": "https://arxiv.org/html/2603.19461#A4.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "Polyglot 的自修改模型是 Claude 3.5 Sonnet (New)；其余三个领域均用 Claude 4.5 Sonnet 修改 task agent 和 meta-agent 代码。",
        "sources": [
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2603.19461#S5.SS1"
          },
          {
            "label": "§5.3",
            "url": "https://arxiv.org/html/2603.19461#S5.SS3"
          },
          {
            "label": "附录D.1",
            "url": "https://arxiv.org/html/2603.19461#A4.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "两层代码：执行任务的 agent，以及负责修改它的 meta-agent。后者的改进程序也能被修改；外层父代选择和评测协议固定。",
        "sources": [
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2603.19461#S5.SS1"
          },
          {
            "label": "§5.3",
            "url": "https://arxiv.org/html/2603.19461#S5.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "反馈随领域变化：编程看执行测试，机器人看环境任务收益，论文评审和数学评分看评价结果。修改者读取相应成绩及执行日志，详细任务协议分行列在表格中。",
        "sources": [
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2603.19461#S5.SS1"
          },
          {
            "label": "§5.3",
            "url": "https://arxiv.org/html/2603.19461#S5.SS3"
          },
          {
            "label": "附录C.1",
            "url": "https://arxiv.org/html/2603.19461#A3.SS1"
          },
          {
            "label": "附录C.2",
            "url": "https://arxiv.org/html/2603.19461#A3.SS2"
          },
          {
            "label": "附录C.3",
            "url": "https://arxiv.org/html/2603.19461#A3.SS3"
          },
          {
            "label": "附录C.4",
            "url": "https://arxiv.org/html/2603.19461#A3.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "DGM-H 同时保存可编辑任务程序和改进程序。论文评审/机器人奖励设计的共同起点仅直接返回一次模型调用结果，没有任务专用解析或后处理，因此初始格式错误可能直接导致零分；不是从成熟领域 task agent 开始。",
        "sources": [
          {
            "label": "初始 agent；各领域数据设置",
            "url": "https://arxiv.org/abs/2603.19461"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "上层修改者读取解题程序、改进程序以及历次成绩和日志，决定改哪一部分。两套程序都可编辑；用训练或验证成绩选版本，再按各领域的测试协议评价。",
        "sources": [
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2603.19461#S5.SS1"
          },
          {
            "label": "§5.3",
            "url": "https://arxiv.org/html/2603.19461#S5.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "论文评审：100 篇训练文章；Polyglot：60 道搜索题；机器人：Go2 前进任务；迁移后的 IMO 评分：100 道训练题。",
        "sources": [
          {
            "label": "附录C.1",
            "url": "https://arxiv.org/html/2603.19461#A3.SS1"
          },
          {
            "label": "附录C.2",
            "url": "https://arxiv.org/html/2603.19461#A3.SS2"
          },
          {
            "label": "附录C.3",
            "url": "https://arxiv.org/html/2603.19461#A3.SS3"
          },
          {
            "label": "附录C.4",
            "url": "https://arxiv.org/html/2603.19461#A3.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "评审及 IMO 各另有 100 道 验证集；Polyglot 与机器人无单独 验证集，以训练成绩选版本。",
        "sources": [
          {
            "label": "附录C.1",
            "url": "https://arxiv.org/html/2603.19461#A3.SS1"
          },
          {
            "label": "附录C.2",
            "url": "https://arxiv.org/html/2603.19461#A3.SS2"
          },
          {
            "label": "附录C.3",
            "url": "https://arxiv.org/html/2603.19461#A3.SS3"
          },
          {
            "label": "附录C.4",
            "url": "https://arxiv.org/html/2603.19461#A3.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "评审及 IMO 各 100 道 测试集；机器人改测抬高躯干；Polyglot 报 full 评测基准，原文同时称含 165 个未见任务。",
        "sources": [
          {
            "label": "附录C.1",
            "url": "https://arxiv.org/html/2603.19461#A3.SS1"
          },
          {
            "label": "附录C.2",
            "url": "https://arxiv.org/html/2603.19461#A3.SS2"
          },
          {
            "label": "附录C.3",
            "url": "https://arxiv.org/html/2603.19461#A3.SS3"
          },
          {
            "label": "附录C.4",
            "url": "https://arxiv.org/html/2603.19461#A3.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "评审/IMO 三段划分；机器人跨目标。Polyglot 的 full 评测基准与未见部分口径需区分；IMO 全集附加结果也不等于独立测试子集。",
        "sources": [
          {
            "label": "附录C.1",
            "url": "https://arxiv.org/html/2603.19461#A3.SS1"
          },
          {
            "label": "附录C.2",
            "url": "https://arxiv.org/html/2603.19461#A3.SS2"
          },
          {
            "label": "附录C.3",
            "url": "https://arxiv.org/html/2603.19461#A3.SS3"
          },
          {
            "label": "附录C.4",
            "url": "https://arxiv.org/html/2603.19461#A3.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "把 task agent 和 meta-agent 的代码都设为可修改对象；再把改进程序迁移到新领域，检验它是否学会了通用的 agent 修改方法。",
        "sources": [
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2603.19461#S5.SS1"
          },
          {
            "label": "§5.3",
            "url": "https://arxiv.org/html/2603.19461#S5.SS3"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2603.28052": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "分类：GPT-OSS-120B；数学：GPT-OSS-20B 等；TB2：Opus 4.6 / Haiku 4.5。各实验目标模型固定。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2603.28052#S3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "Claude Code（可读写项目文件、运行命令和测试的 coding agent 工具） 中的 Claude Opus 4.6 作为候选方案提出者，读取历史运行框架、分数和执行轨迹，改写单文件 Python 运行框架；执行任务的基础模型按领域另设并保持冻结。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2603.28052#S3"
          },
          {
            "label": "Claude Code 官方说明",
            "url": "https://code.claude.com/docs/en/overview"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "可执行 harness 的代码：模型调用、工具使用、记忆与检索、执行步骤。目标模型参数和外层搜索规则固定。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2603.28052#S3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "用于搜索和改进候选方案的数据集标签、任务分数或可执行结果检查器（按测试或判分规则检查任务结果）；不同任务使用不同评分器。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2603.28052#S3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "不同实验有不同起点。分类比较无示范提示、少量示范提示、ACE（通过反思整理经验来构造上下文）和 MCE（维护文字技能库来构造上下文）；数学任务提供检索语料及提示、路由逻辑；终端任务与 Terminus 等已有执行框架比较。不能据某个实验推断全篇只有一套初始工具。",
        "sources": [
          {
            "label": "分类实验；数学附录 C、Tables 10–11；终端实验",
            "url": "https://arxiv.org/abs/2603.28052"
          },
          {
            "label": "§4.1：ACE / MCE 起点说明",
            "url": "https://arxiv.org/html/2603.28052#S4.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "修改者通过终端查阅历代代码、分数和完整执行记录，定位问题后直接改检索、状态管理、提示或执行控制代码。候选先检查接口有效性，再在搜索题上运行；保留效果或成本各有优势的版本，最后评价入选框架。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2603.28052#S3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "分类：LawBench、Symptom2Disease、USPTO-50k 的搜索子集；数学：250 道搜索题；Terminal-Bench 2：全部 89 题。",
        "sources": [
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2603.28052#S4.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "候选方案提出者读取搜索题的标签/成绩和轨迹，自主提出后继版本。",
        "sources": [
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2603.28052#S4.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "分类用留出题；数学另用 IMO-AnswerBench 100、IMO-ProofBench 60、ArXivMath 两个月份共 40 题；TB2 仍测同一 89 题。",
        "sources": [
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2603.28052#S4.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "分类/数学的测试不返回给候选方案提出者；TB2 明确同集搜索和报告，不能统一标成独立测试。",
        "sources": [
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2603.28052#S4.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "修改者可以主动检索历史版本的代码、分数和执行记录，再改写组织模型与工具的程序；历史保留到可重新诊断的细节层面。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2603.28052#S3"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2604.25850": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "GPT-5.4（high）在 NexAU（组织模型、工具和任务执行的模块化 agent 框架） 的 Code Agent 中运行任务；跨模型测试再替换这个执行端，复用已进化的运行框架。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2604.25850#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2604.25850#S3.SS1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2604.25850#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.25850#S3.SS3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2604.25850#S4.SS1.SSS0.Px2"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2604.25850#A1.SS0.SSS0.Px3"
          },
          {
            "label": "NexAU 官方说明",
            "url": "https://github.com/nex-agi/NexAU"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "GPT-5.4 驱动 Evolve Agent 改代码，另一个 GPT-5.4 Agent Debugger 提供诊断。推理强度存在原文差异：正文 §4.1 称三个角色均为 high，附录 A 表 4 的 Evolve Agent 配置是 xhigh。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2604.25850#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2604.25850#S3.SS1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2604.25850#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.25850#S3.SS3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2604.25850#S4.SS1.SSS0.Px2"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2604.25850#A1.SS0.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "coding agent 的 harness：执行代码、工具、中间处理逻辑和长期记忆。模型参数及外层诊断、修改流程固定。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2604.25850#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2604.25850#S3.SS1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2604.25850#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.25850#S3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "Terminal-Bench 2 的任务验收程序判断是否完成；同时比较同一题在修改前后是否由失败变成功、是否反而退化，再检查改动是否符合原先预测。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2604.25850#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2604.25850#S3.SS1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2604.25850#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.25850#S3.SS3"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2604.25850#S4"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2604.25850#S4.SS3"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2604.25850#A1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "从 NexAU 的初始版本出发，仅提供 Bash 命令行工具。NexAU 是组织模型、工具和执行过程的 agent 框架；这个实验的起点未预置完整专用工具、中间处理代码和长期记忆，进化逐步补充这些机制，例如改命令超时处理。",
        "sources": [
          {
            "label": "实验设置与转移实验；原文口径补注",
            "url": "https://arxiv.org/abs/2604.25850"
          },
          {
            "label": "NexAU 官方说明",
            "url": "https://github.com/nex-agi/NexAU"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "诊断角色先从逐题记录分析成功或失败原因，再汇总共同问题。修改者编辑提示、工具、中间处理和记忆代码，同时写出预计修好或破坏哪些任务。下一轮实际执行核对预测，再保留或撤回改动。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2604.25850#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2604.25850#S3.SS1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2604.25850#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.25850#S3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "Terminal-Bench 2 全部 89 题，连续 10 轮修改运行框架；不训练模型参数。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2604.25850#S4"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2604.25850#S4.SS3"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2604.25850#A1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "每题每轮 2 次执行尝试（从开始做任务到得到结果的过程），Agent Debugger 对照成功/失败轨迹及跨轮变化，检验改动 改动清单。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2604.25850#S4"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2604.25850#S4.SS3"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2604.25850#A1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "同一 TB2 89 题报告最终成绩；冻结运行框架后，另测 SWE-bench Verified 500 题。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2604.25850#S4"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2604.25850#S4.SS3"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2604.25850#A1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "TB2 是同集迭代；SWE-bench Verified 是跨评测基准迁移。换模型但仍测 TB2 不等于换了任务。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2604.25850#S4"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2604.25850#S4.SS3"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2604.25850#A1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "把一次框架修改关联到具体组件和执行证据，并通过移植组件检查改动能否复用、是否与其他组件相互干扰。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2604.25850#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2604.25850#S3.SS1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2604.25850#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.25850#S3.SS3"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2606.09498": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "MiniMax M2.5、Qwen3.5-35B-A3B 或 GLM-5。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2606.09498#S3.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2606.09498#S4.SS1.SSS0.Px4"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2606.09498#S4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "每个配置使用对应的 MiniMax M2.5、Qwen3.5-35B-A3B 或 GLM-5 担任提案者，读取评测器返回的失败证据并提出编辑；基础模型参数冻结。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2606.09498#S3.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2606.09498#S4.SS1.SSS0.Px4"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2606.09498#S4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "harness 配置允许修改的提示词、工具、记忆、状态和执行机制；不修改模型参数、任务环境或候选接受规则，也不能任意重写整个 SDK。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2606.09498#S3.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2606.09498#S4.SS1.SSS0.Px4"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2606.09498#S4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "评测任务自带的判分程序给出任务通过或失败。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2606.09498#S3.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2606.09498#S4.SS1.SSS0.Px4"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2606.09498#S4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "DeepAgent SDK 上的简化配置：简短任务提示、默认文件系统和命令行工具。没有多模态输入处理，故对应任务被排除；只能改运行框架定义的配置面，不是任意改整个 SDK。",
        "sources": [
          {
            "label": "实验任务子集与 promotion gate",
            "url": "https://arxiv.org/abs/2606.09498"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "修改者只读取用于诊断的题的轨迹、失败类型、成功行为和历史改动，提出针对性的少量修改。接受时同时检查这批题和留出检查题的分数；留出题的轨迹不公开，但分数参与选择，因此它不是最后才使用的独立测试。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2606.09498#S3.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2606.09498#S4.SS1.SSS0.Px4"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2606.09498#S4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "不训权重。TB2 固定 64 题子集；SWE-bench Verified 67 道 用于诊断和改进的题；AppWorld（通过多个应用的程序接口完成日常事务的交互基准） 90 道官方训练题，提供失败轨迹。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2606.09498#S4.SS1.SSS0.Px1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2606.09498#S4.SS1.SSS0.Px4"
          },
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2606.09498#A1.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "SWE 33 道单独留出的、AppWorld（通过多个应用的程序接口完成日常事务的交互基准） 90 道从 test_normal/test_challenge 抽取的题，加上各自 用于诊断和改进的题 分数共同决定是否接受候选。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2606.09498#S4.SS1.SSS0.Px1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2606.09498#S4.SS1.SSS0.Px4"
          },
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2606.09498#A1.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "最终报告同一 用于诊断和改进的题/预先留出的题 的通过率，没有再加第三套完全不参与门控的测试集。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2606.09498#S4.SS1.SSS0.Px1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2606.09498#S4.SS1.SSS0.Px4"
          },
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2606.09498#A1.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "单独留出的轨迹不向候选方案提出者展示，但成绩参与自动选择；“看不到题”不等于“未用于选版本”。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2606.09498#S4.SS1.SSS0.Px1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2606.09498#S4.SS1.SSS0.Px4"
          },
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2606.09498#A1.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "让执行任务的同一种模型归纳自己的共性失败，再修改自己的运行框架；接受修改仍由预设检查控制，包含留出题的分数。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2606.09498#S3.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2606.09498#S4.SS1.SSS0.Px4"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2606.09498#S4.SS2"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2606.17546": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "主对照用DeepSeek-V4-Flash执行ACE、TF-GRPO、AHE；跨模型实验另用GLM-5.1、GPT-5.4，并交换运行框架快照与执行执行端。",
        "sources": [
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.17546#A1.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2606.17546#S4.SS1"
          },
          {
            "label": "附录B.3",
            "url": "https://arxiv.org/html/2606.17546#A2.SS3"
          },
          {
            "label": "附录B.4",
            "url": "https://arxiv.org/html/2606.17546#A2.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "ACE、TF-GRPO、AHE各自实现更新；主实验执行端为DeepSeek-V4-Flash，跨模型AHE分别在GLM-5.1和GPT-5.4下进化。SEAGym负责调用和记录。",
        "sources": [
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.17546#A1.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2606.17546#S4.SS1"
          },
          {
            "label": "附录B.3",
            "url": "https://arxiv.org/html/2606.17546#A2.SS3"
          },
          {
            "label": "附录B.4",
            "url": "https://arxiv.org/html/2606.17546#A2.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "基准本身固定；比较的是不同方法如何更新可持续保留的运行框架与状态。",
        "sources": [
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.17546#A1.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "各任务原生评分器给出成绩；平台另外比较不同版本在验证、新任务、旧任务重做和成本上的表现，区分能力提升、遗忘与额外开销。",
        "sources": [
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.17546#A1.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2606.17546#S3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "作者自建评估层，分别提供“执行任务”和“更新方法状态”两类接口。前者返回可公开的执行记录和奖励，后者按各方法原有规则更新跨任务保留的运行框架与状态。任务环境和判分程序仍由原评测基准运行，私有答案及数据划分信息不提供给 task agent。",
        "sources": [
          {
            "label": "算法 1；数据划分；附录 E",
            "url": "https://arxiv.org/abs/2606.17546"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "被测方法各自负责更新系统，SEAGym 负责提供任务、保存版本并记录表现。更新后的验证、新任务测试、旧任务重做及成本分别统计，从而观察收益是否保留、是否遗忘。",
        "sources": [
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.17546#A1.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "Terminal-Bench 2 与 HLE（涵盖多个学科高难度问题的 Humanity’s Last Exam 基准） 数学/物理文本题组成 80 道 训练集，按批运行并更新。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2606.17546#S3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "35 道 验证集 用于观察进化轮次快照；更新规则由 ACE、TF-GRPO、AHE 等被测方法决定。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2606.17546#S3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "55 道 同分布测试；另有 80 道 HLE（涵盖多个学科高难度问题的 Humanity’s Last Exam 基准） 计算机科学／人工智能、Engineering 题测 分布外任务；额外重放训练题以观察遗忘。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2606.17546#S3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "明确区分训练、阶段验证、最终 ID/分布外任务 和训练重放；重放成绩不当作新题泛化。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2606.17546#S3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "在连续更新过程中反复测新任务、旧能力和成本，观察中间好版本是否随后退化；重点是测量改进过程。",
        "sources": [
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.17546#A1.SS1"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2607.14777": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "Qwen2.5-3B-Instruct、Qwen2.5-7B-Instruct、Qwen3-1.7B-Instruct的当前checkpoint（某个时刻保存的模型或系统版本）；多模态扩展用Qwen2.5-VL-3B-Instruct。",
        "sources": [
          {
            "label": "附录B.3",
            "url": "https://arxiv.org/html/2607.14777#A2.SS3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.14777#S4.SS1.SSS0.Px4"
          },
          {
            "label": "附录C.3",
            "url": "https://arxiv.org/html/2607.14777#A3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "Stage1由GLM-5.2从轨迹抽取事后技能以构造监督微调（用示范数据训练模型）；Stage2由当前策略checkpoint（某个时刻保存的模型或系统版本）兼任分析器，固定GRPO（比较同一任务多次尝试的奖励，用相对好坏更新模型参数的强化学习方法）与从当前模型实际执行的记录中进行蒸馏学习程序更新参数。",
        "sources": [
          {
            "label": "附录B.3",
            "url": "https://arxiv.org/html/2607.14777#A2.SS3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.14777#S4.SS1.SSS0.Px4"
          },
          {
            "label": "附录C.3",
            "url": "https://arxiv.org/html/2607.14777#A3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "策略模型的参数；事后技能用于训练，不作为永久部署记忆。",
        "sources": [
          {
            "label": "附录B.3",
            "url": "https://arxiv.org/html/2607.14777#A2.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "环境在任务结束时返回的奖励，以及完成任务的逐步执行记录。",
        "sources": [
          {
            "label": "附录B.3",
            "url": "https://arxiv.org/html/2607.14777#A2.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "固定任务交互接口上的可训练 task agent，先用轨迹—技能数据 监督微调（用示范数据训练模型），再进行 on-policy distillation/强化学习（根据奖励调整模型行为）。技能是训练信号，不等同于部署时另外维护一个永久技能库；ALFWorld（通过文字动作完成家居物体操作的交互环境）、WebShop（根据用户要求挑选和购买商品的交互基准）、搜索各有原生动作接口。",
        "sources": [
          {
            "label": "Table 3 与训练数据配置",
            "url": "https://arxiv.org/abs/2607.14777"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "分析器从当前策略生成的轨迹中提取事后技能；技能条件下的 词元 概率提供更密集的训练信号。先做轨迹—技能 监督微调（用示范数据训练模型），再联合 GRPO（比较同一任务多次尝试的奖励，用相对好坏更新模型参数的强化学习方法） 与从当前模型实际执行的记录中进行蒸馏学习；分析器随策略同步更新。按 强化学习（根据奖励调整模型行为）/蒸馏目标更新参数，不是用测试分数接受某段运行框架补丁。",
        "sources": [
          {
            "label": "附录B.3",
            "url": "https://arxiv.org/html/2607.14777#A2.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "监督微调（用示范数据训练模型） 每类 180 题×8 条轨迹；强化学习（根据奖励调整模型行为）：ALFWorld（通过文字动作完成家居物体操作的交互环境） 2,400、WebShop（根据用户要求挑选和购买商品的交互基准） 2,400、搜索 QA 19,200 条训练实例。",
        "sources": [
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2607.14777#A2.SS1.SSS0.Px4"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.14777#S4.SS1.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "训练轨迹的终局奖励和事后技能用于学习；数据比例实验比较样本效率。",
        "sources": [
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2607.14777#A2.SS1.SSS0.Px4"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.14777#S4.SS1.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "ALFWorld（通过文字动作完成家居物体操作的交互环境） 140 已见＋134 未见；WebShop（根据用户要求挑选和购买商品的交互基准） 128 题；搜索 QA 共 51,713 题，涵盖 NQ、TriviaQA、PopQA、HotpotQA（需要结合多份资料作答的多跳问答基准）、2Wiki、MuSiQue、Bamboogle。",
        "sources": [
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2607.14777#A2.SS1.SSS0.Px4"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.14777#S4.SS1.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "训练和评估分别配置；ALFWorld（通过文字动作完成家居物体操作的交互环境） 的 seen/unseen 结果分开报告。七个 QA 评估集不能全部当成训练集。",
        "sources": [
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2607.14777#A2.SS1.SSS0.Px4"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.14777#S4.SS1.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "从模型自己的执行经历提炼文字指导，在训练时帮助产生更好的行为，再把指导转入模型参数；最终执行不依赖额外的这份指导。",
        "sources": [
          {
            "label": "附录B.3",
            "url": "https://arxiv.org/html/2607.14777#A2.SS3"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2607.15524": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "sonnet-4.6、opus-4.7、opus-4.8 的 research/coding task agent，在当前 loop specification 下生成仓库。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2607.15524#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2607.15524#S3.SS3"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2607.15524#S4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "语言模型 运行框架优化器读取历次仓库比较反馈并改写工作流提示。§5.1 列明了执行模型，附录 C 给出优化提示，但这两处没有明确指定优化器的模型型号；不能把评价用 GPT-5.5 当成优化器型号。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2607.15524#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2607.15524#S3.SS3"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2607.15524#S4.SS2"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2607.15524#S5.SS1"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2607.15524#A3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "描述 agent 角色、通信方式、工作流和上下文管理的提示文本；不修改可执行代码或模型参数。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2607.15524#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2607.15524#S3.SS3"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2607.15524#S4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "模型按功能、任务要求和可复现性等标准比较前后两个产物，判断哪版更好；这是成对质量评审，并非所有任务都由代码测试给出通过率。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2607.15524#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2607.15524#S3.SS3"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2607.15524#S4.SS2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.15524#S4.SS1"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2607.15524#S5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "研究任务专用的多 task agent 提示设计，初始定义角色、交接、产物与检查规则，再迭代这些说明。展示的工具/数据清单属于方案规定，不能自动当作已经执行并验证的系统功能。",
        "sources": [
          {
            "label": "任务设定、初始/迭代 harness 示例与评估",
            "url": "https://arxiv.org/abs/2607.15524"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "比较相邻版本的产物及历史修改，找出多 agent 之间的信息传递问题。修改的是文字规定的角色、指令、交付要求和通信步骤；后续仍按产物成对评审比较，不能据此声称完整运行代码都经过执行测试。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2607.15524#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2607.15524#S3.SS3"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2607.15524#S4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "30 个合成 ML 研究任务：量化金融、机器人、制药各 10 个，由行业招聘描述转成研究任务。没有模型参数训练。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.15524#S4.SS1"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2607.15524#S4.SS2"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2607.15524#S5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "同一任务上比较相邻版本生成的仓库；评审反馈写入该任务的运行框架历史。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.15524#S4.SS1"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2607.15524#S4.SS2"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2607.15524#S5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "继续在这 30 个任务上比较版本，另比较不同模型和随机运行。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.15524#S4.SS1"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2607.15524#S4.SS2"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2607.15524#S5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "同题定制与重跑，不是从训练题学习通用运行框架后在另一批题盲测。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.15524#S4.SS1"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2607.15524#S4.SS2"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2607.15524#S5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "比较相邻两个版本的任务产物来调整提示、角色间信息传递和上下文配置；修改范围是这些用户可配置的说明与设置。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2607.15524#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2607.15524#S3.SS3"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2607.15524#S4.SS2"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2607.25886": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "Qwen3.5-35B-A3B-Base 派生的目标 checkpoints；通过固定 task agent 运行框架执行。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2607.25886#S3.SS1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2607.25886#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2607.25886#S3.SS3"
          },
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2607.25886#S3.SS4"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2607.25886#S4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "主矩阵：Claude Code（可读写项目文件、运行命令和测试的 coding agent 工具） + Opus-4.8/Sonnet-5（high），Codex + GPT-5.6-Sol/Terra（max）。生成训练轨迹的外部模型固定Claude Opus4.8，Tinker执行训练。另有Claude Code + Kimi-K2.6指导Kimi-K2.6的案例。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2607.25886#S3.SS1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2607.25886#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2607.25886#S3.SS3"
          },
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2607.25886#S3.SS4"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2607.25886#S4.SS2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.25886#S4.SS1"
          },
          {
            "label": "§5.5",
            "url": "https://arxiv.org/html/2607.25886#S5.SS5.SSS0.Px1"
          },
          {
            "label": "Claude Code 官方说明",
            "url": "https://code.claude.com/docs/en/overview"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "训练数据的选择／构造策略，以及用这些数据训练出的 LoRA 参数（少量附加可训练参数）。训练、推理和评分基础设施固定。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2607.25886#S3.SS1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2607.25886#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2607.25886#S3.SS3"
          },
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2607.25886#S3.SS4"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2607.25886#S4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "训练服务实际生成候选模型，评估端返回其成绩及诊断记录；研究 agent 用这些反馈调整数据策略和选择模型版本。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2607.25886#S3.SS1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2607.25886#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2607.25886#S3.SS3"
          },
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2607.25886#S3.SS4"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2607.25886#S4.SS2"
          },
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2607.25886#S3.SS5"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2607.25886#S4.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "平台通过 Tinker 训练服务执行参数更新并提供训练后的模型调用。软件修复任务使用 mini-swe-agent（主要用命令行读写文件和运行测试），其他任务使用 Terminus-2（组织模型操作终端环境）。研究 agent 主要决定数据策略和合成数据内容，最终评分所用框架固定。",
        "sources": [
          {
            "label": "§3 固定设施；§4.3 与附录 A",
            "url": "https://arxiv.org/abs/2607.25886"
          },
          {
            "label": "mini-swe-agent 官方说明",
            "url": "https://github.com/SWE-agent/mini-swe-agent"
          },
          {
            "label": "Terminus：终端 task agent",
            "url": "https://www.tbench.ai/news/terminus"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "研究 agent 从错误提出能力缺口假设，决定合成或筛选什么数据。训练服务用新数据训练候选适配参数，再返回成绩；研究 agent 选择保存的模型版本。最终部署框架固定，不允许通过更换它来提高分数。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2607.25886#S3.SS1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2607.25886#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2607.25886#S3.SS3"
          },
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2607.25886#S3.SS4"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2607.25886#S4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "研究者围绕六个目标基准，以公开 seed 仓库/示例生成训练记录，交给固定服务训练 Qwen3.5-35B-A3B-Base 的 LoRA（只训练少量适配参数）；不是统一预制训练集。",
        "sources": [
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2607.25886#S3.SS5"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2607.25886#S4.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "SWE-bench Verified/Multilingual/Pro 各 100 题、GPQA（研究生级科学问答基准） Diamond 100 题、TB2 89 题、AIME 2026 30 题提供候选反馈。",
        "sources": [
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2607.25886#S3.SS5"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2607.25886#S4.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "选定 checkpoint（某个时刻保存的模型或系统版本） 后，在新环境用同一目标任务子集重新评估；AIME 每题 4 次解码。",
        "sources": [
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2607.25886#S3.SS5"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2607.25886#S4.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "新建沙箱隔离执行状态，但没有额外不参与候选选择的测试题。",
        "sources": [
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2607.25886#S3.SS5"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2607.25886#S4.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "平台接手训练和数据处理的工程执行，让被测模型主要决定研究什么数据；同时记录找到的最好方案与最终保留方案的差距。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2607.25886#S3.SS1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2607.25886#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2607.25886#S3.SS3"
          },
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2607.25886#S3.SS4"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2607.25886#S4.SS2"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2607.28568": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "Frontis-MA1-35B在OpenMLE-Evo中执行ML研究操作；35B训练基座为Qwen3.6-35B-A3B，另有从Qwen3-30B-A3B-Thinking-2507开始的配置。",
        "sources": [
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2607.28568#S3.SS5"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.28568#S4.SS1"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2607.28568#S4.SS2"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2607.28568#S4.SS3"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2607.28568#S5.SS1"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2607.28568#S5.SS2"
          },
          {
            "label": "§5.4",
            "url": "https://arxiv.org/html/2607.28568#S5.SS4"
          },
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2607.28568#A2.SS1"
          },
          {
            "label": "附录B.3",
            "url": "https://arxiv.org/html/2607.28568#A2.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "部署时由训练后的Frontis-MA1执行草拟／调试／改进／交叉组合。监督微调（用示范数据训练模型）教师包括GLM-4.7与Qwen3-30B-A3B-Thinking-2507，随后固定强化学习（根据奖励调整模型行为）流程训练这些操作。",
        "sources": [
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2607.28568#S3.SS5"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.28568#S4.SS1"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2607.28568#S4.SS2"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2607.28568#S4.SS3"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2607.28568#S5.SS1"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2607.28568#S5.SS2"
          },
          {
            "label": "§5.4",
            "url": "https://arxiv.org/html/2607.28568#S5.SS4"
          },
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2607.28568#A2.SS1"
          },
          {
            "label": "附录B.3",
            "url": "https://arxiv.org/html/2607.28568#A2.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "负责程序进化的模型参数，以及它生成的机器学习程序；外层搜索框架固定。",
        "sources": [
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2607.28568#S3.SS5"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.28568#S4.SS1"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2607.28568#S4.SS2"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2607.28568#S4.SS3"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2607.28568#S5.SS1"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2607.28568#S5.SS2"
          },
          {
            "label": "§5.4",
            "url": "https://arxiv.org/html/2607.28568#S5.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "运行机器学习实验后得到的任务评分或评测结果。",
        "sources": [
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2607.28568#S3.SS5"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.28568#S4.SS1"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2607.28568#S4.SS2"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2607.28568#S4.SS3"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2607.28568#S5.SS1"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2607.28568#S5.SS2"
          },
          {
            "label": "§5.4",
            "url": "https://arxiv.org/html/2607.28568#S5.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "作者的 OpenMLE-Gym 是标准任务环境，OpenMLE-RL 负责训练研究模型，OpenMLE-Evo 负责提出、组合和筛选候选改进。每题已有公开数据、示例提交和 metric.py 评分程序；隐藏答案留在私有区域，研究者有可运行的起点。",
        "sources": [
          {
            "label": "任务包构造、MLE-Bench Lite 设置和 NatureBench 迁移",
            "url": "https://arxiv.org/abs/2607.28568"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "模型学习四类研究操作：草拟程序、修复错误、改进方案、组合不同方案。先用示范训练，再根据执行效果强化这些操作；部署时由 OpenMLE-Evo 搜索系统调度，保存程序、成绩及分支经验，继续选择父代。",
        "sources": [
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2607.28568#S3.SS5"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.28568#S4.SS1"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2607.28568#S4.SS2"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2607.28568#S4.SS3"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2607.28568#S5.SS1"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2607.28568#S5.SS2"
          },
          {
            "label": "§5.4",
            "url": "https://arxiv.org/html/2607.28568#S5.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "OpenMLE-Gym 5,758 个可执行任务：156 个精选任务、3,362 个 Kaggle Dataset 任务、2,240 个 Kaggle Competition 任务；其中执行轨迹用于 监督微调（用示范数据训练模型）/强化学习（根据奖励调整模型行为）。",
        "sources": [
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2607.28568#S3.SS5"
          },
          {
            "label": "§6.1",
            "url": "https://arxiv.org/html/2607.28568#S6.SS1.SSS0.Px1"
          },
          {
            "label": "§6.6",
            "url": "https://arxiv.org/html/2607.28568#S6.SS6"
          },
          {
            "label": "附录D.2",
            "url": "https://arxiv.org/html/2607.28568#A4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "任务内部可见训练数据及验证成绩供代码搜索；程序执行异常也返回操作模型。",
        "sources": [
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2607.28568#S3.SS5"
          },
          {
            "label": "§6.1",
            "url": "https://arxiv.org/html/2607.28568#S6.SS1.SSS0.Px1"
          },
          {
            "label": "§6.6",
            "url": "https://arxiv.org/html/2607.28568#S6.SS6"
          },
          {
            "label": "附录D.2",
            "url": "https://arxiv.org/html/2607.28568#A4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "MLE-Bench Lite 官方 22 题；另用固定 10 题 NatureBench Lite 检查跨科研领域迁移。",
        "sources": [
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2607.28568#S3.SS5"
          },
          {
            "label": "§6.1",
            "url": "https://arxiv.org/html/2607.28568#S6.SS1.SSS0.Px1"
          },
          {
            "label": "§6.6",
            "url": "https://arxiv.org/html/2607.28568#S6.SS6"
          },
          {
            "label": "附录D.2",
            "url": "https://arxiv.org/html/2607.28568#A4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "框架训练任务与评估评测基准去重；竞赛内部的验证/私有测试是另一层划分。NatureBench 子集仅 10 题，结论范围有限。",
        "sources": [
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2607.28568#S3.SS5"
          },
          {
            "label": "§6.1",
            "url": "https://arxiv.org/html/2607.28568#S6.SS1.SSS0.Px1"
          },
          {
            "label": "§6.6",
            "url": "https://arxiv.org/html/2607.28568#S6.SS6"
          },
          {
            "label": "附录D.2",
            "url": "https://arxiv.org/html/2607.28568#A4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "专门训练执行机器学习工程研究的模型，并提供与训练操作相配套的搜索环境，分别检查模型能力和搜索所得经验的迁移。",
        "sources": [
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2607.28568#S3.SS5"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.28568#S4.SS1"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2607.28568#S4.SS2"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2607.28568#S4.SS3"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2607.28568#S5.SS1"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2607.28568#S5.SS2"
          },
          {
            "label": "§5.4",
            "url": "https://arxiv.org/html/2607.28568#S5.SS4"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2608.02276": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "冻结的 Qwen3.5-9B 运行生成的运行框架完成任务；跨模型实验再把运行框架迁移给其他目标模型。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.02276#S3.SS1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.02276#S3.SS2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.02276#S4.SS1.SSS0.Px4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "独立的 Qwen3.5-9B 框架工程师 生成和修改运行框架；先用 GPT-5.5 提供冷启动示例，再用在线 GRPO（比较同一任务多次尝试的奖励，用相对好坏更新模型参数的强化学习方法） 训练工程师模型。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.02276#S3.SS1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.02276#S3.SS2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.02276#S4.SS1.SSS0.Px4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "两种变化：harness 编辑模型的参数，以及它生成的执行补丁。被修复的任务模型参数固定。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.02276#S3.SS1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.02276#S3.SS2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.02276#S4.SS1.SSS0.Px4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "修改框架后，让固定任务模型在同一批题上重新执行，比较真实任务奖励的变化；这份变化训练修改者，不能当作独立留出题的泛化成绩。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.02276#S3.SS1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.02276#S3.SS2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.02276#S4.SS1.SSS0.Px4"
          },
          {
            "label": "附录D",
            "url": "https://arxiv.org/html/2608.02276#A4"
          },
          {
            "label": "附录F",
            "url": "https://arxiv.org/html/2608.02276#A6"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "初始框架已经能组织模型与环境交互，并在任务开始、模型决策前、动作执行前、收到反馈后预留四处可插入辅助代码的位置。编辑模型可以在这里调整输入、检查动作或处理停滞；答题模型参数及任务环境接口固定。",
        "sources": [
          {
            "label": "附录 D、Table D.1",
            "url": "https://arxiv.org/abs/2608.02276"
          },
          {
            "label": "§3.1：四处代码介入位置",
            "url": "https://arxiv.org/html/2608.02276#S3.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "工程师模型读取固定 task agent 的一批失败记录，决定改哪个执行环节。补丁先检查能否运行，再让 task agent 在同一批题上重做；前后奖励变化用于训练工程师。这个训练奖励不等于独立留出题上的收益。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.02276#S3.SS1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.02276#S3.SS2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.02276#S4.SS1.SSS0.Px4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "编辑器的 监督微调（用示范数据训练模型）/强化学习（根据奖励调整模型行为） 任务：WebShop（根据用户要求挑选和购买商品的交互基准） 5,290/5,190；ALFWorld（通过文字动作完成家居物体操作的交互环境） 1,380/1,280；DBBench 2,401/2,302。先分任务再采轨迹，两个训练分区互斥。",
        "sources": [
          {
            "label": "附录D",
            "url": "https://arxiv.org/html/2608.02276#A4"
          },
          {
            "label": "附录F",
            "url": "https://arxiv.org/html/2608.02276#A6"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "299 道 验证集 用于选择编辑器 checkpoint（某个时刻保存的模型或系统版本）；另一个迁移实验每个评测基准给编辑器 10 条失败示例，据此生成补丁。",
        "sources": [
          {
            "label": "附录D",
            "url": "https://arxiv.org/html/2608.02276#A4"
          },
          {
            "label": "附录F",
            "url": "https://arxiv.org/html/2608.02276#A6"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "完整测试 1,300 题：WebShop（根据用户要求挑选和购买商品的交互基准） 500、ALFWorld（通过文字动作完成家居物体操作的交互环境） 500、DBBench 300。附录 F 的未见题结果为扣除 30 道示例后的 1,270 题。",
        "sources": [
          {
            "label": "附录D",
            "url": "https://arxiv.org/html/2608.02276#A4"
          },
          {
            "label": "附录F",
            "url": "https://arxiv.org/html/2608.02276#A6"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "区分编辑器训练、checkpoint（某个时刻保存的模型或系统版本） 验证和最终测试；测试内又区分补丁生成时可见的 30 道示例与未见的 1,270 道题。",
        "sources": [
          {
            "label": "附录D",
            "url": "https://arxiv.org/html/2608.02276#A4"
          },
          {
            "label": "附录F",
            "url": "https://arxiv.org/html/2608.02276#A6"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "用示范及补丁安装后的任务奖励训练一个独立编辑模型，让它从失败记录生成辅助执行代码；答题模型的参数保持冻结。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.02276#S3.SS1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.02276#S3.SS2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.02276#S4.SS1.SSS0.Px4"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2608.05144": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "七个主基准均用 GPT-5.5：SWE-Bench Pro 经 Copilot 运行，推理强度 xhigh；其余六项经 Codex 运行。GLM-5.2 经 Claude Code（可读写项目文件、运行命令和测试的 coding agent 工具） 的结果属于尚在进行、没有匹配 Direct 基线的补充实验。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.05144#S4.SS1"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2608.05144#S4.SS3"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2608.05144#S4.SS4"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2608.05144#S5.SS2"
          },
          {
            "label": "§6.1",
            "url": "https://arxiv.org/html/2608.05144#S6.SS1"
          },
          {
            "label": "Claude Code 官方说明",
            "url": "https://code.claude.com/docs/en/overview"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "GPT-5.5 驱动 Argus 的 管理角色、规划角色、工程角色、审阅角色 分工，写入或审核记忆、技能、流程和验证器；运行时规定持久化及审核规则，涉及目标歧义时由人作决定。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.05144#S4.SS1"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2608.05144#S4.SS3"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2608.05144#S4.SS4"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2608.05144#S5.SS2"
          },
          {
            "label": "§6.1",
            "url": "https://arxiv.org/html/2608.05144#S6.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "跨任务保留的记忆、技能、验证指导、路由规则及部分操作目标；角色分工固定。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.05144#S4.SS1"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2608.05144#S4.SS3"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2608.05144#S4.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "审阅角色检查任务产物、运行记录及其证据是否支持目标完成；需要确认的事项依照系统权限处理。不同任务有不同验收条件，开放科研没有统一自动正确答案。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.05144#S4.SS1"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2608.05144#S4.SS3"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2608.05144#S4.SS4"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2608.05144#S5.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "固定 管理角色–规划角色–工程角色–审阅角色 四角色运行系统，预算由外层控制；规划角色 定任务边界，工程角色 执行，审阅角色 验证。Skill/Wiki 路径向 task agent 开放供自行检索，不是框架自动把所有经验注入。",
        "sources": [
          {
            "label": "§5 与各 arena 评估定义",
            "url": "https://arxiv.org/abs/2608.05144"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "工程或科研角色提出产物、技能和记忆修改，由相应权限角色依据证据决定是否接收。要求独立审核的任务交给审阅者；部分低风险任务允许记录工程角色自审。规划角色维护后续工作，管理角色维护目标与阶段；改研究方向需记录依据，必要时交由人类决定。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.05144#S4.SS1"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2608.05144#S4.SS3"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2608.05144#S4.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "固定模型下的在线任务经验；SWE-bench Pro 731 题顺序执行并积累运行状态，没有统一离线训练集。",
        "sources": [
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2608.05144#S5.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "各任务原生信号：仓库测试、kernel 正确性/速度、nanochat 验证 BPB、nanoGPT 目标 loss，以及 审阅角色 的产物检查。",
        "sources": [
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2608.05144#S5.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "七个 arena：SWE-Pro、SOL-ExecBench、nanochat B200、nanochat H100、nanoGPT speedrun、AARRI-Bench 82 题、Arbor 数学推理数据合成。",
        "sources": [
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2608.05144#S5.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "这些 arena 的评分和适应协议各不相同；在线 SWE 成绩不能视作冻结状态后在全新任务上的独立因果验证。",
        "sources": [
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2608.05144#S5.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "将规划、执行、审核和目标管理分给不同角色；经验需经相应权限与证据检查才长期复用，改变研究方向也要保留理由和必要的人类决策。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.05144#S4.SS1"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2608.05144#S4.SS3"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2608.05144#S4.SS4"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2608.09819": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "Venti：冻结GLM-5.2（744B）配四个LoRA（只训练少量适配参数） 专长模块；Tall：Qwen3.6-35B-A3B配四个LoRA（只训练少量适配参数）。覆盖率搜索实验需与最终适配参数配置分开读。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.09819#S3.SS1.SSS2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.09819#S3.SS2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.09819#S3.SS2.SSS1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.09819#S3.SS2.SSS4"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.09819#S3.SS2.SSS5"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2608.09819#S4"
          },
          {
            "label": "§6.1",
            "url": "https://arxiv.org/html/2608.09819#S6.SS1.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "MindForge 是本文的学习任务生成与执行记录筛选模块；Expansion search 是运行配置搜索流程，负责尝试不同提示、工具和技能配置。需要更新模型适配参数时，由对应训练程序执行。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.09819#S3.SS1.SSS2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.09819#S3.SS2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.09819#S3.SS2.SSS1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.09819#S3.SS2.SSS4"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.09819#S3.SS2.SSS5"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2608.09819#S4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "122 题实证搜索只改提示、技能、工具配置和执行钩子，不训练参数。系统设计还包括专长 LoRA 的训练，但不能把该训练当作 122 题实验的一部分。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.09819#S3.SS1.SSS2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.09819#S3.SS2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.09819#S3.SS2.SSS1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.09819#S3.SS2.SSS4"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.09819#S3.SS2.SSS5"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2608.09819#S4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "任务执行结果、轨迹/config 任务结果；部分系统评估使用 语言模型 评分者。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.09819#S3.SS1.SSS2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.09819#S3.SS2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.09819#S3.SS2.SSS1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.09819#S3.SS2.SSS4"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.09819#S3.SS2.SSS5"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2608.09819#S4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "HCP（本文保存和管理运行配置的组件）保存版本化运行配置，MoL（多个专长适配器及其路由机制）在冻结基础模型上路由 聊天、代理任务、编程、界面生成四类 LoRA（只训练少量适配参数） 专家。基础设施已有模型服务与适配器管理；Expansion（本文的运行配置搜索实验）研究的配置搜索与整套参数训练是两层不同过程。",
        "sources": [
          {
            "label": "§2–3 Expansion；Table 8",
            "url": "https://arxiv.org/abs/2608.09819"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "从失败任务识别缺失能力，尝试修改运行配置；系统设计还支持训练专长适配器，但需要分清具体实验有没有执行该步骤。每个候选配置重新运行任务验证；多个配置累计解决的题数不能当成单一最终版本的成功率。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.09819#S3.SS1.SSS2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.09819#S3.SS2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.09819#S3.SS2.SSS1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.09819#S3.SS2.SSS4"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.09819#S3.SS2.SSS5"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2608.09819#S4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "MindForge 生成并评估任务轨迹，用于更新 专长模块 LoRA（只训练少量适配参数）；Expansion 单独固定基础模型，在 TB2.1 的 29 个来源族、122 个失败模拟任务上搜索配置。",
        "sources": [
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2608.09819#S2.SS3.SSS0.Px5"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.09819#S3.SS2.SSS5"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2608.09819#A2"
          },
          {
            "label": "附录B.6",
            "url": "https://arxiv.org/html/2608.09819#A2.SS6"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "Expansion 的 69 个 jobs、450 次尝试针对尚未通过的同批题；helper 必须通过私有参考验证才进入可复用工具池。",
        "sources": [
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2608.09819#S2.SS3.SSS0.Px5"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.09819#S3.SS2.SSS5"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2608.09819#A2"
          },
          {
            "label": "附录B.6",
            "url": "https://arxiv.org/html/2608.09819#A2.SS6"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "Expansion 报同一 122 题的累计覆盖；整系统另在 ChatBench、LivingBench、VitaBench/2、τ³、PinchBench、ClawGym、SWE-Verified、TB2.1、DeepSWE、SWE Atlas QnA、UI4A-Bench 评估。",
        "sources": [
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2608.09819#S2.SS3.SSS0.Px5"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.09819#S3.SS2.SSS5"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2608.09819#A2"
          },
          {
            "label": "附录B.6",
            "url": "https://arxiv.org/html/2608.09819#A2.SS6"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "122/122 指不同配置累计至少通过一次，不是一个冻结配置通过全部未见题。6,448 条路由诊断样本来自训练数据，也不是独立泛化测试。",
        "sources": [
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2608.09819#S2.SS3.SSS0.Px5"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.09819#S3.SS2.SSS5"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2608.09819#A2"
          },
          {
            "label": "附录B.6",
            "url": "https://arxiv.org/html/2608.09819#A2.SS6"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "把可更新的专长适配参数与可改写的工具、技能和运行配置组织到同一系统；直接框架搜索实验冻结模型，衡量多个配置合起来覆盖多少失败题。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.09819#S3.SS1.SSS2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.09819#S3.SS2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.09819#S3.SS2.SSS1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.09819#S3.SS2.SSS4"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.09819#S3.SS2.SSS5"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2608.09819#S4"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "endlessfrontier.tech-assets-paper.pdf": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "最终由 BigBang-V1 答题，它从 Qwen3.6-35B-A3B 进行后训练得到。生成训练题的 agent 和最终受训模型是两种角色。",
        "sources": [
          {
            "label": "§3.1–3.2 Experimental Setup / Quantitative Results",
            "url": "https://endlessfrontier.tech/assets/paper.pdf"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "生成角色 生成题目及解答，Critic 检查可验证性与质量，Meta-Critic 校准评价。技术报告没有给出这三个数据生产角色各自的模型型号；已明确的 Qwen3.6-35B-A3B 是受训基础模型，不能据此填成三个角色的型号。",
        "sources": [
          {
            "label": "§3.1–3.2 Experimental Setup / Quantitative Results",
            "url": "https://endlessfrontier.tech/assets/paper.pdf"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "任务合成代码、评价标准、训练数据分布，以及接受后训练的模型参数。",
        "sources": [
          {
            "label": "§3.1–3.2 Experimental Setup / Quantitative Results",
            "url": "https://endlessfrontier.tech/assets/paper.pdf"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "先通过计算、模拟、工具或形式检查验证合成任务，再观察用这些任务训练出的模型是否在下游评测中提升；题目能验证与题目有训练价值分开判断。",
        "sources": [
          {
            "label": "§3.1–3.2 Experimental Setup / Quantitative Results",
            "url": "https://endlessfrontier.tech/assets/paper.pdf"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "数据合成/研究框架能生成可验证问题、运行候选模型做校准，并修改合成程序。最终模型多数任务接 search、visit、code_exec，专属评测基准用各自运行框架；不能把合成器和最终执行器混写成一个 task agent。",
        "sources": [
          {
            "label": "数据合成循环；§3 评估协议与主表",
            "url": "https://endlessfrontier.tech/assets/paper.pdf"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "生成者编写并运行合成任务代码，记录失败和结论；批评者判断这些任务是否具有训练价值。再训练候选模型，用真实下游任务表现校准任务生产过程。",
        "sources": [
          {
            "label": "§3.1–3.2 Experimental Setup / Quantitative Results",
            "url": "https://endlessfrontier.tech/assets/paper.pdf"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "生成角色合成并求解可验证科学任务，Critic筛查后对Qwen3.6-35B-A3B做后训练；不是直接拿某个固定评测基准做统一训练集。",
        "sources": [
          {
            "label": "§3.1–3.2 Experimental Setup / Quantitative Results",
            "url": "https://endlessfrontier.tech/assets/paper.pdf"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "Critic评正确性、难度、可验证性及训练价值；真实研究任务表现用于校准Critic并调整下一批合成数据。",
        "sources": [
          {
            "label": "§3.1–3.2 Experimental Setup / Quantitative Results",
            "url": "https://endlessfrontier.tech/assets/paper.pdf"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "BrowseComp、xbench-DeepSearch、SWE-bench Pro、SciCode-Verified（Sub/Main）、FrontierScience-Research、HLE（涵盖多个学科高难度问题的 Humanity’s Last Exam 基准）、BioMysteryBench（HS/HD）、MLE-Bench Lite、PaperBench Code-Dev。",
        "sources": [
          {
            "label": "§3.1–3.2 Experimental Setup / Quantitative Results",
            "url": "https://endlessfrontier.tech/assets/paper.pdf"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "真实任务虽称单独留出的，却会反馈数据合成方向；不能把整个多轮流程解释为最终成绩从未反馈。SciCode经作者审查形成Verified版本。",
        "sources": [
          {
            "label": "§3.1–3.2 Experimental Setup / Quantitative Results",
            "url": "https://endlessfrontier.tech/assets/paper.pdf"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "把任务生成、任务验证和模型学习连起来，并根据学习后的效果调整任务供应；变化涉及训练材料及模型能力。",
        "sources": [
          {
            "label": "§3.1–3.2 Experimental Setup / Quantitative Results",
            "url": "https://endlessfrontier.tech/assets/paper.pdf"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2607.05297": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "冻结的 Gemma-4 31B 读取当前任务技能并解题。",
        "sources": [
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2607.05297#S3.SS4"
          },
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2607.05297#S3.SS5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "五个角色共用 Gemma-4 31B；快速循环改任务技能，慢速循环改指导这些角色的指导如何改进其他技能的说明文件，模型权重保持不变。",
        "sources": [
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2607.05297#S3.SS4"
          },
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2607.05297#S3.SS5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "任务技能和指导五个改进角色的元技能；基础模型、角色连接及评测规则固定。",
        "sources": [
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2607.05297#S3.SS4"
          },
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2607.05297#S3.SS5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "OfficeQA、SealQA 和 ALFWorld 各按自己的答案或环境判定给出结果；训练题的失败轨迹用于提出改动，验证题的成绩用于选择技能版本。",
        "sources": [
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2607.05297#S3.SS4"
          },
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2607.05297#S3.SS5"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.05297#S4.SS1.SSS0.Px1"
          },
          {
            "label": "附录G",
            "url": "https://arxiv.org/html/2607.05297#A7"
          },
          {
            "label": "附录G",
            "url": "https://arxiv.org/html/2607.05297#A7.SS0.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "固定五角色流水线维护两类 Markdown 说明：一类指导完成任务，另一类指导如何修改前一类技能。快循环修改任务技能，慢循环整理改进经验并跨分支共享；角色和运行程序保持固定。",
        "sources": [
          {
            "label": "实验设置、划分敏感性 Table 5",
            "url": "https://arxiv.org/abs/2607.05297"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "分析角色定位失败，检索角色寻找分支经验，分配角色判断各部分贡献。较频繁地修改任务技能，每隔若干轮再修改指导这些角色的元技能；训练题用于找错误，验证题用于评价新技能并选版本。",
        "sources": [
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2607.05297#S3.SS4"
          },
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2607.05297#S3.SS5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "OfficeQA、SealQA、ALFWorld（通过文字动作完成家居物体操作的交互环境），按任务类别分层划分；训练集 用于采失败轨迹，不更新模型参数。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.05297#S4.SS1.SSS0.Px1"
          },
          {
            "label": "附录G",
            "url": "https://arxiv.org/html/2607.05297#A7"
          },
          {
            "label": "附录G",
            "url": "https://arxiv.org/html/2607.05297#A7.SS0.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "独立 验证集 用于评分子技能及选择最好版本；快循环改任务技能，慢循环根据近期改进收益修改五类指导如何改进其他技能的说明。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.05297#S4.SS1.SSS0.Px1"
          },
          {
            "label": "附录G",
            "url": "https://arxiv.org/html/2607.05297#A7"
          },
          {
            "label": "附录G",
            "url": "https://arxiv.org/html/2607.05297#A7.SS0.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "冻结选出的技能，以单独评测基准模式运行未被演化循环看到的 测试集。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.05297#S4.SS1.SSS0.Px1"
          },
          {
            "label": "附录G",
            "url": "https://arxiv.org/html/2607.05297#A7"
          },
          {
            "label": "附录G",
            "url": "https://arxiv.org/html/2607.05297#A7.SS0.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "任务级 训练／验证／测试 互斥；比例消融使用共同 测试集 交集重新计分，不能与主表绝对分数混比。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.05297#S4.SS1.SSS0.Px1"
          },
          {
            "label": "附录G",
            "url": "https://arxiv.org/html/2607.05297#A7"
          },
          {
            "label": "附录G",
            "url": "https://arxiv.org/html/2607.05297#A7.SS0.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "维护两类文字说明：一类指导做任务，另一类指导怎样改前一类说明；前者频繁更新，后者隔若干轮总结更新，外层角色流程固定。",
        "sources": [
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2607.05297#S3.SS4"
          },
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2607.05297#S3.SS5"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2608.15071": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "默认Claude Opus4.6作为任务求解模型；另评Claude Opus4.7、Opus4.5、Kimi-K2.5和GPT-OSS配置。",
        "sources": [
          {
            "label": "§4.5",
            "url": "https://arxiv.org/html/2608.15071#S4.SS5"
          },
          {
            "label": "§4.6",
            "url": "https://arxiv.org/html/2608.15071#S4.SS6"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2608.15071#A2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.15071#S4.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "默认Claude Opus4.6作为修改者；任务求解模型和修改者是分开的角色，实验还替换这些角色的模型组合，不能把所有结果算作同一配置。",
        "sources": [
          {
            "label": "§4.5",
            "url": "https://arxiv.org/html/2608.15071#S4.SS5"
          },
          {
            "label": "§4.6",
            "url": "https://arxiv.org/html/2608.15071#S4.SS6"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2608.15071#A2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.15071#S4.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "供后续任务读取的文字技能库：新增、合并或修改通用经验和任务操作说明。模型参数与底层执行代码固定。",
        "sources": [
          {
            "label": "§4.5",
            "url": "https://arxiv.org/html/2608.15071#S4.SS5"
          },
          {
            "label": "§4.6",
            "url": "https://arxiv.org/html/2608.15071#S4.SS6"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2608.15071#A2"
          },
          {
            "label": "§3.1–3.4：说明的选取、注入与修改",
            "url": "https://arxiv.org/html/2608.15071#S3.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "反馈来自实际任务环境、代码测试结果或逐项评分细则。论文对比模型自行评价、仅告知通过或失败，以及提供更完整诊断信息的反馈。",
        "sources": [
          {
            "label": "§4.5",
            "url": "https://arxiv.org/html/2608.15071#S4.SS5"
          },
          {
            "label": "§4.6",
            "url": "https://arxiv.org/html/2608.15071#S4.SS6"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2608.15071#A2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "参数固定的任务求解模型配合外部文字说明库。每次执行前，系统挑选相关说明加入模型上下文；每批任务结束后，再把失败经验整理为新增、合并或修改的说明。这里“技能编译”指整理文字经验，不是把它编译成可执行代码。",
        "sources": [
          {
            "label": "§4.1、§4.5；附录数据设置",
            "url": "https://arxiv.org/abs/2608.15071"
          },
          {
            "label": "§3.1–3.4：说明的选取、注入与修改",
            "url": "https://arxiv.org/html/2608.15071#S3.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "任务失败或收到负面反馈后，求解模型先从执行记录中提炼经验；每批任务结束，修改者对照已有说明，选择新增、合并、改写或跳过。修改后的说明供未来任务使用；这套流程并不要求每次修改都先通过独立验证集的检查。",
        "sources": [
          {
            "label": "§4.5",
            "url": "https://arxiv.org/html/2608.15071#S4.SS5"
          },
          {
            "label": "§4.6",
            "url": "https://arxiv.org/html/2608.15071#S4.SS6"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2608.15071#A2"
          },
          {
            "label": "§3.1–3.4：说明的选取、注入与修改",
            "url": "https://arxiv.org/html/2608.15071#S3.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "主实验在线积累任务经验并编译成技能；另有 Sonnet 4.5 在 训练 split 上构建技能的独立迁移实验。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.15071#S4.SS1"
          },
          {
            "label": "§4.5",
            "url": "https://arxiv.org/html/2608.15071#S4.SS5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "当前题作答后收到评测基准反馈，生成供后续任务使用的技能；对比细诊断与简化通过/失败反馈。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.15071#S4.SS1"
          },
          {
            "label": "§4.5",
            "url": "https://arxiv.org/html/2608.15071#S4.SS5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "在线主表：WebArena-Infinity 80、TB2 89、SWE-bench Lite 300、CL-Bench 1,899、τ-bench 165。迁移实验另用 Opus 4.7 在 测试集 执行冻结技能。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.15071#S4.SS1"
          },
          {
            "label": "§4.5",
            "url": "https://arxiv.org/html/2608.15071#S4.SS5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "在线更新和冻结迁移是不同协议；前者允许从已做题学习，后者才检验预先学到技能的跨题/模型迁移。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.15071#S4.SS1"
          },
          {
            "label": "§4.5",
            "url": "https://arxiv.org/html/2608.15071#S4.SS5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "把已完成任务的轨迹提炼成后续可读取的文字操作说明，并比较反馈来源、说明粒度及修改模型的影响；执行程序本身不被重写。",
        "sources": [
          {
            "label": "§4.5",
            "url": "https://arxiv.org/html/2608.15071#S4.SS5"
          },
          {
            "label": "§4.6",
            "url": "https://arxiv.org/html/2608.15071#S4.SS6"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2608.15071#A2"
          },
          {
            "label": "§3.1–3.4：说明的选取、注入与修改",
            "url": "https://arxiv.org/html/2608.15071#S3.SS1"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2608.09096": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "主实验固定 DeepSeek-V4-Flash 执行任务的模型；部分任务由 Qwen3.7-Plus 评分者评分。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.09096#S3"
          },
          {
            "label": "附录E.1",
            "url": "https://arxiv.org/html/2608.09096#A5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "九种修改模型分别独立进化运行框架：GPT-5.6 Sol、Claude Opus 4.8、GLM-5.2、Qwen3.7-Max、MiniMax-M3、DeepSeek-V4-Pro、Kimi K2.7 Code、Qwen3.6-27B、Gemma-4-31B。每次均改同一个 DeepSeek-V4-Flash 执行端，预算为 20 次迭代／1,000 步／48 小时。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.09096#S3"
          },
          {
            "label": "附录E.1",
            "url": "https://arxiv.org/html/2608.09096#A5.SS1"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2608.09096#S5.SS1.SSS1"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2608.09096#S5.SS1.SSS2"
          },
          {
            "label": "附录C.1",
            "url": "https://arxiv.org/html/2608.09096#A3.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "不同修改者生成的可执行 harness；执行模型、初始接口、预算与测试服务固定。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.09096#S3"
          },
          {
            "label": "附录E.1",
            "url": "https://arxiv.org/html/2608.09096#A5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "修改阶段返回验证题分数、逐题结果和执行诊断。问答、办公产物及工具任务分别采用对应判分规则，需要模型评审时统一使用 Qwen3.7-Plus；最终测试不参与修改。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.09096#S3"
          },
          {
            "label": "附录E.1",
            "url": "https://arxiv.org/html/2608.09096#A5.SS1"
          },
          {
            "label": "表 1：各基准评分器",
            "url": "https://arxiv.org/html/2608.09096#S4"
          },
          {
            "label": "§5.1.1：统一评审模型",
            "url": "https://arxiv.org/html/2608.09096#S5.SS1.SSS1"
          },
          {
            "label": "CodeAct 原论文：可执行代码动作",
            "url": "https://arxiv.org/abs/2402.01030"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "参数固定的任务执行模型运行同一个最小 CodeAct（让模型生成并执行代码来采取行动的 agent 方式） task agent，修改者可改任务运行代码；构造评测基准时另用多个修改者产生辅助运行框架，筛选对运行框架差异敏感的题。构造阶段与被测进化阶段不混为训练。",
        "sources": [
          {
            "label": "主评估协议；附录 B.2",
            "url": "https://arxiv.org/abs/2608.09096"
          },
          {
            "label": "CodeAct 原论文：可执行代码动作",
            "url": "https://arxiv.org/abs/2402.01030"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "修改者读取验证轨迹、工具错误与分数，自行决定如何诊断。提交修改后的 harness（组织模型调用、工具使用和执行步骤的代码）；研究的对象是不同修改者能构建出什么。验证集 选择 候选；最终冻结后才访问进化期间不可访问的最终评测。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.09096#S3"
          },
          {
            "label": "附录E.1",
            "url": "https://arxiv.org/html/2608.09096#A5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "不训练行为策略权重；修改者用可见 验证集 改 CodeAct（让模型生成并执行代码来采取行动的 agent 方式） 运行框架。构造评测基准时另用辅助任务产生候选运行框架。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.09096#S3"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2608.09096#S4"
          },
          {
            "label": "CodeAct 原论文：可执行代码动作",
            "url": "https://arxiv.org/abs/2402.01030"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "160 道 验证集：BrowseComp、HLE（涵盖多个学科高难度问题的 Humanity’s Last Exam 基准）、GDPval、APEX-Agents、Claw-Eval 各 32 题，返回成绩、轨迹和诊断。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.09096#S3"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2608.09096#S4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "冻结后测 448 道题：BrowseComp/HLE 各 128；GDPval/APEX-Agents/Claw-Eval 各 64。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.09096#S3"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2608.09096#S4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "160 与 448 互斥；构造阶段的 auxiliary tasks 不是被测模型的正式训练集。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.09096#S3"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2608.09096#S4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "固定执行条件和预算，分别指定修改模型、执行模型和评分者，测生成的框架能否在未见任务上保持收益。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.09096#S3"
          },
          {
            "label": "附录E.1",
            "url": "https://arxiv.org/html/2608.09096#A5.SS1"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2608.31111": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "**参数更新实验：** 由 Qwen3.5-4B 或 Qwen3.5-9B 训练得到的候选模型答题。\n\n**运行框架实验：** 固定使用 Qwen3.5-4B，配合创建者生成的候选运行框架答题。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.31111#S3.SS1.SSS0.Px1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2608.31111#S3.SS3.SSS0.Px1"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2608.31111#S4.SS3.SSS0.Px2"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2608.31111#S4.SS4.SSS0.Px2"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2608.31111#S4.SS3.SSS0.Px3"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2608.31111#S4.SS3.SSS0.Px5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "**参数更新实验：** 自行改进时，由初始 Qwen3.5-4B 或 Qwen3.5-9B 决定学习数据与训练方案，平台执行训练；外部指导时，由论文命名为 Luna、Terra、Sol 的三个 GPT-5.6 配置指导同一个 Qwen3.5-4B。负责制定方案的初始模型始终固定，不由训练后的候选模型接替。\n\n**运行框架实验：** 创建者为 Qwen3.5-4B 或上述 GPT-5.6 配置，负责生成外围运行代码。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.31111#S3.SS1.SSS0.Px1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2608.31111#S3.SS3.SSS0.Px1"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2608.31111#S4.SS3.SSS0.Px2"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2608.31111#S4.SS4.SSS0.Px2"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2608.31111#S4.SS3.SSS0.Px3"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2608.31111#S4.SS3.SSS0.Px5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "分别研究两种更新：训练模型参数；固定参数、修改提示、工具规则和执行流程。没有验证两者同步进化。",
        "sources": [
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2608.31111#S4.SS3.SSS0.Px2"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2608.31111#S4.SS3.SSS0.Px6"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "**参数更新实验：** 创建者可用自建验证数据和检查方法调整训练；论文未公开每次本地检查的完整题目和判分脚本。允许中途反馈的设置可有限次查询专家题组的汇总分数，但看不到题目和逐题错误；仅最终提交的设置不返回中途分数。\n\n**运行框架实验：** 创建者依据本地写作检查调整框架。例如 Luna 使用自设八项检查表；正式 20 道写作题的成绩不返回创建者。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.31111#S3.SS2.SSS0.Px4"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2608.31111#S4.SS3.SSS0.Px3"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2608.31111#S4.SS3.SSS0.Px5"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2608.31111#S4.SS4.SSS0.Px2"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2608.31111#S4.SS4.SSS0.Px4"
          },
          {
            "label": "附录 C.5：公开记录边界",
            "url": "https://arxiv.org/html/2608.31111#A3.SS5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "作者自建平台提供数据搜索、导入、生成、训练、进度查询和评估工具，代办底层训练工程。框架进化实验让创建者设计模型外围的运行代码；Qwen-Agent 是 Qwen 团队提供的 agent 开发框架，负责组织工具调用和任务执行，在这里作为人工设计的对照。两者都配合同一 Qwen3.5-4B 模型比较。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2608.31111#S3.SS3"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2608.31111#S3.SS3.SSS0.Px1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2608.31111#S3.SS3.SSS0.Px2"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2608.31111#S4.SS4.SSS0.Px2"
          },
          {
            "label": "Qwen-Agent 官方说明",
            "url": "https://github.com/QwenLM/Qwen-Agent"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "**参数更新实验：** 初始决策模型选择数据与训练方案，平台训练出候选版本。仅最终提交的设置只评提交的最终版本；训练期间调用评估工具获取专家题组总分的设置可以用专家题组总分继续选数据、训练和比较版本。平台按预设资格规则选出候选，只有成绩超过基础模型时才保留，否则退回基础模型。\n\n**运行框架实验：** 创建者根据自己的本地检查修改、选择并提交框架；平台冻结框架后做正式评测，分数不用于继续修改。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2608.31111#S3.SS3.SSS0.Px3"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2608.31111#S3.SS3.SSS0.Px4"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2608.31111#S4.SS3.SSS0.Px3"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2608.31111#S4.SS3.SSS0.Px5"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2608.31111#S4.SS4.SSS0.Px2"
          },
          {
            "label": "附录 C.1：选版本与回退规则",
            "url": "https://arxiv.org/html/2608.31111#A3.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "参数训练：自行下载或合成数据，记录包括 GSM8K 和 Hendrycks 数学数据。框架修改：自建写作任务。目标描述对照：沿用 PostTrainBench。",
        "sources": [
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2608.31111#S4.SS2.SSS0.Px2"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2608.31111#S4.SS3.SSS0.Px9"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2608.31111#S4.SS4.SSS0.Px2"
          },
          {
            "label": "附录C.4",
            "url": "https://arxiv.org/html/2608.31111#A3.SS4.SSS0.Px2"
          },
          {
            "label": "Qwen-Agent 官方说明",
            "url": "https://github.com/QwenLM/Qwen-Agent"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "参数训练：本地验证；部分配置还能调用评估工具获取专家题组总分。框架修改：Luna 用 1 条提示、8 项检查，再检查 2 条相似提示；Sol 检查 4 类任务。",
        "sources": [
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2608.31111#S4.SS3.SSS0.Px5"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2608.31111#S4.SS4.SSS0.Px4"
          },
          {
            "label": "附录D",
            "url": "https://arxiv.org/html/2608.31111#A4.SS0.SSS0.Px2"
          },
          {
            "label": "附录D",
            "url": "https://arxiv.org/html/2608.31111#A4.SS0.SSS0.Px4"
          },
          {
            "label": "附录 C.5：公开记录边界",
            "url": "https://arxiv.org/html/2608.31111#A3.SS5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "参数训练：自建 520 道专家题中的对应目标题组。框架：其中 20 道写作题，每个冻结框架运行 3 次。PostTrainBench：AIME 2025、GPQA Main、HealthBench、HumanEval、GSM8K、ArenaHard、BFCL。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.31111#S3.SS2.SSS0.Px2"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2608.31111#S4.SS3.SSS0.Px2"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2608.31111#S4.SS4.SSS0.Px2"
          },
          {
            "label": "§4.2、附录 B：PostTrainBench 对照",
            "url": "https://arxiv.org/html/2608.31111#S4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "参数训练：可调用评估的配置用同一题组分数选模型；仅最终提交的配置在提交前不返回分数。框架：正式题目和成绩均不返回创建者。520 题是专家新编题，GPQA／MMLU-Pro／MedQA 仅供题型参考。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.31111#S3.SS2.SSS0.Px3"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.31111#S3.SS2.SSS0.Px4"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2608.31111#S4.SS3.SSS0.Px5"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2608.31111#S4.SS4.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "只给宽泛能力目标，让系统自行选择学习内容和自测方式，再用作者保密题检查是否真正朝目标进步；由此暴露“练习进步、目标能力没进步”的落差。",
        "sources": [
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2608.31111#S4.SS3.SSS0.Px2"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2608.31111#S4.SS3.SSS0.Px6"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2408.08435": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "主实验候选 task agent 及对照方案用gpt-3.5-turbo-0125执行；迁移另用GPT-4o、Claude3 Haiku和Claude3.5 Sonnet。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2408.08435#S3"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2408.08435#A2"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2408.08435#A1"
          },
          {
            "label": "附录E",
            "url": "https://arxiv.org/html/2408.08435#A5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "独立 meta-agent（负责设计或修改 task agent）用gpt-4o-2024-05-13读取档案、验证结果并生成候选 task agent 代码。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2408.08435#S3"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2408.08435#A2"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2408.08435#A1"
          },
          {
            "label": "附录E",
            "url": "https://arxiv.org/html/2408.08435#A5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "task agent 的完整代码，包括模型调用、提示和控制流程；外层 meta-agent 及搜索规则保持固定。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2408.08435#S3"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2408.08435#A2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "验证任务的得分、运行过程中的错误信息。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2408.08435#S3"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2408.08435#A2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "Meta Agent Search 在受接口约束的代码空间生成 task agent，初始档案含 CoT、Self-Refine 等人写设计。每候选先自查，验证报错可修至多五轮，再把代码与分数写回档案。",
        "sources": [
          {
            "label": "§4；Algorithm 1 与数据采样",
            "url": "https://arxiv.org/abs/2408.08435"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "读取既往 agent 设计、验证结果和错误反馈，提出新架构并编写可运行程序。运行验证题后把设计和成绩存入档案，再据此选择和探索下一候选。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2408.08435#S3"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2408.08435#A2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "不做参数训练；meta-agent（负责设计或修改 task agent）生成 task agent 代码，以 验证集 表现搜索架构。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2408.08435#S4.SS1"
          },
          {
            "label": "附录E",
            "url": "https://arxiv.org/html/2408.08435#A5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "ARC 小网格题 20；GPQA（研究生级科学问答基准） Diamond 32；DROP、MGSM、MMLU 各 128。代码报错时最多再反思修复 5 次。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2408.08435#S4.SS1"
          },
          {
            "label": "附录E",
            "url": "https://arxiv.org/html/2408.08435#A5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "ARC 60；GPQA（研究生级科学问答基准） 166；其他推理领域各 800。另测 MGSM 设计向 GSM8K（小学数学应用题基准）、GSM-Hard 及不同模型迁移。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2408.08435#S4.SS1"
          },
          {
            "label": "附录E",
            "url": "https://arxiv.org/html/2408.08435#A5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "搜索用 验证集，测试集 分开。ARC 来自公开训练库内的抽样划分，不是 ARC 官方私有测试集。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2408.08435#S4.SS1"
          },
          {
            "label": "附录E",
            "url": "https://arxiv.org/html/2408.08435#A5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "让上层设计模型生成用代码表达的 agent 结构，利用历史设计与评分继续搜索；可以改变模块组合和控制流程。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2408.08435#S3"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2408.08435#A2"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2609.01437": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "由创建者对应模型执行的评测由创建者对应模型执行；统一更换执行模型的评测统一换Gemini3.1 Pro。创建者共六个：Opus4.8、GPT-5.5、Gemini3.1 Pro、DeepSeekV4Pro、Qwen3.7Max、Seed2.0Pro。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2609.01437#S3.SS2.SSS0.Px1"
          },
          {
            "label": "附录E.2",
            "url": "https://arxiv.org/html/2609.01437#A5.SS2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2609.01437#S4.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "上述六种创建者各自修改运行框架；GPT-5.5用Codex0.144.3开发，其余用Claude Code2.1.177。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2609.01437#S3.SS2.SSS0.Px1"
          },
          {
            "label": "附录E.2",
            "url": "https://arxiv.org/html/2609.01437#A5.SS2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2609.01437#S4.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "可执行 harness 的控制循环、工具编排、上下文、状态、生命周期与验证机制；被测模型权重固定。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2609.01437#S3.SS2.SSS0.Px1"
          },
          {
            "label": "附录E.2",
            "url": "https://arxiv.org/html/2609.01437#A5.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "创建阶段读取公开开发任务的成绩与日志；继续进化时，SWE-Pro 和 Terminal-Bench 的真实执行结果帮助定位框架缺陷。创建能力与继续修订能力分别评价。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2609.01437#S3.SS2.SSS0.Px1"
          },
          {
            "label": "附录E.2",
            "url": "https://arxiv.org/html/2609.01437#A5.SS2"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2609.01437#S4.SS3.SSS0.Px2"
          },
          {
            "label": "§5",
            "url": "https://arxiv.org/html/2609.01437#S5.SS0.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "Creation 从 policy-free 底座开始：接口能启动但没有主动执行循环、上下文管理、恢复、验证或停止策略。Evolution 则从 Creation 产出的 H₀ 开始，不能把两个阶段都称空白 seed。",
        "sources": [
          {
            "label": "§3.3、Table 2、§4.3",
            "url": "https://arxiv.org/abs/2609.01437"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "创建者从公开任务产物、日志和逐题反馈定位缺失能力，编写或修改执行循环、工具规则、上下文、状态与错误恢复机制。提交确定的代码版本后作成对评估，最终版本由创建者选定。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2609.01437#S3.SS2.SSS0.Px1"
          },
          {
            "label": "附录E.2",
            "url": "https://arxiv.org/html/2609.01437#A5.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "Creation 从仅有被动接口的弱 seed 构建运行框架；Evolution 从已创建版本继续改代码，不训练权重。",
        "sources": [
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2609.01437#S4.SS3.SSS0.Px2"
          },
          {
            "label": "§5",
            "url": "https://arxiv.org/html/2609.01437#S5.SS0.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "Evolution 使用 SWE-Pro 100 题＋Terminal-Bench 89 题，提供反馈和固定小子集 探测任务。",
        "sources": [
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2609.01437#S4.SS3.SSS0.Px2"
          },
          {
            "label": "§5",
            "url": "https://arxiv.org/html/2609.01437#S5.SS0.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "Creation 覆盖 SWE-Pro、TB2.1、MLE-bench、EQ-Bench3、BrowseComp 共 2,207 实例；Evolution 冻结后另测不重叠 SWE-Pro 630 题。",
        "sources": [
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2609.01437#S4.SS3.SSS0.Px2"
          },
          {
            "label": "§5",
            "url": "https://arxiv.org/html/2609.01437#S5.SS0.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "630 题分数只在所有演化结束后计算，不影响编辑、停止或选版本；TB89 始终属于反馈集。",
        "sources": [
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2609.01437#S4.SS3.SSS0.Px2"
          },
          {
            "label": "§5",
            "url": "https://arxiv.org/html/2609.01437#S5.SS0.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "分别测从简陋起点建设框架和继续改进已有框架，并在统一接口下用不可见的正式任务评价生成系统。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2609.01437#S3.SS2.SSS0.Px1"
          },
          {
            "label": "附录E.2",
            "url": "https://arxiv.org/html/2609.01437#A5.SS2"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2608.03764": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "Codex或Claude Code（可读写项目文件、运行命令和测试的 coding agent 工具）加载所学技能，候选模型为GPT-5.5、Opus4.8、GLM5.2、DeepSeek-V4-Pro-Preview。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.03764#S3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.03764#S4.SS1.SSS0.Px5"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.03764#S4.SS1.SSS0.Px3"
          },
          {
            "label": "Claude Code 官方说明",
            "url": "https://code.claude.com/docs/en/overview"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "对应模型–运行框架配置从5道训练任务构建技能；评估另启动新 task agent 加载该技能，避免沿用训练会话。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.03764#S3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.03764#S4.SS1.SSS0.Px5"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.03764#S4.SS1.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "各任务组的 SKILL.md 文件：业务规则、操作步骤、输出格式和失败经验。修改的是技能内容。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.03764#S3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.03764#S4.SS1.SSS0.Px5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "三种设置给的信息不同：自主探索只见环境；示例监督额外给标准答案；反思监督给程序判分并允许三轮反思。测试考察学到的业务规则能否用于新案例。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.03764#S3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.03764#S4.SS1.SSS0.Px5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "作者自建的企业任务环境，提供可查询的业务数据和按规则判分的程序。被测 task agent 从训练任务提炼可复用技能，测试时携带技能库；评测基准本身不限定只能改技能，也不训练一个统一的任务模型。",
        "sources": [
          {
            "label": "数据构造与实验设置",
            "url": "https://arxiv.org/abs/2608.03764"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "在同组训练环境尝试任务，把允许看到的答案或程序反馈总结为技能；随后由新 task agent 加载该文件执行测试，三种监督强度分别比较。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.03764#S3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.03764#S4.SS1.SSS0.Px5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "V1 12 组、V2 24 组，每组 5 道训练题；环境包括 CRM、ERP、财务、医疗等业务流程。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.03764#S3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.03764#S4.SS1.SSS0.Px5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "训练组的题目与环境；额外反馈依 self/fewshot/reflect 设置提供。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.03764#S3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.03764#S4.SS1.SSS0.Px5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "每组另有 5 道题，合计 180 道，重新组合训练阶段涉及的业务规则。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.03764#S3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.03764#S4.SS1.SSS0.Px5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "同业务环境、不同任务；训练完才交给新 task agent 测试，比较有/无技能的增益。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.03764#S3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.03764#S4.SS1.SSS0.Px5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "把企业业务规则分散在学习案例中，再在测试案例里重新组合；另设提前拿到全部规则的对照，帮助判断瓶颈是缺少经验还是不会运用规则。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.03764#S3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.03764#S4.SS1.SSS0.Px5"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2602.22480": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "主优化目标为GPT-4.1-mini的 task agent；冻结优化后的程序，再换GPT-4.1测跨模型效果。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2602.22480#S3"
          },
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2602.22480#A1.SS2.SSS2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2602.22480#S4.SS1"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2602.22480#S5.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "VeRO-Agent或Claude Code（可读写项目文件、运行命令和测试的 coding agent 工具）负责改代码；默认Claude Sonnet4.5，调度角色另用Claude Opus4.5、GPT-5.2-Codex。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2602.22480#S3"
          },
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2602.22480#A1.SS2.SSS2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2602.22480#S4.SS1"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2602.22480#S5.SS2"
          },
          {
            "label": "Claude Code 官方说明",
            "url": "https://code.claude.com/docs/en/overview"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "目标 agent 的 Python 实现，包括提示、工具及调用编排。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2602.22480#S3"
          },
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2602.22480#A1.SS2.SSS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "ExperimentRunner 返回任务成绩和结构化执行反馈，调用次数受预算限制。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2602.22480#S3"
          },
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2602.22480#A1.SS2.SSS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "论文比较两个明确不同的起点：Pawn 有 4 个工具、基础搜索、文本文件读取、Python 和网页抓取，25 行系统提示、最多 20 轮；Knight 有 6 个工具，增加 Wikipedia、反思、复杂文件读取及更丰富 Python 库，140 行提示、最多 40 轮。不能把两者统称为一个基础 task agent。",
        "sources": [
          {
            "label": "任务数据说明；Table 10",
            "url": "https://arxiv.org/abs/2602.22480"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "编程 task agent 修改代码、提交版本化快照、读取运行反馈继续修复；按 验证集 选版本，GPQA（研究生级科学问答基准） 无 验证集 时按 训练集 选。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2602.22480#S3"
          },
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2602.22480#A1.SS2.SSS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "GAIA（需要检索、推理和使用工具的通用助理任务基准） 50、GPQA（研究生级科学问答基准） Diamond 98、MATH 59、τ-bench Retail 100、SimpleQA 46。",
        "sources": [
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2602.22480#A1.SS2.SSS1"
          },
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2602.22480#A1.SS2.SSS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "GAIA（需要检索、推理和使用工具的通用助理任务基准） 验证集 87、MATH 60、τ-bench Retail 20、SimpleQA 45；GPQA（研究生级科学问答基准） 直接使用训练成绩。",
        "sources": [
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2602.22480#A1.SS2.SSS1"
          },
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2602.22480#A1.SS2.SSS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "GPQA（研究生级科学问答基准） 100、MATH 486、τ-bench Retail 115、SimpleQA 80；GAIA（需要检索、推理和使用工具的通用助理任务基准） 最终仍报告 87 验证集。",
        "sources": [
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2602.22480#A1.SS2.SSS1"
          },
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2602.22480#A1.SS2.SSS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "四项有最终 测试集；GAIA（需要检索、推理和使用工具的通用助理任务基准） 验证集 同时参与选择和报告，不能视为额外盲测。SimpleQA 先筛出三个模型均失败的 171 题再划分。",
        "sources": [
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2602.22480#A1.SS2.SSS1"
          },
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2602.22480#A1.SS2.SSS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "保存 agent 代码版本、执行观察与任务奖励，使代码 agent 的框架优化过程可以追踪和比较；数据隔离需要按具体任务分别读。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2602.22480#S3"
          },
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2602.22480#A1.SS2.SSS2"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2410.04444": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "受限主实验用 gpt-3.5-turbo-0125 执行优化后的策略，与基线保持相同模型；开放实验允许 agent 求助 GPT-4o，需与受限结果区分。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2410.04444#S3"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2410.04444#S5.SS2"
          },
          {
            "label": "§5.3",
            "url": "https://arxiv.org/html/2410.04444#S5.SS3"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2410.04444#A2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "gpt-4o-2024-05-13 驱动 Gödel Agent 读取反馈并改写策略。修改代码的模型与受限测试时答题的 GPT-3.5 不同。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2410.04444#S3"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2410.04444#S5.SS2"
          },
          {
            "label": "§5.3",
            "url": "https://arxiv.org/html/2410.04444#S5.SS3"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2410.04444#A2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "agent 执行逻辑及负责自修改的程序。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2410.04444#S3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "任务预设的效用或验证分数，以及实际运行记录。效用指该任务用来衡量方案好坏的目标。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2410.04444#S3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "从逐步推理的任务求解代码开始，task agent 另有思考、错误记录、Python、Bash 与模型调用等工具，可以直接编辑自身代码；不是只有文字反思的记忆系统。不同任务有各自初始任务求解模型，例如 Game of 24 提供初始 CoT 求解函数。",
        "sources": [
          {
            "label": "实验数据采样；初始与演化代码示例",
            "url": "https://arxiv.org/abs/2410.04444"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "task agent 自读源码与任务效用，调用修改/执行动作改变自己的求解与改进逻辑，再通过任务运行结果继续迭代；不要求形式化证明。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2410.04444#S3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "不训练模型权重；在目标任务的 验证集 上进行源码搜索，每任务 6 次独立循环、每次最多 30 轮。",
        "sources": [
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2410.04444#S5.SS2"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2410.04444#A2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "GPQA（研究生级科学问答基准） 32 题；DROP、MGSM、MMLU 各 128 题，用于改进期间计分。",
        "sources": [
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2410.04444#S5.SS2"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2410.04444#A2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "GPQA（研究生级科学问答基准） 剩余 166 题；DROP、MGSM、MMLU 各 800 题，均用 GPT-3.5 运行候选。",
        "sources": [
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2410.04444#S5.SS2"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2410.04444#A2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "主实验 验证／测试 分开；Game of 24 等展示案例不套用主表划分。",
        "sources": [
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2410.04444#S5.SS2"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2410.04444#A2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "把解题流程和调用自修改的逻辑放进同一可编辑程序，使用实际执行反馈决定修改方向。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2410.04444#S3"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2506.10943": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "知识学习：Qwen2.5-7B；ARC 少样本实验：Llama-3.2-1B-Instruct。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2506.10943#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2506.10943#S3.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "知识学习配置由 Qwen2.5-7B 生成 self-edit；ARC 配置由 Llama-3.2-1B-Instruct 生成。固定内层梯度更新和外层 强化学习（根据奖励调整模型行为）／ReSTEM 程序据此训练对应模型。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2506.10943#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2506.10943#S3.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "生成学习材料／训练配置的策略，以及实际适应后的模型参数。SQuAD 生成训练文本；ARC 选择数据增强、学习率和训练轮次。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2506.10943#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2506.10943#S3.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "更新后在对应问题上的答题成绩；ARC 用正确/错误，知识学习的答案由 GPT-4.1 判分。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2506.10943#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2506.10943#S3.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "SEAL 让模型生成自己的适应材料或训练配置，再调用真实梯度更新流程。知识任务从新文本段落生成训练文本；ARC 提供数据增强和测试时训练工具，模型选择增强开关、学习率和训练轮次等，不能概括为只改提示。",
        "sources": [
          {
            "label": "知识学习与 ARC 实验；附录训练设置",
            "url": "https://arxiv.org/abs/2506.10943"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "模型生成学习数据和更新配置，内层训练程序实际微调，再评价更新后模型。外层训练奖励能产生有效更新的生成方式。知识学习实验对每份上下文生成五种方案，每种用三个随机种子运行，按平均效果选择。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2506.10943#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2506.10943#S3.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "知识任务用 SQuAD 训练集 学习生成 self-edit；ARC 用 11 个筛选后的训练任务学习数据增强/训练配置。",
        "sources": [
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2506.10943#A1.SS2"
          },
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2506.10943#A2.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "内层实际微调后，以问题作答或 ARC 输出的正确率给 self-edit 外层 强化学习（根据奖励调整模型行为） 奖励。",
        "sources": [
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2506.10943#A1.SS2"
          },
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2506.10943#A2.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "知识任务：SQuAD evaluation 的 200 个新文本段落、974 个问题；ARC：8 个未见任务。",
        "sources": [
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2506.10943#A1.SS2"
          },
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2506.10943#A2.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "外层训练材料与最终任务分开；测试时仍对当前 passage/ARC 示例进行内层适应，因此不是全程冻结模型。",
        "sources": [
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2506.10943#A1.SS2"
          },
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2506.10943#A2.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "模型为新材料生成适合训练的内容与更新指令，实际训练后再用任务表现评价这次生成；因此也在学习怎样准备有效的参数更新。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2506.10943#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2506.10943#S3.SS1"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2604.23472": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "候选任务/优化程序在Escher-Loop内执行；程序生成使用Gemini3 Flash ensemble。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2604.23472#S2.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.23472#S3.SS3"
          },
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2604.23472#A1.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "Gemini3 Flash生成程序变体；80%请求用gemini-3-flash-preview的low thinking，20%用默认动态thinking。外层种群选择程序固定。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2604.23472#S2.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.23472#S3.SS3"
          },
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2604.23472#A1.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "任务求解程序，以及负责优化它们的优化器提示。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2604.23472#S2.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.23472#S3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "用 task agent 的得分判断提示词优化器好不好，再据此选择优化器。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2604.23472#S2.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.23472#S3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "作者自建双种群系统：任务程序负责产生几何解，优化器程序负责修改任务程序和优化器；配有程序执行评分、种群采样和优化器比较机制。OpenEvolve 是手工固定优化器对照，不应写成所有运行都用同一个冻结改进器。",
        "sources": [
          {
            "label": "§3 Experimental Protocol；附录 A",
            "url": "https://arxiv.org/abs/2604.23472"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "执行候选计算几何目标值，比较优化器带来的任务收益并更新 Elo；任务群体与优化器群体交替改进，保留演化分支。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2604.23472#S2.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.23472#S3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "Kissing Number、Circle Packing（26 圆）、Heilbronn Triangle（11 点）上的程序搜索，不做参数训练。",
        "sources": [
          {
            "label": "附录C.2",
            "url": "https://arxiv.org/html/2604.23472#A3.SS2"
          },
          {
            "label": "附录C.3",
            "url": "https://arxiv.org/html/2604.23472#A3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "同一几何问题的合法性检查和目标值；优化器的 Elo 来自实际改进效果。",
        "sources": [
          {
            "label": "附录C.2",
            "url": "https://arxiv.org/html/2604.23472#A3.SS2"
          },
          {
            "label": "附录C.3",
            "url": "https://arxiv.org/html/2604.23472#A3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "报告相同问题在 1,000 万等价 词元 预算内的历史最佳目标值。",
        "sources": [
          {
            "label": "附录C.2",
            "url": "https://arxiv.org/html/2604.23472#A3.SS2"
          },
          {
            "label": "附录C.3",
            "url": "https://arxiv.org/html/2604.23472#A3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "优化已知问题的解，不是训练/测试题泛化；动态评分针对优化器相对能力。",
        "sources": [
          {
            "label": "附录C.2",
            "url": "https://arxiv.org/html/2604.23472#A3.SS2"
          },
          {
            "label": "附录C.3",
            "url": "https://arxiv.org/html/2604.23472#A3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "同时保留多种解题者和改进者；改进者的好坏由它能给解题者带来多大实测提升来判断。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2604.23472#S2.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.23472#S3.SS3"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2606.04465": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "默认DeepSeek-V3.2作task task agent；跨模型设置换Gemini3.1 Flash-Lite Preview。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2606.04465#S3.SS1.SSS0.Px2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2606.04465#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2606.04465#S3.SS3"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2606.04465#S3.SS3.SSS0.Px1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2606.04465#S4.SS1.SSS0.Px4"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2606.04465#S4.SS2.SSS0.Px5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "默认Gemini3.1 Pro Preview作负责生成提示词的 agent；另一配置用Claude Opus4.6。负责生成提示词的 agent 优化任务提示，也进化自己的优化提示。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2606.04465#S3.SS1.SSS0.Px2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2606.04465#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2606.04465#S3.SS3"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2606.04465#S3.SS3.SSS0.Px1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2606.04465#S4.SS1.SSS0.Px4"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2606.04465#S4.SS2.SSS0.Px5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "提示优化器自己的系统提示，以及它为各 task agent 修改的提示。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2606.04465#S3.SS1.SSS0.Px2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2606.04465#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2606.04465#S3.SS3"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2606.04465#S3.SS3.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "任务题目的评分器给训练或开发成绩，用来比较新旧提示；保留更好的提示，并在后续任务中检验优化经验是否能迁移。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2606.04465#S3.SS1.SSS0.Px2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2606.04465#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2606.04465#S3.SS3"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2606.04465#S3.SS3.SSS0.Px1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2606.04465#S4.SS1.SSS0.Px1"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2606.04465#A3.SS0.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "SePO 包含提出系统提示词的负责生成提示词的 agent 和按提示做题的 task task agent。只演化负责生成提示词的 agent 的自然语言系统提示；任务代码、工具和模型权重不改。训练在本文指提示搜索，不是参数微调。",
        "sources": [
          {
            "label": "§4.1；附录 C、Table 4",
            "url": "https://arxiv.org/abs/2606.04465"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "读取任务执行结果后生成子提示；只有优于父提示的子代进入档案。预训练阶段让优化器改自己的提示，下游阶段固定这个优化器。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2606.04465#S3.SS1.SSS0.Px2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2606.04465#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2606.04465#S3.SS3"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2606.04465#S3.SS3.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "任务提示搜索：s1K-1.1 数学 535、ARC 416、MBPP 474、Sudoku 440；GPQA（研究生级科学问答基准） 用 MMLU STEM 作 agent 训练池。通用优化器另用 LIMO/MMLU 任务混合。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2606.04465#S4.SS1.SSS0.Px1"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2606.04465#A3.SS0.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "训练池上的正确率决定候选是否入档；它是提示搜索，不是模型权重 监督微调（用示范数据训练模型）。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2606.04465#S4.SS1.SSS0.Px1"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2606.04465#A3.SS0.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "AIME’25 30、ARC-AGI-1 419、MBPP 500、Sudoku 100、GPQA（研究生级科学问答基准） 198。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2606.04465#S4.SS1.SSS0.Px1"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2606.04465#A3.SS0.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "agent 训练池与最终任务分别定义；GPQA（研究生级科学问答基准） 训练量在表中标 N/A，不能补造统一数量。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2606.04465#S4.SS1.SSS0.Px1"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2606.04465#A3.SS0.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "先跨任务优化“指导优化器怎样改提示”的系统提示，再用改好的优化器处理目标任务；两阶段主要改变文字提示。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2606.04465#S3.SS1.SSS0.Px2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2606.04465#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2606.04465#S3.SS3"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2606.04465#S3.SS3.SSS0.Px1"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2606.26294": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "主实验用 GPT-5.5（low）执行编码、论文写作、证明及评审。成本消融仅将搜索期论文任务调用换为 Nemotron 3 Ultra，最终仍用 GPT-5.5（low）评审。",
        "sources": [
          {
            "label": "Appendix C.5",
            "url": "https://arxiv.org/abs/2606.26294"
          },
          {
            "label": "§5.5、附录 C.2",
            "url": "https://arxiv.org/pdf/2606.26294#page=20"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "meta-agent 使用 GPT-5.5（low）读取节点及祖先反馈、修改角色 agent；混合模型消融保持 meta-agent 不变。搜索程序选择节点，并在进化轮次边界替换通过检验的评审器。",
        "sources": [
          {
            "label": "Appendix C.5",
            "url": "https://arxiv.org/abs/2606.26294"
          },
          {
            "label": "§5.5、附录 C.2",
            "url": "https://arxiv.org/pdf/2606.26294#page=20"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "task agent 与学习式评审器；每个选择阶段内部暂时固定评分规则。",
        "sources": [
          {
            "label": "Appendix C.5",
            "url": "https://arxiv.org/abs/2606.26294"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "根据任务结果评分，但评分目标和评审者也会进化；同一轮内保持评审规则固定，轮间才更新。",
        "sources": [
          {
            "label": "Appendix C.5",
            "url": "https://arxiv.org/abs/2606.26294"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "每个角色从相同的最小 task agent 模板加领域输出格式开始，代码可修改。系统同时维护任务执行者与可进化评审者；一轮内评审固定，轮间才替换。初始模板不是预先写好的领域专家流水线。",
        "sources": [
          {
            "label": "§3.2、实验设置；附录 C.5",
            "url": "https://arxiv.org/abs/2606.26294"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "训练反馈用于生成修改；独立验证成绩用于搜索节点，评审器替换发生在进化轮次边界，依赖它的效用历史随之重新处理。",
        "sources": [
          {
            "label": "Appendix C.5",
            "url": "https://arxiv.org/abs/2606.26294"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "论文写作/评审：APReS标题摘要及接受/拒绝；证明：IMO-GradingBench人工分；编码：Polyglot可执行测试，代码评审：CRAVE接受/拒绝PR。",
        "sources": [
          {
            "label": "Appendix C.5",
            "url": "https://arxiv.org/abs/2606.26294"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "独立验证集驱动节点选择；训练轨迹只指导修改、不进入搜索效用。生成物评分角色使用不同生成物作训练与搜索。",
        "sources": [
          {
            "label": "Appendix C.5",
            "url": "https://arxiv.org/abs/2606.26294"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "各领域另用与验证集分开的测试集；证明需进化轮次内冻结评分器给满分7/7。本文明确没有使用SWE-bench。",
        "sources": [
          {
            "label": "Appendix C.5",
            "url": "https://arxiv.org/abs/2606.26294"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "区分生成修改、搜索选节点、最终测试三套证据；评审器可变，但同进化轮次内固定，避免不同尺子的分数直接混用。",
        "sources": [
          {
            "label": "Appendix C.5",
            "url": "https://arxiv.org/abs/2606.26294"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "允许每轮之间修改评价标准，但同一轮内部固定标准以比较候选；跨轮的分数需要结合当轮目标解释。",
        "sources": [
          {
            "label": "Appendix C.5",
            "url": "https://arxiv.org/abs/2606.26294"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2608.07645": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "主进化用Qwen3.6-35B-A3B执行候选编码 task agent；另评Qwen3-Coder-Next-80B-A3B。跨模型迁移冻结运行框架后换DeepSeek-V4-Flash/Pro。",
        "sources": [
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2608.07645#A1.SS1"
          },
          {
            "label": "附录H.1",
            "url": "https://arxiv.org/html/2608.07645#A8.SS1"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2608.07645#S5.SS2.SSS0.Px2"
          },
          {
            "label": "附录C.1",
            "url": "https://arxiv.org/html/2608.07645#A3.SS1"
          },
          {
            "label": "附录F.2",
            "url": "https://arxiv.org/html/2608.07645#A6.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "编码 task agent 依据档案与执行反馈改进后代；主实验使用Qwen3.6-35B-A3B，模型权重固定，变的是 task agent 代码。",
        "sources": [
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2608.07645#A1.SS1"
          },
          {
            "label": "附录H.1",
            "url": "https://arxiv.org/html/2608.07645#A8.SS1"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2608.07645#S5.SS2.SSS0.Px2"
          },
          {
            "label": "附录C.1",
            "url": "https://arxiv.org/html/2608.07645#A3.SS1"
          },
          {
            "label": "附录F.2",
            "url": "https://arxiv.org/html/2608.07645#A6.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "coding agent 的可执行代码与运行结构。",
        "sources": [
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2608.07645#A1.SS1"
          },
          {
            "label": "附录H.1",
            "url": "https://arxiv.org/html/2608.07645#A8.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "读取不同任务、不同历史分支的代码测试结果和执行记录，比较哪些改动有效、哪些导致退化，再提出修改或组合已有方案。",
        "sources": [
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2608.07645#A1.SS1"
          },
          {
            "label": "附录H.1",
            "url": "https://arxiv.org/html/2608.07645#A8.SS1"
          },
          {
            "label": "§5",
            "url": "https://arxiv.org/html/2608.07645#S5"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2608.07645#S5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "Polyglot 初始 forward 仅作一次代码生成，没有结构化仓库分析和测试反馈循环；与 HGM 使用相同祖先版本。",
        "sources": [
          {
            "label": "§5、§5.1 与迁移实验",
            "url": "https://arxiv.org/abs/2608.07645"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "比较历史档案中不同任务和分支的代码及失败经历，提出修改或组合不同谱系的有效部分。分配新候选生成与评估预算，再按方法估计的表现选择最终版本。",
        "sources": [
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2608.07645#A1.SS1"
          },
          {
            "label": "附录H.1",
            "url": "https://arxiv.org/html/2608.07645#A8.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "SWE-bench Verified、Polyglot 各 60 题的搜索设置；统一 200 次评估预算。",
        "sources": [
          {
            "label": "§5",
            "url": "https://arxiv.org/html/2608.07645#S5"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2608.07645#S5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "失败任务池和档案中不同版本的行为用于诊断；私有测试用例不向 task agent 展示。",
        "sources": [
          {
            "label": "§5",
            "url": "https://arxiv.org/html/2608.07645#S5"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2608.07645#S5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "主表报告搜索所得版本；另测完整 Polyglot 225、SWE-Pro、SWE-Multilingual 及跨模型迁移。",
        "sources": [
          {
            "label": "§5",
            "url": "https://arxiv.org/html/2608.07645#S5"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2608.07645#S5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "60 题搜索成绩不等于独立测试；完整 Polyglot 包含这批题，跨评测基准结果单独看。",
        "sources": [
          {
            "label": "§5",
            "url": "https://arxiv.org/html/2608.07645#S5"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2608.07645#S5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "对照同一 agent 在不同任务上的失败，以及不同历史分支在同一任务上的表现，用这些比较证据定位可继承的框架改动。",
        "sources": [
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2608.07645#A1.SS1"
          },
          {
            "label": "附录H.1",
            "url": "https://arxiv.org/html/2608.07645#A8.SS1"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2403.03186": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "默认 gpt-4o-2024-05-13 看屏幕、规划操作并生成控制动作；电脑实际执行键鼠操作。text-embedding-ada-002 只用于技能向量检索。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2403.03186#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2403.03186#S3.SS3"
          },
          {
            "label": "附录B.3",
            "url": "https://arxiv.org/html/2403.03186#A2.SS3"
          },
          {
            "label": "附录D.3",
            "url": "https://arxiv.org/html/2403.03186#A4.SS3"
          },
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2403.03186#S3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2403.03186#S4.SS1"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2403.03186#A1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "同一 GPT-4o 驱动 Cradle 的反思、任务推断和技能整理模块，更新外部记忆与技能；固定框架组织这些调用。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2403.03186#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2403.03186#S3.SS3"
          },
          {
            "label": "附录B.3",
            "url": "https://arxiv.org/html/2403.03186#A2.SS3"
          },
          {
            "label": "附录D.3",
            "url": "https://arxiv.org/html/2403.03186#A4.SS3"
          },
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2403.03186#S3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2403.03186#S4.SS1"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2403.03186#A1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "交互中积累的经验记忆和可执行技能代码。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2403.03186#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2403.03186#S3.SS3"
          },
          {
            "label": "附录B.3",
            "url": "https://arxiv.org/html/2403.03186#A2.SS3"
          },
          {
            "label": "附录D.3",
            "url": "https://arxiv.org/html/2403.03186#A4.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "读取操作前后的截图或视频帧，由视觉模型判断动作是否完成并解释失败，再调整计划。最终效果按对应游戏或软件任务评价。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2403.03186#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2403.03186#S3.SS3"
          },
          {
            "label": "附录B.3",
            "url": "https://arxiv.org/html/2403.03186#A2.SS3"
          },
          {
            "label": "附录D.3",
            "url": "https://arxiv.org/html/2403.03186#A4.SS3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2403.03186#S4.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "作者自建通用电脑控制框架，通过截图理解界面、用键鼠执行操作，不调用游戏内部状态 API。模块包括信息获取、反思、任务推断、技能管理、动作规划和记忆；因此是完整的视觉交互底座，不是只有文本 ReAct（交替进行推理、调用工具和读取结果的执行方式）。",
        "sources": [
          {
            "label": "框架模块；实验与 Stardew Valley 环境说明",
            "url": "https://arxiv.org/abs/2403.03186"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "多模态模型 看前后视频帧判断动作是否完成、解释失败，再规划和修订技能；新技能存入程序记忆，后续按相似度检索。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2403.03186#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2403.03186#S3.SS3"
          },
          {
            "label": "附录B.3",
            "url": "https://arxiv.org/html/2403.03186#A2.SS3"
          },
          {
            "label": "附录D.3",
            "url": "https://arxiv.org/html/2403.03186#A4.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "在电脑游戏/软件实际交互中学习；RDR2 从少量基本移动技能起步，部分环境另给预置原子操作。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2403.03186#S4.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "屏幕视频、动作执行结果及模型反思，不依赖通用的离线标签训练集。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2403.03186#S4.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "RDR2、Stardew Valley 等游戏及软件控制任务，各按任务完成或活动表现评估，通常重复 5 次。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2403.03186#S4.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "实验强调统一键鼠/视频接口；各环境的预置技能不同，不能解释为同一训练集上的统一留出测试。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2403.03186#S4.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "统一通过屏幕获取信息、用鼠标键盘操作，在这一接口上组织规划、反思、技能和记忆，面向完整的计算机使用过程。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2403.03186#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2403.03186#S3.SS3"
          },
          {
            "label": "附录B.3",
            "url": "https://arxiv.org/html/2403.03186#A2.SS3"
          },
          {
            "label": "附录D.3",
            "url": "https://arxiv.org/html/2403.03186#A4.SS3"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2409.07429": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "WebArena 网页交互实验使用 gpt-4-0613，并通过 BrowserGym 浏览器操作环境执行；Mind2Web 网页动作预测实验使用 gpt-3.5-turbo 或 gpt-4，采样温度设为 0，以减少输出随机性。",
        "sources": [
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2409.07429#S2.SS3.SSS0.Px2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2409.07429#S3.SS2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2409.07429#S3.SS2.SSS2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2409.07429#S3.SS2.SSS2.Px1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2409.07429#S3.SS1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2409.07429#S3.SS2.SSS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "工作流归纳与动作生成使用对应实验的同一模型：WebArena为gpt-4-0613；Mind2Web为gpt-3.5-turbo或gpt-4。固定归纳提示把轨迹转成工作流。",
        "sources": [
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2409.07429#S2.SS3.SSS0.Px2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2409.07429#S3.SS2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2409.07429#S3.SS2.SSS2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2409.07429#S3.SS2.SSS2.Px1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2409.07429#S3.SS1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2409.07429#S3.SS2.SSS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "从轨迹归纳的多步工作流记忆；执行模型及工作流归纳、调用流程固定。",
        "sources": [
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2409.07429#S2.SS3.SSS0.Px2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2409.07429#S3.SS2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2409.07429#S3.SS2.SSS2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2409.07429#S3.SS2.SSS2.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "在线成功轨迹用于归纳；评测基准最终用网页任务/动作指标评价，不能把最终 评估器 都当成归纳器可见监督。",
        "sources": [
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2409.07429#S2.SS3.SSS0.Px2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2409.07429#S3.SS2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2409.07429#S3.SS2.SSS2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2409.07429#S3.SS2.SSS2.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "BrowserGym 网页 task agent 上加入从成功经历归纳的任务执行流程；Mind2Web 另使用元素过滤和文本化动作轨迹接口。任务执行流程给步骤方法，不替换浏览器底层执行器。",
        "sources": [
          {
            "label": "§3.1–3.2",
            "url": "https://arxiv.org/abs/2409.07429"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "从任务执行过程归纳可复用网页操作流程。离线设置先完成记忆构建再测试；在线设置在测试任务序列中继续积累。若把失败经历误总结为有效流程，错误也会传播到后续任务。",
        "sources": [
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2409.07429#S2.SS3.SSS0.Px2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2409.07429#S3.SS2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2409.07429#S3.SS2.SSS2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2409.07429#S3.SS2.SSS2.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "Mind2Web 离线 从训练轨迹归纳任务执行流程；WebArena/online 从此前任务交互累积。",
        "sources": [
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2409.07429#S2.SS3.SSS0.Px2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2409.07429#S3.SS2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2409.07429#S3.SS2.SSS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "轨迹及模型归纳结果决定写入内容；Mind2Web 以元素准确率、动作 F1（同时考虑找出的内容有多少正确、应找出的内容找到了多少；匹配对象看当前任务）、步骤/任务成功率评估。",
        "sources": [
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2409.07429#S2.SS3.SSS0.Px2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2409.07429#S3.SS2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2409.07429#S3.SS2.SSS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "WebArena；Mind2Web 的 cross-task、cross-website、cross-domain 三种测试。",
        "sources": [
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2409.07429#S2.SS3.SSS0.Px2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2409.07429#S3.SS2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2409.07429#S3.SS2.SSS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "离线 使用固定流程库；在线 允许从已处理测试题更新记忆，跨网站/域不能当作全程冻结。",
        "sources": [
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2409.07429#S2.SS3.SSS0.Px2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2409.07429#S3.SS2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2409.07429#S3.SS2.SSS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "从具体网页操作案例归纳可复用步骤；既研究事先从训练示例建库，也研究边做测试任务边积累，两种数据使用方式不同。",
        "sources": [
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2409.07429#S2.SS3.SSS0.Px2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2409.07429#S3.SS2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2409.07429#S3.SS2.SSS2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2409.07429#S3.SS2.SSS2.Px1"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2502.12110": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "主实验包括GPT-4o-mini/4o、Qwen2.5-1.5B/3B、Llama3.2-1B/3B；附录还测DeepSeek-R1-32B、Claude3 Haiku、Claude3.5 Haiku。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2502.12110#S3"
          },
          {
            "label": "附录B.3",
            "url": "https://arxiv.org/html/2502.12110#A2.SS3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2502.12110#S4.SS1"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2502.12110#S4.SS2"
          },
          {
            "label": "附录A.3",
            "url": "https://arxiv.org/html/2502.12110#A1.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "对应实验的基础 语言模型 按固定提示生成记忆笔记、判断连接并修订旧记忆的上下文、关键词和标签；向量模型 all-MiniLM-L6-v2 只负责召回。这里的“进化”是记忆内容变化，不是另训练一个更新模型。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2502.12110#S3"
          },
          {
            "label": "附录B.3",
            "url": "https://arxiv.org/html/2502.12110#A2.SS3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2502.12110#S3.SS1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2502.12110#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2502.12110#S3.SS3"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2502.12110#S4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "记忆条目的内容、属性与相互链接，形成可持续更新的记忆网络；不修改模型参数或记忆管理算法。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2502.12110#S3"
          },
          {
            "label": "附录B.3",
            "url": "https://arxiv.org/html/2502.12110#A2.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "新对话提供记忆内容；模型判断新旧笔记之间的关联，决定连接或修订哪些信息。最终问答成绩用于评价记忆效果，不是每次写记忆时得到的奖励。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2502.12110#S3"
          },
          {
            "label": "附录B.3",
            "url": "https://arxiv.org/html/2502.12110#A2.SS3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2502.12110#S4.SS1"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2502.12110#S4.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "在对话模型外加入作者自建的关联记忆网络。新经历形成带上下文说明的原子笔记，与已有笔记建立链接；查询时取 top-k 相关记忆。已有记忆可被重组，变化的是外部笔记和关系，不是模型权重。",
        "sources": [
          {
            "label": "实验数据与记忆结构",
            "url": "https://arxiv.org/abs/2502.12110"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "新对话写成原子笔记，语言模型 结合相邻笔记决定加强链接或修改已有上下文/标签；检索这些笔记回答问题，不按评测基准分数选择运行框架版本。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2502.12110#S3"
          },
          {
            "label": "附录B.3",
            "url": "https://arxiv.org/html/2502.12110#A2.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "LoCoMo（检查模型能否利用长期多轮对话记忆的基准）、DialSim 的长对话用于构建记忆，不进行模型参数训练。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2502.12110#S4.SS1"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2502.12110#S4.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "新笔记与近邻内容驱动记忆维护；问答指标衡量效果，不是逐条记忆的外部纠错信号。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2502.12110#S4.SS1"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2502.12110#S4.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "LoCoMo（检查模型能否利用长期多轮对话记忆的基准） 多类长期问答（该版本报告 7,512 对）；DialSim 的多人长对话问答。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2502.12110#S4.SS1"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2502.12110#S4.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "对话是可见记忆材料，问题检验能否从中找出/组合事实；不是普通监督训练集与测试集的划分。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2502.12110#S4.SS1"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2502.12110#S4.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "新经历进入记忆时会生成关联并更新既有记录，让记忆内容和连接共同变化；生成、关联和更新规则仍由作者预设。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2502.12110#S3"
          },
          {
            "label": "附录B.3",
            "url": "https://arxiv.org/html/2502.12110#A2.SS3"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2508.06433": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "主实验用GPT-4o、Claude及Qwen2.5-72B-Instruct；迁移实验将GPT-4o积累的程序记忆交给Qwen2.5-14B-Instruct使用。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2508.06433#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2508.06433#S3.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2508.06433#S4.SS1.SSS0.Px2"
          },
          {
            "label": "§5",
            "url": "https://arxiv.org/html/2508.06433#S5.SS0.SSS0.Px1"
          },
          {
            "label": "§5",
            "url": "https://arxiv.org/html/2508.06433#S5.SS0.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "程序记忆更新流程调用基础 语言模型 总结和修订操作经验；主配置为 GPT-4o、Claude、Qwen2.5-72B-Instruct。跨模型实验明确由 GPT-4o 生成记忆，再供 Qwen2.5-14B 使用；论文 Backbones 段没有给出 Claude 的具体版本。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2508.06433#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2508.06433#S3.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2508.06433#S4.SS1.SSS0.Px2"
          },
          {
            "label": "§5",
            "url": "https://arxiv.org/html/2508.06433#S5.SS0.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "程序记忆中的具体轨迹与抽象操作脚本。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2508.06433#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2508.06433#S3.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "用任务的执行过程及成败结果整理操作经验，后续做题时检索复用；经验可以增加、修改或删除，各任务的最终评价方法见表格。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2508.06433#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2508.06433#S3.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2508.06433#S4.SS1.SSS0.Px1"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2508.06433#S4.SS2"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2508.06433#A3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "给 task agent 加上程序性记忆：把交互经历整理成可复用的操作步骤，并比较只存脚本、完整轨迹、抽象程序步骤三种粒度。底层仍通过工具或文本动作与环境交互；不是重新生成一套通用运行框架。",
        "sources": [
          {
            "label": "§4.1、Table 1；附录 C",
            "url": "https://arxiv.org/abs/2508.06433"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "任务轨迹和成功/失败反馈交给记忆 构建者，保留具体过程与抽象规则；后续检索相似经验，并执行添加、删除、修改。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2508.06433#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2508.06433#S3.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "TravelPlanner、ALFWorld（通过文字动作完成家居物体操作的交互环境） 交互轨迹用于构建程序记忆，比较完整轨迹、抽象脚本及两者结合。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2508.06433#S4.SS1.SSS0.Px1"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2508.06433#S4.SS2"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2508.06433#A3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "ALFWorld（通过文字动作完成家居物体操作的交互环境） 环境返回 0/1；TravelPlanner 计划转 JSON 后检查常识与硬约束。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2508.06433#S4.SS1.SSS0.Px1"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2508.06433#S4.SS2"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2508.06433#A3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "ALFWorld（通过文字动作完成家居物体操作的交互环境） 分别报告 开发／测试；TravelPlanner 使用 测试集 的两阶段计划评估。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2508.06433#S4.SS1.SSS0.Px1"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2508.06433#S4.SS2"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2508.06433#A3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "论文同时研究顺序更新；开发／测试 列名本身不能证明记忆在测试期间冻结，需区分构建与更新实验。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2508.06433#S4.SS1.SSS0.Px1"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2508.06433#S4.SS2"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2508.06433#A3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "比较执行记录、逐步指令和抽象脚本等经验表示，并比较怎样建库、检索和更新，判断哪种操作知识更能减少重复探索。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2508.06433#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2508.06433#S3.SS1"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2509.25140": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "Gemini2.5 Flash、Gemini2.5 Pro、Claude3.7 Sonnet；网页任务配BrowserGym，SWE配仅提供 Bash 命令行工具 ReAct（交替进行推理、调用工具和读取结果的执行方式）。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2509.25140#S3"
          },
          {
            "label": "附录E",
            "url": "https://arxiv.org/html/2509.25140#A5"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2509.25140#S4.SS1"
          },
          {
            "label": "附录A.3",
            "url": "https://arxiv.org/html/2509.25140#A1.SS3.SSS0.Px2"
          },
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2509.25140#A2.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "经验抽取与成败分类使用对应执行者的同一基础模型，如Gemini2.5 Flash；角色提示及外层追加/检索算法固定。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2509.25140#S3"
          },
          {
            "label": "附录E",
            "url": "https://arxiv.org/html/2509.25140#A5"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2509.25140#S4.SS1"
          },
          {
            "label": "附录A.3",
            "url": "https://arxiv.org/html/2509.25140#A1.SS3.SSS0.Px2"
          },
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2509.25140#A2.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "推理策略记忆条目；不是权重或记忆管理代码。\n\n固定部分：模型权重与抽取/检索流程固定。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2509.25140#S3"
          },
          {
            "label": "附录E",
            "url": "https://arxiv.org/html/2509.25140#A5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "轨迹和用户问题交给同一基础模型的二分类评分者，自判 Success/Failure。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2509.25140#S3"
          },
          {
            "label": "附录E",
            "url": "https://arxiv.org/html/2509.25140#A5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "Gemini-2.5/Claude-3.7 的 ReAct（交替进行推理、调用工具和读取结果的执行方式） task agent，网页用 BrowserGym，SWE 用仅提供 Bash 命令行工具；外部模块从成功和失败轨迹提取可检索原则。任务执行器与记忆提取不是不同训练出来的专用网络。",
        "sources": [
          {
            "label": "Datasets、agent 设置与记忆更新",
            "url": "https://arxiv.org/abs/2509.25140"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "同一模型先自判本次任务成败，再提炼成功策略或避错经验，每条轨迹最多三条记忆。新记忆直接加入，未设置额外裁剪或独立回归检查；多次尝试版本利用同题不同轨迹获得更丰富的对比经验。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2509.25140#S3"
          },
          {
            "label": "附录E",
            "url": "https://arxiv.org/html/2509.25140#A5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "无离线参数训练；在任务序列中从成功与失败轨迹提炼记忆。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2509.25140#S4.SS1"
          },
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2509.25140#A2.SS1"
          },
          {
            "label": "附录B.2",
            "url": "https://arxiv.org/html/2509.25140#A2.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "语言模型 评分者判断轨迹结果并生成经验，不直接读取官方答案作为记忆更新标签。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2509.25140#S4.SS1"
          },
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2509.25140#A2.SS1"
          },
          {
            "label": "附录B.2",
            "url": "https://arxiv.org/html/2509.25140#A2.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "WebArena 684；Mind2Web 1,341（cross-task 252、cross-website 177、cross-domain 912）；SWE-bench Verified 500。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2509.25140#S4.SS1"
          },
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2509.25140#A2.SS1"
          },
          {
            "label": "附录B.2",
            "url": "https://arxiv.org/html/2509.25140#A2.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "先解当前题再更新供未来题用；MaTTS 另增加尝试预算，须与纯记忆效应区分。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2509.25140#S4.SS1"
          },
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2509.25140#A2.SS1"
          },
          {
            "label": "附录B.2",
            "url": "https://arxiv.org/html/2509.25140#A2.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "把成功和失败都提炼成可复用策略，并研究与多次尝试结合的效果；需分别看记忆本身和增加尝试次数带来的收益。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2509.25140#S3"
          },
          {
            "label": "附录E",
            "url": "https://arxiv.org/html/2509.25140#A5"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2604.10923": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "GPT-5-chat驱动 task agent 及本文比较的对照方案；可调用进化出的工具与专家 task agent。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2604.10923#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2604.10923#S3.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.10923#S3.SS3"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.10923#S3.SS3.SSS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.10923#S3.SS3.SSS3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2604.10923#S4.SS1.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "Mem2Evolve 用 GPT-5-chat 作为基础模型，通过固定流程总结经验、生成工具或专家 agent；新工具的代码交给 SandboxFusion 执行。工具内部也可能再调用别的模型，例如图像工具调用 GPT-4o，这不代表外层基础模型换成了 GPT-4o。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2604.10923#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2604.10923#S3.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.10923#S3.SS3"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.10923#S3.SS3.SSS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.10923#S3.SS3.SSS3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2604.10923#S4.SS1.SSS0.Px3"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2604.10923#S4.SS2.SSS0.Px1"
          },
          {
            "label": "附录D.3",
            "url": "https://arxiv.org/html/2604.10923#A4.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "工具与专家 agent 组成的能力库，以及从执行中提炼的策略经验库。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2604.10923#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2604.10923#S3.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.10923#S3.SS3"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.10923#S3.SS3.SSS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.10923#S3.SS3.SSS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "模型评审者根据实际执行结果给出成功判断与批评，再提炼经验、保留有用工具或专家；更新阶段不提供标准答案。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2604.10923#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2604.10923#S3.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.10923#S3.SS3"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.10923#S3.SS3.SSS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.10923#S3.SS3.SSS3"
          },
          {
            "label": "附录B.2",
            "url": "https://arxiv.org/html/2604.10923#A2.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "作者自建两类记忆：资产库存工具和专家 task agent，经验库存成功方法和失败教训。任务先规划、招募或创建资产，再执行；新工具须通过生成测试和修正流程才能入库。它既能积累文字经验，也能扩展可执行能力。",
        "sources": [
          {
            "label": "§3.3、§4.1、Table 2；附录 B.2",
            "url": "https://arxiv.org/abs/2604.10923"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "检索已有工具/专家，不足时参照经验创建；任务结束由 语言模型 评分者给成功标签和批评，再保留有效资产、提炼经验。更新阶段不使用真值答案。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2604.10923#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2604.10923#S3.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.10923#S3.SS3"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.10923#S3.SS3.SSS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.10923#S3.SS3.SSS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "在在线执行任务中构建双记忆，没有统一预制的训练文本集。",
        "sources": [
          {
            "label": "附录B.2",
            "url": "https://arxiv.org/html/2604.10923#A2.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "当前任务轨迹、答案和 语言模型 评分者的成功/失败与批评用于后向更新。",
        "sources": [
          {
            "label": "附录B.2",
            "url": "https://arxiv.org/html/2604.10923#A2.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "GAIA（需要检索、推理和使用工具的通用助理任务基准）、ALFWorld（通过文字动作完成家居物体操作的交互环境）；HotpotQA/2Wiki 各 500；AIME 2024/2025 各 30；TravelPlanner 1,000；WebShop（根据用户要求挑选和购买商品的交互基准） 251。",
        "sources": [
          {
            "label": "附录B.2",
            "url": "https://arxiv.org/html/2604.10923#A2.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "主机制在完成题后更新再服务后续题；官方任务评分与更新用的 语言模型 评分者不是同一个信号。",
        "sources": [
          {
            "label": "附录B.2",
            "url": "https://arxiv.org/html/2604.10923#A2.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "让已有经验指导生成工具或专家 agent，执行这些新能力又产生新经验，把知识积累接到可执行能力的扩展上。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2604.10923#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2604.10923#S3.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.10923#S3.SS3"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.10923#S3.SS3.SSS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.10923#S3.SS3.SSS3"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2604.16839": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "GPT-4o-mini、GPT-4o、Qwen2.5-14B、Qwen2.5-3B分别配HeLa-Mem回答问题。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2604.16839#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2604.16839#S3.SS1.SSS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.16839#S3.SS3"
          },
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2604.16839#S3.SS4"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2604.16839#S4.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "反思步骤调用对应配置的 GPT-4o-mini、GPT-4o、Qwen2.5-14B 或 Qwen2.5-3B；记忆边的强化和衰减由固定 Hebbian 更新公式执行，不是模型参数训练。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2604.16839#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2604.16839#S3.SS1.SSS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.16839#S3.SS3"
          },
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2604.16839#S3.SS4"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2604.16839#S4.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "记忆图的关联权重、情节节点及压缩后的语义记忆。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2604.16839#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2604.16839#S3.SS1.SSS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.16839#S3.SS3"
          },
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2604.16839#S3.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "记忆被共同检索和使用时增强关联，模型从高度关联的内容中总结知识；这与最后用问答成绩衡量效果是两个不同环节。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2604.16839#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2604.16839#S3.SS1.SSS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.16839#S3.SS3"
          },
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2604.16839#S3.SS4"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2604.16839#A3"
          },
          {
            "label": "附录D",
            "url": "https://arxiv.org/html/2604.16839#A4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "作者自建双层记忆：对话节点图＋语义记忆库；检索结合向量相似度和关联传播，没有改基础模型参数。",
        "sources": [
          {
            "label": "LoCoMo 数据说明、Tables 4–5；附录 D",
            "url": "https://arxiv.org/abs/2604.16839"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "共同激活加强边权；高连接节点触发 语言模型 蒸馏。低边权、长期不活跃且近期未访问三条件同时成立才删除记忆。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2604.16839#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2604.16839#S3.SS1.SSS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.16839#S3.SS3"
          },
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2604.16839#S3.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "LoCoMo（检查模型能否利用长期多轮对话记忆的基准） 10 段长对话写入记忆；无需参数训练。",
        "sources": [
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2604.16839#A3"
          },
          {
            "label": "附录D",
            "url": "https://arxiv.org/html/2604.16839#A4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "关联/访问统计驱动维护；附录 D 报告 LongMemEval-S 使用的检索和阈值配置。",
        "sources": [
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2604.16839#A3"
          },
          {
            "label": "附录D",
            "url": "https://arxiv.org/html/2604.16839#A4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "LoCoMo（检查模型能否利用长期多轮对话记忆的基准） 1,986 个问题；另测 LongMemEval-S 500 题。",
        "sources": [
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2604.16839#A3"
          },
          {
            "label": "附录D",
            "url": "https://arxiv.org/html/2604.16839#A4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "读入历史后回答对应记忆问题；附录给出超参数，但这些指标不能单独证明在另一组数据上选好全部阈值。",
        "sources": [
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2604.16839#A3"
          },
          {
            "label": "附录D",
            "url": "https://arxiv.org/html/2604.16839#A4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "经常一起被使用的记忆会加强连接，再将密集关联的具体经历归纳成更一般的知识；改变的是记忆图与内容。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2604.16839#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2604.16839#S3.SS1.SSS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.16839#S3.SS3"
          },
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2604.16839#S3.SS4"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2608.16114": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "GPT-4o或Qwen3-30B-A3B，分别加载HyperSkill超图经验；两者检索预算不同。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.16114#S3"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.16114#S3.SS2"
          },
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2608.16114#S3.SS4"
          },
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2608.16114#S3.SS5"
          },
          {
            "label": "附录H",
            "url": "https://arxiv.org/html/2608.16114#A8"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.16114#S4.SS1"
          },
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2608.16114#A1.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "GPT-4o 或 Qwen3-30B-A3B 配置下，系统从执行轨迹提取技能；固定维护程序根据效用与检索次数合并、裁剪超图。all-MiniLM-L6-v2 是编码器，不负责决定修改文本。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.16114#S3"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.16114#S3.SS2"
          },
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2608.16114#S3.SS4"
          },
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2608.16114#S3.SS5"
          },
          {
            "label": "附录H",
            "url": "https://arxiv.org/html/2608.16114#A8"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.16114#S4.SS1"
          },
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2608.16114#A1.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "连接子任务、技能与整条轨迹的超图记忆。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.16114#S3"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.16114#S3.SS2"
          },
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2608.16114#S3.SS4"
          },
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2608.16114#S3.SS5"
          },
          {
            "label": "附录H",
            "url": "https://arxiv.org/html/2608.16114#A8"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "观察技能使用后的任务结果，衡量技能是否有用。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.16114#S3"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.16114#S3.SS2"
          },
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2608.16114#S3.SS4"
          },
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2608.16114#S3.SS5"
          },
          {
            "label": "附录H",
            "url": "https://arxiv.org/html/2608.16114#A8"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "作者自建超图检索层：同时按子任务和轨迹取候选，再按共现与效用排序技能；每道题开始时组装记忆，本题内保持不变。",
        "sources": [
          {
            "label": "§4.1 与记忆结构",
            "url": "https://arxiv.org/abs/2608.16114"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "任务成功次数和步数更新记忆效用；成功轨迹提炼正策略，失败轨迹提炼避错经验；周期性删除低质量节点并合并冗余节点。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.16114#S3"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.16114#S3.SS2"
          },
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2608.16114#S3.SS4"
          },
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2608.16114#S3.SS5"
          },
          {
            "label": "附录H",
            "url": "https://arxiv.org/html/2608.16114#A8"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "在 xBench、GAIA（需要检索、推理和使用工具的通用助理任务基准）、WebWalkerQA 的连续任务经历中积累技能及轨迹超边。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.16114#S4.SS1"
          },
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2608.16114#A1.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "任务结果与执行步数更新效用；当前题的记忆上下文固定，结束后再维护。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.16114#S4.SS1"
          },
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2608.16114#A1.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "xBench、GAIA（需要检索、推理和使用工具的通用助理任务基准）、WebWalkerQA，报告成功率、步骤和工具调用数，并比较 GPT-4o/Qwen3 骨干。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.16114#S4.SS1"
          },
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2608.16114#A1.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "这是跨任务在线记忆机制；不能把数据集名中的评估集解释成一套冻结记忆后的独立测试。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.16114#S4.SS1"
          },
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2608.16114#A1.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "用能同时连接多个子任务和技能的图结构组织技能库，利用共享关系检索，并按使用价值去重、合并或删减技能。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.16114#S3"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.16114#S3.SS2"
          },
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2608.16114#S3.SS4"
          },
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2608.16114#S3.SS5"
          },
          {
            "label": "附录H",
            "url": "https://arxiv.org/html/2608.16114#A8"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2608.24876": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "进化阶段由冻结的 doubao-seed-2-0-pro 执行任务并产生失败轨迹；τ²-Bench 中它也模拟用户。最终迁移评测另换表 1 的目标模型，复用同一份技能记忆。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2608.24876#S2.SS1.SSS2"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.24876#S3.SS1"
          },
          {
            "label": "附录E",
            "url": "https://arxiv.org/html/2608.24876#A5"
          },
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2608.24876#S3.SS4.SSS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "固定 Meta-Agent 读取失败轨迹并修改对应记忆组件。主实现使用 Claude Code（可读写项目文件、运行命令和测试的 coding agent 工具），替换实验使用 DeepSeek Harness；§3.1 和 §3.4.3 没有为这两个修改端分别给出底层模型型号，不能把工具名当成模型名。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2608.24876#S2.SS1.SSS2"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.24876#S3.SS1"
          },
          {
            "label": "附录E",
            "url": "https://arxiv.org/html/2608.24876#A5"
          },
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2608.24876#S3.SS4.SSS3"
          },
          {
            "label": "Claude Code 官方说明",
            "url": "https://code.claude.com/docs/en/overview"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "工作记忆与经验记忆中的局部技能及控制组件；meta-agent、任务框架和基础模型固定。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2608.24876#S2.SS1.SSS2"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.24876#S3.SS1"
          },
          {
            "label": "附录E",
            "url": "https://arxiv.org/html/2608.24876#A5"
          },
          {
            "label": "Claude Code 官方说明",
            "url": "https://code.claude.com/docs/en/overview"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "从任务成败和多次开发集执行中判断改动是否有效；失败轨迹负责定位记忆中的错误步骤，已成功任务用于检查新补丁是否破坏原有行为。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2608.24876#S2.SS1.SSS2"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.24876#S3.SS1"
          },
          {
            "label": "附录E",
            "url": "https://arxiv.org/html/2608.24876#A5"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2608.24876#A3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "沿用每套评测基准的原 task agent：τ² 工具调用 task agent、SkillFlow 的 Qwen-Code（Qwen 团队的终端 coding agent 工具） CLI（通过终端命令使用的程序界面）、Terminal-Bench 2.1 的 Terminus-2（Terminal-Bench 团队提供的终端 task agent，负责让模型操作命令行环境）；外加中性 M0 记忆与控制层。固定 Claude Code（可读写项目文件、运行命令和测试的 coding agent 工具） meta-agent（负责设计或修改 task agent）读失败并只改对应记忆组件，不修改自己。",
        "sources": [
          {
            "label": "§2.3；附录 C",
            "url": "https://arxiv.org/abs/2608.24876"
          },
          {
            "label": "Qwen Code 官方说明",
            "url": "https://github.com/QwenLM/qwen-code"
          },
          {
            "label": "Terminus：终端 task agent",
            "url": "https://www.tbench.ai/news/terminus"
          },
          {
            "label": "Claude Code 官方说明",
            "url": "https://code.claude.com/docs/en/overview"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "根据失败记录定位具体记忆步骤，例如换货时误用了原商品编号，再只修该部分。开发题中保留已成功任务检查副作用；如果重复运行不足以支持可靠提升，就拒绝修改。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2608.24876#S2.SS1.SSS2"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.24876#S3.SS1"
          },
          {
            "label": "附录E",
            "url": "https://arxiv.org/html/2608.24876#A5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "τ² Retail 16 evolve；Airline 两条运行线分别 10/11 evolve；SkillFlow 按任务族构建技能。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.24876#S3.SS1"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2608.24876#A3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "Retail 12 开发集；Airline 15/10 开发集。Meta-Agent 从失败轨迹定位到记忆组件，再提交范围受限的补丁。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.24876#S3.SS1"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2608.24876#A3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "Retail 86；Airline 25/29；SkillFlow 166 题用于跨模型比较，另含 TB2.1 实验。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.24876#S3.SS1"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2608.24876#A3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "τ² 的 evolve/开发／测试 分开；SkillFlow 在同族选模板并使用，无任务级单独留出的，不能套用 τ² 的隔离结论。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.24876#S3.SS1"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2608.24876#A3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "围绕记忆控制层的具体问题修改该层，并用对照实验区分“多了控制层”和“层里学到有效内容”的收益；小验证集的拒绝也可能漏掉有用补丁。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2608.24876#S2.SS1.SSS2"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.24876#S3.SS1"
          },
          {
            "label": "附录E",
            "url": "https://arxiv.org/html/2608.24876#A5"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2606.01314": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "OfficeQA 比较 Qwen3.5 的 9B、27B、35B、122B、397B 五档；SealQA 表 1 列出 9B、35B、122B、397B。执行模型配合技能库和工具库完成任务，122B 还用于长期恢复实验。",
        "sources": [
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.01314#A1.SS1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2606.01314#S3.SS1.SSS0.Px1"
          },
          {
            "label": "§1",
            "url": "https://arxiv.org/html/2606.01314#S1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2606.01314#S4.SS1.SSS0.Px2"
          },
          {
            "label": "附录D.6",
            "url": "https://arxiv.org/html/2606.01314#A4.SS6"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "反思模块提出技能和工具的联合修改；Tool-Smith（负责实现工具修改的角色）只能包装、编辑、组合、拆分或停用工具。实验使用 Qwen3.5 系列；角色说明没有为 Tool-Smith 另列一款独立模型。",
        "sources": [
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.01314#A1.SS1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2606.01314#S3.SS1.SSS0.Px1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2606.01314#S3.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2606.01314#S4.SS1.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "技能说明、工具实现和失败模式记忆。工具可包装、修改、组合、拆分或停用；任务模型参数与评分接口固定。",
        "sources": [
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.01314#A1.SS1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2606.01314#S3.SS1.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "OfficeQA 和 WildClawBench 使用各自任务评测规则。SealQA 由独立、冻结的 Qwen3.5-122B 读取问题、标准答案和回答，判对或错；同一回答判三次，取多数票。",
        "sources": [
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.01314#A1.SS1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2606.01314#S3.SS1.SSS0.Px1"
          },
          {
            "label": "附录D.4",
            "url": "https://arxiv.org/html/2606.01314#A4.SS4.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "按任务给不同技能/工具库：OfficeQA 有文档检索、表格解析、数值计算技能及 pdf_parser/table_extractor/formula_calc/unit_converter；SealQA 有搜索计划、来源可信度判断及搜索/抓取/去重工具；WildClaw 还有消息、日历、文件、创作和 Git 工具。起点已具备专用能力，不是空白技能库。",
        "sources": [
          {
            "label": "附录 D.2、Tables 3–4 与数据划分",
            "url": "https://arxiv.org/abs/2606.01314"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "先定位失败涉及的技能、工具和错误模式，再一起修改相关技能与工具。依次运行工具单元测试、组合使用检查和回归检查；保存历史失败模式，阻止再次引入相似错误，并据效用调整检索、合并或淘汰。",
        "sources": [
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.01314#A1.SS1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2606.01314#S3.SS1.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "OfficeQA 24 道训练题；SealQA 11 道训练题。WildClaw 另使用六个昼夜的在线经历。",
        "sources": [
          {
            "label": "附录D.1",
            "url": "https://arxiv.org/html/2606.01314#A4.SS1.SSS0.Px1"
          },
          {
            "label": "附录D.6",
            "url": "https://arxiv.org/html/2606.01314#A4.SS6"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "OfficeQA：17 题；SealQA：8 题。均用于筛选候选、检查已有能力是否退步；工具另做单元和集成检查。",
        "sources": [
          {
            "label": "附录D.1",
            "url": "https://arxiv.org/html/2606.01314#A4.SS1.SSS0.Px1"
          },
          {
            "label": "附录D.6",
            "url": "https://arxiv.org/html/2606.01314#A4.SS6"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "OfficeQA 205、SealQA 92 道未用于进化的题；WildClaw 报持续运行结果。",
        "sources": [
          {
            "label": "附录D.1",
            "url": "https://arxiv.org/html/2606.01314#A4.SS1.SSS0.Px1"
          },
          {
            "label": "附录D.6",
            "url": "https://arxiv.org/html/2606.01314#A4.SS6"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "OfficeQA、SealQA 均分训练／验证／测试。WildClaw 持续在线更新；100 轮抗扰动另用受控任务池。",
        "sources": [
          {
            "label": "附录D.1",
            "url": "https://arxiv.org/html/2606.01314#A4.SS1.SSS0.Px1"
          },
          {
            "label": "附录D.6",
            "url": "https://arxiv.org/html/2606.01314#A4.SS6"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "联合维护技能、工具及依赖关系；记录已经验证失败的修改，避免重复采用。",
        "sources": [
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.01314#A1.SS1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2606.01314#S3.SS1.SSS0.Px1"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2606.17220": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "所有实验都由Qwen3-4B-Thinking改写检索查询，再交BM25（根据查询词与文档词项匹配程度排序的检索算法）检索；不是由规则进化模型直接替代检索器。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2606.17220#S4"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.17220#A1.SS1.SSS2"
          },
          {
            "label": "附录A.3",
            "url": "https://arxiv.org/html/2606.17220#A1.SS3.SSS2"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2606.17220#S5.SS1.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "规则进化分别用Qwen3-4B-Thinking、Qwen3-30B-A3B-Thinking、gpt-oss-20b、gpt-oss-120b。四者只改变规则，查询改写模型固定。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2606.17220#S4"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.17220#A1.SS1.SSS2"
          },
          {
            "label": "附录A.3",
            "url": "https://arxiv.org/html/2606.17220#A1.SS3.SSS2"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2606.17220#S5.SS1.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "法律检索的查询改写规则及规则组合。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2606.17220#S4"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.17220#A1.SS1.SSS2"
          },
          {
            "label": "附录A.3",
            "url": "https://arxiv.org/html/2606.17220#A1.SS3.SSS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "在法律案例检索中，对照标注的相关案例计算检索指标，再用历史实验分数比较查询规则及规则组合。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2606.17220#S4"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.17220#A1.SS1.SSS2"
          },
          {
            "label": "附录A.3",
            "url": "https://arxiv.org/html/2606.17220#A1.SS3.SSS2"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2606.17220#S5.SS1.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "从一条人写规则开始，给 task agent 维护可增删的文字规则集合；执行器按规则改写检索查询。系统比较新增和删减规则的效果，并保存历史候选，而非改模型参数或任意工具代码。",
        "sources": [
          {
            "label": "实验设置；Table 2",
            "url": "https://arxiv.org/abs/2606.17220"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "task agent 在新增规则、试验规则组合和删无效规则之间选择；读基线 Recall、历史实验分数与最近行动，再决定下一步。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2606.17220#S4"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.17220#A1.SS1.SSS2"
          },
          {
            "label": "附录A.3",
            "url": "https://arxiv.org/html/2606.17220#A1.SS3.SSS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "LeCaRD-v2 共 800 个查询、55,192 篇候选文档；不训练模型权重。",
        "sources": [
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2606.17220#S5.SS1.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "100 个 开发集 查询用于最多 500 步规则探索，并按历史分数选组合。",
        "sources": [
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2606.17220#S5.SS1.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "其余 700 个查询，报告法律案例检索 Recall。",
        "sources": [
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2606.17220#S5.SS1.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "规则探索与最终查询分开；重复运行/改写次数不当作额外样本。",
        "sources": [
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2606.17220#S5.SS1.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "搜索并筛掉法律检索中的查询改写规则，改变送给检索器的查询方式；最后仍由 BM25 词项匹配算法排列文档。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2606.17220#S4"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.17220#A1.SS1.SSS2"
          },
          {
            "label": "附录A.3",
            "url": "https://arxiv.org/html/2606.17220#A1.SS3.SSS2"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2608.22793": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "GPT-5.5（medium）与GLM-5.2（high）分别加载相同的TRACE Skill Bank执行。",
        "sources": [
          {
            "label": "§2.2",
            "url": "https://arxiv.org/html/2608.22793#S2.SS2"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.22793#S3.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "Skill Bank由GPT-5.5收集的轨迹驱动进化；测试时原样交给GPT-5.5和GLM-5.2，不针对GLM重新进化。",
        "sources": [
          {
            "label": "§2.2",
            "url": "https://arxiv.org/html/2608.22793#S2.SS2"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.22793#S3.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "车载任务的行为技能文本与技能划分。",
        "sources": [
          {
            "label": "§2.2",
            "url": "https://arxiv.org/html/2608.22793#S2.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "每轮的任务得分，以及成功和失败执行之间的对比。",
        "sources": [
          {
            "label": "§2.2",
            "url": "https://arxiv.org/html/2608.22793#S2.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "以模型默认提示与原生工具调用为对照；TRACE 额外加入技能库和按执行状态选择技能的模块。技能库用 GPT-5.5 轨迹演化，测试时不改地迁移到不同骨干，不是让测试骨干重新训练技能。",
        "sources": [
          {
            "label": "实验设置；§3.3 Official Hidden-Set Evaluation",
            "url": "https://arxiv.org/abs/2608.22793"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "经验整理角色 对同一技能的成功/失败轨迹作对照，修改或拆分技能；未调用技能的重复失败用于补新技能，入库前去除任务 ID、记忆答案和环境特定值。",
        "sources": [
          {
            "label": "§2.2",
            "url": "https://arxiv.org/html/2608.22793#S2.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "CAR-bench 公开 训练集 先建技能库，再用公开 测试集 扩充覆盖；环境有 58 个工具、19 条领域政策。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.22793#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.22793#S3.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2608.22793#S3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "公开两部分的执行轨迹用于对比和改写，技能由 GPT-5.5 轨迹演化后跨模型复用。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.22793#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.22793#S3.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2608.22793#S3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "公开主表为 训练集＋测试集 合集；另有官方 30 道隐藏题，每题 3 次运行。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.22793#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.22793#S3.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2608.22793#S3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "公开 测试集 已参与进化；只有另行保留的官方 隐藏 30 题属于未见任务评估。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.22793#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.22793#S3.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2608.22793#S3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "按真正调用过的技能汇总成功与失败轨迹，再对照修订该技能；评价更强调重复运行能否稳定成功。",
        "sources": [
          {
            "label": "§2.2",
            "url": "https://arxiv.org/html/2608.22793#S2.SS2"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2608.23397": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "Qwen3.6-Flash与DeepSeek-V4-Flash作为Doctor回答临床问题；多模态设置只用Qwen3.6-Flash，每病例最多8次Doctor推理。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2608.23397#S3.SS3"
          },
          {
            "label": "§2.6",
            "url": "https://arxiv.org/html/2608.23397#S2.SS6"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.23397#S3.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "回合结束后，reflector 从已完成的病例轨迹提出新增、合并、修补或淘汰记忆的建议，固定审核规则决定是否进入下一快照。实验基础模型为 Qwen3.6-Flash 或 DeepSeek-V4-Flash；§3.1 明确 Doctor 与 moderator 共用模型，但没有为 reflector 单列型号。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2608.23397#S3.SS3"
          },
          {
            "label": "§2.6",
            "url": "https://arxiv.org/html/2608.23397#S2.SS6"
          },
          {
            "label": "§2.2",
            "url": "https://arxiv.org/html/2608.23397#S2.SS2"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.23397#S3.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "临床、流程、符号和视觉知识库中的经验及操作指导。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2608.23397#S3.SS3"
          },
          {
            "label": "§2.6",
            "url": "https://arxiv.org/html/2608.23397#S2.SS6"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "检查经验的来源与适用范围、临床流程约束和任务执行结果，再决定是否允许写入或使用。病例和压力测试分别评价诊断与流程表现。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2608.23397#S3.SS3"
          },
          {
            "label": "§2.6",
            "url": "https://arxiv.org/html/2608.23397#S2.SS6"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.23397#S3.SS2.SSS0.Px2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.23397#S3.SS2.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "自建医生、患者与检查结果交互框架：医生 agent 发出合法检查请求后才能获得结果，未请求或不可得的证据保持未知；控制程序限制技能知识怎样影响动作。隐藏诊断答案由评测端保存，医生 agent 不能提前读取。",
        "sources": [
          {
            "label": "数据构造与交互协议",
            "url": "https://arxiv.org/abs/2608.23397"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "在 Doctor–Patient–Measurement 交互中收集过程证据，提供批评意见的模型结合证据一致性、诊断、安全与检查效率反馈修订技能；最终 评估器 另看私有目标。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2608.23397#S3.SS3"
          },
          {
            "label": "§2.6",
            "url": "https://arxiv.org/html/2608.23397#S2.SS6"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "MIMIC-IV/AgentClinic 衍生 FullChain 700 例；NEJM 图像病例 200 例。压力测试另用 70 病例生成 420 种条件。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.23397#S3.SS2.SSS0.Px2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.23397#S3.SS2.SSS0.Px3"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2608.23397#S3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "训练病例的交互轨迹与提供批评意见的模型检查；不可获得的检查结果保持未知，不能当阴性。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.23397#S3.SS2.SSS0.Px2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.23397#S3.SS2.SSS0.Px3"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2608.23397#S3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "FullChain 300 例、NEJM 100 例；压力测试是另外 30 个病例的 180 种条件。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.23397#S3.SS2.SSS0.Px2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.23397#S3.SS2.SSS0.Px3"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2608.23397#S3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "病例级分开；180 条压力测试不是 180 名独立病人。诊断/评测目标不向执行医生开放。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.23397#S3.SS2.SSS0.Px2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.23397#S3.SS2.SSS0.Px3"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2608.23397#S3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "将临床、操作过程、符号和视觉知识分库存放，并限制各类证据能支持什么写入与使用；同时考察诊断正确性和过程安全。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2608.23397#S3.SS3"
          },
          {
            "label": "§2.6",
            "url": "https://arxiv.org/html/2608.23397#S2.SS6"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2608.23552": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "多日nanoGPT研究比较Kimi K3、DeepSeek V4 Pro、GLM5.3；MazeBench比较Opus5、GPT-5.6 Sol，并报告GLM5.2对照。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2608.23552#S3.SS3"
          },
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2608.23552#S3.SS5.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "对应实验的同一模型在Prime Agent持久运行环境中更新代码和经验；模型是Kimi K3/DeepSeek V4 Pro/GLM5.3等具体配置，不是另一个未命名优化器。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2608.23552#S3.SS3"
          },
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2608.23552#S3.SS5.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "跨轨迹保留的 Python 执行状态、记忆、技能和sub-agent 配置；部分任务还迭代工程产物。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2608.23552#S3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "读取工具执行、程序运行及环境结果，判断当前任务是否完成、哪里需要恢复；具体任务各有自己的验收方式，不能用一个总称代替所有裁判。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2608.23552#S3.SS3"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2608.23552#A1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "Prime Agent 是作者自建的持久运行框架：有保留变量的 REPL、可恢复会话、递归子 task agent、消息通信、预算/停止控制，以及可版本化的提示、记忆和技能。起点已经功能丰富；模型决定如何分工，框架不预设固定工作流图。",
        "sources": [
          {
            "label": "§2 运行机制；§3.1–3.3",
            "url": "https://arxiv.org/abs/2608.23552"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "固定框架提供持久 REPL，task agent 编写辅助函数和小实验，借执行结果修正研究方案；nanoGPT 记录必须通过八随机种子均值验证。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2608.23552#S3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "没有统一离线进化数据集；task agent 在当前研究/控制任务内进行实验，nanoGPT 修改的是 124M GPT 的训练方案。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2608.23552#S3.SS3"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2608.23552#A1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "REPL 自建实验、训练脚本输出和验证 loss；例如先用合成梯度筛选优化器方案。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2608.23552#S3.SS3"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2608.23552#A1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "ARC-AGI-3；OOLONG/OOLONG-Pairs、OBLIQ、LongBench Pro/v2、ManyIH、LongCoT-Mini、EmulatorBench；长期案例 nanoGPT、PMPP-Hard、Factorio、MazeBench。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2608.23552#S3.SS3"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2608.23552#A1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "多套固定框架能力测评与长时自适应案例并列，不构成一套统一的进化集→盲测集。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2608.23552#S3.SS3"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2608.23552#A1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "用可持续保存变量的 Python 交互环境、可继续调用sub-agent 的分工方式，以及跨执行的状态保存支持长任务；整套系统的案例成绩不能单独归因于某一种学习机制。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2608.23552#S3.SS3"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2605.09998": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "主游戏实验用Gemini3 Pro、Flash、Flash-Lite；开源迁移/共同学习用Gemma4 E2B、E4B、26B MoE、31B dense。",
        "sources": [
          {
            "label": "§4.5",
            "url": "https://arxiv.org/html/2605.09998#S4.SS5"
          },
          {
            "label": "附录C.1",
            "url": "https://arxiv.org/html/2605.09998#A3.SS1.SSS2"
          },
          {
            "label": "附录D.4",
            "url": "https://arxiv.org/html/2605.09998#A4.SS4"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2605.09998#S4.SS1.SSS0.Px3"
          },
          {
            "label": "§6",
            "url": "https://arxiv.org/html/2605.09998#S6"
          },
          {
            "label": "附录D",
            "url": "https://arxiv.org/html/2605.09998#A4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "主实验Refiner由Gemini模型承担；共同学习阶段由frontier teacher指导Gemma4，并通过监督微调（用示范数据训练模型）/GRPO更新其权重。论文明确被测Gemma4不能同时胜任teacher与trainee。",
        "sources": [
          {
            "label": "§4.5",
            "url": "https://arxiv.org/html/2605.09998#S4.SS5"
          },
          {
            "label": "附录C.1",
            "url": "https://arxiv.org/html/2605.09998#A3.SS1.SSS2"
          },
          {
            "label": "附录D.4",
            "url": "https://arxiv.org/html/2605.09998#A4.SS4"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2605.09998#S4.SS1.SSS0.Px3"
          },
          {
            "label": "§6",
            "url": "https://arxiv.org/html/2605.09998#S6"
          },
          {
            "label": "附录D",
            "url": "https://arxiv.org/html/2605.09998#A4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "冻结模型设置更新提示、技能、记忆和sub-agent；共同学习设置还更新模型参数。",
        "sources": [
          {
            "label": "§4.5",
            "url": "https://arxiv.org/html/2605.09998#S4.SS5"
          },
          {
            "label": "附录C.1",
            "url": "https://arxiv.org/html/2605.09998#A3.SS1.SSS2"
          },
          {
            "label": "附录D.4",
            "url": "https://arxiv.org/html/2605.09998#A4.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "当前及历史执行记录、游戏进展和失败情况。",
        "sources": [
          {
            "label": "§4.5",
            "url": "https://arxiv.org/html/2605.09998#S4.SS5"
          },
          {
            "label": "附录C.1",
            "url": "https://arxiv.org/html/2605.09998#A3.SS1.SSS2"
          },
          {
            "label": "附录D.4",
            "url": "https://arxiv.org/html/2605.09998#A4.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "游戏只提供画面、ASCII 地图、按键等初始接口，在持续运行中演化提示、技能、记忆和子 task agent。联合训练阶段固定教师负责重标轨迹，再更新学生参数；这与纯冻结模型改运行框架设置分开。",
        "sources": [
          {
            "label": "§3.3、§4；附录 D、Table 5",
            "url": "https://arxiv.org/abs/2605.09998"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "持续游戏中创建/修改/删除技能及 subagent；联合训练每 256 步后用过程奖励筛低奖窗口、Gemini 教师重标，再 soft 监督微调（用示范数据训练模型），沿同一存档继续。",
        "sources": [
          {
            "label": "§4.5",
            "url": "https://arxiv.org/html/2605.09998#S4.SS5"
          },
          {
            "label": "附录C.1",
            "url": "https://arxiv.org/html/2605.09998#A3.SS1.SSS2"
          },
          {
            "label": "附录D.4",
            "url": "https://arxiv.org/html/2605.09998#A4.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "Pokémon Red 等 RPG 的持续交互；开放模型先用 frontier 轨迹 监督微调（用示范数据训练模型） 和离线 GRPO（比较同一任务多次尝试的奖励，用相对好坏更新模型参数的强化学习方法） 预热。",
        "sources": [
          {
            "label": "§4.5",
            "url": "https://arxiv.org/html/2605.09998#S4.SS5"
          },
          {
            "label": "附录D",
            "url": "https://arxiv.org/html/2605.09998#A4"
          },
          {
            "label": "附录D.4",
            "url": "https://arxiv.org/html/2605.09998#A4.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "技能调用结果、游戏进度和过程奖励；反复修订实际使用的技能。",
        "sources": [
          {
            "label": "§4.5",
            "url": "https://arxiv.org/html/2605.09998#S4.SS5"
          },
          {
            "label": "附录D",
            "url": "https://arxiv.org/html/2605.09998#A4"
          },
          {
            "label": "附录D.4",
            "url": "https://arxiv.org/html/2605.09998#A4.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "游戏里程碑来自 reset-free 的连续运行；预热另有 20 个单独留出的 transition 检查动作/格式。",
        "sources": [
          {
            "label": "§4.5",
            "url": "https://arxiv.org/html/2605.09998#S4.SS5"
          },
          {
            "label": "附录D",
            "url": "https://arxiv.org/html/2605.09998#A4"
          },
          {
            "label": "附录D.4",
            "url": "https://arxiv.org/html/2605.09998#A4.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "连续训练曲线不是独立 episode 平均；20 个 transition 留出不代表整条游戏轨迹是盲测。",
        "sources": [
          {
            "label": "§4.5",
            "url": "https://arxiv.org/html/2605.09998#S4.SS5"
          },
          {
            "label": "附录D",
            "url": "https://arxiv.org/html/2605.09998#A4"
          },
          {
            "label": "附录D.4",
            "url": "https://arxiv.org/html/2605.09998#A4.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "在不重置的游戏进程中持续改框架，并进一步加入教师生成训练示范与参数更新，考察同一长期经历中的共同学习。",
        "sources": [
          {
            "label": "§4.5",
            "url": "https://arxiv.org/html/2605.09998#S4.SS5"
          },
          {
            "label": "附录C.1",
            "url": "https://arxiv.org/html/2605.09998#A3.SS1.SSS2"
          },
          {
            "label": "附录D.4",
            "url": "https://arxiv.org/html/2605.09998#A4.SS4"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2605.24539": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "主要对局配置为GPT-5.4-low自博弈、Qwen3.5-4B对GPT-5.4-low、Qwen3.5-4B自博弈；Balatro执行者固定GPT-5.4-low。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2605.24539#S4.SS1.SSS0.Px1"
          },
          {
            "label": "附录C.2",
            "url": "https://arxiv.org/html/2605.24539#A3.SS2.SSS0.Px1"
          },
          {
            "label": "附录C.2",
            "url": "https://arxiv.org/html/2605.24539#A3.SS2.SSS0.Px3"
          },
          {
            "label": "附录C.2",
            "url": "https://arxiv.org/html/2605.24539#A3.SS2.SSS0.Px5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "编程候选方案提出者根据轨迹/示范编辑运行框架；Balatro全部进化条件用Claude Opus4.7 Max，执行者GPT-5.4-low保持冻结。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2605.24539#S4.SS1.SSS0.Px1"
          },
          {
            "label": "附录C.2",
            "url": "https://arxiv.org/html/2605.24539#A3.SS2.SSS0.Px1"
          },
          {
            "label": "附录C.2",
            "url": "https://arxiv.org/html/2605.24539#A3.SS2.SSS0.Px3"
          },
          {
            "label": "附录C.2",
            "url": "https://arxiv.org/html/2605.24539#A3.SS2.SSS0.Px5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "冻结模型外的可执行 harness。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2605.24539#S4.SS1.SSS0.Px1"
          },
          {
            "label": "附录C.2",
            "url": "https://arxiv.org/html/2605.24539#A3.SS2.SSS0.Px1"
          },
          {
            "label": "附录C.2",
            "url": "https://arxiv.org/html/2605.24539#A3.SS2.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "Liar’s Dice 较容易从自己对局获得奖励；Balatro 的奖励更稀疏且随机，因此额外利用人类成功执行的完整过程定位改进方向。教程文字是另一种较弱对照。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2605.24539#S4.SS1.SSS0.Px1"
          },
          {
            "label": "附录C.2",
            "url": "https://arxiv.org/html/2605.24539#A3.SS2.SSS0.Px1"
          },
          {
            "label": "附录C.2",
            "url": "https://arxiv.org/html/2605.24539#A3.SS2.SSS0.Px3"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2605.24539#A1.SS0.SSS0.Px4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "固定游戏执行接口上的初始运行框架；在稀疏奖励之外加入演示轨迹，供候选方案提出者参照可成功的行为。",
        "sources": [
          {
            "label": "实验协议；附录 A",
            "url": "https://arxiv.org/abs/2605.24539"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "候选方案提出者对照演示与开发执行尝试（从开始做任务到得到结果的过程）修改运行框架，候选只按开发成绩选择；选好后冻结，并用配对种子比较。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2605.24539#S4.SS1.SSS0.Px1"
          },
          {
            "label": "附录C.2",
            "url": "https://arxiv.org/html/2605.24539#A3.SS2.SSS0.Px1"
          },
          {
            "label": "附录C.2",
            "url": "https://arxiv.org/html/2605.24539#A3.SS2.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "TextArena Liar’s Dice 的 Small3、OneCall-Wild1 开发回合；BalatroBench 另使用固定种子 A/B/C。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2605.24539#S4.SS1.SSS0.Px1"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2605.24539#A1.SS0.SSS0.Px4"
          },
          {
            "label": "附录C.2",
            "url": "https://arxiv.org/html/2605.24539#A3.SS2.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "只看 development/search 轨迹和演示；Balatro 的 D/E 种子不可见。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2605.24539#S4.SS1.SSS0.Px1"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2605.24539#A1.SS0.SSS0.Px4"
          },
          {
            "label": "附录C.2",
            "url": "https://arxiv.org/html/2605.24539#A3.SS2.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "Liar’s Dice 各 30 个单独留出的逻辑种子，交换座位形成 60 局；Balatro D/E 留出种子，每种子 3 次执行尝试（从开始做任务到得到结果的过程）。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2605.24539#S4.SS1.SSS0.Px1"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2605.24539#A1.SS0.SSS0.Px4"
          },
          {
            "label": "附录C.2",
            "url": "https://arxiv.org/html/2605.24539#A3.SS2.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "先按开发数据选版本，再测试不重叠种子；固定种子减少比较噪声，不代表覆盖所有游戏情形。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2605.24539#S4.SS1.SSS0.Px1"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2605.24539#A1.SS0.SSS0.Px4"
          },
          {
            "label": "附录C.2",
            "url": "https://arxiv.org/html/2605.24539#A3.SS2.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "在分数稀疏或波动较大的任务中加入人类示范，用具体行为参照帮助判断哪里做错、框架该怎么改。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2605.24539#S4.SS1.SSS0.Px1"
          },
          {
            "label": "附录C.2",
            "url": "https://arxiv.org/html/2605.24539#A3.SS2.SSS0.Px1"
          },
          {
            "label": "附录C.2",
            "url": "https://arxiv.org/html/2605.24539#A3.SS2.SSS0.Px3"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2606.06324": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "主任务执行者是GPT-5-mini；GAIA（需要检索、推理和使用工具的通用助理任务基准）迁移再换Qwen3.5 Plus、DeepSeekV3.2、Gemini3 Pro、Claude Sonnet4.5。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2606.06324#S3"
          },
          {
            "label": "§6",
            "url": "https://arxiv.org/html/2606.06324#S6"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2606.06324#S4.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "默认GPT-5-mini运行HarnessFix诊断及修补流程；迁移时直接复用已选运行框架，不用新执行模型重新搜索。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2606.06324#S3"
          },
          {
            "label": "§6",
            "url": "https://arxiv.org/html/2606.06324#S6"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2606.06324#S4.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "已有运行框架的运行机制与组件；修改范围由失败诊断确定，任务模型和评估器固定。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2606.06324#S3"
          },
          {
            "label": "§6",
            "url": "https://arxiv.org/html/2606.06324#S6"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "代码任务运行测试，问答任务按参考答案或相应裁判评分；失败轨迹帮助定位组件，验证集检查修复是否有效以及是否引入新问题。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2606.06324#S3"
          },
          {
            "label": "§6",
            "url": "https://arxiv.org/html/2606.06324#S6"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2606.06324#S4.SS2"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2606.06324#S4.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "每域沿用可工作底座：GAIA（需要检索、推理和使用工具的通用助理任务基准） 用 open-deep-research，SWE 用 mini-swe-agent（主要通过命令行读写文件、运行测试的轻量 coding agent），AppWorld（通过多个应用的程序接口完成日常事务的交互基准） 用官方 simplified ReAct（交替进行推理、调用工具和读取结果的执行方式） code task agent，TB2 用 Harbor（运行隔离任务环境、agent 和验收程序的评测工具） Terminus-2（Terminal-Bench 团队提供的终端 task agent，负责让模型操作命令行环境）。修复过程把运行失败对应到实现位置，再做受限修补和回归检查。",
        "sources": [
          {
            "label": "§IV-B",
            "url": "https://arxiv.org/abs/2606.06324"
          },
          {
            "label": "mini-swe-agent 官方说明",
            "url": "https://github.com/SWE-agent/mini-swe-agent"
          },
          {
            "label": "Harbor：任务与验收接口",
            "url": "https://www.harborframework.com/docs/tasks"
          },
          {
            "label": "Terminus：终端 task agent",
            "url": "https://www.tbench.ai/news/terminus"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "HTIR 将失败步骤映射到运行层和实现位置，聚合 recurring flaw。依据 flaw-specific repair specification 选择 scoped repair operators 生成补丁。验证集 检查目标缺陷减少和新引入 regressions；不是只看训练集总分。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2606.06324#S3"
          },
          {
            "label": "§6",
            "url": "https://arxiv.org/html/2606.06324#S6"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "GAIA（需要检索、推理和使用工具的通用助理任务基准） 60、SWE-bench Verified 100、AppWorld（通过多个应用的程序接口完成日常事务的交互基准） 90、TB2 34 题提供训练轨迹。",
        "sources": [
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2606.06324#S4.SS2"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2606.06324#S4.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "相应 验证集 为 30/50/45/17；检查补丁范围、目标缺陷和回归。",
        "sources": [
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2606.06324#S4.SS2"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2606.06324#S4.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "相应单独留出的 测试集 为 60/100/90/34。另把修好的 GAIA（需要检索、推理和使用工具的通用助理任务基准） 运行框架给四个新模型复用。",
        "sources": [
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2606.06324#S4.SS2"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2606.06324#S4.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "三个分区互斥；跨模型仍测同一 GAIA（需要检索、推理和使用工具的通用助理任务基准） 留出集，不是额外跨评测基准泛化。",
        "sources": [
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2606.06324#S4.SS2"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2606.06324#S4.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "先把失败定位到运行系统的具体层和实现，再限制补丁作用范围，最后检查是否破坏已有能力，把诊断、修改与验收接起来。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2606.06324#S3"
          },
          {
            "label": "§6",
            "url": "https://arxiv.org/html/2606.06324#S6"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2606.14249": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "Claude Sonnet4.6、GPT-5.4、Qwen3.5-9B分别作为task task agent，运行候选运行框架。",
        "sources": [
          {
            "label": "§5.4",
            "url": "https://arxiv.org/html/2606.14249#S5.SS4.SSS0.Px3"
          },
          {
            "label": "§12.5",
            "url": "https://arxiv.org/html/2606.14249#S12.SS5.SSS0.Px1"
          },
          {
            "label": "§6.1",
            "url": "https://arxiv.org/html/2606.14249#S6.SS1.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "默认Claude Opus4.6作为 meta-agent（负责设计或修改 task agent）驱动AEGIS进化；与上述任务执行者分开。共同训练阶段的参数更新仍由GRPO（比较同一任务多次尝试的奖励，用相对好坏更新模型参数的强化学习方法）程序执行。",
        "sources": [
          {
            "label": "§5.4",
            "url": "https://arxiv.org/html/2606.14249#S5.SS4.SSS0.Px3"
          },
          {
            "label": "§12.5",
            "url": "https://arxiv.org/html/2606.14249#S12.SS5.SSS0.Px1"
          },
          {
            "label": "§6.1",
            "url": "https://arxiv.org/html/2606.14249#S6.SS1.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "运行时的可组合处理组件；联合更新设置还训练任务模型参数。",
        "sources": [
          {
            "label": "§5.4",
            "url": "https://arxiv.org/html/2606.14249#S5.SS4.SSS0.Px3"
          },
          {
            "label": "§12.5",
            "url": "https://arxiv.org/html/2606.14249#S12.SS5.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "执行记录用于分析运行组件，任务成绩用于判断实际效果；ALFWorld、GAIA、WebShop、τ³ 和 SWE-bench 的环境验收或答案检查方式分别列在表格中。",
        "sources": [
          {
            "label": "§5.4",
            "url": "https://arxiv.org/html/2606.14249#S5.SS4.SSS0.Px3"
          },
          {
            "label": "§12.5",
            "url": "https://arxiv.org/html/2606.14249#S12.SS5.SSS0.Px1"
          },
          {
            "label": "§9.1",
            "url": "https://arxiv.org/html/2606.14249#S9.SS1.SSS0.Px5"
          },
          {
            "label": "§9.2",
            "url": "https://arxiv.org/html/2606.14249#S9.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "从各任务的人工基础框架开始，修改过程分为整理轨迹、规划改动、生成候选和评审四个角色。每轮提出 4 个候选并保留执行记录；每题重建环境，避免购物车、游戏状态或工作目录互相影响。主要修改提示和运行逻辑；这种环境重置不说明训练题和测试题已隔离。",
        "sources": [
          {
            "label": "Table 3；附录 9.5、Table 8",
            "url": "https://arxiv.org/abs/2606.14249"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "AEGIS 从执行轨迹诊断失败并修改 processor；联合阶段将同批轨迹放进共享 replay buffer，用 cross-harness GRPO（比较同一任务多次尝试的奖励，用相对好坏更新模型参数的强化学习方法） 更新模型，不另采专用 强化学习（根据奖励调整模型行为） 执行尝试（从开始做任务到得到结果的过程）。",
        "sources": [
          {
            "label": "§5.4",
            "url": "https://arxiv.org/html/2606.14249#S5.SS4.SSS0.Px3"
          },
          {
            "label": "§12.5",
            "url": "https://arxiv.org/html/2606.14249#S12.SS5.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "GAIA（需要检索、推理和使用工具的通用助理任务基准） 103、ALFWorld（通过文字动作完成家居物体操作的交互环境） valid-unseen 134、WebShop（根据用户要求挑选和购买商品的交互基准） 100、τ³ Retail/Airline/Telecom 全任务、SWE-Verified 55，形成演化轨迹。",
        "sources": [
          {
            "label": "§9.1",
            "url": "https://arxiv.org/html/2606.14249#S9.SS1.SSS0.Px5"
          },
          {
            "label": "§9.2",
            "url": "https://arxiv.org/html/2606.14249#S9.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "每轮反复在上述固定任务上执行和计分，诊断失败并生成下一版。",
        "sources": [
          {
            "label": "§9.1",
            "url": "https://arxiv.org/html/2606.14249#S9.SS1.SSS0.Px5"
          },
          {
            "label": "§9.2",
            "url": "https://arxiv.org/html/2606.14249#S9.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "论文曲线仍报告同一批任务逐轮变化。",
        "sources": [
          {
            "label": "§9.1",
            "url": "https://arxiv.org/html/2606.14249#S9.SS1.SSS0.Px5"
          },
          {
            "label": "§9.2",
            "url": "https://arxiv.org/html/2606.14249#S9.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "valid-unseen 是原评测基准名称，但这些题参与了本方法迭代；不能据名称称为未参与进化的最终测试。",
        "sources": [
          {
            "label": "§9.1",
            "url": "https://arxiv.org/html/2606.14249#S9.SS1.SSS0.Px5"
          },
          {
            "label": "§9.2",
            "url": "https://arxiv.org/html/2606.14249#S9.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "规定组件的输入输出类型和可组合方式，再从轨迹提议组件修改；另利用不同框架的执行轨迹训练模型，连接组件搜索与参数学习。",
        "sources": [
          {
            "label": "§5.4",
            "url": "https://arxiv.org/html/2606.14249#S5.SS4.SSS0.Px3"
          },
          {
            "label": "§12.5",
            "url": "https://arxiv.org/html/2606.14249#S12.SS5.SSS0.Px1"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2607.13683": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "默认冻结Qwen3.6-27B执行各候选运行框架；跨模型对照还分析较大Qwen模型和Gemini3 Flash。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.13683#S4.SS1"
          },
          {
            "label": "§4.5",
            "url": "https://arxiv.org/html/2607.13683#S4.SS5"
          },
          {
            "label": "§4.6",
            "url": "https://arxiv.org/html/2607.13683#S4.SS6"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "Claude Opus4.8作为修改者，根据轨迹和评分提出运行框架改动；Qwen3.6-27B的权重不更新。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.13683#S4.SS1"
          },
          {
            "label": "§4.5",
            "url": "https://arxiv.org/html/2607.13683#S4.SS5"
          },
          {
            "label": "§4.6",
            "url": "https://arxiv.org/html/2607.13683#S4.SS6"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "完整运行框架候选，以及按不同语义机制组织的候选库。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.13683#S4.SS1"
          },
          {
            "label": "§4.5",
            "url": "https://arxiv.org/html/2607.13683#S4.SS5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "任务结果、执行轨迹与配对候选表现。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.13683#S4.SS1"
          },
          {
            "label": "§4.5",
            "url": "https://arxiv.org/html/2607.13683#S4.SS5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "七个领域共享各自的 vanilla 起点；固定 Qwen3.6-27B 执行，Claude Opus 4.8 作为修改者。",
        "sources": [
          {
            "label": "§3.2、§4.1",
            "url": "https://arxiv.org/abs/2607.13683"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "语言模型 对失败作语义归因并提候选；统计门控决定是否给改动记功和收入质量—多样性档案，误诊本身不能让补丁通过。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.13683#S4.SS1"
          },
          {
            "label": "§4.5",
            "url": "https://arxiv.org/html/2607.13683#S4.SS5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "TB2、AppWorld（通过多个应用的程序接口完成日常事务的交互基准）、LiveCode、Omni-MATH、BrowseComp+、GDPval、SWE-bench 的 训练集。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.13683#S4.SS1"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2607.13683#S4.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "训练任务决定候选门控与档案录取；每题 3 次尝试。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.13683#S4.SS1"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2607.13683#S4.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "各域互斥 测试集，只在选择完成后用于最终排名。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.13683#S4.SS1"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2607.13683#S4.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "原文列的 EvoAgentBench 五域与本站所收录的四域版本不同，因此不借用另一篇的样本数量。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.13683#S4.SS1"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2607.13683#S4.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "维护机制不同的多个框架候选，经过分阶段检查后入库，供后续重组使用；重点同时控制候选多样性和接受修改的质量。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.13683#S4.SS1"
          },
          {
            "label": "§4.5",
            "url": "https://arxiv.org/html/2607.13683#S4.SS5"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2603.21877": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "Qwen3-4B的当前训练checkpoint（某个时刻保存的模型或系统版本），在当前候选提示下解题。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2603.21877#S3.SS1"
          },
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2603.21877#S3.SS4.SSS0.Px2"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2603.21877#A1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2603.21877#S4.SS1.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "P²O-Self-Ref用Qwen3-4B参考模型作提示修改者；Teacher-Ref用Kimi-K2。外层交替运行提示优化和策略参数训练。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2603.21877#S3.SS1"
          },
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2603.21877#S3.SS4.SSS0.Px2"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2603.21877#A1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2603.21877#S4.SS1.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "策略模型参数和帮助解决难题的提示模板；奖励及外层提示搜索、训练算法固定。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2603.21877#S3.SS1"
          },
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2603.21877#S3.SS4.SSS0.Px2"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2603.21877#A1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "数学题按参考答案判断解答正确性；先比较不同提示的解题表现，再利用较好提示带来的奖励训练模型参数。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2603.21877#S3.SS1"
          },
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2603.21877#S3.SS4.SSS0.Px2"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2603.21877#A1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2603.21877#S4.SS1.SSS0.Px1"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2603.21877#S4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "Qwen3-4B 的数学求解训练流程，结合 GRPO（比较同一任务多次尝试的奖励，用相对好坏更新模型参数的强化学习方法） 参数更新与提示模板优化。提示候选保存在前沿集合中，训练时采样使用；变化包括权重和提示，不是只往外部记忆追加文字。",
        "sources": [
          {
            "label": "实验设置与主结果表",
            "url": "https://arxiv.org/abs/2603.21877"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "GRPO（比较同一任务多次尝试的奖励，用相对好坏更新模型参数的强化学习方法） 更新策略后找低奖励困难题；GEPA 在困难题内部划 train/dev 搜索模板，保留 Pareto（保留在不同评价维度上各有优势、不能被另一候选全面超过的方案） 提示，再用于下一轮策略采样。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2603.21877#S3.SS1"
          },
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2603.21877#S3.SS4.SSS0.Px2"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2603.21877#A1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "DeepScaler 随机样本、DeepMath 难度≥7 的样本，分别比较 5,000 与 10,000 条训练规模。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2603.21877#S4.SS1.SSS0.Px1"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2603.21877#S4.SS2"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2603.21877#A1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "训练困难题的内部 train/dev 用于 GEPA 模板搜索；以 开发集 表现选择模型 checkpoint（某个时刻保存的模型或系统版本）。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2603.21877#S4.SS1.SSS0.Px1"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2603.21877#S4.SS2"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2603.21877#A1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "AIME24、AIME25、AMC、MATH500、Minerva、Olympiad。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2603.21877#S4.SS1.SSS0.Px1"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2603.21877#S4.SS2"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2603.21877#A1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "5k/10k 是训练规模，不是训练/测试各一组；提示搜索用训练困难题，不应混写成最终评估题。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2603.21877#S4.SS1.SSS0.Px1"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2603.21877#S4.SS2"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2603.21877#A1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "针对多次尝试全部失败、奖励无法区分好坏的难题，先搜索能引出成功的提示，再把提示帮助下的行为训练进模型参数。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2603.21877#S3.SS1"
          },
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2603.21877#S3.SS4.SSS0.Px2"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2603.21877#A1"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2606.04455": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "提交的 agent.py 在数学、科学和竞赛编程任务中调用 Qwen3-8B，模型通过 vLLM 推理服务运行在独占的 A100 显卡上；软件修复 SWE-Bench 和终端操作 Terminal-Bench 使用 Claude Haiku 4.5。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2606.04455#S3.SS2.SSS0.Px1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2606.04455#S3.SS2.SSS0.Px2"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2606.04455#S4.SS0.SSS0.Px1"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2606.04455#S5.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "外层 coding agent 包括 Claude Code（可读写项目文件、运行命令和测试的 coding agent 工具） + Opus 4.7／Opus 4.6／Sonnet 4.6、Gemini CLI（通过终端命令使用的程序界面） + Gemini 3.1 Pro、Codex + GPT-5.3-Codex／GPT-5.4；另有接入 Claude Code 的开源模型配置。它们写 agent.py，不是最终答题的 Qwen3-8B 或 Haiku 4.5。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2606.04455#S3.SS2.SSS0.Px1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2606.04455#S3.SS2.SSS0.Px2"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2606.04455#S4.SS0.SSS0.Px1"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2606.04455#S5.SS2"
          },
          {
            "label": "Claude Code 官方说明",
            "url": "https://code.claude.com/docs/en/overview"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "meta-agent 写出的可执行 task agent 程序。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2606.04455#S3.SS2.SSS0.Px1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2606.04455#S3.SS2.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "开发阶段的评分接口返回逐题正确性或准确率；最终评测另用参考答案或单元测试计分。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2606.04455#S3.SS2.SSS0.Px1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2606.04455#S3.SS2.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "使用通用编程 task agent 构造或改进目标 task agent 的工作流，评测基准提供统一问题/预测接口和评估控制。可修改的是待交付求解系统；它没有提出一个所有参赛者必须使用的新 meta-agent（负责设计或修改 task agent）架构。",
        "sources": [
          {
            "label": "任务定义与各领域数据说明",
            "url": "https://arxiv.org/abs/2606.04455"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "编程 task agent 实现、运行并修改程序；预算结束后扫描 API 使用合规性，再注入私有结果检查器（按测试或判分规则检查任务结果）测最终版本。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2606.04455#S3.SS2.SSS0.Px1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2606.04455#S3.SS2.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "不训权重；开发题用于设计 task agent。数学 AIME 2022–23 共 60；科学 HLE（涵盖多个学科高难度问题的 Humanity’s Last Exam 基准） 多选 591；LiveCodeBench（使用较新竞赛编程题评价代码能力的基准） 732。",
        "sources": [
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2606.04455#A3.SS0.SSS0.Px1"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2606.04455#A3.SS0.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "上述开发 oracle 的反馈，科学域另允许有限 Google Search 调用。",
        "sources": [
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2606.04455#A3.SS0.SSS0.Px1"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2606.04455#A3.SS0.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "AIME 2024–25 共 60；GPQA（研究生级科学问答基准） Diamond 198；LiveCodeBench（使用较新竞赛编程题评价代码能力的基准） 323。",
        "sources": [
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2606.04455#A3.SS0.SSS0.Px1"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2606.04455#A3.SS0.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "最终结果检查器（按测试或判分规则检查任务结果）仅在开发结束后注入，测试密钥和题目不参与修改。",
        "sources": [
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2606.04455#A3.SS0.SSS0.Px1"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2606.04455#A3.SS0.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "让被测模型在隔离开发环境里编写 agent 系统，开发结束后才加入正式测试的检查程序，同时检查生成系统是否绕过任务规则。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2606.04455#S3.SS2.SSS0.Px1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2606.04455#S3.SS2.SSS0.Px2"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2608.06301": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "按任务固定目标模型：OfficeQA、BrowseComp-Plus 用 DeepSeek-V4-Flash；Terminal-Bench 用 grok-build；GAIA（需要检索、推理和使用工具的通用助理任务基准） 用 GPT-5.4-mini。这些模型运行候选运行框架，不负责外层优化。",
        "sources": [
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2608.06301#A2"
          },
          {
            "label": "附录E",
            "url": "https://arxiv.org/html/2608.06301#A5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "五种优化器：Claude Opus5、Sonnet5、GPT-5.6 Sol、GPT-5.6 Terra、Kimi K3。各自比较统一OpenCode（可连接不同模型的开源 coding agent 工具）与原生Claude Code/Codex/Kimi CLI（通过终端命令使用的程序界面）。",
        "sources": [
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2608.06301#A2"
          },
          {
            "label": "附录E",
            "url": "https://arxiv.org/html/2608.06301#A5"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2608.06301#S4.SS0.SSS0.Px1"
          },
          {
            "label": "OpenCode 官方说明",
            "url": "https://opencode.ai/docs"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "修改者编辑的目标 agent 运行框架；基准、执行模型和测试边界固定。",
        "sources": [
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2608.06301#A2"
          },
          {
            "label": "附录E",
            "url": "https://arxiv.org/html/2608.06301#A5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "可见开发与验证题的成绩用于改框架和选候选，评估次数受固定预算约束；最终测试分区在修改过程中不可访问，各任务评分器保持固定。",
        "sources": [
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2608.06301#A2"
          },
          {
            "label": "附录E",
            "url": "https://arxiv.org/html/2608.06301#A5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "每题域固定一个刻意未调优的小型 Python task agent。OfficeQA 起点约 130 行、3 个工具、24 轮循环和通用提示；GAIA（需要检索、推理和使用工具的通用助理任务基准） 起点则是不能完成任务的只有接口、尚未实现求解功能的占位程序。这两种起点的零/低分意义不同，不能统一写成一个可工作的成熟运行框架。",
        "sources": [
          {
            "label": "§3.2、Table 3；附录 E",
            "url": "https://arxiv.org/abs/2608.06301"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "优化器编辑 seed 程序，使用开发/验证服务比较不可变 Git 快照并提名版本；最终在隔离沙箱执行，超时按零分计。",
        "sources": [
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2608.06301#A2"
          },
          {
            "label": "附录E",
            "url": "https://arxiv.org/html/2608.06301#A5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "GAIA（需要检索、推理和使用工具的通用助理任务基准）、OfficeQA Pro、BrowseComp-Plus、TB2，各按提交的固定 改动清单 取 20% 开发集；不训练目标模型。",
        "sources": [
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2608.06301#A2"
          },
          {
            "label": "附录E",
            "url": "https://arxiv.org/html/2608.06301#A5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "40% 验证集 用于候选比较和提名；每个任务固定目标模型。",
        "sources": [
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2608.06301#A2"
          },
          {
            "label": "附录E",
            "url": "https://arxiv.org/html/2608.06301#A5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "剩余 40% 测试集，每个条件 3 轮；也用同一分区比较现成 编程 运行框架。",
        "sources": [
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2608.06301#A2"
          },
          {
            "label": "附录E",
            "url": "https://arxiv.org/html/2608.06301#A5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "20/40/40 是互斥比例，不是题目数量。GAIA（需要检索、推理和使用工具的通用助理任务基准） seed 是不可工作的只有接口、尚未实现求解功能的占位程序，其他任务的初始能力另计。",
        "sources": [
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2608.06301#A2"
          },
          {
            "label": "附录E",
            "url": "https://arxiv.org/html/2608.06301#A5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "用统一预算和不可由修改者改写的执行、评分边界测框架优化；分别记录修改者的设计能力与目标 agent 获得的收益。",
        "sources": [
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2608.06301#A2"
          },
          {
            "label": "附录E",
            "url": "https://arxiv.org/html/2608.06301#A5"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2505.11942": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "主对照：Llama3.1-8B-Instruct、Qwen2.5-7B-Instruct、DeepSeek-R1-Distill-Llama-8B、DeepSeek-R1-Distill-Qwen-7B；执行SQL/Bash/知识图谱任务。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2505.11942#S3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2505.11942#S4.SS1"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2505.11942#S5.SS1"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2505.11942#A1.SS1.SSS1"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2505.11942#S4.SS2"
          },
          {
            "label": "§6.1",
            "url": "https://arxiv.org/html/2505.11942#S6.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "四种被测模型通过各方法的经验保存与回放流程适应任务；评测基准本身不充当修改模型。构造OS命令序列另用DeepSeek-R1，不能与被测模型混淆。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2505.11942#S3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2505.11942#S4.SS1"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2505.11942#S5.SS1"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2505.11942#A1.SS1.SSS1"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2505.11942#S4.SS2"
          },
          {
            "label": "§6.1",
            "url": "https://arxiv.org/html/2505.11942#S6.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "连续任务间积累和复用的经验；基准衡量这些经验如何影响后续执行。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2505.11942#S3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2505.11942#S4.SS1"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2505.11942#S5.SS1"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2505.11942#A1.SS1.SSS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "环境执行结果及任务完成评分，错误还区分格式、执行、超步数和上下文限制。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2505.11942#S3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2505.11942#S4.SS1"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2505.11942#S5.SS1"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2505.11942#A1.SS1.SSS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "为数据库、操作系统和知识图谱任务提供交互执行环境，被测方法可回放先前任务经验。任务按可复用的原子技能构造，关注经验如何影响后续执行，不是只有长文本问答。",
        "sources": [
          {
            "label": "数据构造；经验回放实验；附录 A/C",
            "url": "https://arxiv.org/abs/2505.11942"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "按共享原子技能构造任务序列，前题经历由方法自行保存和回放；比较随经验累积的表现。数据库每题创建/删除任务表，避免状态污染。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2505.11942#S3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2505.11942#S4.SS1"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2505.11942#S5.SS1"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2505.11942#A1.SS1.SSS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "作者自建 DB、OS、KG 三类可执行任务，先前任务交互形成经验。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2505.11942#S3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2505.11942#S4.SS1"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2505.11942#A1.SS1.SSS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "环境返回 SQL/Bash/图谱操作结果或错误；通过回放量与噪声对照观察学习。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2505.11942#S3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2505.11942#S4.SS1"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2505.11942#A1.SS1.SSS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "后续任务的完成率及不同经验设置下的曲线。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2505.11942#S3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2505.11942#S4.SS1"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2505.11942#A1.SS1.SSS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "经验允许跨题保留，环境副作用受控清理；后续任务不等同于冻结系统后的独立测试。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2505.11942#S3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2505.11942#S4.SS1"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2505.11942#A1.SS1.SSS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "让数据库、操作系统和知识图谱任务之间有明确技能依赖，测先前经历能否帮助后续任务，并检查多放历史是否反而带来干扰。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2505.11942#S3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2505.11942#S4.SS1"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2505.11942#S5.SS1"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2505.11942#A1.SS1.SSS1"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2507.05257": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "未另指定时，RAG（先检索相关资料，再把资料交给模型回答）及商业记忆 task agent 的回答基础模型统一GPT-4o-mini；长上下文对照与附录算力匹配实验另列模型。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2507.05257#S3.SS1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2507.05257#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2507.05257#S3.SS3.SSS0.Px1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2507.05257#S4.SS1"
          },
          {
            "label": "附录F.2",
            "url": "https://arxiv.org/html/2507.05257#A6.SS2"
          },
          {
            "label": "附录J.1",
            "url": "https://arxiv.org/html/2507.05257#A10.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "各记忆系统自己的写入/检索实现；默认配GPT-4o-mini，并非所有系统共享一个被训练的“记忆修改模型”。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2507.05257#S3.SS1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2507.05257#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2507.05257#S3.SS3.SSS0.Px1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2507.05257#S4.SS1"
          },
          {
            "label": "附录F.2",
            "url": "https://arxiv.org/html/2507.05257#A6.SS2"
          },
          {
            "label": "附录J.1",
            "url": "https://arxiv.org/html/2507.05257#A10.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "逐步积累的记忆内容，及其保留、更新和遗忘状态。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2507.05257#S3.SS1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2507.05257#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2507.05257#S3.SS3.SSS0.Px1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2507.05257#S4.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "分别测准确检索、测试时学习、长程理解与选择性遗忘的任务指标。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2507.05257#S3.SS1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2507.05257#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2507.05257#S3.SS3.SSS0.Px1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2507.05257#S4.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "统一按块输入历史材料，再让被测系统用长上下文、RAG（先检索相关资料，再把资料交给模型回答） 或由 task agent 管理、写入和检索的记忆保存并检索。比较的是记忆组件而非统一重写 task agent 源码；分块大小会影响结果，不能略去输入协议。",
        "sources": [
          {
            "label": "§3.1–3.3、实验设置",
            "url": "https://arxiv.org/abs/2507.05257"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "将历史逐块输入系统，随后提出查询；构造新旧矛盾事实以测试是否能覆盖旧记忆，比较不同记忆架构而非统一训练算法。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2507.05257#S3.SS1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2507.05257#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2507.05257#S3.SS3.SSS0.Px1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2507.05257#S4.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "读入材料：文档/LongMemEval/EventQA；BANKING77、CLINC150、TREC、NLU 的带标签示例；小说和电影推荐历史；MQUAKE 构造的事实更新。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2507.05257#S3.SS1.SSS0.Px1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2507.05257#S3.SS1.SSS0.Px2"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2507.05257#S3.SS1.SSS0.Px3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2507.05257#S3.SS1.SSS0.Px4"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2507.05257#S3.SS3.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "记忆维护依输入历史；分块预算固定，部分任务 512 词元、其他常用 4096。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2507.05257#S3.SS1.SSS0.Px1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2507.05257#S3.SS1.SSS0.Px2"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2507.05257#S3.SS1.SSS0.Px3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2507.05257#S3.SS1.SSS0.Px4"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2507.05257#S3.SS3.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "对应的文档/对话问答、分类、推荐、∞-Bench 摘要、Detective QA、FactConsolidation 单跳/多跳问题。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2507.05257#S3.SS1.SSS0.Px1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2507.05257#S3.SS1.SSS0.Px2"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2507.05257#S3.SS1.SSS0.Px3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2507.05257#S3.SS1.SSS0.Px4"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2507.05257#S3.SS3.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "输入材料与问题分工，不是模型参数训练/测试；后出现的新事实应覆盖旧事实。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2507.05257#S3.SS1.SSS0.Px1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2507.05257#S3.SS1.SSS0.Px2"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2507.05257#S3.SS1.SSS0.Px3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2507.05257#S3.SS1.SSS0.Px4"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2507.05257#S3.SS3.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "把长材料拆成连续输入，分别检查检索、从新经历学习、长程理解和选择性遗忘，避免把找回片段当成全部记忆能力。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2507.05257#S3.SS1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2507.05257#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2507.05257#S3.SS3.SSS0.Px1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2507.05257#S4.SS1"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2508.19005": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "进化实验：Qwen3-8B用于训练型RFT，Qwen3-235B-A22B用于Reflexion/AWM推理时进化；不能把这两组视为同模型比较。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2508.19005#S3"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2508.19005#S3.SS2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2508.19005#S4.SS1"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2508.19005#S5.SS2.SSS1.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "RFT从Qwen3-8B自身采样的成功轨迹训练它；Reflexion/AWM分支由Qwen3-235B-A22B生成反思或工作流记忆。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2508.19005#S3"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2508.19005#S3.SS2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2508.19005#S4.SS1"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2508.19005#S5.SS2.SSS1.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "校园生活中积累的经验、工作流，或通过强化微调学到的策略。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2508.19005#S3"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2508.19005#S3.SS2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2508.19005#S4.SS1"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2508.19005#S5.SS2.SSS1.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "任务成功、考试表现、StuGPA 和交互效率。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2508.19005#S3"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2508.19005#S3.SS2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2508.19005#S4.SS1"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2508.19005#S5.SS2.SSS1.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "作者自建 StuLife 学生生活模拟器，带持续的时间、资源、任务状态；比较外部记忆等 task agent 配置。ELL 提出探索、长期记忆、技能学习、知识内化四层目标，不表示报告的每个 task agent 都实际更新模型参数。",
        "sources": [
          {
            "label": "StuLife 场景构造与实验",
            "url": "https://arxiv.org/abs/2508.19005"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "在持续学期中完成课堂、校园和考试任务；从既有经历反思、归纳工作流或训练，再观察之后的表现。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2508.19005#S3"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2508.19005#S3.SS2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2508.19005#S4.SS1"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2508.19005#S5.SS2.SSS1.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "自建 StuLife 1,284 个实例、10 个关联场景；经验来自模拟学期的活动。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2508.19005#S4.SS1"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2508.19005#S5.SS2.SSS1.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "校园工具与任务结果；不同学习分支使用各自的经验处理方式。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2508.19005#S4.SS1"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2508.19005#S5.SS2.SSS1.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "三类活动中的任务成功、考试与整体 StuGPA。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2508.19005#S4.SS1"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2508.19005#S5.SS2.SSS1.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "持续状态和长期事件依赖是评测目的；不能把所有实例当成统一训练完后的一次盲测。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2508.19005#S4.SS1"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2508.19005#S5.SS2.SSS1.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "用状态持续变化的学生生活模拟承载探索、经验归纳、知识维护和验证，同时提供学习框架与动态环境。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2508.19005#S3"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2508.19005#S3.SS2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2508.19005#S4.SS1"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2508.19005#S5.SS2.SSS1.Px2"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2510.17281": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "主系统基础模型为Qwen3-8B；附录Legal消融另换Mistral-Small3.2-24B。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2510.17281#S2.SS1"
          },
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2510.17281#S2.SS3"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2510.17281#S3.SS2"
          },
          {
            "label": "附录A.3",
            "url": "https://arxiv.org/html/2510.17281#A1.SS3.SSS10"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "记忆方法使用模拟用户反馈更新；用户模拟器主要Qwen3-32B，另有Mistral3.2-24B对照。用户模拟器不是被测Qwen3-8B回答模型。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2510.17281#S2.SS1"
          },
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2510.17281#S2.SS3"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2510.17281#S3.SS2"
          },
          {
            "label": "附录A.3",
            "url": "https://arxiv.org/html/2510.17281#A1.SS3.SSS10"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "从用户反馈形成的事实知识与操作经验记忆。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2510.17281#S2.SS1"
          },
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2510.17281#S2.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "模拟用户模型提供任务相关反馈；评测按数据集评分。WritingBench使用WritingBench-Critic-Model-Qwen-7B，其他需要模型评审的数据集使用DeepSeek-V3。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2510.17281#S2.SS1"
          },
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2510.17281#S2.SS3"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2510.17281#S3.SS2"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2510.17281#A1.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "语言模型系统外接可替换记忆模块和用户反馈模拟器，比较 BM25（根据查询词与文档词项匹配程度排序的检索算法）、嵌入检索、A-Mem、Mem0、MemoryOS 等；已有静态知识先载入，后续对话逐批写入记忆。",
        "sources": [
          {
            "label": "数据分区；on-policy 实验流程",
            "url": "https://arxiv.org/abs/2510.17281"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "每步从训练池抽 100 例，最多交互 3 轮后更新记忆，再评估测试池，观察反馈学习曲线。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2510.17281#S2.SS1"
          },
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2510.17281#S2.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "11 来源：LoCoMo（检查模型能否利用长期多轮对话记忆的基准）、DialSim、LexEval、JuDGE、IdeaBench、LimitGen-Syn、WritingPrompts、HelloBench、WritingBench、NF-Cats、SciTechNews；各分区抽样后按 4:1 划分。",
        "sources": [
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2510.17281#S2.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "仅训练 80% 生成用户反馈日志。",
        "sources": [
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2510.17281#S2.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "剩余 20%，按开放域/法律/学术与输入输出格式分区报告。",
        "sources": [
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2510.17281#S2.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "测试题不生成反馈日志；测试曲线反复记录，不应写成每次出现的全是新测试题。",
        "sources": [
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2510.17281#S2.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "把服务过程中的用户反馈作为学习经历，每个分区按学习与测试划分，重点考察反馈积累能否改变后续服务表现。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2510.17281#S2.SS1"
          },
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2510.17281#S2.SS3"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2511.20857": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "Gemini2.5 Flash、Flash-Lite、Pro，以及Claude3.5 Haiku、Claude3.7 Sonnet，各自配相应记忆方法。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2511.20857#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2511.20857#S3.SS1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2511.20857#S3.SS1.SSS0.Px4"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2511.20857#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2511.20857#S3.SS3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2511.20857#S4.SS1.SSS2"
          },
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2511.20857#A1.SS2"
          },
          {
            "label": "附录G.1",
            "url": "https://arxiv.org/html/2511.20857#A7.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "各配置的任务模型按方法规定更新记忆；ReMem在Think/Act之外显式执行Refine Memory，主体基础模型仍为上述五种模型之一。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2511.20857#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2511.20857#S3.SS1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2511.20857#S3.SS1.SSS0.Px4"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2511.20857#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2511.20857#S3.SS3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2511.20857#S4.SS1.SSS2"
          },
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2511.20857#A1.SS2"
          },
          {
            "label": "附录G.1",
            "url": "https://arxiv.org/html/2511.20857#A7.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "连续测试过程中提取、积累和重组的经验记忆。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2511.20857#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2511.20857#S3.SS1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2511.20857#S3.SS1.SSS0.Px4"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2511.20857#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2511.20857#S3.SS3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2511.20857#S4.SS1.SSS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "数学/科学按答案，交互任务按环境成功；经验依各方法纳入。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2511.20857#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2511.20857#S3.SS1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2511.20857#S3.SS1.SSS0.Px4"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2511.20857#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2511.20857#S3.SS3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2511.20857#S4.SS1.SSS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "统一经验记忆评估框架，比较直接保留历史、检索记忆、工作流记忆和 ReMem 等；ReMem 能选择提取、使用与删减经验。变化主要在跨题经验内容和组织，不是统一训练模型。",
        "sources": [
          {
            "label": "数据集说明与实验主表",
            "url": "https://arxiv.org/abs/2511.20857"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "统一 search→predict→evolve：先检索并回答当前任务，再更新记忆供后续使用；比较检索、流程记忆和主动重组。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2511.20857#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2511.20857#S3.SS1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2511.20857#S3.SS1.SSS0.Px4"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2511.20857#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2511.20857#S3.SS3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2511.20857#S4.SS1.SSS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "无统一离线训练池，按顺序输入静态基准改造的任务流。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2511.20857#S4.SS1.SSS1"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2511.20857#A1.SS1"
          },
          {
            "label": "附录F.1",
            "url": "https://arxiv.org/html/2511.20857#A6.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "此前任务及反馈用于经验更新，ReMem 可在执行中整理记忆。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2511.20857#S4.SS1.SSS1"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2511.20857#A1.SS1"
          },
          {
            "label": "附录F.1",
            "url": "https://arxiv.org/html/2511.20857#A6.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "MMLU-Pro、GPQA（研究生级科学问答基准） Diamond、AIME24/25、ToolBench、ALFWorld（通过文字动作完成家居物体操作的交互环境）、BabyAI、ScienceWorld、PDDL。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2511.20857#S4.SS1.SSS1"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2511.20857#A1.SS1"
          },
          {
            "label": "附录F.1",
            "url": "https://arxiv.org/html/2511.20857#A6.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "测流式适应而非冻结记忆；不同方法共享任务顺序与外层接口。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2511.20857#S4.SS1.SSS1"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2511.20857#A1.SS1"
          },
          {
            "label": "附录F.1",
            "url": "https://arxiv.org/html/2511.20857#A6.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "把不同记忆方法放进连续任务流，比较检索、适应和更新怎样影响后续任务，并提供可复用的对照方法。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2511.20857#S3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2511.20857#S3.SS1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2511.20857#S3.SS1.SSS0.Px4"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2511.20857#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2511.20857#S3.SS3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2511.20857#S4.SS1.SSS2"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2604.17308": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "11种模型：Claude Sonnet4.5/4.6、Opus4.5/4.6、MiniMaxM2.5/M2.7、GPT-5.4、GPT-5.3-Codex、Qwen-Coder-Next、Qwen3-Coder-480B、Kimi K2.5；配Claude Code（可读写项目文件、运行命令和测试的 coding agent 工具）、Codex CLI（在终端中读写代码、运行命令的 coding agent 工具）、Qwen-Coder或Kimi-CLI。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2604.17308#S3.SS1"
          },
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2604.17308#A2.SS1"
          },
          {
            "label": "Claude Code 官方说明",
            "url": "https://code.claude.com/docs/en/overview"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "同一任务执行模型在完成任务后根据反馈，用统一补丁格式更新技能库；不是另请一个更强模型写技能。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2604.17308#S3.SS1"
          },
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2604.17308#A2.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "在同一任务族中不断创建和修订的技能文件。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2604.17308#S3.SS1"
          },
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2604.17308#A2.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "每次执行后提供任务判定或逐项评分要求，agent 据此修改技能；实验还检查新技能在后续任务中是否真的被调用。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2604.17308#S3.SS1"
          },
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2604.17308#A2.SS1"
          },
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2604.17308#A1.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "任务以 Harbor（运行隔离任务环境、agent 和验收程序的评测工具） 格式运行；task agent 在每个任务族开始时没有技能，完成任务后读取轨迹与评分细则（逐项规定要满足的要求及给分标准）反馈并用显式补丁更新技能库。原始任务环境固定，待积累的是可复用技能。",
        "sources": [
          {
            "label": "benchmark 构造与 lifelong protocol",
            "url": "https://arxiv.org/abs/2604.17308"
          },
          {
            "label": "Harbor：任务与验收接口",
            "url": "https://www.harborframework.com/docs/tasks"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "每族从空技能库开始；执行任务、看轨迹与评分细则（逐项规定要满足的要求及给分标准）、输出文件补丁，新技能从后续任务起可用。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2604.17308#S3.SS1"
          },
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2604.17308#A2.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "20 个任务族、166 个实例，来源任务提炼自 GDPval/SkillsBench，族内共享执行流程。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2604.17308#S3.SS1"
          },
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2604.17308#A1.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "已做任务的轨迹和评分细则（逐项规定要满足的要求及给分标准）；技能补丁保留版本历史。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2604.17308#S3.SS1"
          },
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2604.17308#A1.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "按难度组织的同族后续任务，比较有/无技能及不同模型。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2604.17308#S3.SS1"
          },
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2604.17308#A1.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "在线顺序学习，没有独立冻结的 训练／测试；同族与跨模型结果分开解释。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2604.17308#S3.SS1"
          },
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2604.17308#A1.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "让同一家族的任务共享可学习的执行流程，观察 agent 从零逐步积累技能，并分别测调用频率与实际任务收益。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2604.17308#S3.SS1"
          },
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2604.17308#A2.SS1"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2604.20087": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "固定 Claude Sonnet 4.6 读取各模型生成的技能并完成任务，采样温度为 0，以减少输出随机性；每题最多 100 轮，使用容器内任务工具。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2604.20087#S3"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2604.20087#S3.SS2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2604.20087#S3.SS2.SSS3"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.20087#S3.SS3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2604.20087#S4.SS1"
          },
          {
            "label": "附录M.2",
            "url": "https://arxiv.org/html/2604.20087#A13.SS2.SSS0.Px1"
          },
          {
            "label": "附录M.3",
            "url": "https://arxiv.org/html/2604.20087#A13.SS3.SSS0.Px1"
          },
          {
            "label": "附录N.2",
            "url": "https://arxiv.org/html/2604.20087#A14.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "生成技能的六种模型为Claude Haiku4.5、Sonnet4.6、Opus4.6、Gemini3.1 Flash Lite、Gemini3 Flash、Gemini3.1 Pro。比较只生成一次、自反馈、教师反馈与技能创建流程。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2604.20087#S3"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2604.20087#S3.SS2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2604.20087#S3.SS2.SSS3"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.20087#S3.SS3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2604.20087#S4.SS1"
          },
          {
            "label": "附录M.2",
            "url": "https://arxiv.org/html/2604.20087#A13.SS2.SSS0.Px1"
          },
          {
            "label": "附录M.3",
            "url": "https://arxiv.org/html/2604.20087#A13.SS3.SSS0.Px1"
          },
          {
            "label": "附录N.2",
            "url": "https://arxiv.org/html/2604.20087#A14.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "自动生成的技能文本；另检查执行时是否真正利用了技能。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2604.20087#S3"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2604.20087#S3.SS2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2604.20087#S3.SS2.SSS3"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.20087#S3.SS3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2604.20087#S4.SS1"
          },
          {
            "label": "附录M.2",
            "url": "https://arxiv.org/html/2604.20087#A13.SS2.SSS0.Px1"
          },
          {
            "label": "附录M.3",
            "url": "https://arxiv.org/html/2604.20087#A13.SS3.SSS0.Px1"
          },
          {
            "label": "附录N.2",
            "url": "https://arxiv.org/html/2604.20087#A14.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "技能内容和执行过程中的模型评审统一由 GPT-5-mini 完成；最终任务结果另按基准检查。技能作者的自评只是一种学习条件，不等于最终验收。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2604.20087#S3"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2604.20087#S3.SS2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2604.20087#S3.SS2.SSS3"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.20087#S3.SS3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2604.20087#S4.SS1"
          },
          {
            "label": "附录M.2",
            "url": "https://arxiv.org/html/2604.20087#A13.SS2.SSS0.Px1"
          },
          {
            "label": "附录M.3",
            "url": "https://arxiv.org/html/2604.20087#A13.SS3.SSS0.Px1"
          },
          {
            "label": "附录N.2",
            "url": "https://arxiv.org/html/2604.20087#A14.SS2"
          },
          {
            "label": "附录L",
            "url": "https://arxiv.org/html/2604.20087#A12"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2604.20087#S3.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "运行器把技能生成和使用分开，比较一次生成、自反馈、教师反馈及技能编写器。教师反馈设置有独立学生/教师提示，教师可参考人写技能及失败上下文，学生负责修订；不是所有设置都让学生看到相同监督。",
        "sources": [
          {
            "label": "§3、Table 1；反馈协议；附录 O",
            "url": "https://arxiv.org/abs/2604.20087"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "每个任务先用一个起始示例生成技能。自反馈设置修订两轮，教师反馈设置修订三轮；保存逐轮技能，再测其实际执行效果。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2604.20087#S3"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2604.20087#S3.SS2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2604.20087#S3.SS2.SSS3"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.20087#S3.SS3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2604.20087#S4.SS1"
          },
          {
            "label": "附录M.2",
            "url": "https://arxiv.org/html/2604.20087#A13.SS2.SSS0.Px1"
          },
          {
            "label": "附录M.3",
            "url": "https://arxiv.org/html/2604.20087#A13.SS3.SSS0.Px1"
          },
          {
            "label": "附录N.2",
            "url": "https://arxiv.org/html/2604.20087#A14.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "20 个技能依赖任务、100 个实例；每任务的一个 seed 实例用于技能生成。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2604.20087#S3.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.20087#S3.SS3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2604.20087#S4.SS1"
          },
          {
            "label": "附录N.2",
            "url": "https://arxiv.org/html/2604.20087#A14.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "seed 实例执行失败的上下文；教师只给修改建议，不能直接发完整解法。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2604.20087#S3.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.20087#S3.SS3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2604.20087#S4.SS1"
          },
          {
            "label": "附录N.2",
            "url": "https://arxiv.org/html/2604.20087#A14.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "同任务的变体实例与确定性结果检查器（按测试或判分规则检查任务结果）；平均每任务 10.6 条测试用例。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2604.20087#S3.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.20087#S3.SS3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2604.20087#S4.SS1"
          },
          {
            "label": "附录N.2",
            "url": "https://arxiv.org/html/2604.20087#A14.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "区分任务数量与实例数量；学技能和用技能分开评估，测试通过不等于技能被实际采用。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2604.20087#S3.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.20087#S3.SS3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2604.20087#S4.SS1"
          },
          {
            "label": "附录N.2",
            "url": "https://arxiv.org/html/2604.20087#A14.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "用依赖技能复用的任务同时检查技能文件、执行过程与任务结果，并比较自反馈和教师反馈，检验初次成功能否转成后续能力。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2604.20087#S3"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2604.20087#S3.SS2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2604.20087#S3.SS2.SSS3"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.20087#S3.SS3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2604.20087#S4.SS1"
          },
          {
            "label": "附录M.2",
            "url": "https://arxiv.org/html/2604.20087#A13.SS2.SSS0.Px1"
          },
          {
            "label": "附录M.3",
            "url": "https://arxiv.org/html/2604.20087#A13.SS3.SSS0.Px1"
          },
          {
            "label": "附录N.2",
            "url": "https://arxiv.org/html/2604.20087#A14.SS2"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2605.18421": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "记忆增强方法统一DeepSeek-V3.2；无记忆对照另含Gemini3 Flash与GPT-5-mini。",
        "sources": [
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2605.18421#S5.SS1.SSS0.Px3"
          },
          {
            "label": "附录B.2",
            "url": "https://arxiv.org/html/2605.18421#A2.SS2"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2605.18421#S5.SS1.SSS0.Px1"
          },
          {
            "label": "附录C.3",
            "url": "https://arxiv.org/html/2605.18421#A3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "各记忆方法在统一utilize/update接口下工作，记忆增强 task agent 的基础模型均为DeepSeek-V3.2；检索编码器如Qwen3-Emb-4B是另一个组件。",
        "sources": [
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2605.18421#S5.SS1.SSS0.Px3"
          },
          {
            "label": "附录B.2",
            "url": "https://arxiv.org/html/2605.18421#A2.SS2"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2605.18421#S5.SS1.SSS0.Px1"
          },
          {
            "label": "附录C.3",
            "url": "https://arxiv.org/html/2605.18421#A3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "单次任务内与跨任务的知识记忆、操作经验。",
        "sources": [
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2605.18421#S5.SS1.SSS0.Px3"
          },
          {
            "label": "附录B.2",
            "url": "https://arxiv.org/html/2605.18421#A2.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "原评测基准的问答、函数调用与任务完成指标。",
        "sources": [
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2605.18421#S5.SS1.SSS0.Px3"
          },
          {
            "label": "附录B.2",
            "url": "https://arxiv.org/html/2605.18421#A2.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "统一 task agent—记忆 接口，区分一次任务内记忆与跨任务记忆，以及知识保存与执行状态保存；比较 15 种记忆方法和长上下文对照。框架重构输入依赖关系，不是一个固定技能学习器。",
        "sources": [
          {
            "label": "§3；§4.2–4.3、上下文预算实验",
            "url": "https://arxiv.org/abs/2605.18421"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "任务内逐块/逐回合更新，结束清空；跨任务完成后更新并复用，同组之外重置；跨环境迁移则先建记忆后冻结。",
        "sources": [
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2605.18421#S5.SS1.SSS0.Px3"
          },
          {
            "label": "附录B.2",
            "url": "https://arxiv.org/html/2605.18421#A2.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "材料来自 MemoryAgentBench 检索/遗忘子集、改造 BFCL、多题共享上下文的 CL-Bench；不是本站另一个六域 CL-Bench。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2605.18421#S4.SS1"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2605.18421#S4.SS2"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2605.18421#S4.SS3"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2605.18421#S4.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "BFCL 按原动作顺序拆分并改为隐式指代；共享上下文提供事实与规则。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2605.18421#S4.SS1"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2605.18421#S4.SS2"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2605.18421#S4.SS3"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2605.18421#S4.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "任务内知识 2,800；BFCL LongContext 800；跨任务知识 120 上下文/884 题；另有 BFCL Base、xbench、WebWalkerQA 170、ALFWorld（通过文字动作完成家居物体操作的交互环境）。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2605.18421#S4.SS1"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2605.18421#S4.SS2"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2605.18421#S4.SS3"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2605.18421#S4.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "四种更新/重置时机不同；只有跨环境执行迁移明确冻结源记忆后测试目标环境。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2605.18421#S4.SS1"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2605.18421#S4.SS2"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2605.18421#S4.SS3"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2605.18421#S4.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "同时区分单次任务内与跨任务的记忆、知识内容与执行经验，并加入长上下文对照，检查专门记忆机制是否有额外价值。",
        "sources": [
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2605.18421#S5.SS1.SSS0.Px3"
          },
          {
            "label": "附录B.2",
            "url": "https://arxiv.org/html/2605.18421#A2.SS2"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2606.05661": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "Claude Opus 4.7、Sonnet 4.6、Gemini 3.1 Pro、Gemini 3 Flash、GPT-5.4 分别搭配记忆方法或 ICL（直接把可用经历放进输入上下文）。计算归一化成绩时，以不保留跨任务状态的 GPT-5.4 + ICL 为基准。",
        "sources": [
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2606.05661#A1.SS2.SSS0.Px3"
          },
          {
            "label": "附录A.5",
            "url": "https://arxiv.org/html/2606.05661#A1.SS5.SSS0.Px3"
          },
          {
            "label": "附录D",
            "url": "https://arxiv.org/html/2606.05661#A4.SS0.SSS0.Px1"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2606.05661#S4.SS3"
          },
          {
            "label": "§5",
            "url": "https://arxiv.org/html/2606.05661#S5.SS0.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "被测模型按各自系统的历史/记忆更新方式适应任务；环境潜在规律和评测程序固定，不存在评测基准替所有方法训练一个统一updater。",
        "sources": [
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2606.05661#A1.SS2.SSS0.Px3"
          },
          {
            "label": "附录A.5",
            "url": "https://arxiv.org/html/2606.05661#A1.SS5.SSS0.Px3"
          },
          {
            "label": "附录D",
            "url": "https://arxiv.org/html/2606.05661#A4.SS0.SSS0.Px1"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2606.05661#S4.SS3"
          },
          {
            "label": "§5",
            "url": "https://arxiv.org/html/2606.05661#S5.SS0.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "顺序任务中对共享规律的适应与保留；具体状态依被测方法而定。",
        "sources": [
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2606.05661#A1.SS2.SSS0.Px3"
          },
          {
            "label": "附录A.5",
            "url": "https://arxiv.org/html/2606.05661#A1.SS5.SSS0.Px3"
          },
          {
            "label": "附录D",
            "url": "https://arxiv.org/html/2606.05661#A4.SS0.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "各环境的任务分数及有状态相对无状态的增益。",
        "sources": [
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2606.05661#A1.SS2.SSS0.Px3"
          },
          {
            "label": "附录A.5",
            "url": "https://arxiv.org/html/2606.05661#A1.SS5.SSS0.Px3"
          },
          {
            "label": "附录D",
            "url": "https://arxiv.org/html/2606.05661#A4.SS0.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "六类带持续潜在规律的任务环境，比较不保留历史、普通上下文学习和专用记忆系统。规律包括代码库布局、疾病变化和对手策略；执行接口随任务变化，例如数据库允许探索 SQL 后提交答案。",
        "sources": [
          {
            "label": "benchmark 设计；附录 A.1–A.6",
            "url": "https://arxiv.org/abs/2606.05661"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "连续处理共享规律的实例，部分环境切换规律后再返回，测首次适应、遗忘和再次适应。",
        "sources": [
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2606.05661#A1.SS2.SSS0.Px3"
          },
          {
            "label": "附录A.5",
            "url": "https://arxiv.org/html/2606.05661#A1.SS5.SSS0.Px3"
          },
          {
            "label": "附录D",
            "url": "https://arxiv.org/html/2606.05661#A4.SS0.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "Blind Spectrum Monitoring、Codebase Adaptation、Cohort Studies、Database Exploration、Exploitable Poker、Sales Prediction 的在线交互。",
        "sources": [
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2606.05661#A1.SS2.SSS0.Px3"
          },
          {
            "label": "附录A.5",
            "url": "https://arxiv.org/html/2606.05661#A1.SS5.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "环境反馈揭示规律；代码任务来自 SWE-bench 的 tablib/tenacity 时间序列。",
        "sources": [
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2606.05661#A1.SS2.SSS0.Px3"
          },
          {
            "label": "附录A.5",
            "url": "https://arxiv.org/html/2606.05661#A1.SS5.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "同序列后续实例；Poker 为 120 手牌、五阶段对手策略，其中包含旧策略回归。",
        "sources": [
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2606.05661#A1.SS2.SSS0.Px3"
          },
          {
            "label": "附录A.5",
            "url": "https://arxiv.org/html/2606.05661#A1.SS5.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "测在线持续学习；无状态对照用于区分基础能力与历史带来的收益。",
        "sources": [
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2606.05661#A1.SS2.SSS0.Px3"
          },
          {
            "label": "附录A.5",
            "url": "https://arxiv.org/html/2606.05661#A1.SS5.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "让任务共享可以逐渐学会的潜在规律，分别测初始能力和经历后的进步；直接把历史放入上下文是重要对照。",
        "sources": [
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2606.05661#A1.SS2.SSS0.Px3"
          },
          {
            "label": "附录A.5",
            "url": "https://arxiv.org/html/2606.05661#A1.SS5.SSS0.Px3"
          },
          {
            "label": "附录D",
            "url": "https://arxiv.org/html/2606.05661#A4.SS0.SSS0.Px1"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2607.05202": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "OpenClaw或Nanobot × Qwen3.5-27B、Qwen3.5-397B、Gemma4-31B，共6个执行配置。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2607.05202#S3.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.05202#S4.SS1.SSS0.Px2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.05202#S4.SS1.SSS0.Px3"
          },
          {
            "label": "附录A.6",
            "url": "https://arxiv.org/html/2607.05202#A1.SS6"
          },
          {
            "label": "附录E.1",
            "url": "https://arxiv.org/html/2607.05202#A5.SS1.SSS0.Px2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.05202#S4.SS1.SSS0.Px1"
          },
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2607.05202#A1.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "Memento、ReasoningBank、GEPA从训练任务建立进化状态，再交相同任务执行框架–基础模型测试；任务构造轨迹另来自Kimi-K2.5、GLM5.1、DeepSeekV3.2，不能当成最终执行模型。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2607.05202#S3.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.05202#S4.SS1.SSS0.Px2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.05202#S4.SS1.SSS0.Px3"
          },
          {
            "label": "附录A.6",
            "url": "https://arxiv.org/html/2607.05202#A1.SS6"
          },
          {
            "label": "附录E.1",
            "url": "https://arxiv.org/html/2607.05202#A5.SS1.SSS0.Px2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.05202#S4.SS1.SSS0.Px1"
          },
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2607.05202#A1.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "从训练经历形成的案例、推理经验、技能或全局提示。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2607.05202#S3.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.05202#S4.SS1.SSS0.Px2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.05202#S4.SS1.SSS0.Px3"
          },
          {
            "label": "附录A.6",
            "url": "https://arxiv.org/html/2607.05202#A1.SS6"
          },
          {
            "label": "附录E.1",
            "url": "https://arxiv.org/html/2607.05202#A5.SS1.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "BrowseComp+、GDPval 用各自评分者；SWE/LiveCodeBench 用隐藏执行测试。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2607.05202#S3.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.05202#S4.SS1.SSS0.Px2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.05202#S4.SS1.SSS0.Px3"
          },
          {
            "label": "附录A.6",
            "url": "https://arxiv.org/html/2607.05202#A1.SS6"
          },
          {
            "label": "附录E.1",
            "url": "https://arxiv.org/html/2607.05202#A5.SS1.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "以 OpenClaw 和 Nanobot 的默认工具收集无技能轨迹，不注入进化产物；再比较学习到的可复用技能。构造时用 Kimi-K2.5、GLM-5.1、DeepSeek-V3.2，每个框架/模型重复运行，单题超时 1800 秒。",
        "sources": [
          {
            "label": "§3.2–3.3；数据构造设置",
            "url": "https://arxiv.org/abs/2607.05202"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "先完整处理训练侧证据并冻结产物，再开始测试；Anchor Skill 额外使用策展者能力标签路由，只是诊断参考。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2607.05202#S3.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.05202#S4.SS1.SSS0.Px2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.05202#S4.SS1.SSS0.Px3"
          },
          {
            "label": "附录A.6",
            "url": "https://arxiv.org/html/2607.05202#A1.SS6"
          },
          {
            "label": "附录E.1",
            "url": "https://arxiv.org/html/2607.05202#A5.SS1.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "BrowseComp+ 154、SWE-Verified 87、LiveCodeBench（使用较新竞赛编程题评价代码能力的基准） 182、GDPval 105，总计 528。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2607.05202#S3.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.05202#S4.SS1.SSS0.Px3"
          },
          {
            "label": "附录A.6",
            "url": "https://arxiv.org/html/2607.05202#A1.SS6"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "训练提示、结果检查器（按测试或判分规则检查任务结果）结果和训练轨迹；按能力图确保测试所需能力在训练中有支持。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2607.05202#S3.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.05202#S4.SS1.SSS0.Px3"
          },
          {
            "label": "附录A.6",
            "url": "https://arxiv.org/html/2607.05202#A1.SS6"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "对应 65/56/86/60，总计 267。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2607.05202#S3.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.05202#S4.SS1.SSS0.Px3"
          },
          {
            "label": "附录A.6",
            "url": "https://arxiv.org/html/2607.05202#A1.SS6"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "任务互斥且测试前完成状态构建；Anchor Skill 路由使用额外标签，不能当可部署自动方法。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2607.05202#S3.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.05202#S4.SS1.SSS0.Px3"
          },
          {
            "label": "附录A.6",
            "url": "https://arxiv.org/html/2607.05202#A1.SS6"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "先从轨迹归纳能力单元及其联系，再据此安排有学习支持的测试任务，区分经验没记好、没选对和执行时没用好的失败。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2607.05202#S3.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.05202#S4.SS1.SSS0.Px2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.05202#S4.SS1.SSS0.Px3"
          },
          {
            "label": "附录A.6",
            "url": "https://arxiv.org/html/2607.05202#A1.SS6"
          },
          {
            "label": "附录E.1",
            "url": "https://arxiv.org/html/2607.05202#A5.SS1.SSS0.Px2"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2608.00155": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "GPT-5.4-medium、Gemini3.1 Pro-medium、Claude Opus4.7-high，通过Exgentic任务接口执行。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2608.00155#S4.SS0.SSS0.Px4"
          },
          {
            "label": "§5.3",
            "url": "https://arxiv.org/html/2608.00155#S5.SS3.SSS0.Px2"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2608.00155#S4.SS0.SSS0.Px1"
          },
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2608.00155#A2.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "对应执行基础模型运行A-Mem、ACE、ReasoningBank、AutoSkill或Harness的更新过程；它们分别积累不同形式的状态，主模型不跨任务替换。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2608.00155#S4.SS0.SSS0.Px4"
          },
          {
            "label": "§5.3",
            "url": "https://arxiv.org/html/2608.00155#S5.SS3.SSS0.Px2"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2608.00155#S4.SS0.SSS0.Px1"
          },
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2608.00155#A2.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "跨领域任务流中持续保留的记忆与技能状态。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2608.00155#S4.SS0.SSS0.Px4"
          },
          {
            "label": "§5.3",
            "url": "https://arxiv.org/html/2608.00155#S5.SS3.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "原生评测基准评分；所需评分者和用户模拟器统一 GPT-5.4。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2608.00155#S4.SS0.SSS0.Px4"
          },
          {
            "label": "§5.3",
            "url": "https://arxiv.org/html/2608.00155#S5.SS3.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "在 Exgentic 中统一接入不同 task agent 和评测基准，嵌入统一用 all-MiniLM-L6-v2，所需评审和用户模拟器统一 GPT-5.4；各记忆/进化方法在这一公共协议下运行。",
        "sources": [
          {
            "label": "Implementation Details 与流式评估协议",
            "url": "https://arxiv.org/abs/2608.00155"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "在固定任务集合上比较不同流式顺序，前题经历可更新状态；三随机种子只改顺序，不改题目集合。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2608.00155#S4.SS0.SSS0.Px4"
          },
          {
            "label": "§5.3",
            "url": "https://arxiv.org/html/2608.00155#S5.SS3.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "没有单独离线训练集，当前流的已完成任务形成经验。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2608.00155#S4.SS0.SSS0.Px4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "每种评测基准的执行反馈及已完成轨迹。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2608.00155#S4.SS0.SSS0.Px4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "AppWorld（通过多个应用的程序接口完成日常事务的交互基准） test-challenge、BFCL multi-turn base、BrowseComp+、HLE（涵盖多个学科高难度问题的 Humanity’s Last Exam 基准）、SWE、τ² telecom 各 50，共 300 题。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2608.00155#S4.SS0.SSS0.Px4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "这些原始 测试集 分区用于在线适应评估，不是先学完再冻结；三种流式场景保持域内暴露顺序一致。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2608.00155#S4.SS0.SSS0.Px4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "让同一方法分别经历独立、顺序和交错的任务流，比较经验范围与跨领域混合的影响，检查收益是否依赖任务排列。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2608.00155#S4.SS0.SSS0.Px4"
          },
          {
            "label": "§5.3",
            "url": "https://arxiv.org/html/2608.00155#S5.SS3.SSS0.Px2"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2608.01149": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "所有被评测 agent 统一使用 DeepSeek-V4-Flash 推理。构造任务间迁移关系时另用 DeepSeek-V4-Flash、GPT-5.4-mini、GLM-5.0 分别测量，再多数投票；这三者不是主实验中三套执行配置。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.01149#S3.SS2"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2608.01149#A1"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2608.01149#A2.SS0.SSS0.Px2"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2608.01149#S4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "各方法自身更新状态；PATH-Bench 控制任务顺序和探针出现位置。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.01149#S3.SS2"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2608.01149#A1"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2608.01149#A2.SS0.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "随学习路径积累的记忆与技能；基准测历史顺序对迁移和遗忘的影响。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.01149#S3.SS2"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2608.01149#A1"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2608.01149#A2.SS0.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "BigCodeBench 完成率、WildToolBench 子任务完成比例，结合前向/后向迁移与遗忘。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.01149#S3.SS2"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2608.01149#A1"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2608.01149#A2.SS0.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "通过可控任务顺序比较记忆/技能 task agent；作者的 SEU 额外判断哪些历史经验有帮助、哪些可能干扰当前任务，再决定是否使用。并非任意扩大记忆库就直接注入所有历史。",
        "sources": [
          {
            "label": "PATH 构造、数据统计与评估协议",
            "url": "https://arxiv.org/abs/2608.01149"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "先估计哪些历史任务会帮助或干扰目标任务，构造相应任务序列；在多个位置重复插入同一个探测任务，观察经验积累后的能力变化。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.01149#S3.SS2"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2608.01149#A1"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2608.01149#A2.SS0.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "BigCodeBench 与 WildToolBench 各 120 个任务组成受控历史。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.01149#S3.SS2"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2608.01149#A1"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2608.01149#A2.SS0.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "任务执行经历形成状态；构造时每个任务对用多模型、五种子估计迁移。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.01149#S3.SS2"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2608.01149#A1"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2608.01149#A2.SS0.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "相同任务池中的后续任务与重复 探测任务；动机实验另用 LifelongAgentBench 50 题。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.01149#S3.SS2"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2608.01149#A1"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2608.01149#A2.SS0.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "探针重现是设计要素；不是互斥训练/测试题泛化实验。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.01149#S3.SS2"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2608.01149#A1"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2608.01149#A2.SS0.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "有意混入有帮助和有干扰的历史，并重复固定检查任务，同时测新经验的帮助与旧能力的遗忘。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.01149#S3.SS2"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2608.01149#A1"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2608.01149#A2.SS0.SSS0.Px2"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2608.03874": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "GPT-4o、GPT-5.3-Codex、Claude Opus4.7，在技能库/上下文条件下执行任务序列。",
        "sources": [
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2608.03874#S3.SS5"
          },
          {
            "label": "附录D",
            "url": "https://arxiv.org/html/2608.03874#A4"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.03874#S4.SS1.SSS1"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2608.03874#S4.SS4.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "对应任务模型按技能学习机制创建、更新和调用技能，比较其跨任务持续积累；不是独立的未命名优化语言模型。",
        "sources": [
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2608.03874#S3.SS5"
          },
          {
            "label": "附录D",
            "url": "https://arxiv.org/html/2608.03874#A4"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.03874#S4.SS1.SSS1"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2608.03874#S4.SS4.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "被测系统的上下文与技能库，按各自方法持续更新。",
        "sources": [
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2608.03874#S3.SS5"
          },
          {
            "label": "附录D",
            "url": "https://arxiv.org/html/2608.03874#A4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "agent 读取前一任务的上下文、执行结果与评审反馈，更新后续可用技能；实验考察之后的任务是否改善，而非只看当前技能文件是否写完。",
        "sources": [
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2608.03874#S3.SS5"
          },
          {
            "label": "附录D",
            "url": "https://arxiv.org/html/2608.03874#A4"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.03874#S3.SS1.SSS0.Px2"
          },
          {
            "label": "附录E",
            "url": "https://arxiv.org/html/2608.03874#A5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "同一底层任务执行环境比较不留技能、隐式经验和显式技能库；显式设置把经历整理成技能并跨题复用。任务流内包含不同形式的输入输出，不限于同一固定工作流。",
        "sources": [
          {
            "label": "§3.1–3.5、§4.1",
            "url": "https://arxiv.org/abs/2608.03874"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "每题三回合：给任务及技能索引、执行、接收评分者后创建/修改技能；修改只从下一子任务起使用。",
        "sources": [
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2608.03874#S3.SS5"
          },
          {
            "label": "附录D",
            "url": "https://arxiv.org/html/2608.03874#A4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "按技能链组织来源任务：OlympiadBench、LawBench、TAT-QA，逐渐过渡到 GAIA（需要检索、推理和使用工具的通用助理任务基准）、ClawBench、MedAgentsBench、MathCoder、OneMillionBench。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.03874#S3.SS1.SSS0.Px2"
          },
          {
            "label": "附录E",
            "url": "https://arxiv.org/html/2608.03874#A5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "当前题完成后的评分者分数和反馈，由 Create Skill/Modify Skill 元技能指导维护。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.03874#S3.SS1.SSS0.Px2"
          },
          {
            "label": "附录E",
            "url": "https://arxiv.org/html/2608.03874#A5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "同一链后续更复杂任务；比较顺序积累和对照。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.03874#S3.SS1.SSS0.Px2"
          },
          {
            "label": "附录E",
            "url": "https://arxiv.org/html/2608.03874#A5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "这些来源分层构成任务流，不是整个数据集分别充当 训练／测试。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.03874#S3.SS1.SSS0.Px2"
          },
          {
            "label": "附录E",
            "url": "https://arxiv.org/html/2608.03874#A5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "把显式技能学习与直接保留历史上下文放在对照条件下比较，检验提升是否确实需要提炼技能。",
        "sources": [
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2608.03874#S3.SS5"
          },
          {
            "label": "附录D",
            "url": "https://arxiv.org/html/2608.03874#A4"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2608.04003": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "固定 Hermes 框架比较 GPT-5.4、GLM-5.1、Kimi K2.6、DeepSeek-V4-Pro、MiniMax-M2.7、Claude Sonnet 4.6、Claude Opus 4.6；比较不同框架时统一使用 MiniMax-M2.7，包括补充的 Codex CLI（在终端中读写代码、运行命令的 coding agent 工具） 和 Claude Code（可读写项目文件、运行命令和测试的 coding agent 工具） 实验。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.04003#S3.SS1"
          },
          {
            "label": "附录A.3",
            "url": "https://arxiv.org/html/2608.04003#A1.SS3"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2608.04003#S4.SS2"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2608.04003#S4.SS2.SSS0.Px1"
          },
          {
            "label": "附录C.2",
            "url": "https://arxiv.org/html/2608.04003#A3.SS2"
          },
          {
            "label": "Claude Code 官方说明",
            "url": "https://code.claude.com/docs/en/overview"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "框架自身的保存、检索、更新路径；评测器通过对照检验实际机制。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.04003#S3.SS1"
          },
          {
            "label": "附录A.3",
            "url": "https://arxiv.org/html/2608.04003#A1.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "跨会话保留的事实、流程、检索条件及更新后的规则。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.04003#S3.SS1"
          },
          {
            "label": "附录A.3",
            "url": "https://arxiv.org/html/2608.04003#A1.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "按任务 评分器 计算完成分，并检查保存的文件、记忆及执行日志是否支持所声称的进化机制。开放答案统一由 MiniMax-M2.7（temperature=0）评分；另用 48 份盲评样本核对人工评分。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.04003#S3.SS1"
          },
          {
            "label": "附录A.3",
            "url": "https://arxiv.org/html/2608.04003#A1.SS3"
          },
          {
            "label": "附录B.4",
            "url": "https://arxiv.org/html/2608.04003#A2.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "同一模型在保留/关闭跨会话经验的匹配条件下运行个人助手任务；每个 episode 是新会话。Hermes+ 在 Hermes 上增加针对保存、检索、更新等环节的干预，用轨迹确认是否真的走了预期记忆路径。",
        "sources": [
          {
            "label": "§3 构造和评估；§4 设置",
            "url": "https://arxiv.org/abs/2608.04003"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "前会话暴露规则或程序，后会话不再重述；设置无保留、干扰、过时记忆及错误机制对照。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.04003#S3.SS1"
          },
          {
            "label": "附录A.3",
            "url": "https://arxiv.org/html/2608.04003#A1.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "自建 26 个场景、204 个 episode，按家庭顺序提供学习经历。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.04003#S3.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "学习 episode 中的事实/纠正，或信息获取任务预置的参考内容。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.04003#S3.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "新会话中的后续 episode，检验能否在恰当时间找回并使用状态。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.04003#S3.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "环境按新会话执行，但允许指定持久状态跨会话；对照用于归因而非普通离线训练/测试。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.04003#S3.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "对同一任务序列配对比较保留与不保留经验，并追踪保存、检索、更新的实际使用，区分成绩上涨和记忆机制真正起作用。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.04003#S3.SS1"
          },
          {
            "label": "附录A.3",
            "url": "https://arxiv.org/html/2608.04003#A1.SS3"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2608.06144": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "Claude Code、Codex、Letta、GenericAgent 四套 agent 执行框架均调用 Qwen3.7-Max；前两者是 coding agent 工具，后两者提供其他 agent 与记忆组织方式。输入上下文上限 100 万词元，最大输出约 6.4 万词元；采样温度为 0，以减少输出随机性。",
        "sources": [
          {
            "label": "附录B.4",
            "url": "https://arxiv.org/html/2608.06144#A2.SS4"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2608.06144#S4.SS4.SSS0.Px1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.06144#S4.SS1.SSS0.Px5"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2608.06144#A2"
          },
          {
            "label": "Claude Code 官方说明",
            "url": "https://code.claude.com/docs/en/overview"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "仍由各框架中的Qwen3.7-Max在原会话内读取judge.md后反思和更新。独立评分 task agent 使用Claude Code（可读写项目文件、运行命令和测试的 coding agent 工具） + Claude Opus4.6。",
        "sources": [
          {
            "label": "附录B.4",
            "url": "https://arxiv.org/html/2608.06144#A2.SS4"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2608.06144#S4.SS4.SSS0.Px1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.06144#S4.SS1.SSS0.Px5"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2608.06144#A2"
          },
          {
            "label": "Claude Code 官方说明",
            "url": "https://code.claude.com/docs/en/overview"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "金融任务执行后积累的记忆与技能。",
        "sources": [
          {
            "label": "附录B.4",
            "url": "https://arxiv.org/html/2608.06144#A2.SS4"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2608.06144#S4.SS4.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "独立Claude Code（可读写项目文件、运行命令和测试的 coding agent 工具） + Claude Opus4.6按固定评估流程检查金融产物并写judge.md；该文件反馈给Qwen3.7-Max执行 task agent 用于下一阶段改进。",
        "sources": [
          {
            "label": "附录B.4",
            "url": "https://arxiv.org/html/2608.06144#A2.SS4"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2608.06144#S4.SS4.SSS0.Px1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.06144#S4.SS1.SSS0.Px5"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2608.06144#A2"
          },
          {
            "label": "Claude Code 官方说明",
            "url": "https://code.claude.com/docs/en/overview"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "比较 Letta、Codex、Claude Code（可读写项目文件、运行命令和测试的 coding agent 工具） 等四个现成框架，在相同 Qwen3.7-Max 下开启或关闭持久经验。另由 Claude Code＋Claude Opus 4.6 独立评分，执行模型和评分模型不是同一个角色。",
        "sources": [
          {
            "label": "§3 数据构造；§4.1",
            "url": "https://arxiv.org/abs/2608.06144"
          },
          {
            "label": "Claude Code 官方说明",
            "url": "https://code.claude.com/docs/en/overview"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "执行→独立评分→恢复原会话反思，之后在新案例复用；分别比较只用记忆、只用技能和两者结合。",
        "sources": [
          {
            "label": "附录B.4",
            "url": "https://arxiv.org/html/2608.06144#A2.SS4"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2608.06144#S4.SS4.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "自建六领域、20 场景、120 个真实案例衍生任务，每场景六个事实不同但流程相关的案例。",
        "sources": [
          {
            "label": "附录B.4",
            "url": "https://arxiv.org/html/2608.06144#A2.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "已完成任务的judge.md 分数与反馈。",
        "sources": [
          {
            "label": "附录B.4",
            "url": "https://arxiv.org/html/2608.06144#A2.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "三个独立打乱、全局交错的任务流，比较质量和合规。",
        "sources": [
          {
            "label": "附录B.4",
            "url": "https://arxiv.org/html/2608.06144#A2.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "在线流式协议；同框架不进化对照用于估计保留经验的收益。",
        "sources": [
          {
            "label": "附录B.4",
            "url": "https://arxiv.org/html/2608.06144#A2.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "把金融工作组织成相关但不同的连续案例，与不更新的系统配对比较，并区分过程评分细则和参考答案提供的反馈。",
        "sources": [
          {
            "label": "附录B.4",
            "url": "https://arxiv.org/html/2608.06144#A2.SS4"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2608.06144#S4.SS4.SSS0.Px1"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2603.08640": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "研究 agent 操作终端完成后训练；最终答题的是提交的 Qwen3-1.7B、Qwen3-4B、SmolLM3-3B 或 Gemma-3-4B 检查点，交给固定评测程序运行。",
        "sources": [
          {
            "label": "§1",
            "url": "https://arxiv.org/html/2603.08640#S1.SS0.SSS0.Px2"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2603.08640#S5.SS2"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2603.08640#A2"
          },
          {
            "label": "附录E",
            "url": "https://arxiv.org/html/2603.08640#A5"
          },
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2603.08640#S2.SS1"
          },
          {
            "label": "§2.2",
            "url": "https://arxiv.org/html/2603.08640#S2.SS2"
          },
          {
            "label": "§2.2",
            "url": "https://arxiv.org/html/2603.08640#S2.SS2.SSS0.Px1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2603.08640#S3.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "表 1 比较多种研究模型与 CLI（通过终端命令使用的程序界面） 的组合，包括 Claude Code（可读写项目文件、运行命令和测试的 coding agent 工具） + Opus 4.6／4.5、Codex CLI（在终端中读写代码、运行命令的 coding agent 工具） + GPT-5.1／5.2，以及 OpenCode（可连接不同模型的开源 coding agent 工具） + GPT-5.1 Codex Max 等；研究模型选择数据和训练代码，不等于被训练的四个基础模型。",
        "sources": [
          {
            "label": "§1",
            "url": "https://arxiv.org/html/2603.08640#S1.SS0.SSS0.Px2"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2603.08640#S5.SS2"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2603.08640#A2"
          },
          {
            "label": "附录E",
            "url": "https://arxiv.org/html/2603.08640#A5"
          },
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2603.08640#S2.SS1"
          },
          {
            "label": "§2.2",
            "url": "https://arxiv.org/html/2603.08640#S2.SS2"
          },
          {
            "label": "§2.2",
            "url": "https://arxiv.org/html/2603.08640#S2.SS2.SSS0.Px1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2603.08640#S3.SS1"
          },
          {
            "label": "Claude Code 官方说明",
            "url": "https://code.claude.com/docs/en/overview"
          },
          {
            "label": "OpenCode 官方说明",
            "url": "https://opencode.ai/docs"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "给定基础模型的后训练参数；研究 agent 选择数据和训练方法。",
        "sources": [
          {
            "label": "§1",
            "url": "https://arxiv.org/html/2603.08640#S1.SS0.SSS0.Px2"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2603.08640#S5.SS2"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2603.08640#A2"
          },
          {
            "label": "附录E",
            "url": "https://arxiv.org/html/2603.08640#A5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "evaluate.py 的目标基准成绩，最终另审查训练数据污染及越界训练。",
        "sources": [
          {
            "label": "§1",
            "url": "https://arxiv.org/html/2603.08640#S1.SS0.SSS0.Px2"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2603.08640#S5.SS2"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2603.08640#A2"
          },
          {
            "label": "附录E",
            "url": "https://arxiv.org/html/2603.08640#A5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "用 Codex CLI（在终端中读写代码、运行命令的 coding agent 工具）、Claude Code（可读写项目文件、运行命令和测试的 coding agent 工具）、Gemini CLI（通过终端命令使用的程序界面） 等标准开发工具 agent，能读写文件、运行代码、处理上下文和权限。提供一张 H100 与 10 小时预算，修改对象是指定基础模型的训练结果；评估运行框架不允许改。",
        "sources": [
          {
            "label": "任务定义与 agent 执行设置",
            "url": "https://arxiv.org/abs/2603.08640"
          },
          {
            "label": "Claude Code 官方说明",
            "url": "https://code.claude.com/docs/en/overview"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "自行检索/整理数据、编写训练代码、试验并选 final_model；不能训练其他模型或改 评估器。",
        "sources": [
          {
            "label": "§1",
            "url": "https://arxiv.org/html/2603.08640#S1.SS0.SSS0.Px2"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2603.08640#S5.SS2"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2603.08640#A2"
          },
          {
            "label": "附录E",
            "url": "https://arxiv.org/html/2603.08640#A5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "各 run 自行选数据训练 Qwen3-1.7B/4B、SmolLM3-3B 或 Gemma-3-4B，禁止把目标测试题用于训练。",
        "sources": [
          {
            "label": "§1",
            "url": "https://arxiv.org/html/2603.08640#S1.SS0.SSS0.Px2"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2603.08640#A2"
          },
          {
            "label": "附录E",
            "url": "https://arxiv.org/html/2603.08640#A5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "可调用 evaluate.py，甚至使用 --limit 加快实验；预算为单 H100、10 小时。",
        "sources": [
          {
            "label": "§1",
            "url": "https://arxiv.org/html/2603.08640#S1.SS0.SSS0.Px2"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2603.08640#A2"
          },
          {
            "label": "附录E",
            "url": "https://arxiv.org/html/2603.08640#A5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "AIME25、GSM8K（小学数学应用题基准）、GPQA（研究生级科学问答基准）、HumanEval（根据函数要求生成代码、用测试检查结果的编程基准）、BFCL、ArenaHard、HealthBench 中指定的一项。",
        "sources": [
          {
            "label": "§1",
            "url": "https://arxiv.org/html/2603.08640#S1.SS0.SSS0.Px2"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2603.08640#A2"
          },
          {
            "label": "附录E",
            "url": "https://arxiv.org/html/2603.08640#A5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "禁止训练测试题不等于评估分数全程隐藏：开发接口允许查询基准成绩，不能写成完全不可见的盲测。",
        "sources": [
          {
            "label": "§1",
            "url": "https://arxiv.org/html/2603.08640#S1.SS0.SSS0.Px2"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2603.08640#A2"
          },
          {
            "label": "附录E",
            "url": "https://arxiv.org/html/2603.08640#A5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "给模型起点和有限 GPU 时间，让 agent 自己完成数据选择、训练和调试，再比较训练产物与官方指令模型的能力。",
        "sources": [
          {
            "label": "§1",
            "url": "https://arxiv.org/html/2603.08640#S1.SS0.SSS0.Px2"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2603.08640#S5.SS2"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2603.08640#A2"
          },
          {
            "label": "附录E",
            "url": "https://arxiv.org/html/2603.08640#A5"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2604.10547": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "第一组交付并测试Qwen2.5-7B-Instruct的训练后模型；受控CLI（通过终端命令使用的程序界面）组交付Qwen3-8B-Base的训练后模型。负责写训练代码的执行模型不是这两个目标模型。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2604.10547#S2.SS1"
          },
          {
            "label": "附录E.3",
            "url": "https://arxiv.org/html/2604.10547#A5.SS3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2604.10547#S3.SS1"
          },
          {
            "label": "附录A.4",
            "url": "https://arxiv.org/html/2604.10547#A1.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "第一组：GPT-5.4驱动OpenHands/OpenCode，Claude Opus4.6驱动Claude Code（可读写项目文件、运行命令和测试的 coding agent 工具）。受控组执行模型包括Opus4.6、Sonnet4.5、GPT-5.4、GPT-5.2、GPT-4o、Gemini2.5 Flash。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2604.10547#S2.SS1"
          },
          {
            "label": "附录E.3",
            "url": "https://arxiv.org/html/2604.10547#A5.SS3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2604.10547#S3.SS1"
          },
          {
            "label": "附录A.4",
            "url": "https://arxiv.org/html/2604.10547#A1.SS4"
          },
          {
            "label": "Claude Code 官方说明",
            "url": "https://code.claude.com/docs/en/overview"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "研究 agent 开发的训练程序，以及提交的模型参数版本。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2604.10547#S2.SS1"
          },
          {
            "label": "附录E.3",
            "url": "https://arxiv.org/html/2604.10547#A5.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "候选能否评估、任务成绩与提交轨迹；最终按最佳有效提交计分。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2604.10547#S2.SS1"
          },
          {
            "label": "附录E.3",
            "url": "https://arxiv.org/html/2604.10547#A5.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "给研究 task agent 提供可运行训练/评估工作区；静态题用 OpenCompass 等评估，交互题各有环境执行尝试（从开始做任务到得到结果的过程）。允许 强化学习（根据奖励调整模型行为），也明确允许 监督微调（用示范数据训练模型），因此完成训练或涨分不代表成功建立 强化学习（根据奖励调整模型行为） 流程。",
        "sources": [
          {
            "label": "任务协议、Table 5",
            "url": "https://arxiv.org/abs/2604.10547"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "读取可见数据和任务，写训练代码并提交候选；记录失败提交、路线切换和分数，区分流程工程与学习算法改进。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2604.10547#S2.SS1"
          },
          {
            "label": "附录E.3",
            "url": "https://arxiv.org/html/2604.10547#A5.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "GSM8K（小学数学应用题基准） 标准 训练集；HumanEval（根据函数要求生成代码、用测试检查结果的编程基准） 82 道可见题；其他任务给相应训练资料。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2604.10547#S2.SS1"
          },
          {
            "label": "§2.6",
            "url": "https://arxiv.org/html/2604.10547#S2.SS6.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "训练过程和提交接口反馈，Git 历史用于分析方法选择。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2604.10547#S2.SS1"
          },
          {
            "label": "§2.6",
            "url": "https://arxiv.org/html/2604.10547#S2.SS6.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "GSM8K（小学数学应用题基准） 测试集、HumanEval（根据函数要求生成代码、用测试检查结果的编程基准） 另 82 题；AlpacaEval 2.0、ALFWorld（通过文字动作完成家居物体操作的交互环境） 134、WebShop（根据用户要求挑选和购买商品的交互基准） 100、DeepSearchQA 200。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2604.10547#S2.SS1"
          },
          {
            "label": "§2.6",
            "url": "https://arxiv.org/html/2604.10547#S2.SS6.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "HumanEval（根据函数要求生成代码、用测试检查结果的编程基准） 是自定义 82/82，不直接对比全量 164 榜单；最佳提交评分不同于只提交一次模型。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2604.10547#S2.SS1"
          },
          {
            "label": "§2.6",
            "url": "https://arxiv.org/html/2604.10547#S2.SS6.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "要求 agent 实际串起交互数据采集、奖励设计、训练与调试；协议也允许监督微调，需要单独检查成绩来自哪一种训练。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2604.10547#S2.SS1"
          },
          {
            "label": "附录E.3",
            "url": "https://arxiv.org/html/2604.10547#A5.SS3"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2606.04261": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "编码 task agent 筛选数据，固定后端训练并测试目标模型；主视觉语言实验目标为LLaVA1.5-7B，扩展另用Qwen2-VL-2B、Qwen2.5-VL-3B。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/2606.04261#S2.SS0.SSS0.Px1"
          },
          {
            "label": "附录C.1",
            "url": "https://arxiv.org/html/2606.04261#A3.SS1"
          },
          {
            "label": "附录D.3",
            "url": "https://arxiv.org/html/2606.04261#A4.SS3.SSS0.Px3"
          },
          {
            "label": "附录D.1",
            "url": "https://arxiv.org/html/2606.04261#A4.SS1.SSS0.Px3"
          },
          {
            "label": "附录D.5",
            "url": "https://arxiv.org/html/2606.04261#A4.SS5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "Claude Code（可读写项目文件、运行命令和测试的 coding agent 工具） + Opus4.7/Sonnet4.6、Codex + GPT-5.4/GPT-5.3负责数据策划；开源对照通过OpenHands运行Kimi K2.5和Qwen3.5-397B。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/2606.04261#S2.SS0.SSS0.Px1"
          },
          {
            "label": "附录C.1",
            "url": "https://arxiv.org/html/2606.04261#A3.SS1"
          },
          {
            "label": "附录D.3",
            "url": "https://arxiv.org/html/2606.04261#A4.SS3.SSS0.Px3"
          },
          {
            "label": "附录D.1",
            "url": "https://arxiv.org/html/2606.04261#A4.SS1.SSS0.Px3"
          },
          {
            "label": "附录D.5",
            "url": "https://arxiv.org/html/2606.04261#A4.SS5"
          },
          {
            "label": "Claude Code 官方说明",
            "url": "https://code.claude.com/docs/en/overview"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "交给固定训练后端的数据子集与数据筛选策略。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/2606.04261#S2.SS0.SSS0.Px1"
          },
          {
            "label": "附录C.1",
            "url": "https://arxiv.org/html/2606.04261#A3.SS1"
          },
          {
            "label": "附录D.3",
            "url": "https://arxiv.org/html/2606.04261#A4.SS3.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "每次训练后返回视觉基准分数，开发者据此修订数据策略。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/2606.04261#S2.SS0.SSS0.Px1"
          },
          {
            "label": "附录C.1",
            "url": "https://arxiv.org/html/2606.04261#A3.SS1"
          },
          {
            "label": "附录D.3",
            "url": "https://arxiv.org/html/2606.04261#A4.SS3.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "所有 agent 共用工作区、命令行和提交门控。Claude Code/Codex 自带文件编辑与命令行；开放模型经 OpenHands 接入。训练配方由平台固定，task agent 重点选择数据子集而不是任意改变训练代码。",
        "sources": [
          {
            "label": "主实验；附录 D.1–D.3",
            "url": "https://arxiv.org/abs/2606.04261"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "检查候选池、写筛选程序、提交子集、训练评估再迭代；训练算法和评估接口固定。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/2606.04261#S2.SS0.SSS0.Px1"
          },
          {
            "label": "附录C.1",
            "url": "https://arxiv.org/html/2606.04261#A3.SS1"
          },
          {
            "label": "附录D.3",
            "url": "https://arxiv.org/html/2606.04261#A4.SS3.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "LLaVA-665K 或 Vision-Flan 186k 中选 10k；另有 DataComp Small 图文筛选训练 ViT-B/32 CLIP。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/2606.04261#S2.SS0.SSS0.Px1"
          },
          {
            "label": "附录D.3",
            "url": "https://arxiv.org/html/2606.04261#A4.SS3.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "每次候选训练后的评测反馈用于下一轮筛选，通常每会话十轮。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/2606.04261#S2.SS0.SSS0.Px1"
          },
          {
            "label": "附录D.3",
            "url": "https://arxiv.org/html/2606.04261#A4.SS3.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "MMVet、LLaVA-Bench、MMBench、MMMU 验证集、MMStar、MathVista-Mini、OCRBench、HallusionBench；CLIP 用 DataComp 38 任务。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/2606.04261#S2.SS0.SSS0.Px1"
          },
          {
            "label": "附录D.3",
            "url": "https://arxiv.org/html/2606.04261#A4.SS3.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "这些评测重复参与筛选反馈；不能把它们写成只在终点出现的独立测试。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/2606.04261#S2.SS0.SSS0.Px1"
          },
          {
            "label": "附录D.3",
            "url": "https://arxiv.org/html/2606.04261#A4.SS3.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "固定模型、训练配方和最终评测，只让研究 agent 改变数据策略，以便把数据研究能力从其他工程改动中分离出来。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/2606.04261#S2.SS0.SSS0.Px1"
          },
          {
            "label": "附录C.1",
            "url": "https://arxiv.org/html/2606.04261#A3.SS1"
          },
          {
            "label": "附录D.3",
            "url": "https://arxiv.org/html/2606.04261#A4.SS3.SSS0.Px3"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2606.05080": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "固定Terminus-2（Terminal-Bench 团队提供的终端 task agent，负责让模型操作命令行环境）框架下比较Opus4.6、Gemini3.1 Pro、GPT-5.4、Grok4-20、Qwen3.6 Plus、DeepSeekV4Pro、GLM5、Kimi K2.6、Hunyuan3 Preview、MiMoV2.5Pro、MiniMaxM2.7。",
        "sources": [
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2606.05080#S2.SS3"
          },
          {
            "label": "§5",
            "url": "https://arxiv.org/html/2606.05080#S5.SS0.SSS0.Px3"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.05080#A1.SS1.SSS0.Px1"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.05080#A1.SS1.SSS0.Px2"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.05080#A1.SS1.SSS0.Px3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2606.05080#S3.SS1"
          },
          {
            "label": "Terminus：终端 task agent",
            "url": "https://www.tbench.ai/news/terminus"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "同一次运行中的上述任务模型修改题目允许的代码或科研产物；外层Terminus-2（Terminal-Bench 团队提供的终端 task agent，负责让模型操作命令行环境）和评估器固定。附录另有更旧/更小模型消融。",
        "sources": [
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2606.05080#S2.SS3"
          },
          {
            "label": "§5",
            "url": "https://arxiv.org/html/2606.05080#S5.SS0.SSS0.Px3"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.05080#A1.SS1.SSS0.Px1"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.05080#A1.SS1.SSS0.Px2"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.05080#A1.SS1.SSS0.Px3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2606.05080#S3.SS1"
          },
          {
            "label": "Terminus：终端 task agent",
            "url": "https://www.tbench.ai/news/terminus"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "目标任务的代码、训练配置或数据选择产物；执行任务的运行框架固定。",
        "sources": [
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2606.05080#S2.SS3"
          },
          {
            "label": "§5",
            "url": "https://arxiv.org/html/2606.05080#S5.SS0.SSS0.Px3"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.05080#A1.SS1.SSS0.Px1"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.05080#A1.SS1.SSS0.Px2"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.05080#A1.SS1.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "运行每题的检查程序，既验证产物是否满足正确性约束，也计算运行速度、误差或产物质量等优化目标；目标随任务变化。",
        "sources": [
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2606.05080#S2.SS3"
          },
          {
            "label": "§5",
            "url": "https://arxiv.org/html/2606.05080#S5.SS0.SSS0.Px3"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.05080#A1.SS1.SSS0.Px1"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.05080#A1.SS1.SSS0.Px2"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.05080#A1.SS1.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "AutoLab 给研究/工程 task agent 提供任务专属代码、数据、计算资源和提交判据，允许构造完整解决方案。任务包含系统优化、模型开发等，不是单一固定空白 task agent 的自我改写。",
        "sources": [
          {
            "label": "附录 A 任务规格；模型开发案例",
            "url": "https://arxiv.org/abs/2606.05080"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "在预算内改代码/配置并执行验证，保存更好产物；统一外层工具、任务定义和评分控制模型间比较。",
        "sources": [
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2606.05080#S2.SS3"
          },
          {
            "label": "§5",
            "url": "https://arxiv.org/html/2606.05080#S5.SS0.SSS0.Px3"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.05080#A1.SS1.SSS0.Px1"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.05080#A1.SS1.SSS0.Px2"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.05080#A1.SS1.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "36 个自建任务：系统 15、挑战 10、模型开发 7、CUDA 4；各题有自己的数据。例：指令任务从 50k 池选至多 5k 做 LoRA（只训练少量适配参数）。",
        "sources": [
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2606.05080#S2.SS3"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.05080#A1.SS1.SSS0.Px1"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.05080#A1.SS1.SSS0.Px2"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.05080#A1.SS1.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "各题本地实验与验证接口；例：FLUX 任务用 15 张概念图调 LoRA（只训练少量适配参数），修 OOM 和配置。",
        "sources": [
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2606.05080#S2.SS3"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.05080#A1.SS1.SSS0.Px1"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.05080#A1.SS1.SSS0.Px2"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.05080#A1.SS1.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "各题自己的终点评分；指令数据选择用不可直接查看的 IFEval，视频预测用留出 Moving MNIST。",
        "sources": [
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2606.05080#S2.SS3"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.05080#A1.SS1.SSS0.Px1"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.05080#A1.SS1.SSS0.Px2"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.05080#A1.SS1.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "36 个优化问题不共用一个 训练／测试 划分；终点评分含私有规则，运行框架在模型对照中固定。",
        "sources": [
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2606.05080#S2.SS3"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.05080#A1.SS1.SSS0.Px1"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.05080#A1.SS1.SSS0.Px2"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.05080#A1.SS1.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "每题给一个可运行但次优的方案，观察 agent 如何反复测量、修改和继续探索，评价长期改进而非第一份答案。",
        "sources": [
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2606.05080#S2.SS3"
          },
          {
            "label": "§5",
            "url": "https://arxiv.org/html/2606.05080#S5.SS0.SSS0.Px3"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.05080#A1.SS1.SSS0.Px1"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.05080#A1.SS1.SSS0.Px2"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2606.05080#A1.SS1.SSS0.Px3"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2607.05155": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "GPT-5.5/GPT-5.4配Codex；Claude Opus4.8、GLM5.1、DeepSeek-V4-Pro-preview配Claude Code（可读写项目文件、运行命令和测试的 coding agent 工具）。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2607.05155#S2.SS1"
          },
          {
            "label": "§2.2",
            "url": "https://arxiv.org/html/2607.05155#S2.SS2"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2607.05155#S3.SS1"
          },
          {
            "label": "Claude Code 官方说明",
            "url": "https://code.claude.com/docs/en/overview"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "各模型在同一次研究运行中据执行与评测反馈修订产物；框架和模型配对固定。Opus4.8另比较200K与1M上下文。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2607.05155#S2.SS1"
          },
          {
            "label": "§2.2",
            "url": "https://arxiv.org/html/2607.05155#S2.SS2"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2607.05155#S3.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "长程科研或工程任务中的候选方案与保留状态，用于观察环境学习过程。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2607.05155#S2.SS1"
          },
          {
            "label": "§2.2",
            "url": "https://arxiv.org/html/2607.05155#S2.SS2"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2607.05155#S3.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "本地试验反馈、提交后评分者反馈和宿主端轨迹测量三层。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2607.05155#S2.SS1"
          },
          {
            "label": "§2.2",
            "url": "https://arxiv.org/html/2607.05155#S2.SS2"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2607.05155#S3.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "每个任务有可持续运行的执行环境、工具和多层反馈，task agent 反复读结果、修改程序/方案并提交检查。不同领域各有初始材料，不是统一只有一个提示词的起点；具体任务工具应按任务规格看。",
        "sources": [
          {
            "label": "benchmark 设计与实验协议",
            "url": "https://arxiv.org/abs/2607.05155"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "每题持续运行至少 12 小时，记录各次提交和历史最佳分数，比较不同模型的学习速度与上限。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2607.05155#S2.SS1"
          },
          {
            "label": "§2.2",
            "url": "https://arxiv.org/html/2607.05155#S2.SS2"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2607.05155#S3.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "134 个自建长时任务，六类能力；经验来自每题内的持续交互。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2607.05155#S2.SS1"
          },
          {
            "label": "§2.2",
            "url": "https://arxiv.org/html/2607.05155#S2.SS2"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2607.05155#S3.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "工作环境中的实验与受控提交反馈，工作/评判环境分开。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2607.05155#S2.SS1"
          },
          {
            "label": "§2.2",
            "url": "https://arxiv.org/html/2607.05155#S2.SS2"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2607.05155#S3.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "每模型每题三次独立 12 小时运行；约 38,000 小时是累计交互时长。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2607.05155#S2.SS1"
          },
          {
            "label": "§2.2",
            "url": "https://arxiv.org/html/2607.05155#S2.SS2"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2607.05155#S3.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "主结论是同问题持续优化曲线，不是先在其他题训练再对这 134 题一次盲测。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2607.05155#S2.SS1"
          },
          {
            "label": "§2.2",
            "url": "https://arxiv.org/html/2607.05155#S2.SS2"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2607.05155#S3.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "在超长任务中记录能力随时间和计算投入变化的曲线，研究学习速度及持续进步的条件。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2607.05155#S2.SS1"
          },
          {
            "label": "§2.2",
            "url": "https://arxiv.org/html/2607.05155#S2.SS2"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2607.05155#S3.SS1"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "doi.org-10.1016-S0065-2458-08-60418-0": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "概念上的“超智能机器”，没有具体模型、可执行 agent 或实验配置。",
        "sources": [
          {
            "label": "关于 ultraintelligent machine 与 intelligence explosion 的论述",
            "url": "https://doi.org/10.1016/S0065-2458(08)60418-0"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "文章讨论机器设计更好机器的可能性，没有提出可复现的自动修改算法。",
        "sources": [
          {
            "label": "关于 ultraintelligent machine 与 intelligence explosion 的论述",
            "url": "https://doi.org/10.1016/S0065-2458(08)60418-0"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "概念上是机器本身及设计更好机器的能力；没有定义具体可执行修改对象。",
        "sources": [
          {
            "label": "关于 ultraintelligent machine 与 intelligence explosion 的论述",
            "url": "https://doi.org/10.1016/S0065-2458(08)60418-0"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "无实验反馈；逻辑论证。",
        "sources": [
          {
            "label": "关于 ultraintelligent machine 与 intelligence explosion 的论述",
            "url": "https://doi.org/10.1016/S0065-2458(08)60418-0"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "这是关于超智能及智能爆发的概念论述，没有现代 task agent 的工具、执行循环或可编辑运行框架；基础运行框架维度不适用。",
        "sources": [
          {
            "label": "原文论述范围",
            "url": "https://doi.org/10.1016/S0065-2458(08)60418-0"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "提出机器设计更聪明机器的递归设想；没有可运行的更新、接受或回退算法。",
        "sources": [
          {
            "label": "关于 ultraintelligent machine 与 intelligence explosion 的论述",
            "url": "https://doi.org/10.1016/S0065-2458(08)60418-0"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "不适用：未定义数据驱动的训练实验。",
        "sources": [
          {
            "label": "关于 ultraintelligent machine 与 intelligence explosion 的论述",
            "url": "https://doi.org/10.1016/S0065-2458(08)60418-0"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "没有实现层面的调试数据或反馈接口。",
        "sources": [
          {
            "label": "关于 ultraintelligent machine 与 intelligence explosion 的论述",
            "url": "https://doi.org/10.1016/S0065-2458(08)60418-0"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "没有评测基准实验，贡献是关于智能爆发的论证。",
        "sources": [
          {
            "label": "关于 ultraintelligent machine 与 intelligence explosion 的论述",
            "url": "https://doi.org/10.1016/S0065-2458(08)60418-0"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "不适用；不能把理论设想当作实证多代改进。",
        "sources": [
          {
            "label": "关于 ultraintelligent machine 与 intelligence explosion 的论述",
            "url": "https://doi.org/10.1016/S0065-2458(08)60418-0"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "提出机器改善自身设计可能进一步提高其设计能力的递归设想；这是一种概念论证，未给出现代 agent 算法或任务实验。",
        "sources": [
          {
            "label": "关于 ultraintelligent machine 与 intelligence explosion 的论述",
            "url": "https://doi.org/10.1016/S0065-2458(08)60418-0"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "people.idsia.ch-juergen": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "文中的自指学习程序执行任务；这是早期程序学习设定，不是 语言模型 运行框架实验。",
        "sources": [
          {
            "label": "PSALM 实现与初步实验",
            "url": "https://people.idsia.ch/~juergen/diploma.html"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "学习程序内部的自指学习机制修改自身学习策略；不存在 GPT、Claude 等基础模型型号。",
        "sources": [
          {
            "label": "PSALM 实现与初步实验",
            "url": "https://people.idsia.ch/~juergen/diploma.html"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "产生学习与程序变异的高阶机制及参数。",
        "sources": [
          {
            "label": "PSALM 实现与初步实验",
            "url": "https://people.idsia.ch/~juergen/diploma.html"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "程序搜索中预先定义的目标或适应度，即用来比较候选程序好坏的分数。",
        "sources": [
          {
            "label": "PSALM 实现与初步实验",
            "url": "https://people.idsia.ch/~juergen/diploma.html"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "早期程序搜索/自指学习构造：meta-level GP 搜索能修改程序的程序，PSALM 让生成、连接和分配 贡献 的 task agent 竞争。它不是现代 语言模型＋命令行的 task agent 运行框架。",
        "sources": [
          {
            "label": "原论文摘要与构造",
            "url": "https://people.idsia.ch/~juergen/diploma.html"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "让程序同时操作任务知识和学习策略，通过演化压力及 贡献 分配保留有用结构；PSALM 使用自扩展符号语言。",
        "sources": [
          {
            "label": "PSALM 实现与初步实验",
            "url": "https://people.idsia.ch/~juergen/diploma.html"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "自建语言中的初步经验任务，非现代统一训练集。",
        "sources": [
          {
            "label": "PSALM 实现与初步实验",
            "url": "https://people.idsia.ch/~juergen/diploma.html"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "环境中的演化压力与信用分配驱动结构变化。",
        "sources": [
          {
            "label": "PSALM 实现与初步实验",
            "url": "https://people.idsia.ch/~juergen/diploma.html"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "作者报告少量初步实验，并在摘要明确说不足以展示具体自指效果。",
        "sources": [
          {
            "label": "PSALM 实现与初步实验",
            "url": "https://people.idsia.ch/~juergen/diploma.html"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "证据是早期实现探索，不可解读为已验证的无限递归改进。",
        "sources": [
          {
            "label": "PSALM 实现与初步实验",
            "url": "https://people.idsia.ch/~juergen/diploma.html"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "研究修改程序的程序也能被搜索的自指机制，并讨论程序生成、连接和收益分配怎样通过 agent 竞争组织起来。",
        "sources": [
          {
            "label": "PSALM 实现与初步实验",
            "url": "https://people.idsia.ch/~juergen/diploma.html"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "cs-0207097": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "OOPS 搜索并执行候选程序来解题；没有语言模型参与。",
        "sources": [
          {
            "label": "§6 Experiments",
            "url": "https://arxiv.org/abs/cs/0207097"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "固定的 OOPS 程序搜索算法复用已找到的程序，分配后续搜索时间；候选程序可以调整搜索偏置。",
        "sources": [
          {
            "label": "§6 Experiments",
            "url": "https://arxiv.org/abs/cs/0207097"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "已发现的程序及可复用的搜索程序；任务正确性标准与时间分配原则固定。",
        "sources": [
          {
            "label": "§6 Experiments",
            "url": "https://arxiv.org/abs/cs/0207097"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "任务可解性/运行时间。",
        "sources": [
          {
            "label": "§6 Experiments",
            "url": "https://arxiv.org/abs/cs/0207097"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "OOPS 是可执行程序搜索系统，保存已解决问题的程序前缀并按概率和计算预算复用；基础对象是通用程序解释/搜索机制，不是预训练语言模型的工具链。",
        "sources": [
          {
            "label": "OOPS 程序搜索与实验",
            "url": "https://arxiv.org/abs/cs/0207097"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "按程序先验和时间预算搜索；新程序必须解决相关任务才冻结保留，后续搜索可复用旧程序，也可搜索修改搜索偏好的程序。",
        "sources": [
          {
            "label": "§6 Experiments",
            "url": "https://arxiv.org/abs/cs/0207097"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "逐步提供符号程序任务，包括计数/序列类任务及 Hanoi；训练是增量程序搜索，不是参数拟合。",
        "sources": [
          {
            "label": "§6 Experiments",
            "url": "https://arxiv.org/abs/cs/0207097"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "执行候选程序检查是否解题，失败则回溯并分配下一段搜索时间。",
        "sources": [
          {
            "label": "§6 Experiments",
            "url": "https://arxiv.org/abs/cs/0207097"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "在之后更复杂的任务上衡量先前程序带来的搜索加速。",
        "sources": [
          {
            "label": "§6 Experiments",
            "url": "https://arxiv.org/abs/cs/0207097"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "顺序归纳的任务序列，没有现代随机 训练／测试 划分。",
        "sources": [
          {
            "label": "§6 Experiments",
            "url": "https://arxiv.org/abs/cs/0207097"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "将已解决任务的程序留给后续问题复用，并允许这些程序改变之后的搜索过程，使经验也能改善寻找新解的方式。",
        "sources": [
          {
            "label": "§6 Experiments",
            "url": "https://arxiv.org/abs/cs/0207097"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "1805.06610": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "形式化定义中的自改进系统；文章讨论计算模型及其性质，不报告某个 语言模型 的运行结果。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/1805.06610#S2"
          },
          {
            "label": "§3",
            "url": "https://arxiv.org/html/1805.06610#S3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "文中定义的自改进算法作用于形式化系统；没有独立的语言模型修改者配置。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/1805.06610#S2"
          },
          {
            "label": "§3",
            "url": "https://arxiv.org/html/1805.06610#S3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "受限形式系统中产生改进的映射；程序分布和评分构造受理论设定约束。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/1805.06610#S2"
          },
          {
            "label": "§3",
            "url": "https://arxiv.org/html/1805.06610#S3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "使用形式化目标和模拟实验中的数值结果；本文把到达最优程序所需的期望步数作为分数，越低越好。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/1805.06610#S2"
          },
          {
            "label": "§3",
            "url": "https://arxiv.org/html/1805.06610#S3"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/1805.06610#S4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "形式化的递归改进系统与效率分析，没有一套现代交互 task agent 运行框架。不能把数学定义中的改进算子写成已实现的模型/工具组件。",
        "sources": [
          {
            "label": "形式化问题与理论分析",
            "url": "https://arxiv.org/abs/1805.06610"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "抽象程序按各自分布产生新程序；分数更低才替换。分数定义为到达最优程序的期望步数。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/1805.06610#S2"
          },
          {
            "label": "§3",
            "url": "https://arxiv.org/html/1805.06610#S3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "随机生成 n=2^l（l=1…20）的抽象程序系统；不是自然语言任务数据。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/1805.06610#S4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "按期望到达步数比较候选并更新当前程序。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/1805.06610#S4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "各规模重复 10 次；n=2^20 时另运行 100 次模拟，观察排名和收敛速度。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/1805.06610#S4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "这是抽象随机系统的模拟证据，不等同于真实 task agent 的能力自进化。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/1805.06610#S4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "用受约束的形式化定义讨论递归自改进及其可能效率，帮助明确什么才算改进；证据类型是理论分析。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/1805.06610#S2"
          },
          {
            "label": "§3",
            "url": "https://arxiv.org/html/1805.06610#S3"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2203.11171": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "UL2-20B、LaMDA-137B、PaLM-540B，以及GPT-3/Codex的code-davinci-001、code-davinci-002，对同一问题采样多条推理链。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2203.11171#S3.SS1.SSS0.Px1"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2203.11171#S4.SS0.SSS0.Px3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2203.11171#S3.SS1.SSS0.Px2"
          },
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2203.11171#A1.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "没有修改模型的语言模型：固定程序采样同一基础模型的多条推理链，提取最终答案并投票；不训练参数或改运行框架。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2203.11171#S3.SS1.SSS0.Px1"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2203.11171#S4.SS0.SSS0.Px3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2203.11171#S3.SS1.SSS0.Px2"
          },
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2203.11171#A1.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "当前问题的多条推理候选与最终答案选择；模型、提示和投票规则不变。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2203.11171#S3.SS1.SSS0.Px1"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2203.11171#S4.SS0.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "同一模型多次回答后的答案一致性用于选择输出；选择时没有环境验收或标准答案反馈。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2203.11171#S3.SS1.SSS0.Px1"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2203.11171#S4.SS0.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "同一道题采样多条逐步推理，再按最终答案多数投票；基础系统只有提示、采样和聚合，不更新跨题技能库、工具代码或模型权重。",
        "sources": [
          {
            "label": "§3.1 与符号 OOD 设置",
            "url": "https://arxiv.org/abs/2203.11171"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "对当前题多次采样不同推理路径，抽取最终答案并多数投票；不诊断或编辑错误路径，也不保留跨题更新。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2203.11171#S3.SS1.SSS0.Px1"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2203.11171#S4.SS0.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "无新增训练；提示中提供少量推理示例。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2203.11171#S3.SS1.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "不使用正确答案调试当前候选，依答案之间的一致性选择。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2203.11171#S3.SS1.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "GSM8K（小学数学应用题基准）、SVAMP、AQuA、AddSub、MultiArith、ASDiv；CommonsenseQA、StrategyQA、ARC；末字母拼接、Coinflip。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2203.11171#S3.SS1.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "通常用官方 测试集，CommonsenseQA 用 开发集；这是题内采样收益，不是跨任务训练收益。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2203.11171#S3.SS1.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "为同一道题采样多条推理路径，再按答案一致性选择结果；多路径一致提供判断信号，但不会留下跨任务更新的系统。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2203.11171#S3.SS1.SSS0.Px1"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2203.11171#S4.SS0.SSS0.Px3"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2303.17651": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "GPT-3.5（text-davinci-003）、ChatGPT（gpt-3.5-turbo）、GPT-4；代码任务另测Codex code-davinci-002。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2303.17651#S3"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2303.17651#S4.SS0.SSS0.Px1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2303.17651#S3.SS1.SSS0.Px1"
          },
          {
            "label": "附录L.2",
            "url": "https://arxiv.org/html/2303.17651#A12.SS2.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "同一基础模型分别执行生成、反馈与重写提示；如评论重写实验的critique和editor均为text-davinci-003，没有额外训练独立提供批评意见的模型。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2303.17651#S3"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2303.17651#S4.SS0.SSS0.Px1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2303.17651#S3.SS1.SSS0.Px1"
          },
          {
            "label": "附录L.2",
            "url": "https://arxiv.org/html/2303.17651#A12.SS2.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "当前回答；模型和生成、反馈、修订流程固定。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2303.17651#S3"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2303.17651#S4.SS0.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "由同一个模型写出具体批评并据此改稿；迭代中没有外部正确性判定，最终研究评测与模型自评分开。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2303.17651#S3"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2303.17651#S4.SS0.SSS0.Px1"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2303.17651#A1"
          },
          {
            "label": "附录M.2",
            "url": "https://arxiv.org/html/2303.17651#A13.SS2.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "一个固定语言模型先给初稿，再按任务专用反馈提示批评，最后改写；重复时携带先前反馈。变化的是当前回答或代码，运行框架和参数保持固定。",
        "sources": [
          {
            "label": "任务设置、Table 4",
            "url": "https://arxiv.org/abs/2303.17651"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "同一模型先生成、再给具体批评、再改写；循环直到停止条件或轮数上限，不更新权重或固定框架。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2303.17651#S3"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2303.17651#S4.SS0.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "无参数训练；各任务用少样本示例指定反馈与改写格式。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2303.17651#S3"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2303.17651#A1"
          },
          {
            "label": "附录M.2",
            "url": "https://arxiv.org/html/2303.17651#A13.SS2.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "当前输出由模型自己检查并给可行动建议；不是统一外部判分器决定每次修改。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2303.17651#S3"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2303.17651#A1"
          },
          {
            "label": "附录M.2",
            "url": "https://arxiv.org/html/2303.17651#A13.SS2.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "FED 对话 342；GSM8K（小学数学应用题基准） 1,319；代码优化、代码可读性 300、情感反转、缩写 250、约束生成 200。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2303.17651#S3"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2303.17651#A1"
          },
          {
            "label": "附录M.2",
            "url": "https://arxiv.org/html/2303.17651#A13.SS2.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "同一测试实例被迭代改写；最终用任务指标/人评比较，不能算新增持久能力。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2303.17651#S3"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2303.17651#A1"
          },
          {
            "label": "附录M.2",
            "url": "https://arxiv.org/html/2303.17651#A13.SS2.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "让同一个模型生成初稿、提出文字批评并据此改稿，所有修改围绕当前产物，任务结束后没有新的持久学习状态。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2303.17651#S3"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2303.17651#S4.SS0.SSS0.Px1"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2305.11738": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "分别使用 text-davinci-003、ChatGPT（gpt-3.5-turbo）及 LLaMA-2 7B／13B／70B 生成初始回答，再调用外部工具验证。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2305.11738#S3.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2305.11738#S4.SS1"
          },
          {
            "label": "附录D.1",
            "url": "https://arxiv.org/html/2305.11738#A4.SS1"
          },
          {
            "label": "§1",
            "url": "https://arxiv.org/html/2305.11738#S1"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2305.11738#S4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "对应执行模型读取工具返回的证据，生成批评并修订自己的回答；这里没有另设一个经过训练的提供批评意见的模型模型。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2305.11738#S3.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2305.11738#S4.SS1"
          },
          {
            "label": "附录D.1",
            "url": "https://arxiv.org/html/2305.11738#A4.SS1"
          },
          {
            "label": "§1",
            "url": "https://arxiv.org/html/2305.11738#S1"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2305.11738#S4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "当前输出；模型权重、工具接口与反馈修订流程固定。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2305.11738#S3.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2305.11738#S4.SS1"
          },
          {
            "label": "附录D.1",
            "url": "https://arxiv.org/html/2305.11738#A4.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "问答使用检索证据，数学程序使用代码执行结果，文本安全使用毒性检测工具；这些外部检查帮助模型判断初稿哪里有错。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2305.11738#S3.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2305.11738#S4.SS1"
          },
          {
            "label": "附录D.1",
            "url": "https://arxiv.org/html/2305.11738#A4.SS1"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2305.11738#S4.SS2.SSS0.Px2"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2305.11738#S4.SS3.SSS0.Px2"
          },
          {
            "label": "附录D.1",
            "url": "https://arxiv.org/html/2305.11738#A4.SS1.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "固定 语言模型 先回答，再调用外部工具取得可检验信息并生成批评、修订答案；不同任务接搜索或程序执行等工具。外部检查是关键，不能描述成模型凭感觉自我评价。",
        "sources": [
          {
            "label": "实验任务与问答结果",
            "url": "https://arxiv.org/abs/2305.11738"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "先回答，再通过检索、Python 或毒性检测等工具检查，模型根据外部证据生成批评并修订；与不用工具的自反馈对照。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2305.11738#S3.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2305.11738#S4.SS1"
          },
          {
            "label": "附录D.1",
            "url": "https://arxiv.org/html/2305.11738#A4.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "不训练参数；当前问题及少样本提示是输入。",
        "sources": [
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2305.11738#S4.SS2.SSS0.Px2"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2305.11738#S4.SS3.SSS0.Px2"
          },
          {
            "label": "附录D.1",
            "url": "https://arxiv.org/html/2305.11738#A4.SS1.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "问答读检索证据；数学读 Python 执行；文本毒性读 Perspective API。",
        "sources": [
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2305.11738#S4.SS2.SSS0.Px2"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2305.11738#S4.SS3.SSS0.Px2"
          },
          {
            "label": "附录D.1",
            "url": "https://arxiv.org/html/2305.11738#A4.SS1.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "AmbigNQ、TriviaQA、HotpotQA（需要结合多份资料作答的多跳问答基准）；GSM8K（小学数学应用题基准）、SVAMP、TabMWP 官方 测试集；RealToxicityPrompts 抽 1,000 个非毒性提示。",
        "sources": [
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2305.11738#S4.SS2.SSS0.Px2"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2305.11738#S4.SS3.SSS0.Px2"
          },
          {
            "label": "附录D.1",
            "url": "https://arxiv.org/html/2305.11738#A4.SS1.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "工具证据用于当前题纠错，正式指标另按答案/毒性评分；不是跨题运行框架学习。",
        "sources": [
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2305.11738#S4.SS2.SSS0.Px2"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2305.11738#S4.SS3.SSS0.Px2"
          },
          {
            "label": "附录D.1",
            "url": "https://arxiv.org/html/2305.11738#A4.SS1.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "让模型调用工具取得外部证据，再据此检查并修改当前回答，使批评有可观察的依据。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2305.11738#S3.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2305.11738#S4.SS1"
          },
          {
            "label": "附录D.1",
            "url": "https://arxiv.org/html/2305.11738#A4.SS1"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2305.20050": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "大规模生成器与奖励模型均从基础GPT-4微调；小规模模型结构类似GPT-4，但预训练算力约少200倍，论文没有公布其参数量或可下载型号。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/2305.20050#S2"
          },
          {
            "label": "§2.4",
            "url": "https://arxiv.org/html/2305.20050#S2.SS4"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2305.20050#S4.SS2"
          },
          {
            "label": "§2.2",
            "url": "https://arxiv.org/html/2305.20050#S2.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "人类逐步标注推理正误，固定监督训练程序微调PRM；不是GPT-4自行重写评分规则。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/2305.20050#S2"
          },
          {
            "label": "§2.4",
            "url": "https://arxiv.org/html/2305.20050#S2.SS4"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2305.20050#S4.SS2"
          },
          {
            "label": "§2.2",
            "url": "https://arxiv.org/html/2305.20050#S2.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "评价推理步骤的奖励模型参数；任务求解器不在此过程中持续自改。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/2305.20050#S2"
          },
          {
            "label": "§2.4",
            "url": "https://arxiv.org/html/2305.20050#S2.SS4"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2305.20050#S4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "人类逐步标注数学解答是否正确，形成约 80 万条步骤标签；模型用这些标注学习评审推理过程，标签并非模型自评生成。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/2305.20050#S2"
          },
          {
            "label": "§2.4",
            "url": "https://arxiv.org/html/2305.20050#S2.SS4"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2305.20050#S4.SS2"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2305.20050#A3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "固定生成模型采样多份数学解答，另训练奖励模型按中间步骤评分，再选解答。核心是过程监督的结果检查器（按测试或判分规则检查任务结果），不是让 task agent 自行改工具或执行循环。",
        "sources": [
          {
            "label": "PRM800K 数据构造；附录 C",
            "url": "https://arxiv.org/abs/2305.20050"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "人类标注解题过程的每一步，训练过程奖励模型（PRM）。解题模型生成多个候选后，由它挑选较可靠的解答；对照的结果奖励模型（ORM）只用最终答案是否正确来训练。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/2305.20050#S2"
          },
          {
            "label": "§2.4",
            "url": "https://arxiv.org/html/2305.20050#S2.SS4"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2305.20050#S4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "PRM800K：约 800k 步骤标签、75k 解答、12k 题，包含原 MATH 测试集 的 4,500 题。",
        "sources": [
          {
            "label": "§2.4",
            "url": "https://arxiv.org/html/2305.20050#S2.SS4"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2305.20050#A3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "标注错误步骤提供局部监督；主动学习优先选看似可信的错解。",
        "sources": [
          {
            "label": "§2.4",
            "url": "https://arxiv.org/html/2305.20050#S2.SS4"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2305.20050#A3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "仅用剩余 500 道 MATH 测试集 题。",
        "sources": [
          {
            "label": "§2.4",
            "url": "https://arxiv.org/html/2305.20050#S2.SS4"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2305.20050#A3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "不能声称训练只用原 训练集 或最终测试全 5,000 题；步骤标签不是独立题目数。",
        "sources": [
          {
            "label": "§2.4",
            "url": "https://arxiv.org/html/2305.20050#S2.SS4"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2305.20050#A3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "训练对推理中间步骤判对错的评价模型，并用它帮助挑选解答，研究逐步反馈相对于只看最终答案的价值。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/2305.20050#S2"
          },
          {
            "label": "§2.4",
            "url": "https://arxiv.org/html/2305.20050#S2.SS4"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2305.20050#S4.SS2"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2309.11495": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "主CoVe实验使用基础Llama65B、greedy decoding和提供少量示范的提示提示；指令微调模型是另外的对照。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.11495#S4.SS1.SSS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.11495#S4.SS1.SSS2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.11495#S4.SS1.SSS3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.11495#S4.SS1.SSS4"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2309.11495#S4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "同一Llama65B按固定CoVe流程生成核验问题、独立回答并修订初答，不用另一个更强核验模型。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.11495#S4.SS1.SSS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.11495#S4.SS1.SSS2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.11495#S4.SS1.SSS3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.11495#S4.SS1.SSS4"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2309.11495#S4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "当前回答及临时验证问题；基础模型与验证流程固定。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.11495#S4.SS1.SSS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.11495#S4.SS1.SSS2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.11495#S4.SS1.SSS3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.11495#S4.SS1.SSS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "模型自己提出核验问题、回答这些问题，再修订初稿；核验仍依赖模型自身知识，没有持续接入外部正确性检查程序。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.11495#S4.SS1.SSS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.11495#S4.SS1.SSS2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.11495#S4.SS1.SSS3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.11495#S4.SS1.SSS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "固定四步提示流程：初稿、拟验证问题、独立回答验证问题、据验证结果重写；不改模型或工具系统。",
        "sources": [
          {
            "label": "§4 的四项评测与验证提示",
            "url": "https://arxiv.org/abs/2309.11495"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "把初稿事实拆成验证问题，部分设置隔离原答案影响，再综合检查结果产出最终回复；内部验证仍由模型完成。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.11495#S4.SS1.SSS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.11495#S4.SS1.SSS2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.11495#S4.SS1.SSS3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.11495#S4.SS1.SSS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "无参数训练；验证问题在当前实例内生成。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.11495#S4.SS1.SSS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.11495#S4.SS1.SSS2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.11495#S4.SS1.SSS3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.11495#S4.SS1.SSS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "模型回答自建事实验证问题，不把最终 FactScore 当作内部反馈。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.11495#S4.SS1.SSS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.11495#S4.SS1.SSS2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.11495#S4.SS1.SSS3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.11495#S4.SS1.SSS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "Wikidata 列表 56；Quest/Wiki-Category 列表 55；MultiSpanQA 418；另测人物传记并用 FactScore。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.11495#S4.SS1.SSS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.11495#S4.SS1.SSS2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.11495#S4.SS1.SSS3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.11495#S4.SS1.SSS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "内部自验证与最终外部事实性评分分开；不构成跨任务进化。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.11495#S4.SS1.SSS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.11495#S4.SS1.SSS2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.11495#S4.SS1.SSS3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.11495#S4.SS1.SSS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "先列出需要核实的问题，再尽量独立回答这些问题，最后修订初稿，减少直接沿用原答案错误的倾向。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.11495#S4.SS1.SSS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.11495#S4.SS1.SSS2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.11495#S4.SS1.SSS3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.11495#S4.SS1.SSS4"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2310.01798": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "gpt-3.5-turbo-0613、GPT-4（2023-08-29访问）、gpt-4-1106-preview、Llama-2-70b-chat。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2310.01798#S3.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2310.01798#S3.SS3"
          },
          {
            "label": "§5",
            "url": "https://arxiv.org/html/2310.01798#S5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "由对应同一模型根据自我检查提示重答；另设oracle标签反馈对照，不能把外部正确性信号算作模型自身判断。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2310.01798#S3.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2310.01798#S3.SS3"
          },
          {
            "label": "§5",
            "url": "https://arxiv.org/html/2310.01798#S5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "当前答案和推理；评测比较不同反馈条件下的自纠错效果。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2310.01798#S3.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2310.01798#S3.SS3"
          },
          {
            "label": "§5",
            "url": "https://arxiv.org/html/2310.01798#S5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "无外部反馈。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2310.01798#S3.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2310.01798#S3.SS3"
          },
          {
            "label": "§5",
            "url": "https://arxiv.org/html/2310.01798#S5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "固定推理提示后最多再做两轮自我检查/修订；分别测试仅靠模型自身反馈和获得 oracle 标签的设置。两者反馈信息量不同，不合并称为自主纠错。",
        "sources": [
          {
            "label": "§3.1–3.2、Tables 2–3",
            "url": "https://arxiv.org/abs/2310.01798"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "比较初答与最多两轮纠错；分别控制是否提供 oracle 正确性信息，及是否已在初始提示充分说明要求。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2310.01798#S3.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2310.01798#S3.SS3"
          },
          {
            "label": "§5",
            "url": "https://arxiv.org/html/2310.01798#S5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "没有额外训练。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2310.01798#S3.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "只依靠模型自身能力 条件只给自纠错提示；oracle 条件额外给真实正确性信号。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2310.01798#S3.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "GSM8K（小学数学应用题基准）、CommonsenseQA 开发集 1,221、HotpotQA（需要结合多份资料作答的多跳问答基准） 100；GPT-3.5 用全量，其他模型每集抽 200（HotpotQA 100）。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2310.01798#S3.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "同题重复作答的受控比较；oracle 收益不能归因于纯自反馈。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2310.01798#S3.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "用对照实验检查没有外部反馈的自纠错，发现要求模型重新思考可能无效，也可能把正确答案改错。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2310.01798#S3.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2310.01798#S3.SS3"
          },
          {
            "label": "§5",
            "url": "https://arxiv.org/html/2310.01798#S5"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2310.04406": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "LATS 使用 GPT-3.5 或 GPT-4 生成行动与答案；正文报告 GPT-3.5 的 HotPotQA／WebShop（根据用户要求挑选和购买商品的交互基准） 结果，以及 GPT-4 的 HumanEval（根据函数要求生成代码、用测试检查结果的编程基准） 结果。",
        "sources": [
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2310.04406#S4.SS2"
          },
          {
            "label": "§1",
            "url": "https://arxiv.org/html/2310.04406#S1"
          },
          {
            "label": "附录D.2",
            "url": "https://arxiv.org/html/2310.04406#A4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "固定 MCTS 程序控制搜索，语言模型提供候选行动、价值判断和失败反思；按 GPT-3.5／GPT-4 配置运行，不训练一个新的搜索模型。",
        "sources": [
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2310.04406#S4.SS2"
          },
          {
            "label": "§1",
            "url": "https://arxiv.org/html/2310.04406#S1"
          },
          {
            "label": "附录D.2",
            "url": "https://arxiv.org/html/2310.04406#A4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "当前任务的搜索树与行动轨迹；搜索、价值回传及提示规则固定。",
        "sources": [
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2310.04406#S4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "当前任务的环境奖励、工具返回或可用测试，与模型对候选路径的评价共同指导搜索；失败后另生成反思来尝试其他路径。",
        "sources": [
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2310.04406#S4.SS2"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2310.04406#S5.SS2"
          },
          {
            "label": "附录D.2",
            "url": "https://arxiv.org/html/2310.04406#A4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "在 ReAct（交替进行推理、调用工具和读取结果的执行方式） 的推理—动作—观察接口外加蒙特卡洛树搜索，节点保留候选轨迹，结合模型评分、环境反馈和反思选择分支。要求搜索时能回到相应状态，不等于一般现实环境都能无代价回滚。",
        "sources": [
          {
            "label": "任务定义、实验和 MBPP 设置",
            "url": "https://arxiv.org/abs/2310.04406"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "树搜索扩展动作/答案，环境或自建测试反馈更新节点价值；终局失败生成文字反思用于下一条分支，选择成功或高价值结果。",
        "sources": [
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2310.04406#S4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "没有离线训练；搜索与反思在当前题内进行。",
        "sources": [
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2310.04406#S5.SS2"
          },
          {
            "label": "附录D.2",
            "url": "https://arxiv.org/html/2310.04406#A4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "编程用模型生成的内部测试及编译信息；GPT-3.5 用 6 条内部测试，GPT-4 用 4 条。",
        "sources": [
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2310.04406#S5.SS2"
          },
          {
            "label": "附录D.2",
            "url": "https://arxiv.org/html/2310.04406#A4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "HotpotQA（需要结合多份资料作答的多跳问答基准）、HumanEval（根据函数要求生成代码、用测试检查结果的编程基准） 全 164、MBPP 抽 397、WebShop（根据用户要求挑选和购买商品的交互基准）。代码最终按正式测试计分。",
        "sources": [
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2310.04406#S5.SS2"
          },
          {
            "label": "附录D.2",
            "url": "https://arxiv.org/html/2310.04406#A4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "内部测试不等于官方最终测试；多分支采样及环境反馈是测试时计算预算。",
        "sources": [
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2310.04406#S5.SS2"
          },
          {
            "label": "附录D.2",
            "url": "https://arxiv.org/html/2310.04406#A4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "把可能动作组织成搜索树，用环境奖励和文字反思选择后续分支，搜索所得树主要服务当前任务。",
        "sources": [
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2310.04406#S4.SS2"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2309.03409": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "提示优化中的评分器/任务回答模型为预训练PaLM2-L或text-bison；这里“评分器”指用候选提示答题的模型，准确率再对标准答案计算。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2309.03409#S3.SS2.SSS0.Px1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.03409#S4.SS1"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2309.03409#S5.SS1"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2309.03409#S5.SS2.SSS1"
          },
          {
            "label": "§5.5",
            "url": "https://arxiv.org/html/2309.03409#S5.SS5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "优化器分别用预训练PaLM2-L、PaLM2-L-IT、text-bison、gpt-3.5-turbo、gpt-4，根据候选提示及分数历史产生新提示。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2309.03409#S3.SS2.SSS0.Px1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.03409#S4.SS1"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2309.03409#S5.SS1"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2309.03409#S5.SS2.SSS1"
          },
          {
            "label": "§5.5",
            "url": "https://arxiv.org/html/2309.03409#S5.SS5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "任务提示或自然语言候选方案；评分模型、指标与优化提示模板固定。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2309.03409#S3.SS2.SSS0.Px1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.03409#S4.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "用带参考答案的任务计算评价指标和分数。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2309.03409#S3.SS2.SSS0.Px1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.03409#S4.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "优化器 语言模型 读取过去的候选提示及其分数，提出新提示；任务模型负责用候选提示做题。可以从空字符串开始，改的是提示，不是运行工具或模型参数。",
        "sources": [
          {
            "label": "主要评测数据；BBH Table 7",
            "url": "https://arxiv.org/abs/2309.03409"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "优化器 语言模型 读取历史提示与训练准确率，再提出新提示；最终选择高分候选，评分器 语言模型 与优化器可不同。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2309.03409#S3.SS2.SSS0.Px1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.03409#S4.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "GSM8K（小学数学应用题基准） 约 3.5% 官方训练题用于提示搜索；BBH 每任务 20%。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.03409#S4.SS1"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2309.03409#S5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "同一搜索子集的准确率作为目标，不提供梯度。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.03409#S4.SS1"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2309.03409#S5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "GSM8K（小学数学应用题基准） 官方 1,319 测试集；BBH 23 个任务的剩余 80%。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.03409#S4.SS1"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2309.03409#S5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "训练分数、测试集 分数与 整体 分开；数学优化小实验另测自身目标函数。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.03409#S4.SS1"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2309.03409#S5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "把已有候选及其分数放入提示，让模型继续提出新候选，形成可以用于提示优化的迭代搜索。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2309.03409#S3.SS2.SSS0.Px1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2309.03409#S4.SS1"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2309.16797": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "PaLM 2-L 读取候选任务提示并解题；表 1 的 Promptbreeder 结果使用这一基础模型。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2309.16797#S3.SS1"
          },
          {
            "label": "附录F",
            "url": "https://arxiv.org/html/2309.16797#A6"
          },
          {
            "label": "§1",
            "url": "https://arxiv.org/html/2309.16797#S1"
          },
          {
            "label": "§5",
            "url": "https://arxiv.org/html/2309.16797#S5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "Promptbreeder 用语言模型生成任务提示及变异提示，再按任务正确率选择；实验底层模型为 PaLM 2-L，进化的是提示文本。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2309.16797#S3.SS1"
          },
          {
            "label": "附录F",
            "url": "https://arxiv.org/html/2309.16797#A6"
          },
          {
            "label": "§1",
            "url": "https://arxiv.org/html/2309.16797#S1"
          },
          {
            "label": "§5",
            "url": "https://arxiv.org/html/2309.16797#S5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "任务提示和指导其变异的提示；基础模型与适应度评分规则固定。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2309.16797#S3.SS1"
          },
          {
            "label": "附录F",
            "url": "https://arxiv.org/html/2309.16797#A6"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "训练任务上的正确率等指标，用来比较候选提示词好坏。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2309.16797#S3.SS1"
          },
          {
            "label": "附录F",
            "url": "https://arxiv.org/html/2309.16797#A6"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "维护 50 个个体的提示种群，每个体包含任务提示和产生变异的提示；既修改做题说明，也修改下一代怎样改提示。执行工具和模型权重不变。",
        "sources": [
          {
            "label": "实验设置；附录 I.2",
            "url": "https://arxiv.org/abs/2309.16797"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "共同演化任务提示和生成变异的提示，含直接变异、超变异与从成功推理反推提示；按批量准确率竞争，平台期后选全程最好个体。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2309.16797#S3.SS1"
          },
          {
            "label": "附录F",
            "url": "https://arxiv.org/html/2309.16797#A6"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "GSM8K（小学数学应用题基准）、SVAMP、MultiArith、AddSub、AQuA-RAT、SingleEQ 等训练题，每次随机 100 题计算适应度。",
        "sources": [
          {
            "label": "附录J.2",
            "url": "https://arxiv.org/html/2309.16797#A10.SS2"
          },
          {
            "label": "附录L",
            "url": "https://arxiv.org/html/2309.16797#A12"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "训练批次准确率用于选择，种群规模 50；100 是批量而非训练总量。",
        "sources": [
          {
            "label": "附录J.2",
            "url": "https://arxiv.org/html/2309.16797#A10.SS2"
          },
          {
            "label": "附录L",
            "url": "https://arxiv.org/html/2309.16797#A12"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "各任务 测试集；无官方划分的 MultiArith、AddSub、SingleEQ、SVAMP 预先均分两半。",
        "sources": [
          {
            "label": "附录J.2",
            "url": "https://arxiv.org/html/2309.16797#A10.SS2"
          },
          {
            "label": "附录L",
            "url": "https://arxiv.org/html/2309.16797#A12"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "最终提示按训练表现选再测 测试集，不另把重复适应度批次当验证集。",
        "sources": [
          {
            "label": "附录J.2",
            "url": "https://arxiv.org/html/2309.16797#A10.SS2"
          },
          {
            "label": "附录L",
            "url": "https://arxiv.org/html/2309.16797#A12"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "同时进化任务提示和指导如何变异任务提示的文字指令，让产生修改的规则也成为可更新对象。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2309.16797#S3.SS1"
          },
          {
            "label": "附录F",
            "url": "https://arxiv.org/html/2309.16797#A6"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2310.03714": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "提示编译实验由 GPT-3.5 或 Llama2-13B-Chat 执行编译后的程序；参数微调实验另由 T5-Large（770M）执行。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2310.03714#S3.SS3"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2310.03714#S4.SS0.SSS0.Px2"
          },
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2310.03714#S3"
          },
          {
            "label": "§7",
            "url": "https://arxiv.org/html/2310.03714#S7.SS0.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "DSPy 的 提示优化器 运行教师程序、筛选示例并编译提示；教师可以是同一模型的程序。T5-Large 的多跳检索微调明确使用两个 Llama2-13B-Chat 多跳程序组成的教师集成。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2310.03714#S3.SS3"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2310.03714#S4.SS0.SSS0.Px2"
          },
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2310.03714#S3"
          },
          {
            "label": "§7",
            "url": "https://arxiv.org/html/2310.03714#S7.SS0.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "提示、示例与模块配置；参数微调设置还会更新执行模型。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2310.03714#S3.SS3"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2310.03714#S4.SS0.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "由使用者定义任务评分指标，结合带标签示例比较程序输出；优化器据此选择提示和示例，部分分支也训练模型参数。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2310.03714#S3.SS3"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2310.03714#S4.SS0.SSS0.Px2"
          },
          {
            "label": "§6",
            "url": "https://arxiv.org/html/2310.03714#S6"
          },
          {
            "label": "§6",
            "url": "https://arxiv.org/html/2310.03714#S6.SS0.SSS0.Px2"
          },
          {
            "label": "§7",
            "url": "https://arxiv.org/html/2310.03714#S7"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "开发者先定义检索、推理、回答等模块和接口，编译器再为各模块选择/生成示例及提示。基础结构由人给定；例如 HotPotQA 使用 Wikipedia 2017 摘要索引和 ColBERTv2 检索，不是让优化器任意发明所有工具。",
        "sources": [
          {
            "label": "HotPotQA fullwiki 案例与数学实验",
            "url": "https://arxiv.org/abs/2310.03714"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "固定的模块化程序交给提示优化器，用训练示例和任务指标选择提示及示范。部分配置还对模块做参数微调，因此编译后的改善不能一概归为纯提示变化。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2310.03714#S3.SS3"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2310.03714#S4.SS0.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "GSM8K（小学数学应用题基准） 200；HotpotQA（需要结合多份资料作答的多跳问答基准） hard 题 200，用于编译/自举示例。",
        "sources": [
          {
            "label": "§6",
            "url": "https://arxiv.org/html/2310.03714#S6"
          },
          {
            "label": "§6",
            "url": "https://arxiv.org/html/2310.03714#S6.SS0.SSS0.Px2"
          },
          {
            "label": "§7",
            "url": "https://arxiv.org/html/2310.03714#S7"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "各 300 道 开发集；HotpotQA（需要结合多份资料作答的多跳问答基准） 从官方 训练集 内部划分。",
        "sources": [
          {
            "label": "§6",
            "url": "https://arxiv.org/html/2310.03714#S6"
          },
          {
            "label": "§6",
            "url": "https://arxiv.org/html/2310.03714#S6.SS0.SSS0.Px2"
          },
          {
            "label": "§7",
            "url": "https://arxiv.org/html/2310.03714#S7"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "GSM8K（小学数学应用题基准） 1,319；HotpotQA（需要结合多份资料作答的多跳问答基准） 从官方 验证集 抽 1,000，因为正式 测试集 隐藏。",
        "sources": [
          {
            "label": "§6",
            "url": "https://arxiv.org/html/2310.03714#S6"
          },
          {
            "label": "§6",
            "url": "https://arxiv.org/html/2310.03714#S6.SS0.SSS0.Px2"
          },
          {
            "label": "§7",
            "url": "https://arxiv.org/html/2310.03714#S7"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "按用途区分集合；官方 验证集 在此充当最终测试，不是编译时的开发集。",
        "sources": [
          {
            "label": "§6",
            "url": "https://arxiv.org/html/2310.03714#S6"
          },
          {
            "label": "§6",
            "url": "https://arxiv.org/html/2310.03714#S6.SS0.SSS0.Px2"
          },
          {
            "label": "§7",
            "url": "https://arxiv.org/html/2310.03714#S7"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "先用模块描述任务流水线，再自动选择示例和适配各模块提示，减少逐个手工编写提示的工作。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2310.03714#S3.SS3"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2310.03714#S4.SS0.SSS0.Px2"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2310.02304": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "固定 GPT-4 供候选改进程序调用；程序运行和任务效用计算由 Python 环境完成。",
        "sources": [
          {
            "label": "§5.1 Fixed Downstream Task",
            "url": "https://arxiv.org/abs/2310.02304"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "GPT-4 在改进方案的模型或程序的提示和调用规则下生成代码改写；改进后的改进方案的模型或程序可以参与下一轮，GPT-4 参数保持不变。",
        "sources": [
          {
            "label": "§5.1 Fixed Downstream Task",
            "url": "https://arxiv.org/abs/2310.02304"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "代码改进器的程序，以及它优化的下游程序；基础模型、预算和外部效用定义固定。",
        "sources": [
          {
            "label": "§5.1 Fixed Downstream Task",
            "url": "https://arxiv.org/abs/2310.02304"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "执行候选程序后计算效用或评测得分；效用指预先规定的任务目标。",
        "sources": [
          {
            "label": "§5.1 Fixed Downstream Task",
            "url": "https://arxiv.org/abs/2310.02304"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "从一个能调用 语言模型、改写并评分程序的种子改进方案的模型或程序开始；它不仅改下游程序，也用同一机制改自身改进代码。系统提供可执行效用函数，不依赖先证明代码更优。",
        "sources": [
          {
            "label": "§5.1、§5.3、Figure 4",
            "url": "https://arxiv.org/abs/2310.02304"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "改进器生成并执行候选程序，按下游效用选择；再把改进器自身当待优化代码，依据改进后的平均下游收益选择下一代。",
        "sources": [
          {
            "label": "§5.1 Fixed Downstream Task",
            "url": "https://arxiv.org/abs/2310.02304"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "主实验为 10-bit Learning Parity with Noise，自建 20 个实例计算改进器效用；初始解是随机采样程序。",
        "sources": [
          {
            "label": "§5.1 Fixed Downstream Task",
            "url": "https://arxiv.org/abs/2310.02304"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "同一效用定义的 5 份副本估计随机改进器表现，限定运行/调用预算。",
        "sources": [
          {
            "label": "§5.1 Fixed Downstream Task",
            "url": "https://arxiv.org/abs/2310.02304"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "另采 50 个未见 LPN 实例，报告五次独立 STOP 运行的 测试集 meta-utility；另有跨任务迁移。",
        "sources": [
          {
            "label": "§5.1 Fixed Downstream Task",
            "url": "https://arxiv.org/abs/2310.02304"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "20/50 是任务实例划分；改进器表现更好不保证它每代都更擅长自改进。",
        "sources": [
          {
            "label": "§5.1 Fixed Downstream Task",
            "url": "https://arxiv.org/abs/2310.02304"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "把“改进输入程序的程序”本身也作为待改进输入，实际调用它修改自己的实现，形成程序层面的自我应用。",
        "sources": [
          {
            "label": "§5.1 Fixed Downstream Task",
            "url": "https://arxiv.org/abs/2310.02304"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2406.07496": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "提示优化实验：gpt-3.5-turbo-0125执行推理；逐题解答改进实验以GPT-4o为基础。其他科学实验还包含非语言模型计算组件。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2406.07496#S3.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2406.07496#S3.SS3"
          },
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2406.07496#S3.SS5.SSS0.Px1"
          },
          {
            "label": "附录G.3",
            "url": "https://arxiv.org/html/2406.07496#A7.SS3.SSS0.Px2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2406.07496#S3.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "提示优化时由GPT-4o提供反向文本反馈并修改提示，执行者仍为gpt-3.5-turbo-0125；TextGrad负责传递和应用这些反馈。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2406.07496#S3.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2406.07496#S3.SS3"
          },
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2406.07496#S3.SS5.SSS0.Px1"
          },
          {
            "label": "附录G.3",
            "url": "https://arxiv.org/html/2406.07496#A7.SS3.SSS0.Px2"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2406.07496#S3.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "计算图中的提示、代码或其他文本变量；不通过数值梯度训练基础语言模型。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2406.07496#S3.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2406.07496#S3.SS3"
          },
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2406.07496#S3.SS5.SSS0.Px1"
          },
          {
            "label": "附录G.3",
            "url": "https://arxiv.org/html/2406.07496#A7.SS3.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "任务执行器或评分器给出损失和错误，模型把它转成针对不同组件的文字批评，再据此修改上游提示、代码或配置。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2406.07496#S3.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2406.07496#S3.SS3"
          },
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2406.07496#S3.SS5.SSS0.Px1"
          },
          {
            "label": "附录G.3",
            "url": "https://arxiv.org/html/2406.07496#A7.SS3.SSS0.Px2"
          },
          {
            "label": "附录E.1",
            "url": "https://arxiv.org/html/2406.07496#A5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "把可修改文本、模型调用和评估串成计算图，评审 语言模型 沿图给出文字修改建议。这里的“梯度”是自然语言反馈，不是对模型权重求导；不同应用有不同起始程序。",
        "sources": [
          {
            "label": "提示优化数据；GPQA/MMLU 任务说明",
            "url": "https://arxiv.org/abs/2406.07496"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "语言模型 把最终损失转成针对上游文本变量的批评，沿计算图传回，再据批评更新提示/代码/数值配置；实际执行器提供可检验结果。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2406.07496#S3.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2406.07496#S3.SS3"
          },
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2406.07496#S3.SS5.SSS0.Px1"
          },
          {
            "label": "附录G.3",
            "url": "https://arxiv.org/html/2406.07496#A7.SS3.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "提示优化：BBH Word Sorting/Object Counting 各 50，GSM8K（小学数学应用题基准） 200。其他应用直接优化当前实例。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2406.07496#S3.SS3"
          },
          {
            "label": "附录E.1",
            "url": "https://arxiv.org/html/2406.07496#A5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "对应 验证集 为 BBH 各 100、GSM8K（小学数学应用题基准） 300；代码用本地测试，放疗用 matRad 计划与临床约束。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2406.07496#S3.SS3"
          },
          {
            "label": "附录E.1",
            "url": "https://arxiv.org/html/2406.07496#A5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "BBH 各 100、GSM8K（小学数学应用题基准） 1,319；另有 GPQA/MMLU 回答、LeetCode Hard 代码及科学设计实验。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2406.07496#S3.SS3"
          },
          {
            "label": "附录E.1",
            "url": "https://arxiv.org/html/2406.07496#A5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "训练提示的三段划分与单实例优化不同，不能全篇套用同一 训练／测试。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2406.07496#S3.SS3"
          },
          {
            "label": "附录E.1",
            "url": "https://arxiv.org/html/2406.07496#A5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "沿系统各变量的依赖关系传递文字批评，指出哪一处输入或提示该调整；“梯度”指反馈传递的类比。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2406.07496#S3.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2406.07496#S3.SS3"
          },
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2406.07496#S3.SS5.SSS0.Px1"
          },
          {
            "label": "附录G.3",
            "url": "https://arxiv.org/html/2406.07496#A7.SS3.SSS0.Px2"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2410.10762": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "主执行配置包括GPT-4o-mini-0718、DeepSeek-V2.5、GPT-4o-0513、Claude3.5-Sonnet-0620。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2410.10762#S4"
          },
          {
            "label": "附录A.4",
            "url": "https://arxiv.org/html/2410.10762#A1.SS4"
          },
          {
            "label": "附录A.6",
            "url": "https://arxiv.org/html/2410.10762#A1.SS6"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2410.10762#S5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "Claude3.5 Sonnet作为优化语言模型修改工作流；MCTS固定负责选择要扩展的节点，执行模型与优化模型分开。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2410.10762#S4"
          },
          {
            "label": "附录A.4",
            "url": "https://arxiv.org/html/2410.10762#A1.SS4"
          },
          {
            "label": "附录A.6",
            "url": "https://arxiv.org/html/2410.10762#A1.SS6"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2410.10762#S5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "工作流代码、节点提示、操作模块与连接关系。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2410.10762#S4"
          },
          {
            "label": "附录A.4",
            "url": "https://arxiv.org/html/2410.10762#A1.SS4"
          },
          {
            "label": "附录A.6",
            "url": "https://arxiv.org/html/2410.10762#A1.SS6"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "QA 的 F1（同时考虑找出的内容有多少正确、应找出的内容找到了多少；匹配对象看当前任务）、数学 solve rate、代码 pass@1（单次尝试完成任务的比例）。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2410.10762#S4"
          },
          {
            "label": "附录A.4",
            "url": "https://arxiv.org/html/2410.10762#A1.SS4"
          },
          {
            "label": "附录A.6",
            "url": "https://arxiv.org/html/2410.10762#A1.SS6"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "从预留节点与操作接口的模板工作流开始。节点表示执行步骤，操作是可复用的调用或处理模块；优化器补全函数并修改节点、提示和连接，起点已有这些模块和接口。",
        "sources": [
          {
            "label": "搜索设置；附录 A.6 算法",
            "url": "https://arxiv.org/abs/2410.10762"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "选择一条已有工作流程，读取其修改历史、成败记录以及预测和期望输出。修改流程代码、节点提示或连接，执行候选获得验证分数，再把结果用于决定下一条搜索分支。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2410.10762#S4"
          },
          {
            "label": "附录A.4",
            "url": "https://arxiv.org/html/2410.10762#A1.SS4"
          },
          {
            "label": "附录A.6",
            "url": "https://arxiv.org/html/2410.10762#A1.SS6"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "不训练参数。GSM8K（小学数学应用题基准）、HumanEval（根据函数要求生成代码、用测试检查结果的编程基准）、MBPP，以及 HotpotQA/DROP 各抽 1,000、MATH 四类难度5题共617，供工作流实验。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2410.10762#S4"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2410.10762#S5.SS1"
          },
          {
            "label": "附录A.4",
            "url": "https://arxiv.org/html/2410.10762#A1.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "每套随机取 20% 验证集；初始模板跑五次后选高波动题驱动搜索。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2410.10762#S4"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2410.10762#S5.SS1"
          },
          {
            "label": "附录A.4",
            "url": "https://arxiv.org/html/2410.10762#A1.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "各套剩余 80%。代码 Test operator 仅用公开测试，MBPP 用每题第一条测试作公开输入。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2410.10762#S4"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2410.10762#S5.SS1"
          },
          {
            "label": "附录A.4",
            "url": "https://arxiv.org/html/2410.10762#A1.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "正文定义 20% validation/80% 测试集；算法注释误写后者 训练，按正文解释并保留冲突。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2410.10762#S4"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2410.10762#S5.SS1"
          },
          {
            "label": "附录A.4",
            "url": "https://arxiv.org/html/2410.10762#A1.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "搜索可执行工作流程中的节点、连接和操作，能够改变解题步骤如何组织，而非仅替换一句提示。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2410.10762#S4"
          },
          {
            "label": "附录A.4",
            "url": "https://arxiv.org/html/2410.10762#A1.SS4"
          },
          {
            "label": "附录A.6",
            "url": "https://arxiv.org/html/2410.10762#A1.SS6"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2507.03616": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "EvoAgentX为可配置框架，没有唯一固定执行模型。附录A.3的HumanEval/AFlow示例明确使用GPT-4o-mini。",
        "sources": [
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2507.03616#S3.SS5"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2507.03616#S4"
          },
          {
            "label": "附录A.3",
            "url": "https://arxiv.org/html/2507.03616#A1.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "框架统一调度TextGrad/AFlow/MIPRO；附录A.3示例由Claude3.5-Sonnet-20240620优化、GPT-4o-mini执行。这是示例配置，不能推广为所有实验。",
        "sources": [
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2507.03616#S3.SS5"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2507.03616#S4"
          },
          {
            "label": "附录A.3",
            "url": "https://arxiv.org/html/2507.03616#A1.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "agent 提示、工具配置和工作流结构，具体取决于接入的优化算法。",
        "sources": [
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2507.03616#S3.SS5"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2507.03616#S4"
          },
          {
            "label": "附录A.3",
            "url": "https://arxiv.org/html/2507.03616#A1.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "反馈由任务和优化器组合决定：问答比较答案，代码运行测试，数学检查解答；TextGrad 等方法再把执行信息用于文字批评或候选比较。",
        "sources": [
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2507.03616#S3.SS5"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2507.03616#S4"
          },
          {
            "label": "附录A.3",
            "url": "https://arxiv.org/html/2507.03616#A1.SS3"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2507.03616#S4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "五层模块化框架：模型/工具组件、task agent、工作流、进化优化器和评估。支持接入已有工作流；对 Open Deep Research、OWL 的优化从这些已有 task agent 出发，不能都描述为空白模板。",
        "sources": [
          {
            "label": "框架层次、Table 1、GAIA 实验",
            "url": "https://arxiv.org/abs/2507.03616"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "平台统一工作流表示、执行和评估，再调用 TextGrad、AFlow 或 MIPRO 等优化器修改提示或流程结构。每种优化器使用相应任务指标和执行反馈比较候选，具体组合见反馈表。",
        "sources": [
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2507.03616#S3.SS5"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2507.03616#S4"
          },
          {
            "label": "附录A.3",
            "url": "https://arxiv.org/html/2507.03616#A1.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "算法实验使用代码/问答等基准支持的搜索数据；应用实验优化 Open Deep Research 与 OWL。",
        "sources": [
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2507.03616#S3.SS5"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2507.03616#S4"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2507.03616#S4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "任务输出与指标送给所选优化器。Table 1 是框架支持的数据规模，不表示每次全量使用。",
        "sources": [
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2507.03616#S3.SS5"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2507.03616#S4"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2507.03616#S4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "算法部分涉及 HotpotQA（需要结合多份资料作答的多跳问答基准）、MBPP、MATH 等；应用部分报告 GAIA（需要检索、推理和使用工具的通用助理任务基准） 上的优化前后表现。",
        "sources": [
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2507.03616#S3.SS5"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2507.03616#S4"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2507.03616#S4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "论文框架支持 训练／开发／测试 不等于每个应用都给出独立测试证据；GAIA（需要检索、推理和使用工具的通用助理任务基准） 应按优化前后应用对照阅读。",
        "sources": [
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2507.03616#S3.SS5"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2507.03616#S4"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2507.03616#S4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "把提示、工具配置和工作流程结构放进统一优化框架，并允许替换优化器，主要贡献是可组合的系统集成。",
        "sources": [
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2507.03616#S3.SS5"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2507.03616#S4"
          },
          {
            "label": "附录A.3",
            "url": "https://arxiv.org/html/2507.03616#A1.SS3"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2509.19349": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "程序优化任务运行候选程序；AIME 运行框架实验由 GPT-4.1-nano 在候选结构下答题，迁移测试另用 GPT-4.1-mini、GPT-4.1 和 o4-mini。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2509.19349#S3.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2509.19349#S3.SS3"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2509.19349#S4.SS2.SSS0.Px1"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2509.19349#S4.SS2.SSS0.Px2"
          },
          {
            "label": "附录B.4",
            "url": "https://arxiv.org/html/2509.19349#A2.SS4.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "固定进化控制器选择父代与模型，再让语言模型改写程序。模型池随实验设置变化：MoE 负载均衡实验明确使用 GPT-4.1、Gemini-2.5-Pro、Claude-Sonnet-4；不能将它们直接当作 AIME 的答题模型。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2509.19349#S3.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2509.19349#S3.SS3"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2509.19349#S4.SS2.SSS0.Px1"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2509.19349#S4.SS2.SSS0.Px2"
          },
          {
            "label": "附录B.4",
            "url": "https://arxiv.org/html/2509.19349#A2.SS4.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "候选程序、科研代码或特定任务的运行框架；进化引擎和外部评分规则固定。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2509.19349#S3.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2509.19349#S3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "运行候选程序后按任务目标评分；采样时也考虑新颖性，以避免只探索相似方案。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2509.19349#S3.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2509.19349#S3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "程序种群/档案加可执行评估器，语言模型 提议代码变化，系统管理采样和选择；每个应用给初始程序与目标函数。MoE 实验改的是训练用损失函数代码，训练模型只是评价候选损失的一部分。",
        "sources": [
          {
            "label": "MoE 实验；附录 B.4、Table 4",
            "url": "https://arxiv.org/abs/2509.19349"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "岛屿档案保存优质程序，采样父代和灵感程序后让 语言模型 变异；执行真实目标评分，按相对增益调整模型采样概率。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2509.19349#S3.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2509.19349#S3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "MoE 损失搜索：556M 模型在 FineWeb 约 2B 词元 上训练评估候选；另有几何及 ALE-Bench 程序优化。",
        "sources": [
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2509.19349#S4.SS4.SSS0.Px2"
          },
          {
            "label": "附录B.3",
            "url": "https://arxiv.org/html/2509.19349#A2.SS3.SSS0.Px1"
          },
          {
            "label": "附录B.4",
            "url": "https://arxiv.org/html/2509.19349#A2.SS4.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "候选程序的执行有效性与目标值；ALE LITE 10 题以公开测试分数搜索。",
        "sources": [
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2509.19349#S4.SS4.SSS0.Px2"
          },
          {
            "label": "附录B.3",
            "url": "https://arxiv.org/html/2509.19349#A2.SS3.SSS0.Px1"
          },
          {
            "label": "附录B.4",
            "url": "https://arxiv.org/html/2509.19349#A2.SS4.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "ALE 最佳公开候选提交私有测试；MoE 将损失迁移到 2.7B 模型、约 30B FineWeb 词元 再评困惑度及下游。",
        "sources": [
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2509.19349#S4.SS4.SSS0.Px2"
          },
          {
            "label": "附录B.3",
            "url": "https://arxiv.org/html/2509.19349#A2.SS3.SSS0.Px1"
          },
          {
            "label": "附录B.4",
            "url": "https://arxiv.org/html/2509.19349#A2.SS4.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "ALE 另报告私有测试取 top-5 最大值的诊断结果，应与单次提交分开；MoE 是跨规模迁移。",
        "sources": [
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2509.19349#S4.SS4.SSS0.Px2"
          },
          {
            "label": "附录B.3",
            "url": "https://arxiv.org/html/2509.19349#A2.SS3.SSS0.Px1"
          },
          {
            "label": "附录B.4",
            "url": "https://arxiv.org/html/2509.19349#A2.SS4.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "提供维护候选程序、选择修改起点并继续搜索的高效进化系统；框架代码也可作为被优化程序，但不是所有实验都在改 agent 自身。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2509.19349#S3.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2509.19349#S3.SS3"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2305.10250": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "SiliconFriend分别接ChatGPT、ChatGLM（6.2B）和BELLE（由LLaMA7B微调）；ChatGPT在论文中未给具体API快照名。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/2305.10250#S2"
          },
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2305.10250#S3"
          },
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2305.10250#S3.SS0.SSS0.Px2"
          },
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2305.10250#S3.SS0.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "对话摘要/用户画像由所接语言模型生成，遗忘强度由固定规则更新；ChatGLM/BELLE另做心理对话LoRA（只训练少量适配参数），ChatGPT不做该参数训练。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/2305.10250#S2"
          },
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2305.10250#S3"
          },
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2305.10250#S3.SS0.SSS0.Px2"
          },
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2305.10250#S3.SS0.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "长期记忆内容及各条记忆的保留强度。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/2305.10250#S2"
          },
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2305.10250#S3"
          },
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2305.10250#S3.SS0.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "用户交互历史；非任务结果检查器。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/2305.10250#S2"
          },
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2305.10250#S3"
          },
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2305.10250#S3.SS0.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "对话模型外的 MemoryBank 包含存储、检索、更新、事件摘要与用户画像；SiliconFriend 是集成该记忆的陪伴应用。已有长期记忆管理，不是简单无限拼接聊天历史。",
        "sources": [
          {
            "label": "MemoryBank 架构与 SiliconFriend 应用",
            "url": "https://arxiv.org/abs/2305.10250"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "按对话生成事件摘要和画像，通过向量检索取回；按遗忘曲线降低旧记忆强度，被回忆时强化。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/2305.10250#S2"
          },
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2305.10250#S3"
          },
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2305.10250#S3.SS0.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "SiliconFriend 的开源模型先用 3.8 万条网络心理对话做 LoRA（只训练少量适配参数）；MemoryBank 本身从用户对话积累事件和用户画像。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2305.10250#S3.SS0.SSS0.Px1"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2305.10250#S4"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2305.10250#S4.SS2.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "检索与遗忘机制随对话更新；不是按独立验证集分数搜索记忆架构。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2305.10250#S3.SS0.SSS0.Px1"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2305.10250#S4"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2305.10250#S4.SS2.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "ChatGPT 模拟 15 位用户、10 天中英对话；人工编写 194 道回忆题（中英各 97），人工评价检索与回答，另展示真实用户对话案例。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2305.10250#S3.SS0.SSS0.Px1"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2305.10250#S4"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2305.10250#S4.SS2.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "参数适配语料与记忆回忆评测是两套材料；回忆题考察已存入的聊天内容，不是陌生知识的泛化。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2305.10250#S3.SS0.SSS0.Px1"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2305.10250#S4"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2305.10250#S4.SS2.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "为长期对话积累、检索和更新用户记忆，重点服务个性化交互，任务解题能力的自改进不是其主要目标。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/2305.10250#S2"
          },
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2305.10250#S3"
          },
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2305.10250#S3.SS0.SSS0.Px2"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2308.10144": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "评估阶段统一gpt-3.5-turbo-0613，按ReAct（交替进行推理、调用工具和读取结果的执行方式）流程执行任务。",
        "sources": [
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2308.10144#S4.SS4"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2308.10144#S5.SS1"
          },
          {
            "label": "附录D.5",
            "url": "https://arxiv.org/html/2308.10144#A4.SS5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "经验规则抽取用gpt-4-0613；训练经验收集中的Reflexion用gpt-3.5-turbo-0613，超窗口时换16k-0613。因此规则提炼者比最终执行模型更强。",
        "sources": [
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2308.10144#S4.SS4"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2308.10144#S5.SS1"
          },
          {
            "label": "附录D.5",
            "url": "https://arxiv.org/html/2308.10144#A4.SS5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "跨任务的文字经验库与成功示例池；经验抽取和检索机制保持固定。",
        "sources": [
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2308.10144#S4.SS4"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2308.10144#S5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "环境/答案正确性 + 成败 逐步执行记录。",
        "sources": [
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2308.10144#S4.SS4"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2308.10144#S5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "ReAct（交替进行推理、调用工具和读取结果的执行方式） 规划器在训练任务失败后允许 Reflexion 式重试，把成功轨迹与提炼规则保存在经验池；测试题可检索经验，而不是重新执行训练阶段的多次试错。",
        "sources": [
          {
            "label": "实验数据与交叉验证",
            "url": "https://arxiv.org/abs/2308.10144"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "agent 用推理—行动循环完成训练任务，失败时允许反思重试。模型比较成功与失败经历并修订经验规则；测试新题时检索成功示例和规则，不重新执行训练阶段的多轮试错。",
        "sources": [
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2308.10144#S4.SS4"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2308.10144#S5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "HotpotQA（需要结合多份资料作答的多跳问答基准） distractor-dev 100 题、ALFWorld（通过文字动作完成家居物体操作的交互环境） 134 题、WebShop（根据用户要求挑选和购买商品的交互基准） 100 题组成任务池；每次用一半收集成功/失败轨迹。",
        "sources": [
          {
            "label": "附录D.1",
            "url": "https://arxiv.org/html/2308.10144#A4.SS1"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2308.10144#S5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "从成败轨迹对比提炼并增删经验规则；不是在测试题上反复试到成功。",
        "sources": [
          {
            "label": "附录D.1",
            "url": "https://arxiv.org/html/2308.10144#A4.SS1"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2308.10144#S5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "另一半任务评估，并交换两半；论文报告四折均值及标准误。另做 HotpotQA（需要结合多份资料作答的多跳问答基准）→FEVER 知识迁移。",
        "sources": [
          {
            "label": "附录D.1",
            "url": "https://arxiv.org/html/2308.10144#A4.SS1"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2308.10144#S5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "训练与评测按每折区分，不能把任务池总量当成训练量。",
        "sources": [
          {
            "label": "附录D.1",
            "url": "https://arxiv.org/html/2308.10144#A4.SS1"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2308.10144#S5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "从训练任务的多次试错提炼一般规则，并保存成功示例，让新任务的单次执行也能利用这些经验。",
        "sources": [
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2308.10144#S4.SS4"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2308.10144#S5.SS1"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2409.00872": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "AgentBench比较GPT-3.5、GPT-4、Llama2-7B、CodeLlama-7B、Qwen-1.8B及ChatGLM2；具体商用API快照没有在§4.1中展开。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2409.00872#S3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2409.00872#S4.SS1"
          },
          {
            "label": "§4.7",
            "url": "https://arxiv.org/html/2409.00872#S4.SS7"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "检查角色、反思和记忆维护按SAGE固定流程运行；§4.1列出被测基础模型，未给出独立检查角色模型的逐配置对应表，不把它默认成GPT-4教师。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2409.00872#S3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2409.00872#S4.SS1"
          },
          {
            "label": "§4.7",
            "url": "https://arxiv.org/html/2409.00872#S4.SS7"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "记忆内容、保留与裁剪状态，以及当前行为策略。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2409.00872#S3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "检查者模型阅读回答与交互历史，给出批评供助手重试。检查者的意见与基准的最终判分是两个来源，不能自动等同。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2409.00872#S3"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2409.00872#S4"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2409.00872#S4.SS3"
          },
          {
            "label": "§4.5",
            "url": "https://arxiv.org/html/2409.00872#S4.SS5"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2409.00872#A3"
          },
          {
            "label": "§4.3：长文本指标",
            "url": "https://arxiv.org/html/2409.00872#S4.SS3"
          },
          {
            "label": "§4.5：检索问答",
            "url": "https://arxiv.org/html/2409.00872#S4.SS5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "User–助手角色–检查角色 交互配合短期/长期记忆，先执行、检查，再反思和更新记忆；框架含检索与任务拆解，不是只有一句 self-reflection 提示。",
        "sources": [
          {
            "label": "§4.1–4.5 与附录任务比较",
            "url": "https://arxiv.org/abs/2409.00872"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "助手先回答，检查者阅读回答和历史并提出批评；助手据此修改，把反思写入短期或长期记忆，后续使用时按记忆保留规则检索。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2409.00872#S3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "无需额外参数训练；反思与记忆来自当前任务交互。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2409.00872#S4"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2409.00872#S4.SS3"
          },
          {
            "label": "§4.5",
            "url": "https://arxiv.org/html/2409.00872#S4.SS5"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2409.00872#A3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "检查角色 检查回答，助手角色 据反馈重试；MemorySyntax 管理历史信息。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2409.00872#S4"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2409.00872#S4.SS3"
          },
          {
            "label": "§4.5",
            "url": "https://arxiv.org/html/2409.00872#S4.SS5"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2409.00872#A3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "AgentBench 六类任务；LCC、RepoBench-P、HotpotQA（需要结合多份资料作答的多跳问答基准）、TriviaQA 长文本；RAG（先检索相关资料，再把资料交给模型回答） 实验还有 Natural Questions，附录另列 MultiWOZ/ALFWorld。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2409.00872#S4"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2409.00872#S4.SS3"
          },
          {
            "label": "§4.5",
            "url": "https://arxiv.org/html/2409.00872#S4.SS5"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2409.00872#A3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "§4 与附录列出了评测任务，但没有给出统一的进化/验证/测试拆分协议；这些结果不能作为严格留出迁移的证据。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2409.00872#S4"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2409.00872#S4.SS3"
          },
          {
            "label": "§4.5",
            "url": "https://arxiv.org/html/2409.00872#S4.SS5"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2409.00872#A3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "在多轮 agent 中结合反思与考虑遗忘的记忆管理，持续调整保留和使用的经验；主要是预设模块的协同。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2409.00872#S3"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2510.04618": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "主实验DeepSeek-V3.1；跨模型另测GPT-OSS-120B、GPT-5.1、Llama3.3-70B-Instruct。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2510.04618#S2.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2510.04618#S4.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2510.04618#S4.SS1.SSS0.Px1"
          },
          {
            "label": "§4.5",
            "url": "https://arxiv.org/html/2510.04618#S4.SS5"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2510.04618#A1.SS1"
          },
          {
            "label": "附录A.4",
            "url": "https://arxiv.org/html/2510.04618#A1.SS4.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "Generator/Reflector/Curator维护操作指南；默认基础模型为DeepSeek-V3.1。独立反思角色消融比较GPT-OSS-120B、DeepSeek-V3.1-671B、GPT-5.1，不能认为三个角色永远同模型。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2510.04618#S2.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2510.04618#S4.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2510.04618#S4.SS1.SSS0.Px1"
          },
          {
            "label": "§4.5",
            "url": "https://arxiv.org/html/2510.04618#S4.SS5"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2510.04618#A1.SS1"
          },
          {
            "label": "附录A.4",
            "url": "https://arxiv.org/html/2510.04618#A1.SS4.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "结构化上下文与操作手册中的策略条目；生成、反思和整理的外层机制保持固定。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2510.04618#S2.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2510.04618#S4.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2510.04618#S4.SS1.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "AppWorld 可仅用工具执行反馈更新指南；FiNER、Formula、DDXPlus 对照标准答案，BIRD-SQL 在本文由 GPT-4o-mini 评审。离线与在线可见反馈范围不同。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2510.04618#S2.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2510.04618#S4.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2510.04618#S4.SS1.SSS0.Px1"
          },
          {
            "label": "§4.1：Evaluation Metrics",
            "url": "https://arxiv.org/html/2510.04618#S4.SS1.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "固定任务执行器外维护结构化操作指南；生成器执行，反思器提炼经验，整理器用增量改动合并规则，避免每轮全文重写。AppWorld（通过多个应用的程序接口完成日常事务的交互基准） 使用 ReAct（交替进行推理、调用工具和读取结果的执行方式） 等底座，其他领域有各自程序。",
        "sources": [
          {
            "label": "§4.1–4.4",
            "url": "https://arxiv.org/abs/2510.04618"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "生成角色执行任务，反思角色从成败经历中提炼经验，整理角色把经验合并进操作指南。采用局部增删，避免每轮整篇重写导致已有知识丢失。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2510.04618#S2.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2510.04618#S4.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2510.04618#S4.SS1.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "离线：AppWorld（通过多个应用的程序接口完成日常事务的交互基准）、FiNER、Formula、DDXPlus、BIRD-SQL 的原始训练划分生成操作指南。在线：此前测试题的交互经验。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2510.04618#S4.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2510.04618#S4.SS1.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "生成角色 产出轨迹，反思角色 找出成功/失败原因，经验整理角色 局部增删条目，保留有用上下文。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2510.04618#S4.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2510.04618#S4.SS1.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "AppWorld（通过多个应用的程序接口完成日常事务的交互基准） test-normal/test-challenge 报 TGC/SGC；FiNER、Formula、DDXPlus 报准确率；BIRD-SQL 在本文用 GPT-4o-mini 评审。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2510.04618#S4.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2510.04618#S4.SS1.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "离线 训练集→测试集；在线按同一打乱后的 测试集 顺序，先答当前题、再更新上下文，后续题会用到前题经验。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2510.04618#S4.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2510.04618#S4.SS1.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "将长期经验组织为逐条可修改的操作手册，以增量方式增加、修订和合并条目，避免反复整体重写让内容越来越空泛。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2510.04618#S2.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2510.04618#S4.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2510.04618#S4.SS1.SSS0.Px1"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2510.16079": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "主要以 Qwen2.5-3B 执行检索与问答，规模实验另比较 Qwen2.5-0.5B、1.5B；训练后仍由相应的更新模型答题。BGE-M3 只负责经验检索的向量表示。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2510.16079#S3.SS3.SSS0.Px2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2510.16079#S4.SS1.SSS4"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2510.16079#S5.SS1"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2510.16079#A1.SS1.SSS0.Px1"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2510.16079#A1.SS1.SSS0.Px8"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "EvolveR 从执行轨迹中总结经验，并用 GRPO（比较同一任务多次尝试的奖励，用相对好坏更新模型参数的强化学习方法） 更新 Qwen2.5 参数；GPT-4o-mini 是教师模型消融配置，不应写成所有实验都依赖的外部教师。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2510.16079#S3.SS3.SSS0.Px2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2510.16079#S4.SS1.SSS4"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2510.16079#S5.SS1"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2510.16079#A1.SS1.SSS0.Px1"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2510.16079#A1.SS1.SSS0.Px8"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "可复用策略原则库与执行模型的参数。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2510.16079#S3.SS3.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "任务表现，以及执行记录对应的成功或失败结果。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2510.16079#S3.SS3.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "带搜索工具的 task agent，外接可检索原则库；从经历中提炼/筛除原则，并通过训练使策略更会使用经验。外部原则与可训练行为策略共同参与，不能归纳为只改静态提示。",
        "sources": [
          {
            "label": "评估数据与训练生命周期",
            "url": "https://arxiv.org/abs/2510.16079"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "将轨迹压缩为经验原则，检索后指导下一批搜索轨迹，再用 GRPO（比较同一任务多次尝试的奖励，用相对好坏更新模型参数的强化学习方法） 训练有效利用经验的策略。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2510.16079#S3.SS3.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "Natural Questions 与 HotpotQA（需要结合多份资料作答的多跳问答基准） 的训练 split 构建经验库；用经验引导的轨迹做 GRPO（比较同一任务多次尝试的奖励，用相对好坏更新模型参数的强化学习方法）。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2510.16079#S4.SS1.SSS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "离线提炼经验原则，在线检索指导搜索；回答正确性及轨迹格式共同构成奖励。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2510.16079#S4.SS1.SSS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "域内 NQ、HotpotQA（需要结合多份资料作答的多跳问答基准）；仅用于域外评估的 TriviaQA、PopQA、2WikiMultiHopQA、MuSiQue、Bamboogle。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2510.16079#S4.SS1.SSS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "§4.1.1 明确后五集仅用于泛化评估；经验库和参数学习来自前两集训练部分。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2510.16079#S4.SS1.SSS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "将外部经验整理与模型参数的强化学习结合，让经验既能在上下文中复用，也能影响模型自身行为。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2510.16079#S3.SS3.SSS0.Px2"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2512.18746": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "主执行模型GPT-5-mini，配SmolAgent或Flash-Searcher；冻结进化后的记忆架构，再换Kimi K2或DeepSeekV3.2测迁移。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2512.18746#S3.SS3"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2512.18746#S5.SS2"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2512.18746#S5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "主实验meta-evolution operator也使用GPT-5-mini，生成和选择记忆设计；模型与执行角色相同，但调用职责分开。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2512.18746#S3.SS3"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2512.18746#S5.SS2"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2512.18746#S5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "经验记忆内容，以及编码、存储、检索和管理记忆的程序；外层候选选择与评测协议保持固定。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2512.18746#S3.SS3"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2512.18746#S5.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "执行是否成功，以及生成文本量、查询次数和重放等开销。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2512.18746#S3.SS3"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2512.18746#S5.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "在 EvolveLab 中演化记忆的编码、更新、检索和组织实现；每次评价候选架构时从空经验库开始。接入 SmolAgent、Flash-Searcher，并另测 CK-Pro 和 OWL，不是只改已有笔记的文字。",
        "sources": [
          {
            "label": "记忆架构搜索；Agent Framework 与迁移实验",
            "url": "https://arxiv.org/abs/2512.18746"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "外层进化记忆系统代码，内层用该代码积累和检索经验；EvolveLab 支持在线和离线运行。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2512.18746#S3.SS3"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2512.18746#S5.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "TaskCraft 抽 300 题作为工作子集，其中 120 题分三轮做记忆架构进化（每轮40）。GAIA（需要检索、推理和使用工具的通用助理任务基准） 设置另用 Level-1 加 67 条 TaskCraft。",
        "sources": [
          {
            "label": "§9.1",
            "url": "https://arxiv.org/html/2512.18746#S9.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "执行候选记忆代码，根据轨迹和成绩改造编码、存储、检索与管理模块。",
        "sources": [
          {
            "label": "§9.1",
            "url": "https://arxiv.org/html/2512.18746#S9.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "GAIA（需要检索、推理和使用工具的通用助理任务基准） 165 题；WebWalkerQA 抽 170 题；xBench-DeepSearch 100 题；另报告 TaskCraft。",
        "sources": [
          {
            "label": "§9.1",
            "url": "https://arxiv.org/html/2512.18746#S9.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "WebWalkerQA/xBench 使用 TaskCraft 上进化出的固定架构。GAIA（需要检索、推理和使用工具的通用助理任务基准） Level-1 参与对应架构进化，不能把全部 GAIA 称为未见测试；架构固定后记忆内容仍可更新。",
        "sources": [
          {
            "label": "§9.1",
            "url": "https://arxiv.org/html/2512.18746#S9.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "把编码、存储、检索等记忆管理的机制与代码纳入搜索，改变系统怎样记忆；外层搜索和选版本程序保持固定。",
        "sources": [
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2512.18746#S3.SS3"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2512.18746#S5.SS2"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2602.07755": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "设计学习时GPT-5-nano执行；最终另换GPT-5-mini测迁移。测试时记忆内部语言模型统一GPT-4o-mini，embedding为text-embedding-3-small。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2602.07755#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2602.07755#S3.SS3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2602.07755#S4.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "GPT-5 Meta Agent编写记忆设计；可调用GPT-4o-mini、GPT-4.1和text-embedding-3-small构建内部流程。它不同于执行者GPT-5-nano。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2602.07755#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2602.07755#S3.SS3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2602.07755#S4.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "记忆数据结构、更新和检索代码，以及运行时积累的记忆内容。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2602.07755#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2602.07755#S3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "先从一组任务收集记忆，再冻结记忆内容，在另一组任务中检索使用；实际任务成功率用于比较记忆设计。论文另外比较记忆量及更新模式的影响。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2602.07755#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2602.07755#S3.SS3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2602.07755#S4.SS1"
          },
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2602.07755#A2.SS1"
          },
          {
            "label": "附录B.3",
            "url": "https://arxiv.org/html/2602.07755#A2.SS3"
          },
          {
            "label": "附录B.4",
            "url": "https://arxiv.org/html/2602.07755#A2.SS4"
          },
          {
            "label": "附录 A.2：静态记忆评估",
            "url": "https://arxiv.org/html/2602.07755#A1.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "固定任务交互 task agent，外接满足接口的候选记忆设计；meta-agent（负责设计或修改 task agent）读分层抽样的成功/失败日志来改记忆程序。每个设计经历积累与部署阶段，不是把全部日志一并塞入提示。",
        "sources": [
          {
            "label": "附录 B.3–B.4",
            "url": "https://arxiv.org/abs/2602.07755"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "Meta Agent 从代码档案采样记忆设计，规划和实现修改；运行失败可反思修复最多三次，按部署成功率保存与选择。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2602.07755#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2602.07755#S3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "ALFWorld（通过文字动作完成家居物体操作的交互环境） 训练集 前30题；BALROG 的 TextWorld/Baba Is AI 各取一半；MiniHack 取30%。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2602.07755#S4.SS1"
          },
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2602.07755#A2.SS1"
          },
          {
            "label": "附录B.3",
            "url": "https://arxiv.org/html/2602.07755#A2.SS3"
          },
          {
            "label": "附录B.4",
            "url": "https://arxiv.org/html/2602.07755#A2.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "学习集再平分：前半收集记忆，后半部署评分；后半运行三次，按平均成功率选最佳设计。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2602.07755#S4.SS1"
          },
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2602.07755#A2.SS1"
          },
          {
            "label": "附录B.3",
            "url": "https://arxiv.org/html/2602.07755#A2.SS3"
          },
          {
            "label": "附录B.4",
            "url": "https://arxiv.org/html/2602.07755#A2.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "TextWorld/Baba Is AI 剩余一半、MiniHack 剩余70%；测试材料也先收集后部署。ALFWorld（通过文字动作完成家居物体操作的交互环境） 另比较静态与动态记忆模式。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2602.07755#S4.SS1"
          },
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2602.07755#A2.SS1"
          },
          {
            "label": "附录B.3",
            "url": "https://arxiv.org/html/2602.07755#A2.SS3"
          },
          {
            "label": "附录B.4",
            "url": "https://arxiv.org/html/2602.07755#A2.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "记忆设计学习与最终测试分开；每套材料内部又有收集/部署两阶段，不能把收集题算作计分部署题。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2602.07755#S4.SS1"
          },
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2602.07755#A2.SS1"
          },
          {
            "label": "附录B.3",
            "url": "https://arxiv.org/html/2602.07755#A2.SS3"
          },
          {
            "label": "附录B.4",
            "url": "https://arxiv.org/html/2602.07755#A2.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "搜索记忆管理程序，再检查它生成的记忆能否帮助另一批任务，区分记忆机制本身和某份记忆内容的价值。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2602.07755#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2602.07755#S3.SS3"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2603.18620": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "主执行者Qwen3-4B-Instruct，权重固定；外部指令由单独训练的编辑策略更新。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2603.18620#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2603.18620#S3.SS3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2603.18620#S4.SS1.SSS0.Px1"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2603.18620#S4.SS3.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "编辑策略同样从Qwen3-4B-Instruct开始，但经过LSE强化训练；主执行模型不随编辑策略一起训练。迁移时固定这份LSE编辑策略指导其他执行模型。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2603.18620#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2603.18620#S3.SS3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2603.18620#S4.SS1.SSS0.Px1"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2603.18620#S4.SS3.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "训练时更新模型参数以学会上下文编辑；部署时持续修改外部上下文。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2603.18620#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2603.18620#S3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "编辑者能看到已做题的题目、模型输出、标准答案和逐题正确性；比较修改上下文前后任务表现的增量，训练怎样改上下文。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2603.18620#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2603.18620#S3.SS3"
          },
          {
            "label": "§3.2：可见反馈",
            "url": "https://arxiv.org/html/2603.18620#S3.SS2"
          },
          {
            "label": "附录 A：评价协议",
            "url": "https://arxiv.org/html/2603.18620#A1.SS0.SSS0.Px3"
          },
          {
            "label": "§4.1：任务与指标",
            "url": "https://arxiv.org/html/2603.18620#S4.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "Qwen3-4B-Instruct执行任务，另一自进化策略改指令；外围代码固定采样、评分及UCB树搜索。SQL任务执行查询检验答案，QA为四选一回答。",
        "sources": [
          {
            "label": "实验设置、Table 4",
            "url": "https://arxiv.org/abs/2603.18620"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "固定任务执行模型，训练另一个编辑策略修改它的提示。奖励衡量修改前后的表现增量；部署时在不同修改分支中搜索，必要时回到较好的旧版本，减少坏修改累积。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2603.18620#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2603.18620#S3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "SQL 编辑策略在 BIRD 训练集 学习；QA 编辑策略在 SuperGPQA 学习。每领域200次生成运行×20轮，约4000个树节点供 强化学习（根据奖励调整模型行为） 采样。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2603.18620#S4.SS1.SSS0.Px2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2603.18620#S4.SS1.SSS0.Px4"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2603.18620#A1.SS0.SSS0.Px1"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2603.18620#A1.SS0.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "部署进化每轮抽10题；每领域固定50题作选路径评分集，每题生成8次，运行25轮。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2603.18620#S4.SS1.SSS0.Px2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2603.18620#S4.SS1.SSS0.Px4"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2603.18620#A1.SS0.SSS0.Px1"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2603.18620#A1.SS0.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "BIRD Mini-Dev 的5个数据库、MMLU-Redux 的10个学科；报告进化中最佳的50题评分集成绩。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2603.18620#S4.SS1.SSS0.Px2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2603.18620#S4.SS1.SSS0.Px4"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2603.18620#A1.SS0.SSS0.Px1"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2603.18620#A1.SS0.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "这里的 holdout 会被反复打分并用于树搜索和挑版本，因此报告的是适应后最佳验证表现，不能称最终不可见测试。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2603.18620#S4.SS1.SSS0.Px2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2603.18620#S4.SS1.SSS0.Px4"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2603.18620#A1.SS0.SSS0.Px1"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2603.18620#A1.SS0.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "专门训练修改上下文的模型，用修改后在后续任务上的表现作为奖励，学习怎样写出未来会有用的经验。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2603.18620#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2603.18620#S3.SS3"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2402.17574": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "GPT-3.5-Turbo-0613、GPT4-0613、Llama2-Chat-70B和Qwen-72B构成游戏 task agent。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2402.17574#S3"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2402.17574#A1.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "对应游戏 task agent 的语言模型执行策略级反思并改提示；固定DFS程序按牌局收益搜索，不另训练一个策略修改模型。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2402.17574#S3"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2402.17574#A1.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "自然语言表示的信念与整体行为策略。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2402.17574#S3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "游戏收益、逐步执行记录，以及对文字信念的检查；策略效果用新的游戏对局评估。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2402.17574#S3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "游戏 task agent 在环境中行动并更新关于对手与策略的文字信念，反思针对整套策略而非单步动作；模型权重固定，策略经验随对局变化。",
        "sources": [
          {
            "label": "游戏评估指标；附录 B1",
            "url": "https://arxiv.org/abs/2402.17574"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "记录自身策略与对游戏环境的判断，从整局失败提炼跨局可用的指导，再通过深度优先搜索比较候选提示带来的筹码收益。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2402.17574#S3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "德州扑克先抽500组牌，挑出167组困难失败牌用于学习。",
        "sources": [
          {
            "label": "附录A.4",
            "url": "https://arxiv.org/html/2402.17574#A1.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "另20组牌作策略开发集；反思错误信念后用 DFS 搜索提示策略。",
        "sources": [
          {
            "label": "附录A.4",
            "url": "https://arxiv.org/html/2402.17574#A1.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "另抽100组新牌，交换四位玩家的手牌和位置形成每组16种安排，共1600局，以平均筹码评价。",
        "sources": [
          {
            "label": "附录A.4",
            "url": "https://arxiv.org/html/2402.17574#A1.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "1600局来自100组牌的排列，不是1600组独立采样手牌。",
        "sources": [
          {
            "label": "附录A.4",
            "url": "https://arxiv.org/html/2402.17574#A1.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "从执行经历调整对环境的判断和较长期的行动策略，再在新的执行轨迹上评价，而不局限于纠正某一个动作。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2402.17574#S3"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2510.23601": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "管理角色为Claude Sonnet4，负责协调；Web Agent为GPT-4.1，负责检索和网页交互；MCP（让 agent 以统一接口连接外部工具的协议）检索embedding用text-embedding-3-large。",
        "sources": [
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2510.23601#S3.SS4"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2510.23601#S4.SS1.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "Manager/generator沿Alita流程把成功执行抽象成MCP（让 agent 以统一接口连接外部工具的协议）工具，并按相似度选择复用；§4.1的角色配对是Claude Sonnet4与GPT-4.1，不能笼统写“同一 task agent”。",
        "sources": [
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2510.23601#S3.SS4"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2510.23601#S4.SS1.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "可检索并执行的 MCP（让 agent 以统一接口连接外部工具的协议） 工具库。",
        "sources": [
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2510.23601#S3.SS4"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2510.23601#S4.SS1.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "成功执行的记录、任务是否通过，以及实际执行证据。",
        "sources": [
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2510.23601#S3.SS4"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2510.23601#S4.SS1.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "先由管理 agent 把成功执行过程整理成通用工具：把写死的输入改为参数，去掉题目专属信息，统一调用接口。这些工具组成 MCP Box（按统一工具协议连接的工具库）；后续 agent 检索工具，通过生成并运行代码完成任务。",
        "sources": [
          {
            "label": "MCP 生成流程与实验数据",
            "url": "https://arxiv.org/abs/2510.23601"
          },
          {
            "label": "CodeAct 原论文：可执行代码动作",
            "url": "https://arxiv.org/abs/2402.01030"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "Alita 的 管理角色（Claude Sonnet 4）协调、Web Agent（GPT-4.1）检索；从成功执行沉淀 MCP（让 agent 以统一接口连接外部工具的协议），再检索组装专门 task agent。",
        "sources": [
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2510.23601#S3.SS4"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2510.23601#S4.SS1.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "Master task agent 完成目标任务，把可复用工具及调用经验整理成 MCP（让 agent 以统一接口连接外部工具的协议） box；比较单次与三次执行构造。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2510.23601#S4.SS1.SSS0.Px2"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2510.23601#S4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "根据新任务与 MCP（让 agent 以统一接口连接外部工具的协议） 描述的 embedding 相似度筛选，实验阈值0.7；不是更新模型参数。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2510.23601#S4.SS1.SSS0.Px2"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2510.23601#S4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "GAIA（需要检索、推理和使用工具的通用助理任务基准） 完整 验证集；PathVQA 随机100题；HLE（涵盖多个学科高难度问题的 Humanity’s Last Exam 基准） 随机100题；报告准确率及 词元 开销。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2510.23601#S4.SS1.SSS0.Px2"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2510.23601#S4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "§4.1 指明评测抽样，但没有声明 MCP（让 agent 以统一接口连接外部工具的协议） 构造题与报告题互斥；不能据此称严格未见迁移。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2510.23601#S4.SS1.SSS0.Px2"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2510.23601#S4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "把成功经验封装为可移植工具，采用统一工具连接协议供后续任务调用，让技能更容易跨环境复用。",
        "sources": [
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2510.23601#S3.SS4"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2510.23601#S4.SS1.SSS0.Px1"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2603.13131": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "Minecraft 由高层语言模型规划、STEVE-1 执行底层动作。§4.3 的受控实验明确使用 Qwen3.5-Plus 规划器，并固定同一个 STEVE-1。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2603.13131#S3.SS2"
          },
          {
            "label": "附录C.2",
            "url": "https://arxiv.org/html/2603.13131#A3.SS2"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2603.13131#S3.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2603.13131#S4.SS1.SSS0.Px2"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2603.13131#S4.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "Monitor 提取执行状态；Inducer 将成功与失败整理成技能和补救办法；经验整理角色 筛选、合并知识；Adaptor 修补未完成的计划。§3 的角色说明没有分别给出这些模块的模型型号，不能仅凭规划器型号将它们全部写成 Qwen3.5-Plus。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2603.13131#S3.SS2"
          },
          {
            "label": "附录C.2",
            "url": "https://arxiv.org/html/2603.13131#A3.SS2"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2603.13131#S3.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2603.13131#S4.SS1.SSS0.Px2"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2603.13131#S4.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "成功技能、失败补救与行为约束组成的知识库。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2603.13131#S3.SS2"
          },
          {
            "label": "附录C.2",
            "url": "https://arxiv.org/html/2603.13131#A3.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "比较动作前后的背包物品和环境状态，检测是否取得进展、是否停滞，并标记失败类型；这些具体证据用于生成技能或补救规则。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2603.13131#S3.SS2"
          },
          {
            "label": "附录C.2",
            "url": "https://arxiv.org/html/2603.13131#A3.SS2"
          },
          {
            "label": "附录 C.2：Monitor 算法",
            "url": "https://arxiv.org/html/2603.13131#A3.SS2"
          },
          {
            "label": "§3.2：知识生成",
            "url": "https://arxiv.org/html/2603.13131#S3.SS2"
          },
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2603.13131#A2.SS1"
          },
          {
            "label": "附录D.4",
            "url": "https://arxiv.org/html/2603.13131#A4.SS4"
          },
          {
            "label": "附录D.5",
            "url": "https://arxiv.org/html/2603.13131#A4.SS5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "固定上层 planner 和 STEVE-1 低层执行策略，在 Minecraft 接口上维护技能知识与失败补救知识两类库；检索预算和评估时模型调用预算受控。更新的是外部知识，不是重训低层动作模型。",
        "sources": [
          {
            "label": "知识积累曲线；附录 D.4–D.5",
            "url": "https://arxiv.org/abs/2603.13131"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "规划模型和底层行动模型 STEVE-1 保持固定。系统从环境反馈中总结成功技能与失败补救规则，检查后入库；遇到未完成计划时检索这些知识作局部修复。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2603.13131#S3.SS2"
          },
          {
            "label": "附录C.2",
            "url": "https://arxiv.org/html/2603.13131#A3.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "Minecraft 交互积累技能与故障补救知识；知识积累实验在0/50/100/200/400 episodes 保存快照。",
        "sources": [
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2603.13131#A2.SS1"
          },
          {
            "label": "附录D.4",
            "url": "https://arxiv.org/html/2603.13131#A4.SS4"
          },
          {
            "label": "附录D.5",
            "url": "https://arxiv.org/html/2603.13131#A4.SS5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "Monitor 从状态、背包差异和停滞中定位失败；经验整理角色 检查字段、可匹配性、可执行性、具体性及冲突。",
        "sources": [
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2603.13131#A2.SS1"
          },
          {
            "label": "附录D.4",
            "url": "https://arxiv.org/html/2603.13131#A4.SS4"
          },
          {
            "label": "附录D.5",
            "url": "https://arxiv.org/html/2603.13131#A4.SS5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "主实验 MCU 70任务；积累实验冻结快照后评估 hard 任务：Iron16、Redstone6、Diamond7、Armor13，按任务数加权。",
        "sources": [
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2603.13131#A2.SS1"
          },
          {
            "label": "附录D.4",
            "url": "https://arxiv.org/html/2603.13131#A4.SS4"
          },
          {
            "label": "附录D.5",
            "url": "https://arxiv.org/html/2603.13131#A4.SS5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "冻结知识后测试；Diamond 课程实验另比较低阶预训练、同任务自学习及混合采样，不能并入同一个隔离结论。",
        "sources": [
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2603.13131#A2.SS1"
          },
          {
            "label": "附录D.4",
            "url": "https://arxiv.org/html/2603.13131#A4.SS4"
          },
          {
            "label": "附录D.5",
            "url": "https://arxiv.org/html/2603.13131#A4.SS5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "把失败提炼成执行时会检查的约束，并利用物品、状态和进展变化定位停滞，让失败经验直接影响后续动作。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2603.13131#S3.SS2"
          },
          {
            "label": "附录C.2",
            "url": "https://arxiv.org/html/2603.13131#A3.SS2"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2603.18000": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "Claude Opus4.6或Claude Sonnet4.6驱动Meta-Agent与可执行子 task agent；外部框架可直接调用保存后的脚本。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2603.18000#S3"
          },
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2603.18000#S3.SS4.SSS0.Px2"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2603.18000#S5.SS1.SSS0.Px4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "Meta-Agent在相应Opus4.6/Sonnet4.6配置中调用create/run/modify，编辑并保存子 task agent；固定工具接口不参与自改。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2603.18000#S3"
          },
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2603.18000#S3.SS4.SSS0.Px2"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2603.18000#S5.SS1.SSS0.Px4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "可执行 Python sub-agent 代码库。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2603.18000#S3"
          },
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2603.18000#S3.SS4.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "运行报错、执行是否成功及任务结果。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2603.18000#S3"
          },
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2603.18000#S3.SS4.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "固定 Meta Skills 和 Tool Skills 配合可执行 Subagent Skills；主 task agent 可生成、保存并再次调用 Python 子 task agent。比较从零解题、只存文字经验和复用可执行子程序三种设置。",
        "sources": [
          {
            "label": "§5.1–5.2；附录 B",
            "url": "https://arxiv.org/abs/2603.18000"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "以子 task agent 脚本为复用单元，按任务检索、创建、调试后保存；导出的脚本可由其他框架按说明调用。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2603.18000#S3"
          },
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2603.18000#S3.SS4.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "作者自建第一批15个现实任务，生成和保存可执行子 task agent。",
        "sources": [
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2603.18000#A2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "Meta-Agent 执行脚本、检查错误并修改子 task agent，保存代码和 SKILL.md。",
        "sources": [
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2603.18000#A2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "第二批15题，沿用相似结构而改变具体要求；涵盖检索、可视化、浏览器及音频处理，比较复用与从零开始的开销。",
        "sources": [
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2603.18000#A2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "两批题目列于附录B；这是小规模结构相似任务迁移，不是公开大规模评测基准的准确率比较。",
        "sources": [
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2603.18000#A2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "把解决复杂任务的流程封装成可独立执行的sub-agent，逐步积累供后续相关任务调用的能力库。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2603.18000#S3"
          },
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2603.18000#S3.SS4.SSS0.Px2"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2603.18743": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "Gemini-3.1-Flash 执行技能和完成任务；Qwen3-Embedding-0.6B 负责技能检索，是另一个可训练的路由模型，不是答题模型。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2603.18743#S2.SS1"
          },
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2603.18743#S2.SS3.SSS0.Px1"
          },
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2603.18743#S2.SS3.SSS0.Px2"
          },
          {
            "label": "§2.4",
            "url": "https://arxiv.org/html/2603.18743#S2.SS4.SSS0.Px2"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2603.18743#S3.SS1.SSS0.Px4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "Gemini-3.1-Flash 通过反思调用改写、发现技能；另用离线强化学习更新 Qwen3-Embedding-0.6B 路由器。论文说明全部实验的底层 语言模型 为 Gemini-3.1-Flash。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2603.18743#S2.SS1"
          },
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2603.18743#S2.SS3.SSS0.Px1"
          },
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2603.18743#S2.SS3.SSS0.Px2"
          },
          {
            "label": "§2.4",
            "url": "https://arxiv.org/html/2603.18743#S2.SS4.SSS0.Px2"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2603.18743#S3.SS1.SSS0.Px4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "技能说明、代码、元数据与效用，以及技能路由器；底层执行语言模型保持冻结。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2603.18743#S2.SS1"
          },
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2603.18743#S2.SS3.SSS0.Px1"
          },
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2603.18743#S2.SS3.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "评审者对照任务回答与参考答案给出结果和理由，失败分析再定位到具体技能。技能修改后运行系统合成的检查用例；合成检查与独立留出题评测分开。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2603.18743#S2.SS1"
          },
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2603.18743#S2.SS3.SSS0.Px1"
          },
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2603.18743#S2.SS3.SSS0.Px2"
          },
          {
            "label": "§2.1：Judge 输入及单测守门",
            "url": "https://arxiv.org/html/2603.18743#S2.SS1"
          },
          {
            "label": "§3.1：GAIA 迭代",
            "url": "https://arxiv.org/html/2603.18743#S3.SS1.SSS0.Px4"
          },
          {
            "label": "§2.4",
            "url": "https://arxiv.org/html/2603.18743#S2.SS4.SSS0.Px3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2603.18743#S3.SS1.SSS0.Px2"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2603.18743#S3.SS1.SSS0.Px3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2603.18743#S3.SS1.SSS0.Px4"
          },
          {
            "label": "§2.3：查询合成",
            "url": "https://arxiv.org/html/2603.18743#S2.SS3.SSS0.Px2"
          },
          {
            "label": "§2.4：检索指标",
            "url": "https://arxiv.org/html/2603.18743#S2.SS4.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "固定 语言模型 和工具执行系统外加技能库及路由器；从相同 5 个原子技能开始，在反思循环中生成和更新可调用技能。技能路由有单独学习设计，不能把“冻结任务模型”推成系统没有任何训练。",
        "sources": [
          {
            "label": "GAIA 数据设置、技能增长分析",
            "url": "https://arxiv.org/abs/2603.18743"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "从搜索和终端等基础技能起步，读技能执行、按评分者反馈写技能；同时训练按执行效用而非纯语义相似度路由的检索模型。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2603.18743#S2.SS1"
          },
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2603.18743#S2.SS3.SSS0.Px1"
          },
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2603.18743#S2.SS3.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "GAIA（需要检索、推理和使用工具的通用助理任务基准） 验证集 的100题；HLE（涵盖多个学科高难度问题的 Humanity’s Last Exam 基准）按8领域抽788题。另为路由器从约8000技能中抽约3000个合成正负查询。",
        "sources": [
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2603.18743#S2.SS3.SSS0.Px2"
          },
          {
            "label": "§2.4",
            "url": "https://arxiv.org/html/2603.18743#S2.SS4.SSS0.Px3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2603.18743#S3.SS1.SSS0.Px2"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2603.18743#S3.SS1.SSS0.Px3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2603.18743#S3.SS1.SSS0.Px4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "失败归因到单个技能，文件级改写后用合成单测和评分者守门；低效技能可重构或新建。",
        "sources": [
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2603.18743#S2.SS3.SSS0.Px2"
          },
          {
            "label": "§2.4",
            "url": "https://arxiv.org/html/2603.18743#S2.SS4.SSS0.Px3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2603.18743#S3.SS1.SSS0.Px2"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2603.18743#S3.SS1.SSS0.Px3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2603.18743#S3.SS1.SSS0.Px4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "GAIA（需要检索、推理和使用工具的通用助理任务基准）另65题；HLE（涵盖多个学科高难度问题的 Humanity’s Last Exam 基准）另342题。路由器另报告140条合成查询的 Recall@K。",
        "sources": [
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2603.18743#S2.SS3.SSS0.Px2"
          },
          {
            "label": "§2.4",
            "url": "https://arxiv.org/html/2603.18743#S2.SS4.SSS0.Px3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2603.18743#S3.SS1.SSS0.Px2"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2603.18743#S3.SS1.SSS0.Px3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2603.18743#S3.SS1.SSS0.Px4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "任务技能学习与任务测试分开；路由器训练是独立数据流程。冻结的是主体 语言模型，路由 embedding 另有训练。",
        "sources": [
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2603.18743#S2.SS3.SSS0.Px2"
          },
          {
            "label": "§2.4",
            "url": "https://arxiv.org/html/2603.18743#S2.SS4.SSS0.Px3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2603.18743#S3.SS1.SSS0.Px2"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2603.18743#S3.SS1.SSS0.Px3"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2603.18743#S3.SS1.SSS0.Px4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "把技能库做成执行期间可读写、可修订的资源；定位失败技能后修复或重写，并单独学习怎样选择该调用的技能。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2603.18743#S2.SS1"
          },
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2603.18743#S2.SS3.SSS0.Px1"
          },
          {
            "label": "§2.3",
            "url": "https://arxiv.org/html/2603.18743#S2.SS3.SSS0.Px2"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2604.15097": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "受控表示实验使用Gemini3.1 Pro Preview和Gemini3.1 Flash Lite Preview；CritPt演化案例另比较Gemini3 Pro Preview与Gemini3.1 Pro Preview两个时期。",
        "sources": [
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2604.15097#S4.SS4"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2604.15097#A1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.15097#S3.SS3.SSS1"
          },
          {
            "label": "附录B.3",
            "url": "https://arxiv.org/html/2604.15097#A2.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "固定Evolver流程驱动Gene更新；对应案例的任务模型为Gemini3 Pro Preview或Gemini3.1 Pro Preview，不能将其与受控实验的Flash Lite混为一组。",
        "sources": [
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2604.15097#S4.SS4"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2604.15097#A1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.15097#S3.SS3.SSS1"
          },
          {
            "label": "附录B.3",
            "url": "https://arxiv.org/html/2604.15097#A2.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "紧凑策略或技能表示中的经验内容与失败警示。",
        "sources": [
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2604.15097#S4.SS4"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2604.15097#A1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "自建科学代码场景通过测试脚本逐项检查完成情况；执行失败历史用于提炼经验。CritPt 的外部任务评价另行统计。",
        "sources": [
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2604.15097#S4.SS4"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2604.15097#A1"
          },
          {
            "label": "附录 B.1：评价协议与指标",
            "url": "https://arxiv.org/html/2604.15097#A2.SS1"
          },
          {
            "label": "附录B.2",
            "url": "https://arxiv.org/html/2604.15097#A2.SS2"
          },
          {
            "label": "附录D.3",
            "url": "https://arxiv.org/html/2604.15097#A4.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "固定执行 task agent，注入同源经验的不同表示：完整文档式 Skill、简短策略 Gene 或不加指导。Gene 包含触发信号、策略、约束和验证钩子；对照控制经验来源以研究表示的作用。",
        "sources": [
          {
            "label": "§3.3、§4.1；附录 B/D",
            "url": "https://arxiv.org/abs/2604.15097"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "OpenClaw 负责运行 task agent，进化流程把经历压缩成在特定情境触发的短策略 Gene（本文的策略经验表示）。通过实际执行验证改动，并记录每条经验的来源和修改历史。",
        "sources": [
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2604.15097#S4.SS4"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2604.15097#A1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "作者自建科学/技术场景，把经验编码成 Skill、自由文本或 Gene；演化版本还从历史执行与外部论文来源获取 Gene。",
        "sources": [
          {
            "label": "附录B.2",
            "url": "https://arxiv.org/html/2604.15097#A2.SS2"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2604.15097#S4.SS4"
          },
          {
            "label": "附录D.3",
            "url": "https://arxiv.org/html/2604.15097#A4.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "场景自带测试脚本，按检查点完成度比较表示；进化中记录触发条件、策略、约束及验证事件。",
        "sources": [
          {
            "label": "附录B.2",
            "url": "https://arxiv.org/html/2604.15097#A2.SS2"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2604.15097#S4.SS4"
          },
          {
            "label": "附录D.3",
            "url": "https://arxiv.org/html/2604.15097#A4.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "45个场景的4590次保留试验；另在 CritPt 比较两个日期的 Evolver（Gene）与相应基础模型。",
        "sources": [
          {
            "label": "附录B.2",
            "url": "https://arxiv.org/html/2604.15097#A2.SS2"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2604.15097#S4.SS4"
          },
          {
            "label": "附录D.3",
            "url": "https://arxiv.org/html/2604.15097#A4.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "表示对照与 CritPt 系统演化是不同实验；后者不能据此解释为同一套严格 训练／验证／测试 划分。",
        "sources": [
          {
            "label": "附录B.2",
            "url": "https://arxiv.org/html/2604.15097#A2.SS2"
          },
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2604.15097#S4.SS4"
          },
          {
            "label": "附录D.3",
            "url": "https://arxiv.org/html/2604.15097#A4.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "在受控条件下比较长步骤文档与紧凑策略表示，直接把“经验怎样写”作为实验变量。",
        "sources": [
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2604.15097#S4.SS4"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2604.15097#A1"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2604.20133": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "主实验由 GPT-5.2 配合 EvoAgent 执行外贸任务；模型替换实验改用 GPT-4.1 或 Qwen3.5-35B-A3B。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2604.20133#S3.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.20133#S3.SS3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2604.20133#S4.SS1"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2604.20133#S4.SS2.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "EvoAgent 根据用户反馈调用模型生成、修订技能并组织sub-agent。主配置的基础模型是 GPT-5.2；§4 未为技能修订角色另列一款独立模型。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2604.20133#S3.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.20133#S3.SS3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2604.20133#S4.SS1"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2604.20133#S4.SS2.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "技能库、技能元数据、记忆与用户信息。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2604.20133#S3.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.20133#S3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "技能更新主要利用用户交互和使用记录；论文最后另用模型从专业性、准确性等维度评审回答。最终评审分数不应自动当作每次技能更新的奖励。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2604.20133#S3.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.20133#S3.SS3"
          },
          {
            "label": "§3.2：实际奖励说明",
            "url": "https://arxiv.org/html/2604.20133#S3.SS2.SSS0.Px6"
          },
          {
            "label": "§3.3：技能成熟度",
            "url": "https://arxiv.org/html/2604.20133#S3.SS3.SSS0.Px6"
          },
          {
            "label": "§4.1：回答评估设计",
            "url": "https://arxiv.org/html/2604.20133#S4.SS1.SSS2.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "作者自建五层系统：API、路由编排、运行时、工具/会话、持久化；主 task agent 用 ReAct（交替进行推理、调用工具和读取结果的执行方式） 并分层委派子 task agent，逐步披露技能以控制上下文。基础系统已含多 task agent 和记忆管理。",
        "sources": [
          {
            "label": "§3 架构、§4 数据收集",
            "url": "https://arxiv.org/abs/2604.20133"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "在线层做技能调用和多 task agent 委派，离线层分析历史对话更新画像、长期记忆和技能库。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2604.20133#S3.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.20133#S3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "系统从历史会话积累用户画像、记忆与技能；外贸实验脚本采集664段、每段8–9轮的对话池。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2604.20133#S4.SS1.SSS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2604.20133#S4.SS1.SSS2.Px1"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2604.20133#S4.SS3.SSS1.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "会话内执行与会话间离线分析分开；离线根据使用记录提炼或重构技能。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2604.20133#S4.SS1.SSS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2604.20133#S4.SS1.SSS2.Px1"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2604.20133#S4.SS3.SSS1.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "随机抽20段对话拆成172个评估实例，§4.1/4.2复用；另测长对话压缩和记忆稳定性。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2604.20133#S4.SS1.SSS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2604.20133#S4.SS1.SSS2.Px1"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2604.20133#S4.SS3.SSS1.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "§4提供的是自建系统测试，未建立技能形成材料与172评估实例之间的明确互斥划分。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2604.20133#S4.SS1.SSS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2604.20133#S4.SS1.SSS2.Px1"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2604.20133#S4.SS3.SSS1.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "将长期保存技能与多 agent 任务分派组织到同一助理框架，重点检查积累的能力能否在实际工作中被调用。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2604.20133#S3.SS1"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2604.20133#S3.SS3"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2605.23904": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "GPT-5.5、GPT-5.4、GPT-5.4-mini、GPT-5.4-nano、GPT-5.2、Qwen3.5-4B、Qwen3.6-35B-A3B；分别按直接对话/Codex/Claude Code模式运行。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2605.23904#S4.SS0.SSS0.Px2"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2605.23904#S4.SS0.SSS0.Px3"
          },
          {
            "label": "附录C.1",
            "url": "https://arxiv.org/html/2605.23904#A3.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2605.23904#S4.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "独立优化器 语言模型，也包含同模型配置；目标模型保持冻结。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2605.23904#S4.SS0.SSS0.Px2"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2605.23904#S4.SS0.SSS0.Px3"
          },
          {
            "label": "附录C.1",
            "url": "https://arxiv.org/html/2605.23904#A3.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "一份供模型阅读的技能文档，写明领域任务的操作策略；改变的是文档中的文字，目标模型参数和执行程序保持固定。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2605.23904#S4.SS0.SSS0.Px2"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2605.23904#S4.SS0.SSS0.Px3"
          },
          {
            "label": "附录C.1",
            "url": "https://arxiv.org/html/2605.23904#A3.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "每个任务的评分程序或结果检查器，以及完整的逐步执行记录和对应分数。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2605.23904#S4.SS0.SSS0.Px2"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2605.23904#S4.SS0.SSS0.Px3"
          },
          {
            "label": "附录C.1",
            "url": "https://arxiv.org/html/2605.23904#A3.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "固定 task agent 在执行时参考这份领域操作说明。表格任务仍使用 openpyxl/pandas，OfficeQA 保留工具调用循环，ALFWorld（通过文字动作完成家居物体操作的交互环境） 保留多步动作接口；修改范围是说明文档，不包含这些执行程序。",
        "sources": [
          {
            "label": "实验设置与数据划分",
            "url": "https://arxiv.org/abs/2605.23904"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "固定模型及 直接对话/Codex/Claude Code 执行框架，优化共享格式的 SKILL.md；合并成败反思、限制编辑数，用验证门控和优化器侧经验防止退化。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2605.23904#S4.SS0.SSS0.Px2"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2605.23904#S4.SS0.SSS0.Px3"
          },
          {
            "label": "附录C.1",
            "url": "https://arxiv.org/html/2605.23904#A3.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "SearchQA、SpreadsheetBench、OfficeQA、DocVQA、LiveMathematicianBench、ALFWorld（通过文字动作完成家居物体操作的交互环境）；无特殊声明默认20%用于技能学习。ALFWorld实际39训练任务，LiveMath每轮35训练题。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2605.23904#S4.SS0.SSS0.Px1"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2605.23904#S4.SS0.SSS0.Px2"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2605.23904#A3.SS0.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "默认10% 选择，仅据此接受或拒绝编辑；ALFWorld（通过文字动作完成家居物体操作的交互环境）使用140 选择。分数须严格提高，平分拒绝。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2605.23904#S4.SS0.SSS0.Px1"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2605.23904#S4.SS0.SSS0.Px2"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2605.23904#A3.SS0.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "默认70%互斥 测试集；ALFWorld134 测试集。主表使用各任务原生成功率/精确匹配；附录协议还覆盖 SealQA。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2605.23904#S4.SS0.SSS0.Px1"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2605.23904#S4.SS0.SSS0.Px2"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2605.23904#A3.SS0.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "seed=42确定划分；编辑只看训练反馈，选择做门控，测试集不参与接受修改。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2605.23904#S4.SS0.SSS0.Px1"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2605.23904#S4.SS0.SSS0.Px2"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2605.23904#A3.SS0.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "对技能文档限制单次修改幅度、进行验证并记住被拒的编辑，让文字技能的更新有可追踪的接受与撤回过程。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2605.23904#S4.SS0.SSS0.Px2"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2605.23904#S4.SS0.SSS0.Px3"
          },
          {
            "label": "附录C.1",
            "url": "https://arxiv.org/html/2605.23904#A3.SS1"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2607.00272": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "仿真中由Claude Code（可读写项目文件、运行命令和测试的 coding agent 工具） + Claude Opus4.6（1M上下文）写程序，机器人执行引擎实际执行控制；真实双臂YAM迁移实验用Codex + GPT-5.5 xhigh。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/2607.00272#S2"
          },
          {
            "label": "附录E.4",
            "url": "https://arxiv.org/html/2607.00272#A5.SS4"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2607.00272#S3.SS1"
          },
          {
            "label": "Claude Code 官方说明",
            "url": "https://code.claude.com/docs/en/overview"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "仿真编码与修复 task agent 为Claude Opus4.6；真实迁移为GPT-5.5 xhigh。协调角色管理技能，执行角色运行、诊断、修改机器人程序。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/2607.00272#S2"
          },
          {
            "label": "附录E.4",
            "url": "https://arxiv.org/html/2607.00272#A5.SS4"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2607.00272#S3.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "机器人控制程序及可跨任务复用的技能库。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/2607.00272#S2"
          },
          {
            "label": "附录E.4",
            "url": "https://arxiv.org/html/2607.00272#A5.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "机器人模拟器判断目标是否完成，执行视频、关键帧和工具记录帮助定位抓取、移动等步骤的失败；调试与最终测试采用不同随机种子。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/2607.00272#S2"
          },
          {
            "label": "附录E.4",
            "url": "https://arxiv.org/html/2607.00272#A5.SS4"
          },
          {
            "label": "§2.3：搜索算法",
            "url": "https://arxiv.org/html/2607.00272#S2.SS3"
          },
          {
            "label": "附录 E.2：接口及成功验收",
            "url": "https://arxiv.org/html/2607.00272#A5.SS2"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2607.00272#S3.SS1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2607.00272#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2607.00272#S3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "Claude Code（可读写项目文件、运行命令和测试的 coding agent 工具）＋Claude Opus 4.6 写 Python 机器人程序，基于 CaP-X/MuJoCo Playground 的感知、几何、运动规划 API。task agent、环境及 API 固定，增长的是可复用机器人技能，不是更换低层执行接口。",
        "sources": [
          {
            "label": "模拟环境设置与技能迁移协议",
            "url": "https://arxiv.org/abs/2607.00272"
          },
          {
            "label": "Claude Code 官方说明",
            "url": "https://code.claude.com/docs/en/overview"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "协调角色管理共享技能库，执行角色编写、运行并修复机器人程序。各次任务共享可复用技能，而非整段聊天；动作前后观察和关键帧用于定位失败步骤。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/2607.00272#S2"
          },
          {
            "label": "附录E.4",
            "url": "https://arxiv.org/html/2607.00272#A5.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "LIBERO-Pro每任务seed51–65；Robosuite101–125；BEHAVIOR-1K26–35。跨任务迁移另从 LIBERO-90 累积技能。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2607.00272#S3.SS1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2607.00272#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2607.00272#S3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "执行角色 在上述调试种子编写、执行、诊断、修复机器人程序；协调角色 把可复用经验保存到技能库。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2607.00272#S3.SS1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2607.00272#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2607.00272#S3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "LIBERO-Pro每任务seed1–50；Robosuite1–100；BEHAVIOR-1K两任务各1–25。另用 LIBERO-90 技能零样本迁移到 LIBERO-Pro Long。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2607.00272#S3.SS1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2607.00272#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2607.00272#S3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "调试与评测种子互斥。LIBERO/Robosuite每任务冻结一个程序；BEHAVIOR评测按当前多模态轨迹增量生成代码块。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2607.00272#S3.SS1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2607.00272#S3.SS2"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2607.00272#S3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "从机器人视觉和物理执行失败中提炼可复用修复技能，并检查这些技能能否跨任务、环境及部分仿真到实物设置迁移。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/2607.00272#S2"
          },
          {
            "label": "附录E.4",
            "url": "https://arxiv.org/html/2607.00272#A5.SS4"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2607.26784": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "Qwen3-1.7B和Qwen3-4B；主表展示4B在ALFWorld（通过文字动作完成家居物体操作的交互环境）、WebShop（根据用户要求挑选和购买商品的交互基准）、ScienceWorld的结果。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2607.26784#S3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.26784#S4.SS1.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "同一Qwen3策略交替解题与整理技能，通过跨任务强化学习（根据奖励调整模型行为）训练；不是另一个外部语言模型负责写技能。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2607.26784#S3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.26784#S4.SS1.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "跨任务传递的技能文档，以及学习如何执行和整理技能的模型参数。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2607.26784#S3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.26784#S4.SS1.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "当前任务的结果，以及后续任务表现对先前技能修改的评价；后者用于判断这次修改是否对未来任务有帮助。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2607.26784#S3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.26784#S4.SS1.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "同一可训练行为策略交替做任务和整理持续技能文档；执行获得当前任务奖励，整理技能获得后续任务收益的信用。既训练参数也改变外部技能，不是单纯事后保存成功轨迹。",
        "sources": [
          {
            "label": "主实验、§5.1",
            "url": "https://arxiv.org/abs/2607.26784"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "用跨任务 强化学习（根据奖励调整模型行为） 联合训练求解与技能整理，执行反馈通过时间对齐奖励训练可迁移的技能更新方式。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2607.26784#S3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.26784#S4.SS1.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "ALFWorld（通过文字动作完成家居物体操作的交互环境）、1000商品版 WebShop（合成目标）、ScienceWorld；每更新16序列×3任务×8 trials，共384次任务执行，最多150更新。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.26784#S4.SS1.SSS0.Px1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.26784#S4.SS1.SSS0.Px3"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2607.26784#S4.SS2.SSS0.Px2"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2607.26784#S5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "同一策略交替解题和整理技能，把后续任务收益分配给较早技能更新。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.26784#S4.SS1.SSS0.Px1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.26784#S4.SS1.SSS0.Px3"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2607.26784#S4.SS2.SSS0.Px2"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2607.26784#S5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "每环境128个留出任务。Pass@2/3允许同题带技能重试；ALFWorld（通过文字动作完成家居物体操作的交互环境）另按2/4/6题序列、每题一次测试跨题积累。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.26784#S4.SS1.SSS0.Px1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.26784#S4.SS1.SSS0.Px3"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2607.26784#S4.SS2.SSS0.Px2"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2607.26784#S5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "留出指训练题之外，测试阶段技能仍会更新；同题重试成绩与跨题一次执行成绩需分开读。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.26784#S4.SS1.SSS0.Px1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.26784#S4.SS1.SSS0.Px3"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2607.26784#S4.SS2.SSS0.Px2"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2607.26784#S5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "把当前任务成功的奖励与写出的技能帮助后续任务的奖励分开，训练 agent 为未来任务整理经验的能力。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2607.26784#S3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2607.26784#S4.SS1.SSS0.Px3"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2608.11350": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "上层固定Qwen3.6-27B规划。VLABench下层为官方π0 checkpoint（某个时刻保存的模型或系统版本），通过OpenPI执行每次连续执行五个动作；ESI-Bench用固定交互API。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.11350#S3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.11350#S4.SS1.SSS0.Px3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.11350#S4.SS1.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "冻结的 Qwen3.6-27B 承担优化所需的语言模型调用，结合轨迹总结修改技能与运行框架；成本统计包含规划、判分、总结和产物优化。π0 负责机器人底层动作，不修改运行框架。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.11350#S3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.11350#S4.SS1.SSS0.Px3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.11350#S4.SS1.SSS0.Px1"
          },
          {
            "label": "附录A.4",
            "url": "https://arxiv.org/html/2608.11350#A1.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "可复用技能和管理上下文的运行框架代码；基础模型参数固定。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.11350#S3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.11350#S4.SS1.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "VLABench 用环境成功信号验收，ESI-Bench 用答案正确率评价；诊断模型另外分析动作前后观察与轨迹，解释问题出在技能、上下文还是环境。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.11350#S3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.11350#S4.SS1.SSS0.Px3"
          },
          {
            "label": "附录 A：逐轮诊断",
            "url": "https://arxiv.org/html/2608.11350#A1.SS3.SSS1.Px1"
          },
          {
            "label": "§4.1：划分",
            "url": "https://arxiv.org/html/2608.11350#S4.SS1"
          },
          {
            "label": "附录 A：ESI 诊断",
            "url": "https://arxiv.org/html/2608.11350#A1.SS3.SSS2.Px1"
          },
          {
            "label": "附录 A：结果汇总",
            "url": "https://arxiv.org/html/2608.11350#A1.SS3.SSS2.Px2"
          },
          {
            "label": "§4.1：任务划分",
            "url": "https://arxiv.org/html/2608.11350#S4.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "冻结 Qwen3.6-27B 上层规划器；VLABench 用官方 π0 检查点经 OpenPI 执行子目标，每次输出 5 个低层动作，最多 10 轮规划/400 环境步。ESI-Bench 使用固定交互 API，最多 30 步。可演化的是技能和上层运行框架，不重训这些执行模型。",
        "sources": [
          {
            "label": "§4.1、优化协议、Table 2",
            "url": "https://arxiv.org/abs/2608.11350"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "上层规划模型和底层执行接口固定。优化者依据动作前后观察、整次任务结果和诊断报告，修改文字技能及上下文构造代码；在验证环境中运行，保留若干较好候选继续搜索。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.11350#S3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.11350#S4.SS1.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "VLABench15训练 episodes；ESI-Bench10训练问题。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.11350#S4.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.11350#S4.SS1.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "VLABench固定24验证 episodes；ESI-Bench10验证题。4轮、宽度3的 beam search（每轮保留若干较好候选继续搜索），先优化技能，再固定技能优化运行框架。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.11350#S4.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.11350#S4.SS1.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "VLABench800互斥 episodes：自建C1–C4各200，改变目标类别/任务形式；ESI-Bench231题。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.11350#S4.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.11350#S4.SS1.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "两套实验训练、验证、测试互斥；C1–C4是作者自建划分，不能称官方划分。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.11350#S4.SS1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.11350#S4.SS1.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "保持模型及底层动作接口固定，从目标环境的执行经历修改上层技能和上下文处理代码，适应不能任意改机器人动作接口的条件。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.11350#S3"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.11350#S4.SS1.SSS0.Px3"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2504.15228": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "SICA 的大部分 agent 使用 Claude Sonnet 3.5 v2，专门的 reasoning task agent 使用 o3-mini；agent 协作调用工具完成基准任务。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2504.15228#S3"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2504.15228#S4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "自改进也在这套 agent 系统中完成：主要由 Claude Sonnet 3.5 v2 工作，o3-mini 提供专门推理。修改目标是 agent 系统的代码，而非这两个模型的参数。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2504.15228#S3"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2504.15228#S4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "coding agent 的完整实现；改进后的 agent 可继续修改后代，外层档案管理和评价规则保持固定。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2504.15228#S3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "按固定评测目标综合衡量任务表现、费用和时间，同时提供运行反馈。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2504.15228#S3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "初始编程 task agent 已有文件/shell/计算器、子 task agent、异步监督和上下文管理。编辑先以代码改动记录追加，随后合并文件视图以利用缓存；进化可以改变这些已有组件，不是从空白 ReAct（交替进行推理、调用工具和读取结果的执行方式） 起步。",
        "sources": [
          {
            "label": "基础 agent、Algorithm 1、Table 1",
            "url": "https://arxiv.org/abs/2504.15228"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "当前最好 task agent 兼任下一轮修改者，自改工具与子 task agent；文件编辑目标来自相邻Git提交，定位任务要求返回符号定义位置。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2504.15228#S3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "固定抽50题 SWE-bench Verified、50题 LiveCodeBench（使用较新竞赛编程题评价代码能力的基准）；另自建文件编辑和代码符号定位任务。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2504.15228#S4"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2504.15228#S4.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "四类任务的正确性、时间和费用组合为效用，最好历史版本读取档案并实现下一版。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2504.15228#S4"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2504.15228#S4.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "主表展示同一评测基准集上的逐代成绩；另有 AIME/GPQA 推理实验。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2504.15228#S4"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2504.15228#S4.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "§4没有另设主编码实验的最终盲测集；进化曲线分数同时参与选择。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2504.15228#S4"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2504.15228#S4.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "让 coding agent 修改自己实际使用的工具和软件实现，再由改好的版本继续提出修改，在真实代码任务中检验自修改。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2504.15228#S3"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2603.03329": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "Gemini-2.5-Flash 配合运行框架做决策；纯代码策略设置则直接运行最终生成的代码，不在执行时调用语言模型。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2603.03329#S3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "Gemini-2.5-Flash 生成并根据执行反馈修订运行框架或代码策略。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2603.03329#S3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "防止无效动作的代码运行框架，或完全取代模型逐步决策的代码策略。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2603.03329#S3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "游戏环境反馈动作是否合法、违反什么规则，以及终局胜负或奖励；“不再犯非法动作”与“更容易赢”是两种不同评价目标。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2603.03329#S3"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2603.03329#S4.SS2"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2603.03329#S4.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "TextArena 的原始游戏状态和动作接口外生成代码运行框架，作为合法动作验证器或辅助决策器。动作验证实验去掉提示中直接列出的合法动作，要求代码从规则/状态推导，而非照抄答案。",
        "sources": [
          {
            "label": "§4.1 与动作验证设置",
            "url": "https://arxiv.org/abs/2603.03329"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "把动作合法性从 语言模型 判断转成程序检查；验证器拒绝非法提案让模型重答，纯代码策略版本推理时甚至不调用语言模型。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2603.03329#S3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "TextArena 游戏交互提供状态、动作合法性和终局奖励；合成动作验证器/策略代码。",
        "sources": [
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2603.03329#S4.SS2"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2603.03329#S4.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "Thompson sampling 选代码树节点，语言模型据非法动作反馈改 propose_action 与 is_legal_action。策略版本最多256轮。",
        "sources": [
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2603.03329#S4.SS2"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2603.03329#S4.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "实际对局选16个单人、16个双人游戏；单人每游戏20局，双人40局并平分先后手。",
        "sources": [
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2603.03329#S4.SS2"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2603.03329#S4.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "这是同游戏的新对局测试；§4.2说明随机种子和先后手，但没有给出训练与测试种子互斥清单。",
        "sources": [
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2603.03329#S4.SS2"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2603.03329#S4.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "根据环境动作规则生成可执行检查代码，在模型动作到达环境前阻止或处理非法动作，将部分可靠性要求交给程序保证。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2603.03329#S3"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2606.19980": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "真实YAM机器人执行学到的控制策略或脚本；研究代码由Codex + GPT-5.5 xhigh、Claude Code（可读写项目文件、运行命令和测试的 coding agent 工具） + Opus4.7 High、Kimi Code + Kimi K2.6 thinking生成。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/2606.19980#S2"
          },
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2606.19980#S2.SS1.SSS0.Px2"
          },
          {
            "label": "附录B.5",
            "url": "https://arxiv.org/html/2606.19980#A2.SS5"
          },
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2606.19980#S3"
          },
          {
            "label": "附录C.4",
            "url": "https://arxiv.org/html/2606.19980#A3.SS4"
          },
          {
            "label": "Claude Code 官方说明",
            "url": "https://code.claude.com/docs/en/overview"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "上述三种编程 task agent 在真实反馈下改控制代码或训练算法；改变的是机器人策略，不是让GPT-5.5或Opus4.7自身做参数训练。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/2606.19980#S2"
          },
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2606.19980#S2.SS1.SSS0.Px2"
          },
          {
            "label": "附录B.5",
            "url": "https://arxiv.org/html/2606.19980#A2.SS5"
          },
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2606.19980#S3"
          },
          {
            "label": "附录C.4",
            "url": "https://arxiv.org/html/2606.19980#A3.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "机器人策略、训练基础设施和算法代码；组织复位、运行、验证和改进的外层流程保持固定。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/2606.19980#S2"
          },
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2606.19980#S2.SS1.SSS0.Px2"
          },
          {
            "label": "附录B.5",
            "url": "https://arxiv.org/html/2606.19980#A2.SS5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "真实机器人环境通过传感器判据或视觉奖励识别器判断成功，结合视频和运行记录诊断失败；RoboCasa 模拟实验采用其原生成功函数。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/2606.19980#S2"
          },
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2606.19980#S2.SS1.SSS0.Px2"
          },
          {
            "label": "附录B.5",
            "url": "https://arxiv.org/html/2606.19980#A2.SS5"
          },
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2606.19980#S3"
          },
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2606.19980#A1.SS2"
          },
          {
            "label": "附录C.1",
            "url": "https://arxiv.org/html/2606.19980#A3.SS1"
          },
          {
            "label": "附录D.2",
            "url": "https://arxiv.org/html/2606.19980#A4.SS2"
          },
          {
            "label": "附录D.2",
            "url": "https://arxiv.org/html/2606.19980#A4.SS2.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "真实机器人学习栈，task agent 可写奖励/视觉处理代码并改进策略流程；底层有感知、控制和训练设施，需满足实时延迟。不是在一个无硬件约束的文字模拟器里改提示词。",
        "sources": [
          {
            "label": "任务设置与视觉奖励案例",
            "url": "https://arxiv.org/abs/2606.19980"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "先用人类示范/约束搭建可复位、可判分环境，再让编码 task agent 通过统一机器人接口自动收集数据、训练或改控制程序。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/2606.19980#S2"
          },
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2606.19980#S2.SS1.SSS0.Px2"
          },
          {
            "label": "附录B.5",
            "url": "https://arxiv.org/html/2606.19980#A2.SS5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "真实YAM机器人在线回合及人类演示，分别入replay与demonstration buffer；任务含Push-T、插pin、GPU插槽、剪扎带。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2606.19980#S3"
          },
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2606.19980#A1.SS2"
          },
          {
            "label": "附录C.1",
            "url": "https://arxiv.org/html/2606.19980#A3.SS1"
          },
          {
            "label": "附录D.2",
            "url": "https://arxiv.org/html/2606.19980#A4.SS2"
          },
          {
            "label": "附录D.2",
            "url": "https://arxiv.org/html/2606.19980#A4.SS2.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "编码 task agent 可选择BC/强化学习（根据奖励调整模型行为）/脚本方法；用传感器成功判据、执行视频、碰撞/越界终止反馈。奖励识别另用数分钟成功/失败演示。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2606.19980#S3"
          },
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2606.19980#A1.SS2"
          },
          {
            "label": "附录C.1",
            "url": "https://arxiv.org/html/2606.19980#A3.SS1"
          },
          {
            "label": "附录D.2",
            "url": "https://arxiv.org/html/2606.19980#A4.SS2"
          },
          {
            "label": "附录D.2",
            "url": "https://arxiv.org/html/2606.19980#A4.SS2.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "真实任务表现及Push-T简化消融；RoboCasa每任务固定40个(seed,layout,style)组合，以原生成功函数计分。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2606.19980#S3"
          },
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2606.19980#A1.SS2"
          },
          {
            "label": "附录C.1",
            "url": "https://arxiv.org/html/2606.19980#A3.SS1"
          },
          {
            "label": "附录D.2",
            "url": "https://arxiv.org/html/2606.19980#A4.SS2"
          },
          {
            "label": "附录D.2",
            "url": "https://arxiv.org/html/2606.19980#A4.SS2.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "RoboCasa诊断子集也取自同一40条清单，不能称全程不可见。扎带奖励识别有单独沙箱留出，不能把该隔离套到所有策略实验。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2606.19980#S3"
          },
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2606.19980#A1.SS2"
          },
          {
            "label": "附录C.1",
            "url": "https://arxiv.org/html/2606.19980#A3.SS1"
          },
          {
            "label": "附录D.2",
            "url": "https://arxiv.org/html/2606.19980#A4.SS2"
          },
          {
            "label": "附录D.2",
            "url": "https://arxiv.org/html/2606.19980#A4.SS2.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "给代码 agent 可重复开展物理试验的接口，并允许它改机器人训练系统和算法代码，把真实实验接到策略改进流程。",
        "sources": [
          {
            "label": "§2",
            "url": "https://arxiv.org/html/2606.19980#S2"
          },
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2606.19980#S2.SS1.SSS0.Px2"
          },
          {
            "label": "附录B.5",
            "url": "https://arxiv.org/html/2606.19980#A2.SS5"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2607.14159": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "搜索时任务基础模型为GPT-5.3-Codex；冻结运行框架后迁移Sonnet4.6、Gemini3.1 Pro、Qwen3.5-397B-A17B、GLM5、GPT-4.1、DeepSeekV3.2。",
        "sources": [
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2607.14159#A3.SS0.SSS0.Px1"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2607.14159#A3.SS0.SSS0.Px3"
          },
          {
            "label": "附录D",
            "url": "https://arxiv.org/html/2607.14159#A4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "论文把GPT-5.3-Codex列作搜索来源模型；附录C/D没有另给诊断与修改角色各自独立的模型型号，不补写一个Claude修改器。",
        "sources": [
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2607.14159#A3.SS0.SSS0.Px1"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2607.14159#A3.SS0.SSS0.Px3"
          },
          {
            "label": "附录D",
            "url": "https://arxiv.org/html/2607.14159#A4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "控制上下文、工具、生成、编排、记忆和输出的配置，以及指导配置的经验库。",
        "sources": [
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2607.14159#A3.SS0.SSS0.Px1"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2607.14159#A3.SS0.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "搜索所用任务的分数和诊断信息；最终测试不返回用于修改方案的反馈。",
        "sources": [
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2607.14159#A3.SS0.SSS0.Px1"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2607.14159#A3.SS0.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "六维可配置运行框架，以结构化策略文件配合运行说明、操作指南、记忆内容落地。所有实验初始 W₀ 关闭示范、检索、结构化辅助、跨调用记忆和输出验证器；这些功能是在搜索中选择开启，而不是预置强底座。",
        "sources": [
          {
            "label": "初始化；附录 C",
            "url": "https://arxiv.org/abs/2607.14159"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "经验辅助运行框架搜索，并研究针对测试实例的适配；区分搜索过程峰值和最终验证选定版本。",
        "sources": [
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2607.14159#A3.SS0.SSS0.Px1"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2607.14159#A3.SS0.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "Terminal-Bench89题按80/20分，搜索部分71题；另在LiveCodeBench（使用较新竞赛编程题评价代码能力的基准）、FinanceAgent搜索。",
        "sources": [
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2607.14159#A3.SS0.SSS0.Px1"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2607.14159#A3.SS0.SSS0.Px3"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2607.14159#S3.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "利用历史轨迹经验修改运行框架，搜索结束按验证成绩选择，使用该选定版本报告结果。",
        "sources": [
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2607.14159#A3.SS0.SSS0.Px1"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2607.14159#A3.SS0.SSS0.Px3"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2607.14159#S3.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "Terminal-Bench18题留出，另报告LiveCodeBench（使用较新竞赛编程题评价代码能力的基准）、FinanceAgent；选定运行框架无再训练迁移到另外六种模型。",
        "sources": [
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2607.14159#A3.SS0.SSS0.Px1"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2607.14159#A3.SS0.SSS0.Px3"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2607.14159#S3.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "附录C明确18题留出及验证选版本，但未列另外两集的具体划分数量，也未细分71题内部验证分配；不补造统一比例。",
        "sources": [
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2607.14159#A3.SS0.SSS0.Px1"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2607.14159#A3.SS0.SSS0.Px3"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2607.14159#S3.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "从历史案例学习按当前任务选择运行配置；新题执行时可使用不同配置，而无需再拿答案反馈搜索。",
        "sources": [
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2607.14159#A3.SS0.SSS0.Px1"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2607.14159#A3.SS0.SSS0.Px3"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2608.01918": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "主执行模型GPT-5.4；冻结运行框架后换Claude Sonnet4.6（non-thinking）测试迁移。",
        "sources": [
          {
            "label": "HarnessCompass",
            "url": "https://arxiv.org/html/2608.01918#Sx3"
          },
          {
            "label": "Constrained Evolution",
            "url": "https://arxiv.org/html/2608.01918#Sx3.SSx2"
          },
          {
            "label": "Aggregation and use.",
            "url": "https://arxiv.org/html/2608.01918#Sx3.SSx3.SSS0.Px3"
          },
          {
            "label": "Running the tracks independently.",
            "url": "https://arxiv.org/html/2608.01918#Sx3.SSx4.SSS0.Px1"
          },
          {
            "label": "Models.",
            "url": "https://arxiv.org/html/2608.01918#Sx4.SSx1.SSS0.Px3"
          },
          {
            "label": "The advantage is more evident on held-out tasks.",
            "url": "https://arxiv.org/html/2608.01918#Sx4.SSx2.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "代码 task agent、轨迹分析器、反馈 task agent、meta-agent（负责设计或修改 task agent）均用GPT-5.4；职责分离但共享同一基础模型。",
        "sources": [
          {
            "label": "HarnessCompass",
            "url": "https://arxiv.org/html/2608.01918#Sx3"
          },
          {
            "label": "Constrained Evolution",
            "url": "https://arxiv.org/html/2608.01918#Sx3.SSx2"
          },
          {
            "label": "Aggregation and use.",
            "url": "https://arxiv.org/html/2608.01918#Sx3.SSx3.SSS0.Px3"
          },
          {
            "label": "Running the tracks independently.",
            "url": "https://arxiv.org/html/2608.01918#Sx3.SSx4.SSS0.Px1"
          },
          {
            "label": "Models.",
            "url": "https://arxiv.org/html/2608.01918#Sx4.SSx1.SSS0.Px3"
          },
          {
            "label": "The advantage is more evident on held-out tasks.",
            "url": "https://arxiv.org/html/2608.01918#Sx4.SSx2.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "系统提示、工具说明和实现、中间处理、sub-agent 配置、技能与长期记忆；外层修改算法固定。",
        "sources": [
          {
            "label": "HarnessCompass",
            "url": "https://arxiv.org/html/2608.01918#Sx3"
          },
          {
            "label": "Constrained Evolution",
            "url": "https://arxiv.org/html/2608.01918#Sx3.SSx2"
          },
          {
            "label": "Aggregation and use.",
            "url": "https://arxiv.org/html/2608.01918#Sx3.SSx3.SSS0.Px3"
          },
          {
            "label": "Running the tracks independently.",
            "url": "https://arxiv.org/html/2608.01918#Sx3.SSx4.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "运行 SWE-bench 仓库测试判断补丁是否解决问题，再结合执行日志和执行模型对自身失败的解释决定怎么改框架。",
        "sources": [
          {
            "label": "HarnessCompass",
            "url": "https://arxiv.org/html/2608.01918#Sx3"
          },
          {
            "label": "Constrained Evolution",
            "url": "https://arxiv.org/html/2608.01918#Sx3.SSx2"
          },
          {
            "label": "Aggregation and use.",
            "url": "https://arxiv.org/html/2608.01918#Sx3.SSx3.SSS0.Px3"
          },
          {
            "label": "Running the tracks independently.",
            "url": "https://arxiv.org/html/2608.01918#Sx3.SSx4.SSS0.Px1"
          },
          {
            "label": "The advantage is more evident on held-out tasks.",
            "url": "https://arxiv.org/html/2608.01918#Sx4.SSx2.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "与 AHE 使用同样的仅提供 Bash 命令行工具 H₀：没有初始 middleware（处理模型与工具之间消息、调用和返回结果的中间代码）、skills、subagents。修改受到跨任务通用性约束，不能把某题私有符号或路径编码进规则。",
        "sources": [
          {
            "label": "Table 2 与跨模型设置",
            "url": "https://arxiv.org/abs/2608.01918"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "限制修改为任务无关组件，将第一人称反馈与轨迹互证；分开优化工具/控制结构和提示/技能/记忆以减少改动干扰。",
        "sources": [
          {
            "label": "HarnessCompass",
            "url": "https://arxiv.org/html/2608.01918#Sx3"
          },
          {
            "label": "Constrained Evolution",
            "url": "https://arxiv.org/html/2608.01918#Sx3.SSx2"
          },
          {
            "label": "Aggregation and use.",
            "url": "https://arxiv.org/html/2608.01918#Sx3.SSx3.SSS0.Px3"
          },
          {
            "label": "Running the tracks independently.",
            "url": "https://arxiv.org/html/2608.01918#Sx3.SSx4.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "SWE-bench Verified中50题作为进化集；GPT-5.4在仅提供 Bash 命令行工具 seed上运行。",
        "sources": [
          {
            "label": "The advantage is more evident on held-out tasks.",
            "url": "https://arxiv.org/html/2608.01918#Sx4.SSx2.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "同50题的执行轨迹及 task agent 自述共同诊断，结构与指导两个轨道分别修改、比较并整合。",
        "sources": [
          {
            "label": "The advantage is more evident on held-out tasks.",
            "url": "https://arxiv.org/html/2608.01918#Sx4.SSx2.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "剩余450题独立留出；另将冻结运行框架迁移Claude Sonnet4.6。表中Total500包含进化题。",
        "sources": [
          {
            "label": "The advantage is more evident on held-out tasks.",
            "url": "https://arxiv.org/html/2608.01918#Sx4.SSx2.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "Sample50与Held-Out450互斥；跨模型结果也拆开两部分，不能把Total500当全未见。",
        "sources": [
          {
            "label": "The advantage is more evident on held-out tasks.",
            "url": "https://arxiv.org/html/2608.01918#Sx4.SSx2.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "限制框架写入题目专属信息，主动收集诊断证据，并逐个组件优化，以减少记题和同时改多处造成的干扰。",
        "sources": [
          {
            "label": "HarnessCompass",
            "url": "https://arxiv.org/html/2608.01918#Sx3"
          },
          {
            "label": "Constrained Evolution",
            "url": "https://arxiv.org/html/2608.01918#Sx3.SSx2"
          },
          {
            "label": "Aggregation and use.",
            "url": "https://arxiv.org/html/2608.01918#Sx3.SSx3.SSS0.Px3"
          },
          {
            "label": "Running the tracks independently.",
            "url": "https://arxiv.org/html/2608.01918#Sx3.SSx4.SSS0.Px1"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2608.08466": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "冻结的 DeepSeek-V4-Flash-Preview 配合当前运行框架执行任务。",
        "sources": [
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2608.08466#A2.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "DeepSeek-V4-Flash-Preview 分别承担进化者和元进化者，在各自允许编辑的文件范围内修改代码。",
        "sources": [
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2608.08466#A2.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "任务运行框架和产生修改的进化策略代码；最外层控制及选择规则固定。",
        "sources": [
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2608.08466#A2.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "游戏环境给出任务进展奖励；多次执行后采用偏保守的分数比较候选，降低偶然高分的影响。开发反馈驱动修改，验证结果用于最终选版本。",
        "sources": [
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2608.08466#A2.SS1"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2608.08466#S4.SS2.SSS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "BALROG 各任务初始运行框架，通过固定 using_harness 接口接入；上层修改者和负责修改改进流程的上层修改者分开，外层锚固定，结束时的最佳版本选择阶段也不可进化。初始版本不预先评分，首轮冷启动。",
        "sources": [
          {
            "label": "BALROG 实验协议；Table 3",
            "url": "https://arxiv.org/abs/2608.08466"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "分别演化任务运行框架与上层修改者；用收益下界降低少量回合的噪声，在固定预算下选择最终代码。",
        "sources": [
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2608.08466#A2.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "BALROG的BabyAI、BabaIsAI、Crafter、MiniHack、TextWorld、NLE；Setup A使用全任务集交互进化。",
        "sources": [
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2608.08466#S4.SS2.SSS2"
          },
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2608.08466#A2.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "开发集用于进化奖励，val用于终局选最佳版本；元层可修改进化器，终局提交选择阶段固定。",
        "sources": [
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2608.08466#S4.SS2.SSS2"
          },
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2608.08466#A2.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "Setup A在同任务增加评估回合；Setup B对BabaIsAI子族留出20% 测试集：BreakStop、GoTo、Make。",
        "sources": [
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2608.08466#S4.SS2.SSS2"
          },
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2608.08466#A2.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "Setup A是分布内重测；Setup B才是未见任务。Advanced仅3题，被排除于拆分测试。每套件配置见表3。",
        "sources": [
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2608.08466#S4.SS2.SSS2"
          },
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2608.08466#A2.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "在固定外部边界内允许任务框架与修改策略分层变化，并控制基础模型能力及反馈质量，研究进一步改进何时受限。",
        "sources": [
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2608.08466#A2.SS1"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2608.09380": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "DeepSeek-V4-Flash，YC-Bench官方medium配置，20轮上下文，加载当前Loop Policy。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.09380#S4.SS1"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2608.09380#S4.SS2"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2608.09380#S4.SS3"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2608.09380#S5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "同一实验配置的DeepSeek-V4-Flash生成候选Loop Policy；固定Champion–Challenger程序负责配对比较、发布和回滚。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.09380#S4.SS1"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2608.09380#S4.SS2"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2608.09380#S4.SS3"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2608.09380#S5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "观察、规划、记忆、行动、验证、恢复、停止与预算控制策略，以及版本关系。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.09380#S4.SS1"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2608.09380#S4.SS2"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2608.09380#S4.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "读取企业经营的在线记录或归档失败经历，再在相同条件下比较候选与当前版本的资金、存活、任务成功和风险指标。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.09380#S4.SS1"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2608.09380#S4.SS2"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2608.09380#S4.SS3"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2608.09380#S5.SS1"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2608.09380#S5.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "作者在 YC-Bench 业务模拟环境中维护有版本的控制流程，规定怎样观察、计划、调用工具、验证、重试和停止。新候选与当前保留版本在相同条件下比较，通过检查后在下一任务开始时启用；发现退化可退回旧版本。",
        "sources": [
          {
            "label": "框架与 YC-Bench 实验",
            "url": "https://arxiv.org/abs/2608.09380"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "把观察、规划、验证、恢复和停止等规则作为可更新的运行策略，连同验证证据和版本历史保存。候选通过检查才发布；小范围试运行发现退化时回滚，并隔离相应反馈。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.09380#S4.SS1"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2608.09380#S4.SS2"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2608.09380#S4.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "YC-Bench企业经营轨迹；在线从运行中积累，离线从归档轨迹生成Loop Policy候选。",
        "sources": [
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2608.09380#S5.SS1"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2608.09380#S5.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "固定模型/工具/资源做候选与Champion配对评估；在线共12次候选更新，离线每轮3候选、最多4轮。",
        "sources": [
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2608.09380#S5.SS1"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2608.09380#S5.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "官方medium配置、seed1/2/3、20轮上下文，从相同初态模拟一年；评最终资金、存活、成功与风险。",
        "sources": [
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2608.09380#S5.SS1"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2608.09380#S5.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "在线评测中持续更新；离线策略评测时冻结。§V没有另列跨场景未见测试，跨场景验证被列作未来工作。",
        "sources": [
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2608.09380#S5.SS1"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2608.09380#S5.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "把观察、规划、验证和恢复策略保存为有版本的可复用资源，将发布前检查、使用后监测和必要的回退纳入更新流程。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.09380#S4.SS1"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2608.09380#S4.SS2"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2608.09380#S4.SS3"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2608.12307": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "主任务执行者GPT-5.4-mini；目标模型对照换Gemini3.5 Flash。强构建者仅构造运行框架，不代替目标模型答最终测试。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.12307#S3"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2608.12307#S4"
          },
          {
            "label": "§5.6",
            "url": "https://arxiv.org/html/2608.12307#S5.SS6"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "跨目标对照的五种构建者为Opus4.7、GPT-5.5、Gemini3.1 Pro、Gemini3.5 Flash、Grok0.1，统一在Cursor构造运行框架；构造者与目标GPT-5.4-mini/Gemini3.5 Flash分开。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.12307#S3"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2608.12307#S4"
          },
          {
            "label": "§5.6",
            "url": "https://arxiv.org/html/2608.12307#S5.SS6"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "为冻结弱模型构建的执行代码、路由与验证流程；不更新弱模型参数。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.12307#S3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "用心智推理任务的可见验证题检查回答正确性，供强模型选择运行框架；最终评测与验证数据的具体边界存在原文口径冲突，表格保留了说明。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.12307#S3"
          },
          {
            "label": "§5.3",
            "url": "https://arxiv.org/html/2608.12307#S5.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "构建者 获得可用工作区、任务/提交规则、engines.py 模型调用示例及有标签验证题，自行构造可调用入口；允许路由、提示、检索、前后处理和符号求解，没有固定候选架构。对照是直接调用目标模型，以及人写 UserHarness。",
        "sources": [
          {
            "label": "Algorithm 1、§3–4 与原文口径补注",
            "url": "https://arxiv.org/abs/2608.12307"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "强模型为固定弱模型构建代码辅助、上下文组织和答案检查，使部分不可靠推理转成稳定处理步骤。强模型负责构建，弱模型负责最终执行，两者参数不因这轮框架搜索而更新。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.12307#S3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "不训练模型参数；强构建者在目标任务的195道有标签验证题上编写给弱模型用的运行框架。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.12307#S3"
          },
          {
            "label": "§5.3",
            "url": "https://arxiv.org/html/2608.12307#S5.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "可运行目标模型查看验证准确率并改代码，最终提交后构建者退出。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.12307#S3"
          },
          {
            "label": "§5.3",
            "url": "https://arxiv.org/html/2608.12307#S5.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "BigToM1200、Hi-ToM1200、MMToM-QA600、MuMA-ToM900，总3900；多模态题转成文本。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.12307#S3"
          },
          {
            "label": "§5.3",
            "url": "https://arxiv.org/html/2608.12307#S5.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "原文对full-set与隐藏 测试集的口径不一致：验证占5%，§4又将3900称隐藏 测试集。可确认构建者只见验证材料；不能确认195与3900完全互斥，亦不自行改成3705。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.12307#S3"
          },
          {
            "label": "§5.3",
            "url": "https://arxiv.org/html/2608.12307#S5.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "由强模型把部分推理和检查逻辑写成运行代码，交给弱模型执行任务时使用，实现无需训练弱模型参数的能力支持。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.12307#S3"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2608.24735": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "Gemma 4 31B-IT 或 GPT-5.2；单次生成与最多 8-turn 多步交互任务求解模型。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.24735#S3.SS0.SSS0.Px1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.24735#S3.SS1.SSS0.Px4"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.24735#S3.SS1.SSS0.Px6"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "与执行端对应的 Gemma 4 31B-IT 或 GPT-5.2 读取固定 Ω 模板，生成下一层优化提示；不更换或训练基础模型。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.24735#S3.SS0.SSS0.Px1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.24735#S3.SS1.SSS0.Px4"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.24735#S3.SS1.SSS0.Px6"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "逐层增加的策略上下文及可调用辅助代码；基础模型和生成下一层的操作保持固定。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.24735#S3.SS0.SSS0.Px1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.24735#S3.SS1.SSS0.Px4"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.24735#S3.SS1.SSS0.Px6"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "候选程序实际运行后，返回输出、报错、退出状态及任务得分；组合优化、分类、终端任务等分别由相应评估器判断，不能用统一“答对率”概括。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.24735#S3.SS0.SSS0.Px1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.24735#S3.SS1.SSS0.Px4"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.24735#S3.SS1.SSS0.Px6"
          },
          {
            "label": "§2：执行反馈定义",
            "url": "https://arxiv.org/html/2608.24735#S2.SS0.SSS0.Px2"
          },
          {
            "label": "附录 C：八类基准",
            "url": "https://arxiv.org/html/2608.24735#A3.SS0.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "三种底座按任务区分：可编辑 Python 任务求解模型、Docker 内 bash task agent、固定下游模型前的提示改写器。同一递归模板控制改进层次；单次生成和最多 8 轮的多步交互执行是不同实验变体。",
        "sources": [
          {
            "label": "实验设置；附录 C",
            "url": "https://arxiv.org/abs/2608.24735"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "同一元操作可反复作用形成更深层，不预设只到二层；不同层逐渐承担原语、库、策略等角色。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.24735#S3.SS0.SSS0.Px1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.24735#S3.SS1.SSS0.Px4"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.24735#S3.SS1.SSS0.Px6"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "八类任务：CO-Bench36问题、AlphaEvolve Math、四域符号回归、AlgoTune8任务、ARC-AGI-2120题、TB2 89题、Symptom2Disease、LawBench。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.24735#S3.SS0.SSS0.Px1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.24735#S3.SS1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.24735#S3.SS1.SSS0.Px8"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "对候选层链作档案搜索，由统一Ω操作递归生成上层辅助，按验证/任务分数选版本与停止。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.24735#S3.SS0.SSS0.Px1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.24735#S3.SS1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.24735#S3.SS1.SSS0.Px8"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "CO-Bench、S2D、LawBench报告留出；ARC另报留出；AlphaEvolve Math、AlgoTune、符号回归直接报优化目标成绩。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.24735#S3.SS0.SSS0.Px1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.24735#S3.SS1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.24735#S3.SS1.SSS0.Px8"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "没有统一训练／测试协议；后三类明确无留出。常规3个seed，TB2有单seed及按任务类别计算方差的例外。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.24735#S3.SS0.SSS0.Px1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.24735#S3.SS1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.24735#S3.SS1.SSS0.Px8"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "让历史改进层参与当前执行中的辅助与上下文组织，研究增加辅助层数的效果；层数增加本身不表示外部修改规则也改变。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2608.24735#S3.SS0.SSS0.Px1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.24735#S3.SS1.SSS0.Px4"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.24735#S3.SS1.SSS0.Px6"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2605.27276": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "task agent 统一用 gpt-oss-120B；完成训练步骤后，改用它经 LoRA（只训练少量适配参数） 更新的检查点执行任务。",
        "sources": [
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2605.27276#S4.SS3"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2605.27276#S5.SS1"
          },
          {
            "label": "§6.2",
            "url": "https://arxiv.org/html/2605.27276#S6.SS2"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2605.27276#S5.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "Claude Sonnet 4.6 分别担任上层设计者和反馈分析者，设计 task agent 并决定改运行框架还是训练参数；Modal 云计算平台上的训练程序实际更新 gpt-oss-120B 的参数。",
        "sources": [
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2605.27276#S4.SS3"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2605.27276#S5.SS1"
          },
          {
            "label": "§6.2",
            "url": "https://arxiv.org/html/2605.27276#S6.SS2"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2605.27276#S5.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "task agent 的运行框架与模型参数。",
        "sources": [
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2605.27276#S4.SS3"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2605.27276#S5.SS1"
          },
          {
            "label": "§6.2",
            "url": "https://arxiv.org/html/2605.27276#S6.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "逐步执行记录，以及评测任务的分数或结果检查器的判定。",
        "sources": [
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2605.27276#S4.SS3"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2605.27276#S5.SS1"
          },
          {
            "label": "§6.2",
            "url": "https://arxiv.org/html/2605.27276#S6.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "上层设计模型生成面向任务的运行框架，并可通过 LoRA（只训练少量附加适配参数）调整 gpt-oss-120b。实验比较只改框架与联合更新；每类任务另有按程序规则判结果的评分器。",
        "sources": [
          {
            "label": "§6.1、Table 2",
            "url": "https://arxiv.org/abs/2605.27276"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "从 gpt-oss-120b、一个简单工具调用循环和可训练的适配参数起步。反馈 agent 读取执行结果，决定修改提示、解析和工具逻辑，还是训练模型参数；训练服务负责实际参数更新。",
        "sources": [
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2605.27276#S4.SS3"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2605.27276#S5.SS1"
          },
          {
            "label": "§6.2",
            "url": "https://arxiv.org/html/2605.27276#S6.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "LawBench191类罪名分类：5332训练样本；另外的TriMul与MAGIC直接围绕目标计算任务优化。",
        "sources": [
          {
            "label": "§6.1",
            "url": "https://arxiv.org/html/2605.27276#S6.SS1"
          },
          {
            "label": "§6.3",
            "url": "https://arxiv.org/html/2605.27276#S6.SS3.SSS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "Feedback-Agent选择改运行框架或做LoRA（只训练少量适配参数）更新；LawBench评分使用所报告的913题测试集 评分器，迭代成绩用于决策。",
        "sources": [
          {
            "label": "§6.1",
            "url": "https://arxiv.org/html/2605.27276#S6.SS1"
          },
          {
            "label": "§6.3",
            "url": "https://arxiv.org/html/2605.27276#S6.SS3.SSS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "LawBench913题；TriMul在固定形状测H100运行时间；MAGIC以pancreas单细胞数据及参考真值评价去噪。",
        "sources": [
          {
            "label": "§6.1",
            "url": "https://arxiv.org/html/2605.27276#S6.SS1"
          },
          {
            "label": "§6.3",
            "url": "https://arxiv.org/html/2605.27276#S6.SS3.SSS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "LawBench训练样本与测试集分开，但同一评分器参与反馈，不能称最终分数完全不可见；另外两项不是常规数据集留出。",
        "sources": [
          {
            "label": "§6.1",
            "url": "https://arxiv.org/html/2605.27276#S6.SS1"
          },
          {
            "label": "§6.3",
            "url": "https://arxiv.org/html/2605.27276#S6.SS3.SSS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "把改运行框架与训练模型参数作为同一改进流程中的可选操作，根据失败选择改哪里，并比较两类操作的互补收益。",
        "sources": [
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2605.27276#S4.SS3"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2605.27276#S5.SS1"
          },
          {
            "label": "§6.2",
            "url": "https://arxiv.org/html/2605.27276#S6.SS2"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2607.21971": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "经MetaEvolve强化训练的Qwen3-14B执行多轮程序进化；公平对照也使用Qwen3-14B。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2607.21971#S2.SS1"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2607.21971#A1.SS0.SSS0.Px1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2607.21971#S3.SS1.SSS2"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2607.21971#S3.SS1.SSS3.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "固定强化学习（根据奖励调整模型行为）算法训练Qwen3-14B的诊断/修改能力；测试时由训练后的Qwen3-14B提出下一版程序。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2607.21971#S2.SS1"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2607.21971#A1.SS0.SSS0.Px1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2607.21971#S3.SS1.SSS2"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2607.21971#S3.SS1.SSS3.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "训练阶段学习多轮进化能力的模型参数；使用时继续改进候选程序。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2607.21971#S2.SS1"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2607.21971#A1.SS0.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "运行测试用例检查正确性与效率，并据此给奖励；训练输入包含当前程序、任务得分及历史尝试。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2607.21971#S2.SS1"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2607.21971#A1.SS0.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "编程演化搜索框架向模型提供历史候选与执行适应度，训练其生成更好的反思/修改。训练的是执行自演化所需的元技能，不仅是固定优化器在测试题上多采样。",
        "sources": [
          {
            "label": "训练合成与 OOD 评估设置",
            "url": "https://arxiv.org/abs/2607.21971"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "通过强化学习（根据奖励调整模型行为）训练诊断、修改和改进程序的元技能，再把学到的修改能力用于多轮代码进化。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2607.21971#S2.SS1"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2607.21971#A1.SS0.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "PRIME-RL/Eurus-2-RL-Data中的TACO、APPS、Codeforces、CodeContests，合成程序改进经验后强化训练元技能。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2607.21971#S2.SS1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2607.21971#S3.SS1.SSS1.Px1"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2607.21971#S4.SS3"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2607.21971#A2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "在每道代码题上执行候选并反馈，用多轮采样、保留top候选迭代程序；附录B比较轮数与采样规模。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2607.21971#S2.SS1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2607.21971#S3.SS1.SSS1.Px1"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2607.21971#S4.SS3"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2607.21971#A2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "七套题各随机50题：上述四来源的测试题，加完全不参与训练的AtCoder、LeetCode、USACO。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2607.21971#S2.SS1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2607.21971#S3.SS1.SSS1.Px1"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2607.21971#S4.SS3"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2607.21971#A2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "后面三套是数据源级留出；评测仍允许逐题程序搜索，不能当作单次直接生成。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2607.21971#S2.SS1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2607.21971#S3.SS1.SSS1.Px1"
          },
          {
            "label": "§4.3",
            "url": "https://arxiv.org/html/2607.21971#S4.SS3"
          },
          {
            "label": "附录B",
            "url": "https://arxiv.org/html/2607.21971#A2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "通过强化学习培养利用反馈、分析历史和提出改进的能力，将这些能力写进修改模型的参数，再用于新的优化任务。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2607.21971#S2.SS1"
          },
          {
            "label": "附录A",
            "url": "https://arxiv.org/html/2607.21971#A1.SS0.SSS0.Px1"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2608.05446": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "主可训练策略Qwen3-8B；提示时对照另用Claude Opus4.5、GPT-4.1、GPT-5。",
        "sources": [
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2608.05446#A3.SS0.SSS0.Px5"
          },
          {
            "label": "附录D.2",
            "url": "https://arxiv.org/html/2608.05446#A4.SS2"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.05446#S3.SS1.SSS0.Px2"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2608.05446#A3.SS0.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "监督微调（用示范数据训练模型）/GRPO训练Qwen3-8B；外部Claude Opus收集监督微调（用示范数据训练模型）轨迹并合并经验库，训练轮次边界才合并。附录C仅写“Claude Opus”，未标明该教师的具体版本，不能从对照方案的Opus4.5推定。",
        "sources": [
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2608.05446#A3.SS0.SSS0.Px5"
          },
          {
            "label": "附录D.2",
            "url": "https://arxiv.org/html/2608.05446#A4.SS2"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.05446#S3.SS1.SSS0.Px2"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2608.05446#A3.SS0.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "记录信念、进度与经验的外部状态，以及学习何时读写这些状态的模型策略。",
        "sources": [
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2608.05446#A3.SS0.SSS0.Px5"
          },
          {
            "label": "附录D.2",
            "url": "https://arxiv.org/html/2608.05446#A4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "ALFWorld 环境判断家居任务是否完成；奖励还考虑非法动作与框架使用成本，以训练模型何时值得读写外部状态。",
        "sources": [
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2608.05446#A3.SS0.SSS0.Px5"
          },
          {
            "label": "附录D.2",
            "url": "https://arxiv.org/html/2608.05446#A4.SS2"
          },
          {
            "label": "附录 C：动作解析",
            "url": "https://arxiv.org/html/2608.05446#A3.SS0.SSS0.Px2"
          },
          {
            "label": "附录 C：示范数据",
            "url": "https://arxiv.org/html/2608.05446#A3.SS0.SSS0.Px4"
          },
          {
            "label": "附录 C：GRPO",
            "url": "https://arxiv.org/html/2608.05446#A3.SS0.SSS0.Px5"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.05446#S3.SS1.SSS0.Px1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.05446#S3.SS2"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2608.05446#A3.SS0.SSS0.Px4"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2608.05446#S3.SS3"
          },
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2608.05446#S3.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "ALFWorld 家居操作环境外提供三类状态：当前世界信息、已确定的子目标进度、跨任务可复用经验，论文合称 BPE。track 查询物体，commit 记录子目标，recall 检索经验，note 写下新经验。先收集教师使用这些接口的示范，再训练模型自主选择何时调用。",
        "sources": [
          {
            "label": "SFT 数据构造；Table 1",
            "url": "https://arxiv.org/abs/2608.05446"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "固定三个外部状态接口：记录当前世界信息、任务进度、跨任务经验。训练模型决定何时查询或写入这些状态，另由外部总结模型整理经验内容。",
        "sources": [
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2608.05446#A3.SS0.SSS0.Px5"
          },
          {
            "label": "附录D.2",
            "url": "https://arxiv.org/html/2608.05446#A4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "教师在500个ALFWorld（通过文字动作完成家居物体操作的交互环境） 训练 games运行，保留87成功轨迹、1153下一动作样本；监督微调（用示范数据训练模型）后接GRPO（比较同一任务多次尝试的奖励，用相对好坏更新模型参数的强化学习方法）。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.05446#S3.SS1.SSS0.Px1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.05446#S3.SS2"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2608.05446#A3.SS0.SSS0.Px4"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2608.05446#A3.SS0.SSS0.Px5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "策略用commit/track/recall/note管理信念、进度和经验；每训练轮次末外部summarizer合并、修正或删除技能，batch内技能库稳定。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.05446#S3.SS1.SSS0.Px1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.05446#S3.SS2"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2608.05446#A3.SS0.SSS0.Px4"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2608.05446#A3.SS0.SSS0.Px5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "主表为ALFWorld140任务已见 split；另分析未见环境迁移，不能把主表96.9%称未见成绩。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.05446#S3.SS1.SSS0.Px1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.05446#S3.SS2"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2608.05446#A3.SS0.SSS0.Px4"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2608.05446#A3.SS0.SSS0.Px5"
          },
          {
            "label": "§3.3",
            "url": "https://arxiv.org/html/2608.05446#S3.SS3"
          },
          {
            "label": "§3.4",
            "url": "https://arxiv.org/html/2608.05446#S3.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "监督微调（用示范数据训练模型）语料来自训练 games；主结果的已见指训练分布内环境，非模型训练时已执行全部评测题。经验库更新和策略训练是两个机制。",
        "sources": [
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.05446#S3.SS1.SSS0.Px1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2608.05446#S3.SS2"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2608.05446#A3.SS0.SSS0.Px4"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2608.05446#A3.SS0.SSS0.Px5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "训练模型决定何时记录、整理和读取外部状态；执行时状态持续变化，训练所得读写策略决定怎样利用它。",
        "sources": [
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2608.05446#A3.SS0.SSS0.Px5"
          },
          {
            "label": "附录D.2",
            "url": "https://arxiv.org/html/2608.05446#A4.SS2"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2608.13951": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "所有SWE-bench与LCB任务执行尝试（从开始做任务到得到结果的过程）统一MiniMax-M2.7-highspeed（deterministic=false），配不同同题不同候选 运行框架。",
        "sources": [
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2608.13951#S5.SS1"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2608.13951#S5.SS2"
          },
          {
            "label": "§5.4",
            "url": "https://arxiv.org/html/2608.13951#S5.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "HELIX控制器按来源组合运行框架组件并组织候选验证；MiniMax-M2.7-highspeed执行任务。本文到达可供模型更新的轨迹数据产出，不等于已训练下一代模型。",
        "sources": [
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2608.13951#S5.SS1"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2608.13951#S5.SS2"
          },
          {
            "label": "§5.4",
            "url": "https://arxiv.org/html/2608.13951#S5.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "可组合的运行框架组件与运行策略；展示的搜索阶段冻结执行模型，轨迹供后续模型学习使用。",
        "sources": [
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2608.13951#S5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "SWE-bench 的代码测试结果、重复执行结果，以及执行记录的来源信息。",
        "sources": [
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2608.13951#S5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "在 Pi 类编程运行系统上用类型化接口约束会话、工具、控制、接收和策略，比较不同运行框架候选；验证 同题不同候选 轨迹后导出参数更新数据。可检查的更新边界比任意自写代码更窄。",
        "sources": [
          {
            "label": "§6 数据核算、Table 3；§7",
            "url": "https://arxiv.org/abs/2608.13951"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "重组 Pi 等开源运行框架的组件，在同一题上保存不同候选的成功、失败和接近成功的执行记录。结合官方验收标签生成可供后续训练、批评和偏好学习使用的数据；本文的数据产出不等于已完成下一代模型训练。",
        "sources": [
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2608.13951#S5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "主矩阵用LCB来源前100个合格AtCoder修复题，65种运行框架各跑一次，共6500 slots；SWE轨迹另导出训练记录。",
        "sources": [
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2608.13951#S5.SS2"
          },
          {
            "label": "§5.3",
            "url": "https://arxiv.org/html/2608.13951#S5.SS3"
          },
          {
            "label": "§5.4",
            "url": "https://arxiv.org/html/2608.13951#S5.SS4"
          },
          {
            "label": "§9.1",
            "url": "https://arxiv.org/html/2608.13951#S9.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "只用本地公开test_solution.py的实际执行及通过输出判断LCB成功；选成员做重复运行和官方SWE验证。",
        "sources": [
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2608.13951#S5.SS2"
          },
          {
            "label": "§5.3",
            "url": "https://arxiv.org/html/2608.13951#S5.SS3"
          },
          {
            "label": "§5.4",
            "url": "https://arxiv.org/html/2608.13951#S5.SS4"
          },
          {
            "label": "§9.1",
            "url": "https://arxiv.org/html/2608.13951#S9.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "LCB三成员各题10次，共3000 slots；跨基准SWE-bench Verified55题、5成员各2次，共550 slots。",
        "sources": [
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2608.13951#S5.SS2"
          },
          {
            "label": "§5.3",
            "url": "https://arxiv.org/html/2608.13951#S5.SS3"
          },
          {
            "label": "§5.4",
            "url": "https://arxiv.org/html/2608.13951#S5.SS4"
          },
          {
            "label": "§9.1",
            "url": "https://arxiv.org/html/2608.13951#S9.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "LCB只测公开用例，不是官方隐藏测试。论文证据链到达运行框架筛选及训练数据产出，不能声称已验证完整多代模型训练闭环。",
        "sources": [
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2608.13951#S5.SS2"
          },
          {
            "label": "§5.3",
            "url": "https://arxiv.org/html/2608.13951#S5.SS3"
          },
          {
            "label": "§5.4",
            "url": "https://arxiv.org/html/2608.13951#S5.SS4"
          },
          {
            "label": "§9.1",
            "url": "https://arxiv.org/html/2608.13951#S9.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "要求运行框架既支持当前执行，也产出可追踪、适合后续训练的轨迹；论文主要验证这一框架与数据接口，未完成多代模型训练的闭环实证。",
        "sources": [
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2608.13951#S5.SS1"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2505.19955": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "MLR-Agent研究系统比较o4-mini、Gemini2.5-Pro-Preview-05-06、Claude3.7 Sonnet；Codex配置用o4-mini-medium，AI 科研角色 V2用o4-mini-high。",
        "sources": [
          {
            "label": "§6",
            "url": "https://arxiv.org/html/2505.19955#S6.SS0.SSS0.Px1"
          },
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2505.19955#S3.SS5.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "各研究 task agent 在其模型与编码框架中迭代科研产物；MLR-Bench及MLR-Judge固定，不存在一个统一的跨论文自改模型。",
        "sources": [
          {
            "label": "§6",
            "url": "https://arxiv.org/html/2505.19955#S6.SS0.SSS0.Px1"
          },
          {
            "label": "§3.5",
            "url": "https://arxiv.org/html/2505.19955#S3.SS5.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "系统不做持续自进化；评测科研 agent 从想法到实验和论文的能力。",
        "sources": [
          {
            "label": "§6",
            "url": "https://arxiv.org/html/2505.19955#S6.SS0.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "Gemini-2.5-Pro-Preview 与 Claude-3.7-Sonnet 按研究阶段的评分要求分别评审，读取研究产物及实验日志后取平均；另与人类专家评价比较一致性。",
        "sources": [
          {
            "label": "§6",
            "url": "https://arxiv.org/html/2505.19955#S6.SS0.SSS0.Px1"
          },
          {
            "label": "§2.1：评审模型与输入",
            "url": "https://arxiv.org/html/2505.19955#S2.SS1"
          },
          {
            "label": "§3.3：十个实验课题",
            "url": "https://arxiv.org/html/2505.19955#S3.SS3"
          },
          {
            "label": "附录 D.2：评分细则",
            "url": "https://arxiv.org/html/2505.19955#A4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "MLR-Agent 四阶段：想法生成、提案、实验、论文写作；MLR-Judge 另按评分细则（逐项规定要满足的要求及给分标准）评审研究质量。基础系统已包含研究流程，作品得分与真实实验是否有效需要分别检查。",
        "sources": [
          {
            "label": "benchmark 组成与评估框架",
            "url": "https://arxiv.org/abs/2505.19955"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "评估从想法到论文的完整开放研究过程，并提供模块化研究 task agent 与经人类对照的评审器。",
        "sources": [
          {
            "label": "§6",
            "url": "https://arxiv.org/html/2505.19955#S6.SS0.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "201个来自NeurIPS/ICLR/ICML workshop的开放研究任务；task agent 为各课题自行选数据和实验。",
        "sources": [
          {
            "label": "§6",
            "url": "https://arxiv.org/html/2505.19955#S6.SS0.SSS0.Px1"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2505.19955#S4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "MLR-Agent组织研究阶段并迭代产物；MLR-Judge按评分细则（逐项规定要满足的要求及给分标准）评阶段产物及最终论文。",
        "sources": [
          {
            "label": "§6",
            "url": "https://arxiv.org/html/2505.19955#S6.SS0.SSS0.Px1"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2505.19955#S4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "201题是研究项目集合，按科研产物质量评价；另外用人类专家评分检查语言模型评审一致性。",
        "sources": [
          {
            "label": "§6",
            "url": "https://arxiv.org/html/2505.19955#S6.SS0.SSS0.Px1"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2505.19955#S4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "不是统一模型训练数据集；课题内数据划分由各研究实现决定，论文质量分不等价于严格测试集成绩。",
        "sources": [
          {
            "label": "§6",
            "url": "https://arxiv.org/html/2505.19955#S6.SS0.SSS0.Px1"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2505.19955#S4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "评价从研究想法到真实实验和论文的完整过程，核对实验是否实际成立，使可信研究与流畅写作可以分开观察。",
        "sources": [
          {
            "label": "§6",
            "url": "https://arxiv.org/html/2505.19955#S6.SS0.SSS0.Px1"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2605.08678": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "完整集：Claude Opus4.6、GPT-5.4、Gemini3.1 Pro、DeepSeekV3.2、Qwen3.6 Plus。Lite另有Opus4.7、Sonnet4.6、GPT-5.5 Pro/5.5、Gemini3.1 Flash Lite、DeepSeekV4Pro/Flash、Qwen3.6Max、KimiK2.6、GLM5.1。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2605.08678#S3.SS2.SSS1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2605.08678#S3.SS2.SSS1.Px1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2605.08678#S4.SS1.SSS0.Px1"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2605.08678#S5.SS1.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "一般实验由上述任务模型改算法；测试时进化用Gemini3.1 Pro，测试时参数训练用Qwen3.5-35B-A3B。两条路线不能当同模型对照。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2605.08678#S3.SS2.SSS1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2605.08678#S3.SS2.SSS1.Px1"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2605.08678#S4.SS1.SSS0.Px1"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2605.08678#S5.SS1.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "被改进的是目标机器学习方法；不要求研究 agent 本身持续自改。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2605.08678#S3.SS2.SSS1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2605.08678#S3.SS2.SSS1.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "在固定训练和评估流程下运行修改后的算法，比较多个数据、环境或模型规模设置的成绩；隐藏设置用于检查改进是否能推广。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2605.08678#S3.SS2.SSS1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2605.08678#S3.SS2.SSS1.Px1"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2605.08678#S5.SS1.SSS0.Px1"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2605.08678#S5.SS2.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "起点提供完整对照方案、代码、数据协议和预算，后端在隔离软件环境中运行。agent 用四种工具实验：edit 修改指定组件，test 运行训练并查看允许公开的指标，submit 提交此前结果，undo 撤回改动。训练和评估规则由平台固定。",
        "sources": [
          {
            "label": "§3 任务设计、运行接口、test-time scaling",
            "url": "https://arxiv.org/abs/2605.08678"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "锁住评估器及共用训练超参，把得分改进尽量归因于目标算法；支持采样、探索、种群进化和测试时训练对照。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2605.08678#S3.SS2.SSS1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2605.08678#S3.SS2.SSS1.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "140个研究任务覆盖12个ML领域，各任务提供代码、对照方案及数据设置；只能编辑指定算法组件。",
        "sources": [
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2605.08678#S5.SS1.SSS0.Px1"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2605.08678#S5.SS2.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "统一受保护训练协议、容量和评估器；低延迟进化/测试时训练实验开放三个设置中的两个。",
        "sources": [
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2605.08678#S5.SS1.SSS0.Px1"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2605.08678#S5.SS2.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "在任务规格规定的设置评价算法；上述进化/训练对照另用第三个隐藏设置测迁移。",
        "sources": [
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2605.08678#S5.SS1.SSS0.Px1"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2605.08678#S5.SS2.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "140是方法研究任务数，各任务内部数据不同；测试集工具可见反馈与隐藏设置成绩需分开，不能把所有结果都称盲测。",
        "sources": [
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2605.08678#S5.SS1.SSS0.Px1"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2605.08678#S5.SS2.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "要求提出的机器学习改进跨设置仍有效、扩大规模后仍成立，使方法创新与只在一个设置中调出高分可以区分。",
        "sources": [
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2605.08678#S3.SS2.SSS1"
          },
          {
            "label": "§3.2",
            "url": "https://arxiv.org/html/2605.08678#S3.SS2.SSS1.Px1"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2608.17271": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "表 2 比较 18 种模型／工具组合：包括 Codex + GPT-5.6 Sol（xhigh／ultra），Claude Code（可读写项目文件、运行命令和测试的 coding agent 工具） + Opus 5／Opus 4.8／GLM-5.3／GLM-5.2／Kimi K3／K2.7／MiniMax M3／DeepSeek V4 Flash／Pro／MiMo V2.5 Pro，以及 Kimi Code、MiMo Code、OpenHands 下的对应配置。agent 执行完整科研项目。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2608.17271#S2.SS1"
          },
          {
            "label": "附录D",
            "url": "https://arxiv.org/html/2608.17271#A4"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.17271#S3.SS1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.17271#S3.SS1.SSS0.Px1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.17271#S3.SS1.SSS0.Px3"
          },
          {
            "label": "Claude Code 官方说明",
            "url": "https://code.claude.com/docs/en/overview"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "没有跨任务持续修改自身的 agent；评测程序改变提供给 agent 的方法与步骤说明，以测试科研自主性。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2608.17271#S2.SS1"
          },
          {
            "label": "附录D",
            "url": "https://arxiv.org/html/2608.17271#A4"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.17271#S3.SS1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.17271#S3.SS1.SSS0.Px1"
          },
          {
            "label": "§3.1",
            "url": "https://arxiv.org/html/2608.17271#S3.SS1.SSS0.Px3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "系统不进化；逐步减少提供给科研 agent 的方法与步骤指导。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2608.17271#S2.SS1"
          },
          {
            "label": "附录D",
            "url": "https://arxiv.org/html/2608.17271#A4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "科研项目各有参考生成和评分逻辑，通过沙箱执行与评分重放检查产物；专家审查主要用于保证基准任务质量，不是 agent 执行时的实时指导。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2608.17271#S2.SS1"
          },
          {
            "label": "附录D",
            "url": "https://arxiv.org/html/2608.17271#A4"
          },
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2608.17271#A3.SS0.SSS0.Px6"
          },
          {
            "label": "附录 C：任务提交与修订",
            "url": "https://arxiv.org/html/2608.17271#A3.SS0.SSS0.Px4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "给研究 task agent 项目级问题、数据、约束与交付要求，允许自行构建分析和实验流程。不是所有任务共用可编辑的统一初始任务求解模型；例如动力学任务只给观察数据，不直接给控制方程。",
        "sources": [
          {
            "label": "任务构造与示例规格",
            "url": "https://arxiv.org/abs/2608.17271"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "用完整科研项目和逐步撤去方法指导的四级提示，区分知识、选方法与把方法落实成实验的能力。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2608.17271#S2.SS1"
          },
          {
            "label": "附录D",
            "url": "https://arxiv.org/html/2608.17271#A4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "60个项目级科学研究任务，输入各领域观测数据；不是统一训练集。",
        "sources": [
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2608.17271#A3.SS0.SSS0.Px6"
          },
          {
            "label": "附录D",
            "url": "https://arxiv.org/html/2608.17271#A4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "task agent 分析观测、建模、模拟及生成科研产物；B1–B4改变给多少方法/操作指导。",
        "sources": [
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2608.17271#A3.SS0.SSS0.Px6"
          },
          {
            "label": "附录D",
            "url": "https://arxiv.org/html/2608.17271#A4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "11个科学领域的项目交付；例如二维动力学以观测快照和初态预测未来场，并提交谱、诊断和可执行代码。",
        "sources": [
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2608.17271#A3.SS0.SSS0.Px6"
          },
          {
            "label": "附录D",
            "url": "https://arxiv.org/html/2608.17271#A4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "同任务不同提示等级保持科学目标、数据和评分相同，主要测自主方法实现能力，不能解释为跨题训练后泛化。",
        "sources": [
          {
            "label": "附录C",
            "url": "https://arxiv.org/html/2608.17271#A3.SS0.SSS0.Px6"
          },
          {
            "label": "附录D",
            "url": "https://arxiv.org/html/2608.17271#A4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "对同一科研项目逐步减少人类给定的方法和步骤，测 agent 在少指导条件下能否自主完成可验证研究。",
        "sources": [
          {
            "label": "§2.1",
            "url": "https://arxiv.org/html/2608.17271#S2.SS1"
          },
          {
            "label": "附录D",
            "url": "https://arxiv.org/html/2608.17271#A4"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2507.19457": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "主复合AI系统使用Qwen3-8B或GPT-4.1-mini-2025-04-14；它们执行候选提示，GEPA不更新这些执行模型的权重。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2507.19457#S3"
          },
          {
            "label": "附录E.2",
            "url": "https://arxiv.org/html/2507.19457#A5.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "Qwen3-8B 或 GPT-4.1-mini 在对应配置中读取执行轨迹和文字反馈，提出提示修改；固定 GEPA 算法选择候选并评测。跨模型实验将完全用 Qwen3-8B 优化的提示交给 GPT-4.1-mini 执行。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2507.19457#S3"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2507.19457#S4"
          },
          {
            "label": "附录E.2",
            "url": "https://arxiv.org/html/2507.19457#A5.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "模型系统中的一个或多个提示；基础模型参数保持不变。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2507.19457#S3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "执行轨迹提供推理、工具调用和返回信息；任务反馈进一步指出缺失文档、未满足约束或结果错误，供模型提出有针对性的提示修改。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2507.19457#S3"
          },
          {
            "label": "附录 E.1：逐基准反馈函数",
            "url": "https://arxiv.org/html/2507.19457#A5.SS1"
          },
          {
            "label": "§4：访问边界",
            "url": "https://arxiv.org/html/2507.19457#S4"
          },
          {
            "label": "§5.1：反馈驱动手册检索",
            "url": "https://arxiv.org/html/2507.19457#S5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "固定复合 AI 程序及模块接口，在执行轨迹反馈下修改模块提示，并保留不同题上互补的候选。DSPy 与 Trace 对照保持相同架构、初始提示及数据；不是由 GEPA 自由改写任意工具。",
        "sources": [
          {
            "label": "实验比较、优化数据协议；§5.1",
            "url": "https://arxiv.org/abs/2507.19457"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "利用执行轨迹和评估器诊断文本定向改提示，按逐题Pareto（保留在不同评价维度上各有优势、不能被另一候选全面超过的方案）优势保留多样候选，必要时合并互补模块。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2507.19457#S3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "HotpotQA150；IF-RLVR150；AIME2022–24共90题的一半；PUPA111；LiveBench-Math368题约三等分；HoVer150。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2507.19457#S4"
          },
          {
            "label": "附录E.1",
            "url": "https://arxiv.org/html/2507.19457#A5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "训练材料内部区分产生反思的反馈与Pareto（保留在不同评价维度上各有优势、不能被另一候选全面超过的方案）比较；外部验证集可查分、限制直接读题。Hotpot/IF各300、AIME45、PUPA111验证。HoVer300验证。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2507.19457#S4"
          },
          {
            "label": "附录E.1",
            "url": "https://arxiv.org/html/2507.19457#A5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "HotpotQA300；IFBench294新约束题；AIME2025共30题各重复5次；PUPA221；LiveBench剩余测试部分；HoVer300。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2507.19457#S4"
          },
          {
            "label": "附录E.1",
            "url": "https://arxiv.org/html/2507.19457#A5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "主实验三段分开；IFBench测试约束训练不可见。另有NPUEval/KernelBench逐题程序优化，不能套用主提示实验协议。",
        "sources": [
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2507.19457#S4"
          },
          {
            "label": "附录E.1",
            "url": "https://arxiv.org/html/2507.19457#A5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "从执行记录中反思错误来改提示，同时保留在不同任务上各有所长的候选并尝试组合，充分利用分数之外的文字证据。",
        "sources": [
          {
            "label": "§3",
            "url": "https://arxiv.org/html/2507.19457#S3"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2609.00829": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "公开题：DeepSeek-V4-Flash + OpenClaw；企业题：领域微调Qwen3.6-27B或DeepSeek-V4-Flash + LAMAgent。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2609.00829#S4.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "评估 agent 负责失败定位及候选审核，优化 agent 据反馈编辑运行框架。§4.1 明确了执行端 Qwen3.6-27B／DeepSeek-V4-Flash，但未分别列出这两个修改相关角色的模型配置。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2609.00829#S4.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "执行代码、提示、技能和工具；模型冻结。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2609.00829#S4.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "先判断任务成败，再把失败过程与成功参考路径对齐，找出反复出错的步骤；候选修改还要通过防记答案检查和任务表现检查。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2609.00829#S4.SS1"
          },
          {
            "label": "§3.5：质量门控",
            "url": "https://arxiv.org/html/2609.00829#S3.SS5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "企业任务用 LAMAgent，开放任务用 OpenClaw；前者可改项目代码/技能/提示/工具，后者可改技能目录、AGENTS.md、SOUL.md 和工具。技能目录含参考资料与脚本，不限一份 skill.md。",
        "sources": [
          {
            "label": "数据与 Implementation Details",
            "url": "https://arxiv.org/abs/2609.00829"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "对比真实与参考轨迹定位运行框架故障；可改整目录、脚本及项目代码，不只改skill.md。OpenClaw用于公开题，LAMAgent用于企业题。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2609.00829#S4.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "SearchQA、OfficeQA、SpreadsheetBench及自建CloudCoreNetwork-QA、Wireless-QA的训练split；企业题涉及网络问答及KPI/网元配置SQL。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2609.00829#S4.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "训练题最多5次尝试构造参考轨迹；验证集做改动门控与早停。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2609.00829#S4.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "各数据集测试集，所有方法共用三段划分；另将OpenClaw产物迁移其他运行框架。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2609.00829#S4.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "§4.1没有列各split绝对数量，企业数据称in-house；不能推定公开可下载或套用SkillOpt的2:1:7。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2609.00829#S4.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "借助参考答案构造的参考轨迹定位失败，再改可复用框架，并检查答案泄漏、提示膨胀和已有任务退化；参考轨迹属于额外监督。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2609.00829#S4.SS1"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2608.27311": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "DeepSeek-V4-Flash-preview，分别在OpenCode（可连接不同模型的开源 coding agent 工具）、Codex CLI（在终端中读写代码、运行命令的 coding agent 工具）、Pi Coding Agent中执行。",
        "sources": [
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2608.27311#A1.SS1"
          },
          {
            "label": "附录C.2",
            "url": "https://arxiv.org/html/2608.27311#A3.SS2.SSS2"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2608.27311#S5.SS1.SSS0.Px2"
          },
          {
            "label": "OpenCode 官方说明",
            "url": "https://opencode.ai/docs"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "DeepSeek-V4-Flash-preview承担进化、诊断与任务执行等模型角色；控制器安排配对验证、确认和预算计数。",
        "sources": [
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2608.27311#A1.SS1"
          },
          {
            "label": "附录C.2",
            "url": "https://arxiv.org/html/2608.27311#A3.SS2.SSS2"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2608.27311#S5.SS1.SSS0.Px2"
          },
          {
            "label": "附录B.2",
            "url": "https://arxiv.org/html/2608.27311#A2.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "用户可配置的运行框架组件。",
        "sources": [
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2608.27311#A1.SS1"
          },
          {
            "label": "附录C.2",
            "url": "https://arxiv.org/html/2608.27311#A3.SS2.SSS2"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2608.27311#S5.SS1.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "从失败轨迹识别需要修复的行为，再在相关训练题上比较修改前后；除了成绩提高，还要确认改动确实触发并恢复了目标行为。",
        "sources": [
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2608.27311#A1.SS1"
          },
          {
            "label": "附录C.2",
            "url": "https://arxiv.org/html/2608.27311#A3.SS2.SSS2"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2608.27311#S5.SS1.SSS0.Px2"
          },
          {
            "label": "§3.2：二元任务结果",
            "url": "https://arxiv.org/html/2608.27311#S3.SS2"
          },
          {
            "label": "§5.1：实验设置",
            "url": "https://arxiv.org/html/2608.27311#S5.SS1.SSS0.Px2"
          },
          {
            "label": "附录 A.4.2：配对审查",
            "url": "https://arxiv.org/html/2608.27311#A1.SS4.SSS2"
          },
          {
            "label": "附录 B.2：原生运行与 grader",
            "url": "https://arxiv.org/html/2608.27311#A2.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "用 OpenCode（可连接不同模型的开源 coding agent 工具） 1.17.13、Codex CLI（在终端中读写代码、运行命令的 coding agent 工具） 0.144.4、Pi 0.80.10 的用户可配置组件作为起点；任务模型/工具/推理预算由评估端覆盖固定。Banking Knowledge 用 BM25（根据查询词与文档词项匹配程度排序的检索算法） 检索，修改不能擅自扩工具或预算。",
        "sources": [
          {
            "label": "附录 B.1–B.4、Tables 7–9",
            "url": "https://arxiv.org/abs/2608.27311"
          },
          {
            "label": "OpenCode 官方说明",
            "url": "https://opencode.ai/docs"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "先定位任务空间和运行框架组件，再用配对轨迹检查是否真正修复；即使小批次分数上涨，也可因无可归因恢复而拒绝。",
        "sources": [
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2608.27311#A1.SS1"
          },
          {
            "label": "附录C.2",
            "url": "https://arxiv.org/html/2608.27311#A3.SS2.SSS2"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2608.27311#S5.SS1.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "四个环境各抽30题TRAIN：τ² Retail、τ³ Banking Knowledge、Terminal-Bench2、BIRD Mini-Dev Challenging。",
        "sources": [
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2608.27311#S5.SS1.SSS0.Px1"
          },
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2608.27311#A2.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "TRAIN内选择至少5题做配对验证，再确认；要求改动确实触发且能归因于恢复行为，不只看分数涨跌。",
        "sources": [
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2608.27311#S5.SS1.SSS0.Px1"
          },
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2608.27311#A2.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "互斥TEST分别40、67、59、72题；τ²使用官方40题测试集，其余为扣除TRAIN后的剩余题。",
        "sources": [
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2608.27311#S5.SS1.SSS0.Px1"
          },
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2608.27311#A2.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "TEST的题目、轨迹与反馈全程不可见；内部20/10对照划分仍属于TRAIN，不是最终TEST。",
        "sources": [
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2608.27311#S5.SS1.SSS0.Px1"
          },
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2608.27311#A2.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "根据补丁涉及的行为选择更相关的验证任务并分配预算，检查局部退化，减少每次都完整重跑固定题集的成本。",
        "sources": [
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2608.27311#A1.SS1"
          },
          {
            "label": "附录C.2",
            "url": "https://arxiv.org/html/2608.27311#A3.SS2.SSS2"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2608.27311#S5.SS1.SSS0.Px2"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2608.10178": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "Claude Haiku4.5、GPT-5-mini、DeepSeek-V4-Flash，分别运行相同初始运行框架。",
        "sources": [
          {
            "label": "§2.2",
            "url": "https://arxiv.org/html/2608.10178#S2.SS2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.10178#S4.SS1.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "每次实验均由对应的 Claude Haiku 4.5、GPT-5-mini 或 DeepSeek-V4-Flash 同时承担任务执行和外层修改两个角色；因此跨模型结果反映两种角色的共同影响。",
        "sources": [
          {
            "label": "§2.2",
            "url": "https://arxiv.org/html/2608.10178#S2.SS2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.10178#S4.SS1.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "提示、工具和记忆；生成修改的进化方法固定。",
        "sources": [
          {
            "label": "§2.2",
            "url": "https://arxiv.org/html/2608.10178#S2.SS2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.10178#S4.SS1.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "仓库测试给出修复成败，轨迹分析标记失败类型；修改者预测哪些题会改善或退化，下一轮实际执行再核对这些预测。",
        "sources": [
          {
            "label": "§2.2",
            "url": "https://arxiv.org/html/2608.10178#S2.SS2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.10178#S4.SS1.SSS0.Px2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.10178#S4.SS1.SSS0.Px1"
          },
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2608.10178#A2.SS1"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2608.10178#S4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "极简推理—行动循环：两句系统提示、任务与提交模板、一个命令行工具，记忆和自动触发处理代码起初为空。未预先写入测试、构建、补丁范围等指导规则；另与人工设计的 mini-SWE-agent 轻量编程框架在相同预算下比较。",
        "sources": [
          {
            "label": "附录 B.1–B.3",
            "url": "https://arxiv.org/abs/2608.10178"
          },
          {
            "label": "mini-swe-agent 官方说明",
            "url": "https://github.com/SWE-agent/mini-swe-agent"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "重点分析相同进化方法究竟写入什么：可跨语言的行为原则与语言/模型相关细节，以及这些产物的迁移。",
        "sources": [
          {
            "label": "§2.2",
            "url": "https://arxiv.org/html/2608.10178#S2.SS2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.10178#S4.SS1.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "Multi-SWE-BenchC、C++、Java、Rust、TypeScript、JavaScript、Go、Python八种语言，各20题作进化集，逐轮评分，运行3轮。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.10178#S4.SS1.SSS0.Px1"
          },
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2608.10178#A2.SS1"
          },
          {
            "label": "§4",
            "url": "https://arxiv.org/html/2608.10178#S4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "相同进化规则用于不同语言/模型，分析最终行为指导、工具和执行缺陷。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.10178#S4.SS1.SSS0.Px1"
          },
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2608.10178#A2.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "每语言50题互斥单独留出的；只在最终提升版本上评一次。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.10178#S4.SS1.SSS0.Px1"
          },
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2608.10178#A2.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "测试不参与提案、打分或选择；跨模型移植/蒸馏复用同一测试题，不能累计为新增样本。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.10178#S4.SS1.SSS0.Px1"
          },
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2608.10178#A2.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "固定进化流程，跨语言和模型比较所得框架，并删去语言生态专属内容做对照，区分通用执行策略与本地工程知识。",
        "sources": [
          {
            "label": "§2.2",
            "url": "https://arxiv.org/html/2608.10178#S2.SS2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2608.10178#S4.SS1.SSS0.Px2"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2608.31100": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "主上下文实验：GPT-4o、GPT-4.1、o3-mini、Gemini2.5 Flash/Pro、GPT-5.5、Gemini3.5 Flash，使用统一游戏接口。 参数训练实验另用 Qwen3-8B：训练轮次 0 是原始模型，训练轮次 1–19 是用探索轨迹更新后的模型；每个检查点都在七个游戏上测试。",
        "sources": [
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2608.31100#S4.SS4"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2608.31100#S5.SS2.SSS0.Px2"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2608.31100#S5.SS2.SSS0.Px1"
          },
          {
            "label": "§6.1",
            "url": "https://arxiv.org/html/2608.31100#S6.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "模型产生自评与经验总结；控制器保留历史或摘要。参数学习分支另用自生成轨迹训练模型。",
        "sources": [
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2608.31100#S4.SS4"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2608.31100#S5.SS2.SSS0.Px2"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2608.31100#S5.SS2.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "对比保留交互历史、维护摘要记忆和训练模型参数三条学习路径。",
        "sources": [
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2608.31100#S4.SS4"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2608.31100#S5.SS2.SSS0.Px2"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2608.31100#S5.SS2.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "模型自评与可执行环境结果检查器（按测试或判分规则检查任务结果）。",
        "sources": [
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2608.31100#S4.SS4"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2608.31100#S5.SS2.SSS0.Px2"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2608.31100#S5.SS2.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "统一文本游戏交互接口，动作后能得到程序计算的结果，并要求模型给自评分。比较直接使用历史、摘要记忆和参数训练三种经验利用方式；这三种更新对象不同。",
        "sources": [
          {
            "label": "benchmark 设计与探索/评估阶段；附录游戏规格",
            "url": "https://arxiv.org/abs/2608.31100"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "先让 agent 主动试验，再让它自行判断结果，最后比较原始历史、摘要记忆和参数学习三种经验利用方式。真实环境判分在探索时不提供，用于之后检查自评是否可靠和能力是否提升。",
        "sources": [
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2608.31100#S4.SS4"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2608.31100#S5.SS2.SSS0.Px2"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2608.31100#S5.SS2.SSS0.Px1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "七个文本游戏的宽松探索配置：Chess、Minesweeper、Nullify、Plants-vs-Zombies、Snake、Tetris、Trust Evolution。",
        "sources": [
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2608.31100#S4.SS4"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2608.31100#S5.SS1"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2608.31100#A1.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "用自己的轨迹和自评分更新完整历史、摘要记忆或参数；再用真实环境分数检查自评是否可靠。",
        "sources": [
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2608.31100#S4.SS4"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2608.31100#S5.SS1"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2608.31100#A1.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "更严格配置：如扫雷首雷即结束、Snake碰撞结束、Trust Evolution均匀抽对手；逐checkpoint（某个时刻保存的模型或系统版本）评价收益。",
        "sources": [
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2608.31100#S4.SS4"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2608.31100#S5.SS1"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2608.31100#A1.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "探索和评测随机种子互斥；评测轨迹不写入历史、记忆或训练数据。宽松到严格的变化按游戏定义，非统一文本数据split。",
        "sources": [
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2608.31100#S4.SS4"
          },
          {
            "label": "§5.1",
            "url": "https://arxiv.org/html/2608.31100#S5.SS1"
          },
          {
            "label": "附录A.1",
            "url": "https://arxiv.org/html/2608.31100#A1.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "将自主尝试、自我判分和利用经验分阶段测量；探索时不提供环境真实分数，正式测验再用程序检查任务结果。",
        "sources": [
          {
            "label": "§4.4",
            "url": "https://arxiv.org/html/2608.31100#S4.SS4"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2608.31100#S5.SS2.SSS0.Px2"
          },
          {
            "label": "§5.2",
            "url": "https://arxiv.org/html/2608.31100#S5.SS2.SSS0.Px1"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "2609.01481": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "Codex CLI0.142.5 + GPT-5.5 high；OpenCode1.14.30 + DeepSeek-V4-Pro；Pi0.80.10 + MiniMax-M3。",
        "sources": [
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2609.01481#A1.SS2"
          },
          {
            "label": "附录B.6",
            "url": "https://arxiv.org/html/2609.01481#A2.SS6"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2609.01481#S4.SS2.SSS0.Px2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2609.01481#S4.SS1.SSS0.Px2"
          },
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2609.01481#A2.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "对应同一模型–运行框架配置承担Planner/Developer/QA角色：规划角色改文档、Developer改项目代码、QA产出证据。不是另有一个被训练的HoH模型。",
        "sources": [
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2609.01481#A1.SS2"
          },
          {
            "label": "附录B.6",
            "url": "https://arxiv.org/html/2609.01481#A2.SS6"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2609.01481#S4.SS2.SSS0.Px2"
          },
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2609.01481#S4.SS1.SSS0.Px2"
          },
          {
            "label": "附录B.1",
            "url": "https://arxiv.org/html/2609.01481#A2.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "正在开发的软件项目与版本历史。",
        "sources": [
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2609.01481#A1.SS2"
          },
          {
            "label": "附录B.6",
            "url": "https://arxiv.org/html/2609.01481#A2.SS6"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2609.01481#S4.SS2.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "实现时测试与独立评价分离。",
        "sources": [
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2609.01481#A1.SS2"
          },
          {
            "label": "附录B.6",
            "url": "https://arxiv.org/html/2609.01481#A2.SS6"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2609.01481#S4.SS2.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "在现成 编程 task agent 外加开发者—独立 QA—规划交接协议；保存开发文档、执行证据和下一轮修订要求。对照 Vanilla 只有标准开发一遍，Vanilla Continuation 多续跑两次但不提供独立 QA 证据。",
        "sources": [
          {
            "label": "附录 B.4–B.5、跨迭代证据协议",
            "url": "https://arxiv.org/abs/2609.01481"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "外层流程协调已有 coding agent，每轮根据计划、质量检查证据和已有代码继续开发。保留上轮项目作为下一轮起点，支持多日修复与功能扩展；变化的主要是软件产物。",
        "sources": [
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2609.01481#A1.SS2"
          },
          {
            "label": "附录B.6",
            "url": "https://arxiv.org/html/2609.01481#A2.SS6"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2609.01481#S4.SS2.SSS0.Px2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "同一软件项目的公开规格与上一轮QA证据驱动继续开发；不是跨数据集训练运行框架。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2609.01481#S4.SS1.SSS0.Px4"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2609.01481#S4.SS2.SSS0.Px1"
          },
          {
            "label": "§5",
            "url": "https://arxiv.org/html/2609.01481#S5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "固定Planner/Developer/QA循环，更新开发文档、保留项目代码；QA证据反馈下一轮，不提供私有评分细则（逐项规定要满足的要求及给分标准）。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2609.01481#S4.SS1.SSS0.Px4"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2609.01481#S4.SS2.SSS0.Px1"
          },
          {
            "label": "§5",
            "url": "https://arxiv.org/html/2609.01481#S5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "GameCraft-Bench45项目、FrontierSWE15项目、ProgramBench隐藏行为测试；另从空目录开发FPS Fusepoint70轮。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2609.01481#S4.SS1.SSS0.Px4"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2609.01481#S4.SS2.SSS0.Px1"
          },
          {
            "label": "§5",
            "url": "https://arxiv.org/html/2609.01481#S5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "最终评测基准评估与开发QA分开；项目本身反复修改。三轮提升是同项目产物进化，不是 harness/模型参数自改。",
        "sources": [
          {
            "label": "§4.1",
            "url": "https://arxiv.org/html/2609.01481#S4.SS1.SSS0.Px4"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2609.01481#S4.SS2.SSS0.Px1"
          },
          {
            "label": "§5",
            "url": "https://arxiv.org/html/2609.01481#S5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "在现成 coding agent 之外安排持续开发，将缺陷修复与新增功能分开推进；主要累积改进的是软件项目产物。",
        "sources": [
          {
            "label": "附录A.2",
            "url": "https://arxiv.org/html/2609.01481#A1.SS2"
          },
          {
            "label": "附录B.6",
            "url": "https://arxiv.org/html/2609.01481#A2.SS6"
          },
          {
            "label": "§4.2",
            "url": "https://arxiv.org/html/2609.01481#S4.SS2.SSS0.Px2"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-09",
    "roleAuditDate": "2026-09-09"
  },
  "rsi-exam": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "**研究过程：** 被测模型在 coding agent 工具中运行实验，模型与框架配对见“谁来改”。\n\n**候选方法的执行：** 按任务区分。记忆架构调用固定 gpt-4o-mini；科学发现框架调用固定 gpt-4o；Lean 证明流程调用固定 gpt-5.4-2026-03-05 并交给 Lean 4.9 检查。数学后训练任务由提交的 Qwen3-1.7B-Base 衍生模型答题；数值求解任务直接运行提交的程序。",
        "sources": [
          {
            "label": "官方报告 · 被测模型与执行框架",
            "url": "https://rsi-exam.ai/blog.html#models-harnesses"
          },
          {
            "label": "任务内模型配置（固定版本仓库）",
            "url": "https://github.com/aiming-lab/RSI-Exam/blob/0386e19fe41fa924c04a68702f20591ab612132d/.env.local.example"
          },
          {
            "label": "任务说明 · 记忆架构：数据、固定模型、判分",
            "url": "https://rsi-exam.ai/tasks/locomo_longterm_memory.html"
          },
          {
            "label": "任务说明 · 科学发现：场景、预算、三项指标",
            "url": "https://rsi-exam.ai/tasks/discoveryworld_agent_harness_low2.html"
          },
          {
            "label": "任务说明 · Lean 证明：开发题、模型与编译检查",
            "url": "https://rsi-exam.ai/tasks/lean_formal_proof_workflow_design.html"
          },
          {
            "label": "任务说明 · 数学后训练：数据、学生模型、答案匹配",
            "url": "https://rsi-exam.ai/tasks/teacher_student_math_posttraining.html"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "公开报告比较九组研究者模型与 agent 工具：Opus 5、GLM 5.3、DeepSeek V4 Pro 配 Claude Code；GPT-5.6-sol、GPT-5.5 配 Codex；Kimi K3 配 Kimi CLI；Grok 4.6 配 Grok Build；Qwen3.8 Max 配 Qwen Coder；Gemini 3.7 Flash 配 Antigravity CLI。这些工具负责文件编辑、命令执行和上下文管理。研究者自行提假设、修改、测量并选择最终版本，统一提示给出研究流程；研究者模型自身不在本次任务中训练。",
        "sources": [
          {
            "label": "官方报告 · 被测模型与执行框架",
            "url": "https://rsi-exam.ai/blog.html#models-harnesses"
          },
          {
            "label": "统一研究指令：实验、保存版本与回退",
            "url": "https://github.com/aiming-lab/RSI-Exam/blob/0386e19fe41fa924c04a68702f20591ab612132d/infra/prompts/autoresearch.j2"
          },
          {
            "label": "官方报告 · 适用范围与限制",
            "url": "https://rsi-exam.ai/blog.html#conclusion"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "任务指定的算法、程序或固定模型外围的框架。部分任务训练作为产物的学生模型，法律任务交付回答；提出改进方案的研究者模型自身不训练。",
        "sources": [
          {
            "label": "官方报告 · 研究目标",
            "url": "https://rsi-exam.ai/blog.html#introduction"
          },
          {
            "label": "任务说明 · 数学后训练：数据、学生模型、答案匹配",
            "url": "https://rsi-exam.ai/tasks/teacher_student_math_posttraining.html"
          },
          {
            "label": "任务说明 · 法律任务：可见最终问题与保密评分标准",
            "url": "https://rsi-exam.ai/tasks/legal_matter_caseload_regulatory.html"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "开发反馈来自各任务自己的检查程序或评分服务：记忆问答对照参考答案算词元 F1；Lean 证明由编译器验收；科学发现报告行动进度、完成情况与解释性知识；数学训练只返回开发题总体正确率；法律问答返回满足了几项保密要求。修改者可根据这些分数及允许查看的运行记录继续实验；正式结果原则上只在提交后计算。",
        "sources": [
          {
            "label": "任务说明 · 记忆架构：数据、固定模型、判分",
            "url": "https://rsi-exam.ai/tasks/locomo_longterm_memory.html"
          },
          {
            "label": "任务说明 · Lean 证明：开发题、模型与编译检查",
            "url": "https://rsi-exam.ai/tasks/lean_formal_proof_workflow_design.html"
          },
          {
            "label": "任务说明 · 科学发现：场景、预算、三项指标",
            "url": "https://rsi-exam.ai/tasks/discoveryworld_agent_harness_low2.html"
          },
          {
            "label": "任务说明 · 数学后训练：数据、学生模型、答案匹配",
            "url": "https://rsi-exam.ai/tasks/teacher_student_math_posttraining.html"
          },
          {
            "label": "任务说明 · 法律任务：可见最终问题与保密评分标准",
            "url": "https://rsi-exam.ai/tasks/legal_matter_caseload_regulatory.html"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "**研究者的外层工具：** 使用现成 coding agent，并统一提供“提假设—实现—测量—保存或撤回”的研究指令；Harbor 负责容器、执行预算与独立评分环境。报告运行未使用额外技能库或 MCP 外部工具连接服务。\n\n**被改进的起点：** 每题提供任务专属的可运行弱方法。例如记忆系统只抽取零散事实、按 BM25 词项匹配检索后调用一次模型；证明系统先生成证明，编译失败后至多修复一次；科学发现初始框架每步重新调用模型并重放历史，没有独立的持久状态管理。",
        "sources": [
          {
            "label": "官方报告 · 运行与访问限制",
            "url": "https://rsi-exam.ai/blog.html#execution-records"
          },
          {
            "label": "统一研究指令：实验、保存版本与回退",
            "url": "https://github.com/aiming-lab/RSI-Exam/blob/0386e19fe41fa924c04a68702f20591ab612132d/infra/prompts/autoresearch.j2"
          },
          {
            "label": "任务说明 · 记忆架构：数据、固定模型、判分",
            "url": "https://rsi-exam.ai/tasks/locomo_longterm_memory.html"
          },
          {
            "label": "任务说明 · Lean 证明：开发题、模型与编译检查",
            "url": "https://rsi-exam.ai/tasks/lean_formal_proof_workflow_design.html"
          },
          {
            "label": "任务说明 · 科学发现：场景、预算、三项指标",
            "url": "https://rsi-exam.ai/tasks/discoveryworld_agent_harness_low2.html"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "先运行起点，提出修改假设、编辑实现，再用可见数据测量。日志记录版本、父版本、改动、成绩及保留或撤回决定，所有版本都保存。哪些额外验证能检验泛化由研究者选择；科学发现任务另强制每个版本跑完同一六场景开发套件并撤回退化版本。预算结束后评价留下的最终交付物，未根据最终隐藏分数再选一次版本。一般任务上限 12 小时，数学后训练任务明确为 8 小时；其他计算限制按任务规定。",
        "sources": [
          {
            "label": "统一研究指令：实验、保存版本与回退",
            "url": "https://github.com/aiming-lab/RSI-Exam/blob/0386e19fe41fa924c04a68702f20591ab612132d/infra/prompts/autoresearch.j2"
          },
          {
            "label": "任务说明 · 科学发现：场景、预算、三项指标",
            "url": "https://rsi-exam.ai/tasks/discoveryworld_agent_harness_low2.html"
          },
          {
            "label": "任务说明 · 数学后训练：数据、学生模型、答案匹配",
            "url": "https://rsi-exam.ai/tasks/teacher_student_math_posttraining.html"
          },
          {
            "label": "README · 时间预算",
            "url": "https://github.com/aiming-lab/RSI-Exam/blob/0386e19fe41fa924c04a68702f20591ab612132d/README.md#-quick-start"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "没有供全部研究者共同训练的统一训练集；每次研究从一个任务包开始。可见材料由任务定义：记忆任务给 4 段多轮对话、812 对问答；科学发现给两类场景各 3 个种子；Lean 给 54 道定理；潮汐反演给 6 个流域案例。数学后训练另提供本地 train.jsonl（题目与整数答案）、固定 8B 教师及 Qwen3-1.7B-Base 学生，训练仅可用规定的本地资源；公开说明未点名训练语料的原始基准，也未列出教师型号。",
        "sources": [
          {
            "label": "任务说明 · 记忆架构：数据、固定模型、判分",
            "url": "https://rsi-exam.ai/tasks/locomo_longterm_memory.html"
          },
          {
            "label": "任务说明 · 科学发现：场景、预算、三项指标",
            "url": "https://rsi-exam.ai/tasks/discoveryworld_agent_harness_low2.html"
          },
          {
            "label": "任务说明 · Lean 证明：开发题、模型与编译检查",
            "url": "https://rsi-exam.ai/tasks/lean_formal_proof_workflow_design.html"
          },
          {
            "label": "任务说明 · 潮汐反演：观测、验证测站与误差",
            "url": "https://rsi-exam.ai/tasks/tidal_friction_inverse.html"
          },
          {
            "label": "任务说明 · 数学后训练：数据、学生模型、答案匹配",
            "url": "https://rsi-exam.ai/tasks/teacher_student_math_posttraining.html"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "主要用每题可见开发分区比较版本，研究者也可自行再划验证集。记忆任务允许按对话或问答子集检查；Lean 比较版本须覆盖全部 54 题；科学发现须覆盖六个场景。数学后训练的 dev.jsonl 只给题目，有限查询仅返回总体正确率。法律任务用 18 道开发问题、合计 90 次提交额度，返回满足要求的数量，隐藏要求正文。各项判分与使用方式在反馈行分别列出。",
        "sources": [
          {
            "label": "统一研究指令：实验、保存版本与回退",
            "url": "https://github.com/aiming-lab/RSI-Exam/blob/0386e19fe41fa924c04a68702f20591ab612132d/infra/prompts/autoresearch.j2"
          },
          {
            "label": "任务说明 · 记忆架构：数据、固定模型、判分",
            "url": "https://rsi-exam.ai/tasks/locomo_longterm_memory.html"
          },
          {
            "label": "任务说明 · Lean 证明：开发题、模型与编译检查",
            "url": "https://rsi-exam.ai/tasks/lean_formal_proof_workflow_design.html"
          },
          {
            "label": "任务说明 · 科学发现：场景、预算、三项指标",
            "url": "https://rsi-exam.ai/tasks/discoveryworld_agent_harness_low2.html"
          },
          {
            "label": "任务说明 · 数学后训练：数据、学生模型、答案匹配",
            "url": "https://rsi-exam.ai/tasks/teacher_student_math_posttraining.html"
          },
          {
            "label": "任务说明 · 法律任务：可见最终问题与保密评分标准",
            "url": "https://rsi-exam.ai/tasks/legal_matter_caseload_regulatory.html"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "RSI-Exam 0.1 含 88 项研究任务、6 个领域，35 项公开、53 项未公开；35/53 指任务包的发布状态，不是每项任务内的训练/测试划分。主协议在独立环境中重跑最终交付物：记忆换未见对话，Lean 换未见定理，科学发现换同两主题各 2 个新参数种子，潮汐反演换流域和测站，数学学生在分离的整数答案题上测试。法律任务另有 18 道最终问题，其题目开局可见、评分要求保密，最终只交一次。公开主报告每个模型—任务组合仅运行一次；全部 88 项逐任务配置不能仅从 35 个公开任务外推。",
        "sources": [
          {
            "label": "官方报告 · 评测流程、数据隔离与分数标定",
            "url": "https://rsi-exam.ai/blog.html#benchmark"
          },
          {
            "label": "官方报告 · 被测模型与执行框架",
            "url": "https://rsi-exam.ai/blog.html#models-harnesses"
          },
          {
            "label": "任务说明 · 记忆架构：数据、固定模型、判分",
            "url": "https://rsi-exam.ai/tasks/locomo_longterm_memory.html"
          },
          {
            "label": "任务说明 · Lean 证明：开发题、模型与编译检查",
            "url": "https://rsi-exam.ai/tasks/lean_formal_proof_workflow_design.html"
          },
          {
            "label": "任务说明 · 科学发现：场景、预算、三项指标",
            "url": "https://rsi-exam.ai/tasks/discoveryworld_agent_harness_low2.html"
          },
          {
            "label": "任务说明 · 潮汐反演：观测、验证测站与误差",
            "url": "https://rsi-exam.ai/tasks/tidal_friction_inverse.html"
          },
          {
            "label": "任务说明 · 数学后训练：数据、学生模型、答案匹配",
            "url": "https://rsi-exam.ai/tasks/teacher_student_math_posttraining.html"
          },
          {
            "label": "任务说明 · 法律任务：可见最终问题与保密评分标准",
            "url": "https://rsi-exam.ai/tasks/legal_matter_caseload_regulatory.html"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "主协议将开发环境与评分环境分离，只传规定的交付物，保护测试目标和评分资产，并限制网络访问。两点例外必须保留：数学任务交付合并后的模型权重，评分端不执行研究者代码；法律任务的最终问题本身可见，隐藏的是评分标准且不返回最终反馈。因此“隐藏测试”不统一意味着题目不可见。研究者使用不同模型与 agent 框架，结果是二者组合的表现；单次运行不能估计同一组合重跑的波动。本站依据 0.1 官方网页报告、任务说明和公开代码收录，日期采用项目首发 2026-08-26，数据与代码于 08-28 公开。",
        "sources": [
          {
            "label": "官方报告 · 评测流程、数据隔离与分数标定",
            "url": "https://rsi-exam.ai/blog.html#benchmark"
          },
          {
            "label": "官方报告 · 运行与访问限制",
            "url": "https://rsi-exam.ai/blog.html#execution-records"
          },
          {
            "label": "任务说明 · 数学后训练：数据、学生模型、答案匹配",
            "url": "https://rsi-exam.ai/tasks/teacher_student_math_posttraining.html"
          },
          {
            "label": "任务说明 · 法律任务：可见最终问题与保密评分标准",
            "url": "https://rsi-exam.ai/tasks/legal_matter_caseload_regulatory.html"
          },
          {
            "label": "官方报告 · 适用范围与限制",
            "url": "https://rsi-exam.ai/blog.html#conclusion"
          },
          {
            "label": "README · News：项目与数据发布时间",
            "url": "https://github.com/aiming-lab/RSI-Exam/blob/0386e19fe41fa924c04a68702f20591ab612132d/README.md#-news"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "给研究者一个能跑但较弱的起点，要求它经历多轮实验后交付可被重新执行的方法；用任务原有指标评价，再将起点标为 0、可用的强参考方法标为 0.6。版本日志和最终泛化结果一起保留，可以观察改进来自反复调同一方法，还是换了更有效的设计。具体任务也保留各自的模型训练或回答提交协议。",
        "sources": [
          {
            "label": "官方报告 · 评测流程、数据隔离与分数标定",
            "url": "https://rsi-exam.ai/blog.html#benchmark"
          },
          {
            "label": "官方报告 · 三条研究轨迹",
            "url": "https://rsi-exam.ai/blog.html#trajectory-analysis"
          },
          {
            "label": "任务说明 · 数学后训练：数据、学生模型、答案匹配",
            "url": "https://rsi-exam.ai/tasks/teacher_student_math_posttraining.html"
          },
          {
            "label": "任务说明 · 法律任务：可见最终问题与保密评分标准",
            "url": "https://rsi-exam.ai/tasks/legal_matter_caseload_regulatory.html"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-11",
    "roleAuditDate": "2026-09-11"
  },
  "2609.00196": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "搜索问答和数学由 Qwen3.5-2B 执行，棋题由 Qwen3.5-4B 执行。参数阶段更新这些模型，下一阶段由更新后的模型配合候选框架做题；搜索工具、Python 运行环境与棋盘规则保持固定。",
        "sources": [
          {
            "label": "§5.2：执行模型与评测",
            "url": "https://arxiv.org/html/2609.00196#S5.SS2"
          },
          {
            "label": "§5.1：三个领域的数据",
            "url": "https://arxiv.org/html/2609.00196#S5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "Claude Opus 4.7 通过 Meta-Harness 搜索器读历史框架代码、逐题成败和轨迹，每轮提出 3 个候选框架。参数更新由训练程序完成：当前执行模型每题采样 8 条轨迹，仅留下判对的轨迹做监督微调。修改框架的 Claude 本身不在这个循环中训练。",
        "sources": [
          {
            "label": "附录B、表1：修改模型和预算",
            "url": "https://arxiv.org/html/2609.00196#A2"
          },
          {
            "label": "§3–4：参数更新与框架搜索",
            "url": "https://arxiv.org/html/2609.00196#S3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "Qwen 执行模型的参数，以及提示、工具结果处理、轮数和停止规则等框架代码，交替更新。",
        "sources": [
          {
            "label": "§5.1：三个领域的数据",
            "url": "https://arxiv.org/html/2609.00196#S5.SS1"
          },
          {
            "label": "附录B.2：各领域初始框架",
            "url": "https://arxiv.org/html/2609.00196#A2.SS2"
          },
          {
            "label": "§3–4：参数更新与框架搜索",
            "url": "https://arxiv.org/html/2609.00196#S3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "问答：GPT-5.4-mini 将提取出的答案与参考答案比对；数学：程序提取最终方框答案并与标准答案匹配；棋题：python-chess 检查合法性，并要求走完题库参考着法。二元正确标记同时用于筛训练轨迹、评候选框架和统计测试成绩；Python 报错和棋盘反馈另供执行、诊断使用。",
        "sources": [
          {
            "label": "附录B.3：三个固定判分器",
            "url": "https://arxiv.org/html/2609.00196#A2.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "三个领域各有简单起点。问答只原样转发查询，每次返回截断到 200 词元的一段文档，最多 2 轮；数学没有系统提示，提取第一个 Python 代码块，回传原始输出/报错，最多 2 轮；棋题展示棋盘及完整历史，格式错误和非法着法各重试 1 次，最多 9 轮。搜索空间允许扩展这些控制，但棋题框架不能替模型搜索或代选着法。",
        "sources": [
          {
            "label": "附录B.2：各领域初始框架",
            "url": "https://arxiv.org/html/2609.00196#A2.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "先固定框架，用当前模型产生正确轨迹并微调；再固定新模型，让 Claude 搜索更适配的框架，按框架训练集分数保留最好候选。固定方案每轮约 0.6 个训练轮次、6 次框架搜索；自适应方案在训练信号连续不涨后切换。算法最终返回规则另使用最好测试成绩，需与阶段内训练分数选框架区分。",
        "sources": [
          {
            "label": "§4：交替流程与返回规则",
            "url": "https://arxiv.org/html/2609.00196#S4"
          },
          {
            "label": "§6.2：交替节奏及自适应切换",
            "url": "https://arxiv.org/html/2609.00196#S6.SS2"
          },
          {
            "label": "附录B、表1：修改模型和预算",
            "url": "https://arxiv.org/html/2609.00196#A2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "问答：HotpotQA 14,801 + Natural Questions 4,145 题训练参数，另用同来源 200 + 56 题搜索框架。数学：DAPO-Math-17K 17,917 题训练，其中 256 题搜索框架。棋题：Lichess 16,384 题训练，另 256 题搜索框架。",
        "sources": [
          {
            "label": "§5.1：三个领域的数据",
            "url": "https://arxiv.org/html/2609.00196#S5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "三个任务均用各自的 256 道框架搜索题比较候选，提供逐题结果和轨迹；按训练奖励切换阶段，不另设验证集。",
        "sources": [
          {
            "label": "§3–4：参数更新与框架搜索",
            "url": "https://arxiv.org/html/2609.00196#S3"
          },
          {
            "label": "§5.1：三个领域的数据",
            "url": "https://arxiv.org/html/2609.00196#S5.SS1"
          },
          {
            "label": "§6.2：交替节奏及自适应切换",
            "url": "https://arxiv.org/html/2609.00196#S6.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "问答：2WikiMultiHopQA、Bamboogle、HotpotQA、MuSiQue、Natural Questions、PopQA、TriviaQA 各 100 题。数学：AIME 2024／2025。棋题：另 256 道 Lichess 题。均每题采样 8 次、取平均正确率。",
        "sources": [
          {
            "label": "§5.1：三个领域的数据",
            "url": "https://arxiv.org/html/2609.00196#S5.SS1"
          },
          {
            "label": "§5.2：执行模型与评测",
            "url": "https://arxiv.org/html/2609.00196#S5.SS2"
          },
          {
            "label": "§5.3、图2：最好测试成绩",
            "url": "https://arxiv.org/html/2609.00196#S5.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "三项均按最高测试分选择最终模型与框架，测试参与选版本。数学的框架搜索题属于参数训练集；棋题的训练、搜索、测试题互斥。",
        "sources": [
          {
            "label": "§4：交替流程与返回规则",
            "url": "https://arxiv.org/html/2609.00196#S4"
          },
          {
            "label": "§5.1：三个领域的数据",
            "url": "https://arxiv.org/html/2609.00196#S5.SS1"
          },
          {
            "label": "§5.3、图2：最好测试成绩",
            "url": "https://arxiv.org/html/2609.00196#S5.SS3"
          },
          {
            "label": "§6.1：轨迹成本口径",
            "url": "https://arxiv.org/html/2609.00196#S6.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "把“交替改参数与改可执行框架”的节奏单独拿出来研究：一次长训练再长搜索，不如多次小步交替；某些数学能力必须先训练，框架搜索才开始有效。进一步用训练信号停滞自动决定何时切换，不必为每个领域手动设定阶段预算。",
        "sources": [
          {
            "label": "§6.2：交替节奏及自适应切换",
            "url": "https://arxiv.org/html/2609.00196#S6.SS2"
          },
          {
            "label": "§6.1：不同领域的瓶颈",
            "url": "https://arxiv.org/html/2609.00196#S6.SS1"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-11",
    "roleAuditDate": "2026-09-11"
  },
  "2609.09646": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "AgentX 的头脑风暴工作流协调提问、构思和验证 agent 完成实验提案任务。所有条件固定相同执行模型、工具和评分规则；本文正文没有列出所用执行模型的具体型号，不能据 AgentX 其他实验反推。",
        "sources": [
          {
            "label": "§3：AgentX 与诊断—修改—重放循环",
            "url": "https://arxiv.org/html/2609.09646#S3"
          },
          {
            "label": "§6.1：120题划分与接受规则",
            "url": "https://arxiv.org/html/2609.09646#S6.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "模型诊断执行记录并生成修改内容；控制器先决定改几个 agent、做哪类操作、改哪些目标。预写程序负责规定的增加/删除 agent 文件操作，其余指令改写由模型完成。本文未披露诊断、修改与评分角色的具体模型型号及是否共用模型。",
        "sources": [
          {
            "label": "§3：AgentX 与诊断—修改—重放循环",
            "url": "https://arxiv.org/html/2609.09646#S3"
          },
          {
            "label": "§5：指定改动、检查与保留版本",
            "url": "https://arxiv.org/html/2609.09646#S5"
          },
          {
            "label": "§6.1：120题划分与接受规则",
            "url": "https://arxiv.org/html/2609.09646#S6.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "多 agent 指令、输入输出约定、agent 增删与路由；模型参数固定。",
        "sources": [
          {
            "label": "§4：三级修改权限",
            "url": "https://arxiv.org/html/2609.09646#S4"
          },
          {
            "label": "§3：AgentX 与诊断—修改—重放循环",
            "url": "https://arxiv.org/html/2609.09646#S3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "根据旧执行轨迹构造可重放任务与评分要求，再将新旧框架在相同任务及随机种子上配对运行。优化轨迹与静态编辑错误用于提出补丁，验证分数用于接受和保留版本。论文报告0–5质量分与完成率，但没有给出逐项评分表、质量分聚合细则或评审模型名称。",
        "sources": [
          {
            "label": "§3：AgentX 与诊断—修改—重放循环",
            "url": "https://arxiv.org/html/2609.09646#S3"
          },
          {
            "label": "§6.1：120题划分与接受规则",
            "url": "https://arxiv.org/html/2609.09646#S6.SS1"
          },
          {
            "label": "§6.5、表3：等词元成本结果",
            "url": "https://arxiv.org/html/2609.09646#S6.SS5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "沿用 AgentX 已有的多 agent 头脑风暴流程，有提问、构思、验证及提案协调分工，也已有根据失败诊断、写补丁、配对重放、接受或撤回的 SGPO 循环。新增的是明确指定修改范围/操作、保证目标一致及保留其他候选起点，并非从空白 agent 开始。",
        "sources": [
          {
            "label": "§3：AgentX 与诊断—修改—重放循环",
            "url": "https://arxiv.org/html/2609.09646#S3"
          },
          {
            "label": "§5：指定改动、检查与保留版本",
            "url": "https://arxiv.org/html/2609.09646#S5"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "控制器选改动类别与目标，模型写内容，程序检查是否恰好改到指定对象及结构是否有效；有效候选与当前版本做3次配对重放。平均验证增益须超过0.05并通过保护检查，每轮最多接受1个候选。可从当前版本或保留档案继续改，但后代仍必须胜过当前版本才能被采用。",
        "sources": [
          {
            "label": "§5：指定改动、检查与保留版本",
            "url": "https://arxiv.org/html/2609.09646#S5"
          },
          {
            "label": "§6.1：120题划分与接受规则",
            "url": "https://arxiv.org/html/2609.09646#S6.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "作者在 AgentX 头脑风暴工作流中组织120个任务：60个单 agent 指令问题、60个跨 agent 交接/结构问题。每类按30/15/15分为优化、验证和测试，共60/30/30。先按源对话和底层要求分组再划分，避免同源问题跨区。模型参数不训练。",
        "sources": [
          {
            "label": "§6.1：120题划分与接受规则",
            "url": "https://arxiv.org/html/2609.09646#S6.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "60道优化题的轨迹和静态补丁错误供生成候选；30道验证题用于新旧版本比较、档案排名及任务切换后的重评分。每轮3次提案，每个提案最多改120行、增加6,000字符；无效提案和重试同样计成本。",
        "sources": [
          {
            "label": "§6.1：120题划分与接受规则",
            "url": "https://arxiv.org/html/2609.09646#S6.SS1"
          },
          {
            "label": "§6.4：任务切换实验",
            "url": "https://arxiv.org/html/2609.09646#S6.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "30道未参与搜索的测试题，两类各15题。测试质量曲线、任务完成率及相同2,000万词元预算下最后可负担的版本分别报告；任务切换仅在这两类头脑风暴问题之间进行，并未测跨行业泛化。",
        "sources": [
          {
            "label": "§6.1：120题划分与接受规则",
            "url": "https://arxiv.org/html/2609.09646#S6.SS1"
          },
          {
            "label": "§6.5、表3：等词元成本结果",
            "url": "https://arxiv.org/html/2609.09646#S6.SS5"
          },
          {
            "label": "§6.4：任务切换实验",
            "url": "https://arxiv.org/html/2609.09646#S6.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "测试反馈不进入搜索；等成本比较按预算选最后版本，不按测试最高分选。实验只有一个 AgentX 工作流、五个配对随机种子；与其他论文方法没有共享基准上的直接排名。执行/修改/评分模型型号及完整评分要求未在本文披露，结论可用于理解搜索控制，但复现实验仍需这些配置。",
        "sources": [
          {
            "label": "§6.1：120题划分与接受规则",
            "url": "https://arxiv.org/html/2609.09646#S6.SS1"
          },
          {
            "label": "§6.5、表3：等词元成本结果",
            "url": "https://arxiv.org/html/2609.09646#S6.SS5"
          },
          {
            "label": "§2：未跨系统比较的范围说明",
            "url": "https://arxiv.org/html/2609.09646#S2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "将“允许改很多东西”和“实际产生有效修改”分开：先指定目标，再用程序落实结构编辑；把暂时落后但属于不同改动类别的整套框架留作未来起点。还比较轮流开放小范围到大范围权限，以及档案在新任务适应与保留旧能力间的取舍。",
        "sources": [
          {
            "label": "§5：指定改动、检查与保留版本",
            "url": "https://arxiv.org/html/2609.09646#S5"
          },
          {
            "label": "§4：三级修改权限",
            "url": "https://arxiv.org/html/2609.09646#S4"
          },
          {
            "label": "§6.4：任务切换实验",
            "url": "https://arxiv.org/html/2609.09646#S6.SS4"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-11",
    "roleAuditDate": "2026-09-11"
  },
  "2609.09153": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "统一使用 ReAct 执行器，即循环“决定下一步—调用工具—读取结果”。分别测试 Claude Sonnet 4.6、Gemini 3.1 Pro、Gemini 3.5 Flash、Grok 4.1 Fast；每组的图指导模型与图修改模型和执行器使用同一种模型。专门的图构造及十轮企业仿真实验使用冻结 Gemini 3.5 Flash。",
        "sources": [
          {
            "label": "§4：模型与共享执行框架",
            "url": "https://arxiv.org/html/2609.09153#S4"
          },
          {
            "label": "附录D.3：迭代构图实验",
            "url": "https://arxiv.org/html/2609.09153#A4.SS3"
          },
          {
            "label": "§5.4：最终图与中途最高分",
            "url": "https://arxiv.org/html/2609.09153#S5.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "与该组执行器同型号的冻结模型作为图修改者，对照高分/低分轨迹，增删步骤节点和连接、改边上的条件与提醒。另一次同型号模型调用将当前节点附近的图转成下一步指导。固定程序定位节点、检查结构并按验证分决定是否接受；没有训练模型参数。",
        "sources": [
          {
            "label": "§3：图表示、使用与更新",
            "url": "https://arxiv.org/html/2609.09153#S3"
          },
          {
            "label": "§4：模型与共享执行框架",
            "url": "https://arxiv.org/html/2609.09153#S4"
          },
          {
            "label": "附录B.6：验证、拒绝记录与结构检查",
            "url": "https://arxiv.org/html/2609.09153#A2.SS6"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "有条件连接的步骤图：做什么、先后顺序、何时转到下一步及避错提醒；模型权重不变。",
        "sources": [
          {
            "label": "§3：图表示、使用与更新",
            "url": "https://arxiv.org/html/2609.09153#S3"
          },
          {
            "label": "§4：模型与共享执行框架",
            "url": "https://arxiv.org/html/2609.09153#S4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "每条训练轨迹带对应任务评分，修改者比较高低分轨迹并读失败记录。问答对照参考答案；对话任务由 Gemini 3.1 Pro 按指令要求评审；工具任务用各基准的状态/调用检查；企业仿真用存活、寿命及财务分数。迭代方案还在独立验证集上验收，退步则拒绝并保留拒绝原因。",
        "sources": [
          {
            "label": "附录B.2：各基准判分",
            "url": "https://arxiv.org/html/2609.09153#A2.SS2"
          },
          {
            "label": "§3：图表示、使用与更新",
            "url": "https://arxiv.org/html/2609.09153#S3"
          },
          {
            "label": "附录B.6：验证、拒绝记录与结构检查",
            "url": "https://arxiv.org/html/2609.09153#A2.SS6"
          },
          {
            "label": "附录C.1：企业仿真规则与指标",
            "url": "https://arxiv.org/html/2609.09153#A3.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "共用能调用工具、读取结果的 ReAct 执行器。图的起点有两种：人写的工具步骤与条件图，或只含 Start→End、没有中间知识的最小骨架。另设无图起点作为对照。一次性构图直接接收修改；逐批迭代构图才有独立验证集的回退门槛，不能混写成所有方案都有验证保护。",
        "sources": [
          {
            "label": "§4：模型与共享执行框架",
            "url": "https://arxiv.org/html/2609.09153#S4"
          },
          {
            "label": "附录D.2：五种图构造方案",
            "url": "https://arxiv.org/html/2609.09153#A4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "执行一批训练任务→按分数对照轨迹→提出图编辑→先检查边端点、节点类型和能否走到终止节点→验证集不掉分才保留。拒绝候选、训练记录及验证分留给下一次修改。每道题内部和测试时图固定；文中“在线进化”指训练批次之间更新图，并非在测试题上边做边改。",
        "sources": [
          {
            "label": "附录B.6：验证、拒绝记录与结构检查",
            "url": "https://arxiv.org/html/2609.09153#A2.SS6"
          },
          {
            "label": "附录D.2：五种图构造方案",
            "url": "https://arxiv.org/html/2609.09153#A4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "主比较的训练数：HotpotQA 1,000；MultiChallenge 100；GDPval 88；ALFWorld 238；τ-bench 500；BFCL v3 100；EnterpriseArena 50场。这里训练指收集轨迹构图，不更新模型权重。专门十轮企业自进化另用20场训练；不能与主表50场混为一个设置。",
        "sources": [
          {
            "label": "附录B.1、表5：数据划分",
            "url": "https://arxiv.org/html/2609.09153#A2.SS1"
          },
          {
            "label": "附录D.2：五种图构造方案",
            "url": "https://arxiv.org/html/2609.09153#A4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "迭代构图：HotpotQA 每100题更新一次，用额外1,000题验证；MultiChallenge 每20题更新一次，用额外100题验证；企业十轮实验用20场验证。一次性构图方案无验证回退。三类迭代实验明确验证/测试不重叠，其他基准的独立验证样本数没有在表5逐项列出。",
        "sources": [
          {
            "label": "附录B.1、表5：数据划分",
            "url": "https://arxiv.org/html/2609.09153#A2.SS1"
          },
          {
            "label": "附录D.3：迭代构图实验",
            "url": "https://arxiv.org/html/2609.09153#A4.SS3"
          },
          {
            "label": "附录D.2：五种图构造方案",
            "url": "https://arxiv.org/html/2609.09153#A4.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "主表：HotpotQA 1,000题；MultiChallenge 166题；GDPval 44题；ALFWorld 134题；τ-bench 零售115题；BFCL v3 多轮基础类100题；EnterpriseArena 50场。构图消融的 MultiChallenge 只测56题。十轮企业自进化另用20场测试，最终返回图存活率85%，中途最高95%不作最终成绩。",
        "sources": [
          {
            "label": "附录B.1、表5：数据划分",
            "url": "https://arxiv.org/html/2609.09153#A2.SS1"
          },
          {
            "label": "§5.4：最终图与中途最高分",
            "url": "https://arxiv.org/html/2609.09153#S5.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "图在测试期间冻结；企业主比较按互斥随机种子区分训练/测试，十轮实验另按20/20/20划分并由验证集选图。HotpotQA 去重按题号分区，GDPval 按职业确定性划分，ALFWorld 用标准未见任务。十轮实验每分区只有20场，少数场景即可影响接受决定；85%不能替换成测试中途最高95%。",
        "sources": [
          {
            "label": "附录B.1、表5：数据划分",
            "url": "https://arxiv.org/html/2609.09153#A2.SS1"
          },
          {
            "label": "§5.4：最终图与中途最高分",
            "url": "https://arxiv.org/html/2609.09153#S5.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "将零散文字经验组织成“有条件连接的步骤图”，每一步只给与当前位置有关的指导。可从只有起止节点的骨架逐步长出程序知识，也能修复一个错误的人写先验。它改变图结构与边上说明，不任意重写整个 agent 源码。",
        "sources": [
          {
            "label": "§3：图表示、使用与更新",
            "url": "https://arxiv.org/html/2609.09153#S3"
          },
          {
            "label": "附录D.2：五种图构造方案",
            "url": "https://arxiv.org/html/2609.09153#A4.SS2"
          },
          {
            "label": "§5.3：骨架构图与错误先验修复",
            "url": "https://arxiv.org/html/2609.09153#S5.SS3"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-11",
    "roleAuditDate": "2026-09-11"
  },
  "2607.22688": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "Qwen3-8B 或 Qwen3-32B 在数学推理中多轮调用 Python，训练后继续用对应候选模型。主实验两轮，每轮包含框架更新和成功轨迹监督微调；长期22版本案例使用 Qwen3-8B。",
        "sources": [
          {
            "label": "§4.1：模型、基准、轮次",
            "url": "https://arxiv.org/html/2607.22688#S4.SS1"
          },
          {
            "label": "附录H：AIME24长期案例",
            "url": "https://arxiv.org/html/2607.22688#A8"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "HarnessCritic 是读失败轨迹、诊断根因并给局部补丁的模型角色，随后固定程序合并兼容建议并验收。论文没有为主实验单独列出这个角色的具体模型型号；附录D只说明归因对照使用初始模型，不能扩写为全部轮次都由某个确定外部模型修改。模型参数由监督微调程序更新。",
        "sources": [
          {
            "label": "§3.3：归因和局部补丁",
            "url": "https://arxiv.org/html/2607.22688#S3.SS3"
          },
          {
            "label": "§3.4：成功轨迹微调",
            "url": "https://arxiv.org/html/2607.22688#S3.SS4"
          },
          {
            "label": "附录D：归因人工对照",
            "url": "https://arxiv.org/html/2607.22688#A4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "数学 agent 的提示、工具与运行配置，以及 Qwen 执行模型参数，交替更新。",
        "sources": [
          {
            "label": "§3.3：归因和局部补丁",
            "url": "https://arxiv.org/html/2607.22688#S3.SS3"
          },
          {
            "label": "§3.4：成功轨迹微调",
            "url": "https://arxiv.org/html/2607.22688#S3.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "失败轨迹记录模型输出、工具调用、Python标准输出/错误和终态。HarnessCritic 根据具体事件定位格式错误、缺少技能、重试或上下文问题；程序再比较目标失败类和原有成功类任务的新旧得分。成功轨迹须通过任务检查才用于微调，但原文未公开逐基准答案解析器及完整判分实现。",
        "sources": [
          {
            "label": "§3.3：归因和局部补丁",
            "url": "https://arxiv.org/html/2607.22688#S3.SS3"
          },
          {
            "label": "§3.4：成功轨迹微调",
            "url": "https://arxiv.org/html/2607.22688#S3.SS4"
          },
          {
            "label": "附录E：两组验收任务",
            "url": "https://arxiv.org/html/2607.22688#A5"
          },
          {
            "label": "附录A：工具输出与失败类型",
            "url": "https://arxiv.org/html/2607.22688#A1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "初始框架有512词元的数学/Python使用提示、带JSON调用格式的沙箱Python解释器（默认30秒超时）、异常最多重试3次、滑窗保留最后4,000词元、工具输出截断2,000词元；初始技能库为空、没有长期记忆或外部检索。代码解释器循环起始最多15轮。",
        "sources": [
          {
            "label": "附录A/C：Python循环与初始配置",
            "url": "https://arxiv.org/html/2607.22688#A3"
          },
          {
            "label": "附录A：多轮执行",
            "url": "https://arxiv.org/html/2607.22688#A1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "按当前框架收集失败→模型给根因与字段补丁→按复现频率、严重性和字段一致性合并→两组任务重放验收→在改好框架下收集成功轨迹微调→下一轮。主实验两轮，每轮框架内部5次迭代；比较起点已先经过一次框架优化，所以不等于原始未经调整的 Qwen。",
        "sources": [
          {
            "label": "§3.2–3.5：两个循环与验收",
            "url": "https://arxiv.org/html/2607.22688#S3.SS2"
          },
          {
            "label": "§3.3：归因和局部补丁",
            "url": "https://arxiv.org/html/2607.22688#S3.SS3"
          },
          {
            "label": "附录E：两组验收任务",
            "url": "https://arxiv.org/html/2607.22688#A5"
          },
          {
            "label": "§4.1：模型、基准、轮次",
            "url": "https://arxiv.org/html/2607.22688#S4.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "微调使用当前模型在接受后的框架下产生并通过任务检查的轨迹。本文实验点名 AIME 2024、AIME 2025、HMMT February 2025 各30题，但没有明确列出另一个训练题库、成功轨迹总数及其与90道评测题的题号关系。不能据此写成在某训练基准上训练、再独立测竞赛题。",
        "sources": [
          {
            "label": "§3.4：成功轨迹微调",
            "url": "https://arxiv.org/html/2607.22688#S3.SS4"
          },
          {
            "label": "§4.1：模型、基准、轮次",
            "url": "https://arxiv.org/html/2607.22688#S4.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "补丁分别在两组任务上重放：含目标失败类型的一组必须改善；原有成功或其他行为的一组不得退步。附录E给出接受公式，但未列这两组的来源、题号及样本数。长期案例明确围绕 AIME24 连续迭代22个版本，并根据准确率与耗时回退。",
        "sources": [
          {
            "label": "附录E：两组验收任务",
            "url": "https://arxiv.org/html/2607.22688#A5"
          },
          {
            "label": "附录H：AIME24长期案例",
            "url": "https://arxiv.org/html/2607.22688#A8"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "主表在 AIME24、AIME25、HMMT25 各30题上比较 Qwen3-8B/32B 的两轮更新，报告多次运行平均的单次答对率。另一个AIME24长期案例探索6条轨迹多数投票和时间预算；它与主表单次正确率不是同一种统计。",
        "sources": [
          {
            "label": "§4.1：模型、基准、轮次",
            "url": "https://arxiv.org/html/2607.22688#S4.SS1"
          },
          {
            "label": "§4.2、表6：两轮改进",
            "url": "https://arxiv.org/html/2607.22688#S4.SS2"
          },
          {
            "label": "附录H：AIME24长期案例",
            "url": "https://arxiv.org/html/2607.22688#A8"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "论文提出防退化验收，但未披露训练题、两组验收题与最终90道题之间的完整隔离关系。AIME24长期案例用同一基准迭代并选设计，不能视为另一份独立测试。收录它是因为联合训练和故障归因的设计有对照价值，而不是将其涨分当作已证明跨数据泛化。",
        "sources": [
          {
            "label": "§4.1：模型、基准、轮次",
            "url": "https://arxiv.org/html/2607.22688#S4.SS1"
          },
          {
            "label": "附录E：两组验收任务",
            "url": "https://arxiv.org/html/2607.22688#A5"
          },
          {
            "label": "附录H：AIME24长期案例",
            "url": "https://arxiv.org/html/2607.22688#A8"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "先修好产生训练轨迹的框架，再把新框架下成功的行为训练进模型，使下一轮暴露出新的框架瓶颈。与广泛搜索 agent 代码相比，重点是“哪项失败由哪个框架字段导致”的局部修补及两组行为验收。",
        "sources": [
          {
            "label": "§1：联合后训练动机",
            "url": "https://arxiv.org/html/2607.22688#S1"
          },
          {
            "label": "§3.3：归因和局部补丁",
            "url": "https://arxiv.org/html/2607.22688#S3.SS3"
          },
          {
            "label": "§3.4：成功轨迹微调",
            "url": "https://arxiv.org/html/2607.22688#S3.SS4"
          },
          {
            "label": "附录E：两组验收任务",
            "url": "https://arxiv.org/html/2607.22688#A5"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-11",
    "roleAuditDate": "2026-09-11"
  },
  "2606.01779": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "Qwen3-4B 或 Qwen3-8B 配当前框架执行。每个保留下来的框架有自己的一份模型分支，训练新增 LoRA 适配参数（少量附加可训练矩阵），再在下一轮继承；同一个父模型分出的兄弟框架不共享后续适配参数。",
        "sources": [
          {
            "label": "附录C.2：模型与适配参数配置",
            "url": "https://arxiv.org/html/2606.01779#A3.SS2"
          },
          {
            "label": "附录D：每条分支的模型适配",
            "url": "https://arxiv.org/html/2606.01779#A4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "GPT-5.5 担任外部修改者，依次诊断失败、规划修补方向、生成框架代码、按初步运行检查修复；最多3次修复重试。训练程序再用对应框架收集的成功轨迹更新 Qwen 的 LoRA，GPT-5.5 不随此过程训练。",
        "sources": [
          {
            "label": "附录C.2：模型与适配参数配置",
            "url": "https://arxiv.org/html/2606.01779#A3.SS2"
          },
          {
            "label": "附录C.4：诊断、编写和筛选",
            "url": "https://arxiv.org/html/2606.01779#A3.SS4"
          },
          {
            "label": "附录D：每条分支的模型适配",
            "url": "https://arxiv.org/html/2606.01779#A4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "规划、工具动作、记忆的框架代码，以及与每个框架匹配的 Qwen LoRA 适配参数。",
        "sources": [
          {
            "label": "§3.2：联合进化流程与起点",
            "url": "https://arxiv.org/html/2606.01779#S3.SS2"
          },
          {
            "label": "附录C.3：代码表示与修改范围",
            "url": "https://arxiv.org/html/2606.01779#A3.SS3"
          },
          {
            "label": "附录C.2：模型与适配参数配置",
            "url": "https://arxiv.org/html/2606.01779#A3.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "ToolHop：最终答案正确率与中间目标完成率各占一半；本地检索问答：答案与参考答案的词级F1；EnvScaler-RL：环境终态满足了多少项程序检查。各候选还记录词元和耗时。GPT-5.5 读这些结果与轨迹定位首次实质错误，再比较任务分、词元、延迟筛候选。TMDB/API-Bank只作迁移测试。",
        "sources": [
          {
            "label": "附录C.1：进化反馈具体计算",
            "url": "https://arxiv.org/html/2606.01779#A3.SS1"
          },
          {
            "label": "附录C.4：诊断、编写和筛选",
            "url": "https://arxiv.org/html/2606.01779#A3.SS4"
          },
          {
            "label": "附录E.1–E.2：迁移与成本口径",
            "url": "https://arxiv.org/html/2606.01779#A5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "从一个人工设计的框架和原始 Qwen 开始。论文将框架定义为规划、动作、记忆三个模块的可执行代码/配置，接口检查要求工具格式、动作名和记忆字段有效。方法段没有完整列出初始框架每项启用的功能，因此不能把“允许修改的重试/记忆能力”一律说成初始就已配置。",
        "sources": [
          {
            "label": "§3.2：联合进化流程与起点",
            "url": "https://arxiv.org/html/2606.01779#S3.SS2"
          },
          {
            "label": "附录C.3：代码表示与修改范围",
            "url": "https://arxiv.org/html/2606.01779#A3.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "每轮用约1,200题收集执行证据，GPT-5.5 提出8个框架；先通过可导入、接口与简单运行检查。随后两批各200题筛选：8→4→2，兼顾任务分、词元和耗时。保留者用剩余题完成运行，成功轨迹复用于各自模型适配；主实验共3轮。档案记录父版本、故障、改动和成绩供以后参考。",
        "sources": [
          {
            "label": "附录C.2：模型与适配参数配置",
            "url": "https://arxiv.org/html/2606.01779#A3.SS2"
          },
          {
            "label": "附录C.4.5：两阶段筛选",
            "url": "https://arxiv.org/html/2606.01779#A3.SS4.SSS5"
          },
          {
            "label": "附录C.4：诊断、编写和筛选",
            "url": "https://arxiv.org/html/2606.01779#A3.SS4"
          },
          {
            "label": "附录D：每条分支的模型适配",
            "url": "https://arxiv.org/html/2606.01779#A4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "训练和进化共3,800题：EnvScaler-RL 2,000题（带状态和检查函数的多步环境）；ToolHop 800题；Natural Questions、HotpotQA、2WikiMultiHopQA 合计1,000题（转换成固定本地文档检索任务）。同一池用于框架进化、成功轨迹筛选和LoRA训练，不另虚构一份参数训练题库。",
        "sources": [
          {
            "label": "附录B.2–B.3：3,800题及去重隔离",
            "url": "https://arxiv.org/html/2606.01779#A2.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "从每轮约1,200题中逐步取新的200题子集做两阶段筛选；剩余任务给保留框架收集轨迹。它们属于可用于适配的训练/进化池。候选比较同时看任务表现、词元与延迟，优先保留在这些指标上没有被另一方案全面超越的版本；不能理解成只取正确率最高者。",
        "sources": [
          {
            "label": "附录C.4.5：两阶段筛选",
            "url": "https://arxiv.org/html/2606.01779#A3.SS4.SSS5"
          },
          {
            "label": "附录C.1：进化反馈具体计算",
            "url": "https://arxiv.org/html/2606.01779#A3.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "五个数据集、四组实验：ToolHop 195题，RestBench-TMDB 100题，API-Bank 114题，以及本地检索 HotpotQA、2WikiMultiHopQA 两个测试子集。附录B.1没有列出后两子集题数。TMDB和API-Bank用 ToolHop 上进化出的框架直接迁移，不在目标测试题上再次进化。",
        "sources": [
          {
            "label": "附录B.1：各基准测试指标",
            "url": "https://arxiv.org/html/2606.01779#A2.SS1"
          },
          {
            "label": "附录E.1–E.2：迁移与成本口径",
            "url": "https://arxiv.org/html/2606.01779#A5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "3,800题与正式测试集严格分离；同源基准按题号和标准化任务指令去重，本地文档库在适配前固定，测试题号不对搜索、训练或选模开放。候选筛选集仍属适配数据。论文轨迹成本不含外部修改模型生成费用；不能把执行轨迹更少等同总费用必然更低。",
        "sources": [
          {
            "label": "附录B.3：测试隔离",
            "url": "https://arxiv.org/html/2606.01779#A2.SS3"
          },
          {
            "label": "附录E.1–E.2：迁移与成本口径",
            "url": "https://arxiv.org/html/2606.01779#A5.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "不是让所有候选框架共享一个训练后的模型，而是保留各自匹配的模型分支；修好的规划、工具和记忆接口所产生的成功轨迹，立即用来训练这套接口的执行者。选择时同时考虑任务分、词元与延迟，避免只把更复杂、开销更大的框架当作进步。",
        "sources": [
          {
            "label": "附录D：每条分支的模型适配",
            "url": "https://arxiv.org/html/2606.01779#A4"
          },
          {
            "label": "附录C.1：进化反馈具体计算",
            "url": "https://arxiv.org/html/2606.01779#A3.SS1"
          },
          {
            "label": "§3.2：联合进化流程与起点",
            "url": "https://arxiv.org/html/2606.01779#S3.SS2"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-11",
    "roleAuditDate": "2026-09-11"
  },
  "2605.30621": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "六种执行模型：Claude Opus 4.6、Sonnet 4.6、Haiku 4.5、Qwen3-235B-A22B、Qwen3-32B、GPT-OSS-120B。测修改者时固定 Opus、Sonnet、Qwen3-235B 三个代表执行者；测执行收益时固定同三种代表修改者。Qwen3.5-9B只作为修改者，不列为执行者。",
        "sources": [
          {
            "label": "§4.1、附录B.2：模型配对",
            "url": "https://arxiv.org/html/2605.30621#S4.SS1"
          },
          {
            "label": "§4.2：修改者能力实验",
            "url": "https://arxiv.org/html/2605.30621#S4.SS2"
          },
          {
            "label": "§4.3：执行者收益与失败分析",
            "url": "https://arxiv.org/html/2605.30621#S4.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "上述六种模型加 Qwen3.5-9B，共七种修改者，按相同提示、轨迹窗口和预算读执行证据、改允许的外部文件。执行者与修改者独立配对，模型权重都不训练。工具与评测脚本禁止修改，修改者自己的系统提示固定。",
        "sources": [
          {
            "label": "§4.1、附录B.2：模型配对",
            "url": "https://arxiv.org/html/2605.30621#S4.SS1"
          },
          {
            "label": "附录B.4：初始提示与可写范围",
            "url": "https://arxiv.org/html/2605.30621#A2.SS4"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "SWE、SkillsBench改技能目录；MCP-Atlas还改系统提示和追加记忆。工具与模型参数固定。",
        "sources": [
          {
            "label": "附录B.4：初始提示与可写范围",
            "url": "https://arxiv.org/html/2605.30621#A2.SS4"
          },
          {
            "label": "§4.1、附录B.2：模型配对",
            "url": "https://arxiv.org/html/2605.30621#S4.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "SWE用问题对应的隐藏测试检查补丁；MCP-Atlas看最终答案满足了多少条参考事实要求；SkillsBench运行每题确定性检查器。成绩先锁定，再把该次任务的执行证据交给修改者，供以后任务使用。Claude Sonnet 4.6 对“技能是否被遵循”的评审是单独分析，不是这些任务通用的正确性判分。",
        "sources": [
          {
            "label": "附录B.3：各基准判分及顺序",
            "url": "https://arxiv.org/html/2605.30621#A2.SS3"
          },
          {
            "label": "附录D.3–D.4：技能遵循诊断",
            "url": "https://arxiv.org/html/2605.30621#A4.SS3"
          },
          {
            "label": "§3.2：先答题再更新",
            "url": "https://arxiv.org/html/2605.30621#S3.SS2"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "同一基准所有配对从相同起点、同任务流和工具开始。SWE系统提示是828字节的修复问题指南；MCP是1,309字节的API调用指南；SkillsBench不加系统提示，从空技能库开始，去掉基准原配的人工技能，只允许使用此前任务中进化出的技能。",
        "sources": [
          {
            "label": "附录B.4：初始提示与可写范围",
            "url": "https://arxiv.org/html/2605.30621#A2.SS4"
          },
          {
            "label": "附录B.1：三个任务流",
            "url": "https://arxiv.org/html/2605.30621#A2.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "当前框架执行一批任务并锁定成绩→把轨迹和结果整理成固定格式的证据→修改者更新可写技能、提示或记忆→后面的任务使用新版本。论文控制各模型的更新预算和任务轮数；没有额外列出独立验证集挑最佳框架或回放当前题后覆盖旧分数的步骤。",
        "sources": [
          {
            "label": "§3.2：先答题再更新",
            "url": "https://arxiv.org/html/2605.30621#S3.SS2"
          },
          {
            "label": "附录B.3：各基准判分及顺序",
            "url": "https://arxiv.org/html/2605.30621#A2.SS3"
          },
          {
            "label": "§4.1、附录B.2：模型配对",
            "url": "https://arxiv.org/html/2605.30621#S4.SS1"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "没有参数训练集。学习证据来自同一任务流中已经做过的任务：SWE-bench Verified全500题；MCP-Atlas公开500题；SkillsBench 86题。技能或记忆只在这些任务完成、计分之后更新。",
        "sources": [
          {
            "label": "附录B.1：三个任务流",
            "url": "https://arxiv.org/html/2605.30621#A2.SS1"
          },
          {
            "label": "附录B.3：各基准判分及顺序",
            "url": "https://arxiv.org/html/2605.30621#A2.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "当前任务的执行记录和已取得结果供后续更新；不同模型配对共享提示格式、轨迹窗口、更新预算和任务顺序。本文没有单设开发/验证分区，不能把“先计分再用经验”改写成训练—验证—测试三分法。",
        "sources": [
          {
            "label": "§4.1、附录B.2：模型配对",
            "url": "https://arxiv.org/html/2605.30621#S4.SS1"
          },
          {
            "label": "§3.2：先答题再更新",
            "url": "https://arxiv.org/html/2605.30621#S3.SS2"
          },
          {
            "label": "附录B.3：各基准判分及顺序",
            "url": "https://arxiv.org/html/2605.30621#A2.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "最终统计上述同一条任务流的成绩：SWE补丁通过率；MCP严格全事实满足率及平均事实覆盖分；SkillsBench按每题5次运行的结果平均。另分析技能加载率与加载后遵循率，不是另建一份隐藏测试集。",
        "sources": [
          {
            "label": "附录B.1：三个任务流",
            "url": "https://arxiv.org/html/2605.30621#A2.SS1"
          },
          {
            "label": "附录B.3：各基准判分及顺序",
            "url": "https://arxiv.org/html/2605.30621#A2.SS3"
          },
          {
            "label": "附录D.3–D.4：技能遵循诊断",
            "url": "https://arxiv.org/html/2605.30621#A4.SS3"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "每道题的分数在它自己的证据用于更新前锁定，因此该题反馈不反过来提高该题已记录成绩；但经验和评价来自同一连续任务流，不是最终冻结后测未见集合。结论限定在这种技能/提示/记忆编辑空间与三类任务，不能外推为所有代码修改都不需要强模型。",
        "sources": [
          {
            "label": "附录B.3：各基准判分及顺序",
            "url": "https://arxiv.org/html/2605.30621#A2.SS3"
          },
          {
            "label": "附录B.4：初始提示与可写范围",
            "url": "https://arxiv.org/html/2605.30621#A2.SS4"
          },
          {
            "label": "§6：范围与限制",
            "url": "https://arxiv.org/html/2605.30621#S6"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "把两个通常混在一起的因素交叉控制：谁能写出有帮助的框架，谁能真正利用框架。再从日志区分“根本没加载技能”和“加载了但后续不按步骤做”，解释为什么能力更弱、理论提升空间更大的模型，实际收益反而可能更小。",
        "sources": [
          {
            "label": "§3.3：固定一侧的能力指标",
            "url": "https://arxiv.org/html/2605.30621#S3.SS3"
          },
          {
            "label": "§4.2：修改者能力实验",
            "url": "https://arxiv.org/html/2605.30621#S4.SS2"
          },
          {
            "label": "§4.3：执行者收益与失败分析",
            "url": "https://arxiv.org/html/2605.30621#S4.SS3"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-11",
    "roleAuditDate": "2026-09-11"
  },
  "2609.08175": {
    "fields": [
      {
        "key": "executor",
        "label": "谁执行",
        "value": "理论中是任意固定模型配当前框架。实证分两套：DS-1000所有模型请求返回 gpt-5.4-mini-2026-03-17；WorkBuddy Code使用 deepseek-v4-flash-260425 配 DeepSeek Harness 0.1.0-rc.5（提交47f943859bef）。每套执行模型保持冻结。",
        "sources": [
          {
            "label": "§1–2，p1–4：研究对象与假设",
            "url": "https://arxiv.org/pdf/2609.08175#page=1"
          },
          {
            "label": "附录I.3.4，p84–85：请求与模型身份记录",
            "url": "https://arxiv.org/pdf/2609.08175#page=84"
          },
          {
            "label": "附录I.3.5，p87–89：WorkBuddy–DSH设置",
            "url": "https://arxiv.org/pdf/2609.08175#page=87"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "modifier",
        "label": "谁来改",
        "value": "DS-1000同一冻结 gpt-5.4-mini 模型生成或修订Python框架源码；WorkBuddy由相同DeepSeek模型/agent 组合，根据生成分区的题目、旧成绩及失败材料提出4个持久系统角色提示。固定统计验收程序判断能否采用，模型不自己凭一句“我改好了”决定。",
        "sources": [
          {
            "label": "附录I.3.4，p82–85：DS-1000设置与模型",
            "url": "https://arxiv.org/pdf/2609.08175#page=82"
          },
          {
            "label": "附录I.3.4，p84–85：请求与模型身份记录",
            "url": "https://arxiv.org/pdf/2609.08175#page=84"
          },
          {
            "label": "附录I.3.5，p87–89：WorkBuddy–DSH设置",
            "url": "https://arxiv.org/pdf/2609.08175#page=87"
          },
          {
            "label": "§4，p7–10：有限数据验收",
            "url": "https://arxiv.org/pdf/2609.08175#page=7"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "object",
        "label": "什么在进化 / 哪些部分不变",
        "value": "理论覆盖冻结模型的持久框架更新；实证分别改 Python求解框架源码和每个新会话加载的系统角色提示。",
        "sources": [
          {
            "label": "§1–2，p1–4：研究对象与假设",
            "url": "https://arxiv.org/pdf/2609.08175#page=1"
          },
          {
            "label": "附录I.3.4，p82–85：DS-1000设置与模型",
            "url": "https://arxiv.org/pdf/2609.08175#page=82"
          },
          {
            "label": "附录I.3.5，p87–89：WorkBuddy–DSH设置",
            "url": "https://arxiv.org/pdf/2609.08175#page=87"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "verdict",
        "label": "反馈是什么 / 怎样判对错",
        "value": "DS-1000按程序题执行检查得到通过/失败，再分别统计修好了多少旧失败、损害了多少旧成功；WorkBuddy用Code任务的基准评分。两者都另用有限样本算不确定区间决定是否可接受，并保留独立审计任务事后检查。审计点估计看起来变好，不代表区间足够窄、已被可靠验收。",
        "sources": [
          {
            "label": "§6.3，p15–16：两组诊断实验",
            "url": "https://arxiv.org/pdf/2609.08175#page=15"
          },
          {
            "label": "附录I.3.4，p82–85：DS-1000设置与模型",
            "url": "https://arxiv.org/pdf/2609.08175#page=82"
          },
          {
            "label": "附录I.3.5，p87–89：WorkBuddy–DSH设置",
            "url": "https://arxiv.org/pdf/2609.08175#page=87"
          },
          {
            "label": "§4，p7–10：有限数据验收",
            "url": "https://arxiv.org/pdf/2609.08175#page=7"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "seed",
        "label": "基础 harness / 初始系统",
        "value": "DS-1000起点只把公开题目交给模型调用一次，没有多调用编排或后处理搜索；候选可以改变这些外围流程，但静态审查禁止访问文件、进程、环境、网络、隐藏测试和参考解。WorkBuddy起点是已有DeepSeek Harnesscoding agent，修改只替换系统角色提示，不增工具或改变上下文管理。",
        "sources": [
          {
            "label": "附录I.3.4，p82–85：DS-1000设置与模型",
            "url": "https://arxiv.org/pdf/2609.08175#page=82"
          },
          {
            "label": "附录I.3.5，p87–89：WorkBuddy–DSH设置",
            "url": "https://arxiv.org/pdf/2609.08175#page=87"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "cycle",
        "label": "怎样定位问题、修改与保留版本",
        "value": "生成候选→独立任务估计修复与退化→用同时控制多个判断错误风险的区间验收→通过才选择，否则保留旧版本→最后独立审计。DS-1000比较独立生成、只看无标签运行记录修订、再加正确性标签修订三种方式；WorkBuddy固定4个提示候选后再验收。跨步实证另以点估计选更新，不等同理论的高置信接受规则。",
        "sources": [
          {
            "label": "§6.3，p15–16：两组诊断实验",
            "url": "https://arxiv.org/pdf/2609.08175#page=15"
          },
          {
            "label": "§4，p7–10：有限数据验收",
            "url": "https://arxiv.org/pdf/2609.08175#page=7"
          },
          {
            "label": "附录I.3.4，p85–87：跨步骤测量",
            "url": "https://arxiv.org/pdf/2609.08175#page=85"
          },
          {
            "label": "附录I.3.5，p87–89：WorkBuddy–DSH设置",
            "url": "https://arxiv.org/pdf/2609.08175#page=87"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "train",
        "label": "训练 / 进化数据",
        "value": "均不训练参数。DS-1000：排除 516 道试运行题后取 480 题，分四组，每组 8 题生成修改。WorkBuddy Code：80 题中 20 题生成修改。",
        "sources": [
          {
            "label": "附录I.3.4，p82–85：DS-1000设置与模型",
            "url": "https://arxiv.org/pdf/2609.08175#page=82"
          },
          {
            "label": "附录I.3.5，p87–89：WorkBuddy–DSH设置",
            "url": "https://arxiv.org/pdf/2609.08175#page=87"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "debug",
        "label": "调试 / 选版本数据",
        "value": "DS-1000：每组另用 8 题低预算验收、48 题高预算验收，按后者选择。WorkBuddy：20 题验收四个冻结候选，每个系统取前三次有效运行。",
        "sources": [
          {
            "label": "附录I.3.4，p82–85：DS-1000设置与模型",
            "url": "https://arxiv.org/pdf/2609.08175#page=82"
          },
          {
            "label": "附录I.3.5，p87–89：WorkBuddy–DSH设置",
            "url": "https://arxiv.org/pdf/2609.08175#page=87"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "test",
        "label": "最终测试数据",
        "value": "DS-1000：每组另 56 题；WorkBuddy：另 40 题。均审计所有候选，包括未被采用者。DS-1000 连续修改实验另用 48 题选更新、48 题测量。",
        "sources": [
          {
            "label": "附录I.3.4，p82–85：DS-1000设置与模型",
            "url": "https://arxiv.org/pdf/2609.08175#page=82"
          },
          {
            "label": "附录I.3.5，p87–89：WorkBuddy–DSH设置",
            "url": "https://arxiv.org/pdf/2609.08175#page=87"
          },
          {
            "label": "附录I.3.4，p85–87：跨步骤测量",
            "url": "https://arxiv.org/pdf/2609.08175#page=85"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "isolation",
        "label": "数据隔离与证据边界",
        "value": "生成、验收、审计题均互斥；WorkBuddy 完成验收和选择后才开放审计。理论保证另要求固定任务分布、奖励与规定的抽样条件。",
        "sources": [
          {
            "label": "§1–2，p1–4：研究对象与假设",
            "url": "https://arxiv.org/pdf/2609.08175#page=1"
          },
          {
            "label": "§4，p7–10：有限数据验收",
            "url": "https://arxiv.org/pdf/2609.08175#page=7"
          },
          {
            "label": "§6.3，p15–16：两组诊断实验",
            "url": "https://arxiv.org/pdf/2609.08175#page=15"
          },
          {
            "label": "附录I.3.5，p87–89：WorkBuddy–DSH设置",
            "url": "https://arxiv.org/pdf/2609.08175#page=87"
          }
        ],
        "status": "recorded"
      },
      {
        "key": "novelty",
        "label": "关键设计 / 与相近研究的区别",
        "value": "把候选真的更好、生成器能找到它、有限数据能认证它、选中后还能继续进步拆开证明与测量。达到性能上限附近时，识别微小真实改进的最坏情况评估成本会增加；当前执行变好本身，也不能保证下一轮更容易找到好修改。",
        "sources": [
          {
            "label": "§3，p4–7：改进目标与生成概率",
            "url": "https://arxiv.org/pdf/2609.08175#page=4"
          },
          {
            "label": "§5，p10–13：瓶颈及评估成本",
            "url": "https://arxiv.org/pdf/2609.08175#page=10"
          },
          {
            "label": "§6.4，p16–17：多轮保证及实证",
            "url": "https://arxiv.org/pdf/2609.08175#page=16"
          }
        ],
        "status": "recorded"
      }
    ],
    "sourceDate": "2026-09-11",
    "roleAuditDate": "2026-09-11"
  }
}
