AGENT CORE
每个长任务都是一次可续跑、可审计的运行:状态与每次判定全部落库,进程被杀也能从断点恢复。计划不是一次写死的剧本,而是随证据不断生长的任务板。
把研究目标拆成一份带验收标准的步骤清单。多数任务直接命中固定模板,一次模型都不用调;出现意外时按增量修订计划,改的是清单,不是从头再来。
一次执行一个动作:检索文献、生成代码、启动训练。异常绝不外抛,全部转成观察交给校验环节,一次工具失败不会终结整个任务。
逐步核对事先声明的验收标准。廉价的确定性检查先跑,模型裁判只在规则无法判定时出场;失败原因写得足够具体,直接成为下一轮修正的输入。
跑完一轮实验,分析说还要再来一轮,清单里就长出下一轮的步骤;失败的步骤留痕作废,不静默重试。
服务重启后自动认领仍在途的任务,从检查点继续;远端还活着的训练进程重新挂上去接着看,不会孤儿一轮训练。
AI 生成的实验代码先在本地完成语法编译检查,有错带着行号回喂修正,不把低级错误带上集群。
实验进行到需要取舍的节点会暂停提问,研究者的答复被采纳进下一轮;不回复也有安全的默认路径。
查文献这类步骤固定的任务走流水线模式,零模型重规划;只有实验这类开放任务才启用完整循环。
任务级 token 预算、步骤级重试上限、方法级变更过门禁,多道保险防止失控。