面向科研实验室的端到端 AI 智能体平台,已在 GitHub 开源观看 2 分钟演示 ↗

AGENT CORE

一个持久化的循环:规划、执行、校验

每个长任务都是一次可续跑、可审计的运行:状态与每次判定全部落库,进程被杀也能从断点恢复。计划不是一次写死的剧本,而是随证据不断生长的任务板。

PLAN · 规划 Navigator

把研究目标拆成一份带验收标准的步骤清单。多数任务直接命中固定模板,一次模型都不用调;出现意外时按增量修订计划,改的是清单,不是从头再来。

EXECUTE · 执行 Helm

一次执行一个动作:检索文献、生成代码、启动训练。异常绝不外抛,全部转成观察交给校验环节,一次工具失败不会终结整个任务。

VERIFY · 校验 Sextant

逐步核对事先声明的验收标准。廉价的确定性检查先跑,模型裁判只在规则无法判定时出场;失败原因写得足够具体,直接成为下一轮修正的输入。

校验是一条成本递增的链:能用规则判定的,绝不请模型
无错误 退出码 = 0 产物存在 指标达标 字段完整 模型裁判 · 仅当规则无法判定
动 GPU、花预算、投稿之前,任务停在审批门禁上等你点头;批准后从原地继续,暂停零成本。
活的计划

跑完一轮实验,分析说还要再来一轮,清单里就长出下一轮的步骤;失败的步骤留痕作废,不静默重试。

崩溃恢复

服务重启后自动认领仍在途的任务,从检查点继续;远端还活着的训练进程重新挂上去接着看,不会孤儿一轮训练。

上机前先编译

AI 生成的实验代码先在本地完成语法编译检查,有错带着行号回喂修正,不把低级错误带上集群。

中途可干预

实验进行到需要取舍的节点会暂停提问,研究者的答复被采纳进下一轮;不回复也有安全的默认路径。

分级自治

查文献这类步骤固定的任务走流水线模式,零模型重规划;只有实验这类开放任务才启用完整循环。

预算硬上限

任务级 token 预算、步骤级重试上限、方法级变更过门禁,多道保险防止失控。

去看看它怎么跑一个真实实验

两分钟演示里有一段完整的实验循环:生成、编译、部署、训练、分析、换思路再来。

观看演示 →