Grit 出品的 RADAR 抢先体验中

智能体说完成,RADAR 来检验。

RADAR 运行 Claude Code 和 Codex 等 AI 编程智能体。每项任务在工作开始前都会先有一项测试;只有当 RADAR 亲自运行这项测试并且测试通过,任务才算完成。

  1. 您把一项任务和它的测试交给 RADAR。 测试在任何工作开始之前写好。
  2. 由一个智能体来做。 在它自己的一份项目副本里。
  3. 智能体说已经完成。 RADAR 把这句话记为一项声明,而不是一个结果。
  4. RADAR 亲自运行测试。 测试失败。任务重新打开,并附上失败记录。
  5. 智能体修复问题。RADAR 再次运行测试。 测试通过。
  6. 任务关闭。 证据留存。
radar app
示例会话

radar app示例会话

滚动或滑动,即可在屏幕中移动查看。

radar app
示例

图 1 · 一次示例会话,使用示例数据

运行您已在使用的智能体

  • Claude Code
  • Codex CLI
  • OMP
  • Hermes Agent

配合使用的工具

  • Claude
  • ChatGPT
  • Git
  • Python
  • Obsidian
  • Windows
  • Linux
RADAR 会取代我的智能体吗?

通俗地说

RADAR 是做什么的?用一个例子来说明。

AI 智能体是一种替您编写和修改软件的程序。它工作很快,完成后会告诉您它完成了。RADAR 负责检查它是否真的完成了。

AI 智能体
一种能自己完成软件工作的程序,比如修复一个程序错误。Claude Code 和 Codex CLI 就是其中两个。
测试
一项小而精确的检查,用来证明工作做对了,在工作开始之前就已写好。工程师称之为验收测试。
记录
记下每项任务的地方:谁接手了它,声称了什么,测试结果如何。RADAR 称之为台账。
  1. 先写好测试

    在任何人动手之前,先为任务写好测试:输入错误的密码必须被拒绝,输入正确的密码必须能登录。

  2. 由智能体来做

    RADAR 把任务交给一个 AI 智能体。智能体在一份属于自己的项目副本里工作,所以其他任何东西都不会被改动。

  3. 智能体说已经完成

    智能体报告:完成了。RADAR 把这句话记为一项声明,而不是一个结果。

  4. RADAR 亲自运行测试

    RADAR 不轻信智能体的话,而是自己在工作的最新版本上运行测试。

  5. 如果失败,任务会重新打开

    在这个例子里,输入错误的密码仍然能登录。任务会带着失败记录重新打开,智能体再试一次。尝试三次之后,由另一个智能体接手;再试三次仍不行,任务就会等您来处理。

  6. 测试通过,任务关闭

    智能体修复了问题,RADAR 再次运行测试。测试通过,于是任务关闭,记录中保存着证据。

为什么这很重要

智能体可能会信心十足地出错。没有检查,一个错误的“完成”就会进入您的产品,传到您的客户那里。有了 RADAR,任务是否完成,由证据说了算。

图 2 · 同一个例子,近距离查看

海图室

每个智能体、每项任务,都在一个屏幕上。

这是 RADAR 的主屏幕。下面介绍它的五个部分。

radar
示例数据

radar示例数据

滚动或滑动,即可在屏幕中移动查看。

点按数字即可放大。

图 3 · 主屏幕,使用示例数据
  1. 右上:CHART

    地图

    每座岛是一台计算机:您自己的电脑,或您运行的一台服务器。虚线表示正在上面工作的智能体。停止响应的机器会被标记为 AGROUND,并继续留在地图上。

  2. 左侧:LOG

    记录

    每项任务都按状态计数:等待中、进行中、等待测试。所有智能体共用一份记录,因此在它们之间不会遗漏任何东西。

  3. 左下:NEXT

    需要您处理

    只有需要人来做的决定才会交到您手上,并附上下一步要运行的命令。一个智能体有三次尝试机会,之后由另一个智能体接手;再试三次仍不行,任务就在这里等您。

  4. 左下:ARRIVALS

    先检验,再并入

    工作只有在测试通过后才会并入您的项目,并入之后测试还会再运行一次。条形显示每小时有多少任务并入。

  5. 右下:COMMANDS

    命令与记忆

    RADAR 由一份简短的命令列表驱动。其中一个命令用来搜索记忆:记录经验教训的笔记,RADAR 会在下一个智能体开始之前把它们展示给它。您可以在 Obsidian 中打开这些笔记。

图 3 · 主屏幕,使用示例数据

来自 Grit 自身的工作

观察所得,并非对照比较

在 Grit 自身的工作中(2026年9月20日至28日),运行同一款编程智能体的工作进程共 1,608 次报告某项任务已完成(涉及 1,457 项任务);Grit 随即在同一台服务器上重新运行验收命令,其中 74 次报告的重新运行失败(4.6%)。仅凭一项声明,不能关闭任务。

显示哪种计数

1,608 次报告称已完成,因此每一次都算作完成。测试已重新运行:其中 74 次报告失败。

一个方块:一次任务已完成的报告 Grit 的重新运行失败

Grit 内部台账,2026年9月28日 06:00 UTC 快照

版本

面向个人的开放版。
面向企业的版本正在开发中。

公开发布时开源(Apache-2.0)

RADAR

面向个人开发者,在您自己的电脑上运行。

  • 记录、测试、记忆,以及并行工作的多个智能体
  • 运行 Claude Code、Codex CLI、OMP 和 Hermes Agent
  • 需要 Python 3.12 或更高版本;无需账户,无需云服务

开发中

面向企业的 RADAR

面向团队,运行在您自己的基础设施上。

  • 在您团队自己的基础设施上运行,针对您自己的代码
  • 由 Grit 部署并提供支持
  • 为您的工作构建的自主系统,遵循同样的规则:只有测试再次通过,任务才会关闭
RADAR 现在可以使用吗?

RADAR 正处于抢先体验阶段。如需加入,请通过联系页面,或通过 X 或 Instagram 给我们发消息。获得使用权限后,您把代码仓库的链接交给您的编程智能体,并说“安装这个”。仓库中附有专为智能体编写的安装步骤:智能体会检查您的电脑,在安装任何缺少的东西之前先征求您的同意,装好 RADAR 并向您报告。

RADAR 会取代我的编程智能体吗?

不会。RADAR 运行您已在使用的智能体,并检验它们的工作。工作仍由智能体完成。RADAR 给它们一份共同的记录、一项无法跳过的检查,以及一份共同的记忆。

怎样才算完成?

当 RADAR 在工作的最新版本上运行任务的测试并且测试通过时,任务才算完成。智能体自己说的“完成”只记为一项声明;在测试通过之前,RADAR 不会关闭任务。人可以推翻这一规定,而这次推翻也会被记录下来。

它能运行哪些智能体?

Claude Code、Codex CLI、OMP 和 Hermes Agent。每个智能体都在自己的一份项目副本里工作,可以在您的电脑上,也可以在您自己的 Linux 服务器上。

RADAR 比 Claude Code 或 Codex 更好吗?

它不是替代品,所以不与它们竞争。RADAR 运行它们,并检验它们交付的成果。

如果测试本身就错了呢?

那么检查本身也是错的。这就是测试要在工作开始之前写好、让人能够读到的原因,此后对它的任何改动也都会被记录。

我的代码会离开我的电脑吗?

不会经由 RADAR。它不需要账户,也不需要云服务;每项外部服务都是可选的,在您开启之前一直处于关闭状态。您的智能体仍会像现在一样,与各自的服务提供商通信。

运行它需要多少费用?

RADAR 本身不会产生任何账单。它运行的智能体会继续使用您为它们登录的账户,例如 Claude 或 ChatGPT 套餐,并遵守这些服务提供商的条款和使用限制。只有在您指定服务提供商和预算时,RADAR 才会使用付费 API。

您的智能体编写代码,RADAR 确保工作真正完成。