动手搭一个 Harness

一句话:agent 就是一个模型,在一个循环里,能调用工具。 其余的一切 —— 一段 prompt、几道护栏、顺手整理一下记忆 —— 都是细节。

不用装任何东西,不用 Google 账号。每一步点「▶ 运行」就行,然后动手改 prompt 再跑一次。

怎么读这些运行记录

每一步都有 TRACE 开关,打开能额外看到每步的 token 数、增长条,以及未截断的工具输出。 默认关着,好让正常视图保持清爽。代码、prompt 和工具输出保持英文原文 —— 那些是这堂课的研究对象本身。

🧠 那些行是中文的,不是因为网站翻译了它,而是因为服务端在你那段 SYSTEM_PROMPT 后面 追加了下面这一行。删掉它,模型立刻回到英文 —— 这本身就是这个 lab 的论点: 起作用的是 prompt


  

这就是整个 lab

agent 就是一个模型,在一个循环里,能调用工具。你看过了这个循环(第 2 步), 用一段 prompt 和一个工具箱把它变成 agent(第 3 步),让它在长任务里活下来(第 4 步), 看它被攻击并被限制住(第 5 步),只用 prompt 就挖出了一个隐藏漏洞(挑战), 还加了你自己的工具。真正起作用的是 prompt 和工具,循环每次都一样。

回去随便玩:改任务、调 prompt、加工具、打开 TRACE。