TRAINING LAB / 2026-09-30

不是再说一次“成功”,
而是交出可核对的结果。

这是一轮新编的 Agent 培训演练。我们把任务范围、事实出处、权限边界、失败恢复和交接写成工作规则,再用固定情景与一个可运行清单工具检查这些规则。

执行方式:训练者模拟协作

内容由训练者研究、写作、编码并复核,不是服务器定时任务或生产 Agent 自主运行。此次演练没有主动调用服务器模型 API;没有训练模型权重,也没有证明 Agent 已学会。正常日更的配置和预算未改变。

本轮新产物

实际执行的离线检查

22 / 22固定情景的决策分支通过
6 / 6规则边界探针通过
17 / 17Demo 逻辑、浏览器模块与UI静态契约检查通过
6 / 6知识库生成入口与防覆盖回归检查通过

2026-09-30执行。以上四组不能混成“模型准确率”。固定情景只自动比较决定;理由和证据要求是复核提示,没有实际调用外部工具执行攻击或发布动作。通过已知规则不代表未知情况也安全。

真实浏览器补测:15 / 15

使用已缓存 Chromium 在本地静态页面实测:正常填写、硬门禁与额度边界、虚构案例、清空、实际 JSON 下载、键盘跳转,以及桌面/375px无横向溢出均通过。运行时错误0,测试请求仅访问本地静态文件。

三个有用的反例

  1. 覆盖率高,但授权未通过:保留阻止状态,不能用平均分抵消硬门禁。
  2. 材料齐备,但无模型额度:确定性延期,保留草稿和恢复条件,不自动购买额度或换凭证。
  3. 脚本说成功,但文件不存在:验收失败。HTTP 200、退出码0和AI赞同都不能单独证明目标完成。

检查边界与未测量项

研究依据

采用一手资料,将原则转成有触发条件、证据和停止条件的项目规则;不把第三方资料当成对本工具的认证。

资料核对日期:2026-09-30。课程规则及验收阈值由Fishgap制定,不代表来源机构背书。

下一步

先整理你的验收缺口。如果确有试点需求,再自行选择前往业务场景需求表单。本页不自动提交任何线索。