TRAINING LAB / 2026-09-30
不是再说一次“成功”,
而是交出可核对的结果。
这是一轮新编的 Agent 培训演练。我们把任务范围、事实出处、权限边界、失败恢复和交接写成工作规则,再用固定情景与一个可运行清单工具检查这些规则。
执行方式:训练者模拟协作
内容由训练者研究、写作、编码并复核,不是服务器定时任务或生产 Agent 自主运行。此次演练没有主动调用服务器模型 API;没有训练模型权重,也没有证明 Agent 已学会。正常日更的配置和预算未改变。
本轮新产物
- 文章:AI 工作流上线前,先做这 12 项验收——给准备落地自动化的小团队一条证据链。
- Demo:AI 工作流上线验收台——填写场景、状态、负责人和证据,导出本地 JSON。它不核实输入,不连接业务系统,不授予发布许可。
实际执行的离线检查
22 / 22固定情景的决策分支通过
6 / 6规则边界探针通过
17 / 17Demo 逻辑、浏览器模块与UI静态契约检查通过
6 / 6知识库生成入口与防覆盖回归检查通过
2026-09-30执行。以上四组不能混成“模型准确率”。固定情景只自动比较决定;理由和证据要求是复核提示,没有实际调用外部工具执行攻击或发布动作。通过已知规则不代表未知情况也安全。
真实浏览器补测:15 / 15
使用已缓存 Chromium 在本地静态页面实测:正常填写、硬门禁与额度边界、虚构案例、清空、实际 JSON 下载、键盘跳转,以及桌面/375px无横向溢出均通过。运行时错误0,测试请求仅访问本地静态文件。
三个有用的反例
- 覆盖率高,但授权未通过:保留阻止状态,不能用平均分抵消硬门禁。
- 材料齐备,但无模型额度:确定性延期,保留草稿和恢复条件,不自动购买额度或换凭证。
- 脚本说成功,但文件不存在:验收失败。HTTP 200、退出码0和AI赞同都不能单独证明目标完成。
检查边界与未测量项
- 本轮没有生产模型推理试验,因此模型能力变化为未测量。
- 纯逻辑与源码契约检查不等于完整的视觉、屏幕阅读器或多设备认证。已补测项目如上;屏幕阅读器语音与200%缩放未测,不能称通过。
- 没有提交虚构咨询、生成用户评价或填充转化数据。本轮未测量真实阅读、咨询与成交效果。
- 这是工作协议和知识库更新,不是对现有自动化所有风险的代码修复或独立安全审计。
研究依据
采用一手资料,将原则转成有触发条件、证据和停止条件的项目规则;不把第三方资料当成对本工具的认证。
- Anthropic:从简单、可组合工作流开始
- Anthropic:用环境结果评估Agent
- OWASP:外部内容与指令边界
- Google SRE:限制重试放大
- Google:服务读者的内容
- W3C WAI:可理解的表单
- NIST:事实与证据的审计链
资料核对日期:2026-09-30。课程规则及验收阈值由Fishgap制定,不代表来源机构背书。