# Project Glasswing: Securing critical software for the AI era

> 来源：[HackerNews](https://www.anthropic.com/glasswing)

# Project Glasswing: 为AI时代的关键软件构筑安全防线

## 背景与概述

在人工智能技术飞速发展的今天，AI系统正以前所未有的深度融入我们的数字基础设施。从自动驾驶、医疗诊断到金融风控、网络安全，AI模型已成为众多关键软件系统的核心决策组件。然而，与传统的软件漏洞不同，AI模型（尤其是大型语言模型和深度学习模型）的安全风险更加隐蔽和复杂。对抗性攻击、数据投毒、模型窃取、提示注入等新型威胁层出不穷，对依赖AI的系统构成了严峻挑战。

正是在这样的背景下，Anthropic公司启动了 **Project Glasswing**。该项目旨在开发一套系统性的方法和工具，专门用于加固那些集成或依赖AI模型的关键软件。Glasswing的名字灵感来源于一种拥有近乎透明翅膀的蝴蝶，寓意着项目目标：让AI系统的内部运作和安全状态变得清晰可见、易于防护。这并非一个单一的工具，而是一个涵盖安全评估、风险缓解、持续监控的全方位框架，其核心是应对AI时代特有的安全范式转变。

## 核心内容

Project Glasswing主要围绕以下几个核心支柱展开，旨在构建一个纵深防御体系：

1.  **针对AI组件的威胁建模**：传统软件威胁建模（如STRIDE）难以完全覆盖AI特有的风险。Glasswing引入了针对机器学习系统的威胁分类法，重点关注：
    *   **模型完整性**：防止训练数据被投毒或模型权重被恶意篡改。
    *   **推理安全性**：防御对抗性样本攻击，确保模型在真实（可能被扰动）的输入下仍能做出可靠决策。
    *   **提示安全与越狱**：对于大语言模型应用，系统性地识别和阻断可能导致模型生成有害内容或泄露敏感信息的恶意提示。
    *   **供应链安全**：确保从预训练模型、微调数据集到部署框架的整个AI供应链可信。

2.  **安全基准与评估套件**：Glasswing致力于建立一套标准化的安全基准测试。这类似于传统软件的安全渗透测试，但专门针对AI模型的行为。例如，开发一套“对抗性提示库”，用于系统性地测试LLM应用对各类越狱、角色扮演、指令覆盖等攻击的鲁棒性。这为开发者提供了一个客观衡量其AI组件安全水平的标尺。

3.  **运行时监控与异常检测**：AI系统的风险是动态的。Glasswing框架强调在应用运行时持续监控模型的输入、输出和内部状态。通过建立正常行为基线，系统可以实时检测异常活动，例如：
    *   输入数据分布突然偏移（可能遭遇新型对抗攻击）。
    *   模型对特定类别输入的置信度异常波动。
    *   输出内容中出现已知的有害模式或敏感信息泄露。
    *   资源使用模式异常（可能提示模型窃取攻击）。

4.  **架构安全模式与最佳实践**：Glasswing提供了一系列经过验证的架构模式和设计指南，帮助开发者在系统设计之初就嵌入安全性。例如：
    *   **AI组件沙箱化**：将模型推理服务运行在高度隔离的环境中，限制其网络访问和系统调用能力。
    *   **输入输出净化与验证层**：在模型前后部署专门的过滤和验证层，对输入进行规范化、检测异常，对输出进行内容安全过滤和格式校验。
    *   **防御性提示工程框架**：为LLM应用提供结构化的提示模板和安全上下文管理机制，减少提示注入的风险。

## 技术分析

从技术实现角度看，Project Glasswing并非要重新发明轮子，而是对现有安全工具链和AI运维（MLOps）实践的深度整合与增强。

**架构层面**，Glasswing倡导一个分层的安全架构。最底层是**加固的AI模型本身**，可能通过对抗训练、差分隐私训练等技术提升其内在鲁棒性。之上是**模型服务层**，集成了输入验证、对抗样本检测（如使用特征挤压或检测器网络）、输出内容过滤等模块。再往上是**应用集成层**，在这里，AI服务被当作一个需要特殊关照的“第三方组件”来管理，其访问受到严格的身份认证、授权和审计日志的控制。最外层是**全局监控与响应系统**，汇聚所有AI组件的日志和指标，进行关联分析，实现安全事件的集中告警和响应。

**关键技术点**包括：
*   **可观测性增强**：为模型推理过程添加更细粒度的遥测数据，不仅记录输入输出，还可能包括中间层激活的统计信息、注意力分布等，为异常检测提供丰富信号。
*   **轻量级检测模型**：部署轻量级的辅助分类器或异常检测模型，实时分析主模型的输入和输出，起到“安全副驾驶”的作用。
*   **安全即代码**：将安全策略（如允许的输入范围、禁止的输出关键词列表、访问控制规则）以代码或配置文件的形式进行管理，实现版本控制和自动化测试。

一个简化的概念性代码示例，展示如何在模型服务API前加入一个输入验证器：

```python
import torch
from transformers import AutoModelForSequenceClassification, AutoTokenizer
from some_glasswing_library import InputValidator, OutputSanitizer

# 加载业务模型
model = AutoModelForSequenceClassification.from_pretrained("my-ai-model")
tokenizer = AutoTokenizer.from_pretrained("my-ai-model")

# 初始化Glasswing安全组件
input_validator = InputValidator(
    max_length=512,
    allowed_characters=None, # 可定义允许的字符集
    toxicity_detector=load_toxicity_model() # 集成内容安全预检
)
output_sanitizer = OutputSanitizer(
    blocklist=["敏感词1", "敏感词2"],
    max_confidence_threshold=0.95 # 对过高置信度输出保持警惕
)

def secure_model_predict(user_input: str):
    # 1. 输入验证与净化
    is_valid, cleaned_input, validation_report = input_validator.validate_and_clean(user_input)
    if not is_valid:
        return {"error": "Invalid input", "report": validation_report}
    
    # 2. 模型推理
    inputs = tokenizer(cleaned_input, return_tensors="pt", truncation=True)
    with torch.no_grad():
        outputs = model(**inputs)
        predictions = torch.nn.functional.softmax(outputs.logits, dim=-1)
    
    # 3. 输出净化与后处理
    final_output, sanitization_log = output_sanitizer.sanitize(predictions, cleaned_input)
    
    return {
        "prediction": final_output,
        "security_metadata": {
            "input_validated": True,
            "output_sanitized": True,
            "validation_report": validation_report,
            "sanitization_log": sanitization_log
        }
    }
```

## 实践建议

对于正在或计划将AI集成到关键应用中的开发者团队，可以遵循以下步骤来借鉴Glasswing的思路提升安全性：

1.  **从威胁评估开始**：不要直接编码。首先，与安全团队合作，为你的AI应用进行一次专门的威胁建模会议。识别出最可能被利用的攻击面（是训练数据？用户提示？还是API接口？）。
2.  **分层设计安全控制**：
    *   **数据层**：确保训练和微调数据的来源可信，进行数据清洗和去毒。
    *   **模型层**：考虑采用提供一定鲁棒性保证的训练技术，或使用经过安全评估的预训练模型。
    *   **服务层**：在模型API前/后强制加入输入验证和输出过滤。对用户提供的提示，使用分隔符、系统提示加固等技术。
    *   **系统层**：对模型服务进行严格的网络隔离、资源限制和访问控制。
3.  **建立监控基线**：在测试和预发布阶段，收集模型在正常情况下的输入输出模式、响应时间、置信度分布等数据，建立行为基线。任何在生产环境中偏离该基线的行为都应触发告警。
4.  **进行定期安全测试**：将AI安全测试纳入CI/CD管道。定期使用对抗性样本、恶意提示集等“红队”工具对系统进行测试，评估其防御能力。
5.  **保持依赖更新与审计**：密切关注所使用的AI框架（如TensorFlow, PyTorch）、模型库和云服务的安全公告。定期审计整个AI软件供应链。

## 总结

Project Glasswing的出现，标志着AI安全正从一个前沿研究课题，转向工程化、系统化的最佳实践集合。它回应了一个紧迫的需求：当AI从实验室的演示品转变为支撑社会运转的关键软件组件时，我们必须以对待操作系统或数据库同等的严谨态度来对待其安全性。对于开发者而言，拥抱类似Glasswing的理念，意味着将“安全左移”到AI系统开发的生命周期最早阶段，通过架构设计、工具链和持续监控，共同构筑起抵御AI时代新型威胁的坚固防线。这不仅是技术挑战，更是确保AI技术得以负责任、可持续地造福社会的基石。