# Bonsai 27B: A 27B-Class model that runs on a phone

> 来源：[HackerNews](https://prismml.com/news/bonsai-27b)

# Bonsai 27B：让 270 亿参数大模型跑在手机上的技术突破

## 背景与概述

近年来，大语言模型（LLM）的参数规模从数十亿迅速膨胀到千亿甚至万亿级别。虽然云端模型能力强大，但调用成本、网络延迟、隐私风险等问题日益突出。与此同时，端侧 AI 的需求却在快速增长：实时语音助手、离线翻译、端侧文档分析等场景都希望模型能在本地运行。

然而，传统观念认为，百亿参数级模型必须依赖服务器级 GPU。Bonsai 27B 的出现挑战了这一假设——它声称能在普通智能手机上运行，同时保持 27B 级别模型的性能。这一进展标志着端侧大模型进入了一个新的阶段，也为开发者打开了更多"本地优先"的 AI 应用可能性。

## 核心内容

### 1. 27B 性能，手机级资源占用

Bonsai 27B 的核心卖点是在保持 27B 参数模型能力的同时，将推理所需的计算和内存压降到手机可接受的范围。这通常意味着模型不会在所有时刻激活全部参数，而是通过某种稀疏机制按需调用，从而兼顾模型容量与运行效率。

### 2. 稀疏架构与专家混合（MoE）

大多数能在端侧运行的大模型都采用了 **MoE（Mixture of Experts）** 架构。MoE 允许模型在推理时只激活部分参数，例如每次前向传播只调用 2-4 个专家网络。这样，虽然模型总参数量很大，但实际计算量（FLOPs）和激活内存却显著降低。

### 3. 激进的量化与压缩

为了在手机上运行，Bonsai 27B 很可能采用了 INT4/INT8 量化、权重共享、分组量化（如 GPTQ/AWQ）等技术。这些技术能将模型体积压缩到原来的 1/4 甚至更小，同时尽量保持推理质量。

### 4. 推理引擎优化

端侧推理框架如 llama.cpp、MLC-LLM、QNN 等针对 ARM CPU/NPU 做了深度优化。Bonsai 27B 可能配合了专门的推理 runtime，优化了 KV Cache 管理、Attention 计算和内存调度，从而实现可