Bonsai 27B: A 27B-Class model that runs on a phone

来源:HackerNews

Bonsai 27B:让 270 亿参数大模型跑在手机上的技术突破

背景与概述

近年来,大语言模型(LLM)的参数规模从数十亿迅速膨胀到千亿甚至万亿级别。虽然云端模型能力强大,但调用成本、网络延迟、隐私风险等问题日益突出。与此同时,端侧 AI 的需求却在快速增长:实时语音助手、离线翻译、端侧文档分析等场景都希望模型能在本地运行。

然而,传统观念认为,百亿参数级模型必须依赖服务器级 GPU。Bonsai 27B 的出现挑战了这一假设——它声称能在普通智能手机上运行,同时保持 27B 级别模型的性能。这一进展标志着端侧大模型进入了一个新的阶段,也为开发者打开了更多"本地优先"的 AI 应用可能性。

核心内容

1. 27B 性能,手机级资源占用

Bonsai 27B 的核心卖点是在保持 27B 参数模型能力的同时,将推理所需的计算和内存压降到手机可接受的范围。这通常意味着模型不会在所有时刻激活全部参数,而是通过某种稀疏机制按需调用,从而兼顾模型容量与运行效率。

2. 稀疏架构与专家混合(MoE)

大多数能在端侧运行的大模型都采用了 MoE(Mixture of Experts) 架构。MoE 允许模型在推理时只激活部分参数,例如每次前向传播只调用 2-4 个专家网络。这样,虽然模型总参数量很大,但实际计算量(FLOPs)和激活内存却显著降低。

3. 激进的量化与压缩

为了在手机上运行,Bonsai 27B 很可能采用了 INT4/INT8 量化、权重共享、分组量化(如 GPTQ/AWQ)等技术。这些技术能将模型体积压缩到原来的 1/4 甚至更小,同时尽量保持推理质量。

4. 推理引擎优化

端侧推理框架如 llama.cpp、MLC-LLM、QNN 等针对 ARM CPU/NPU 做了深度优化。Bonsai 27B 可能配合了专门的推理 runtime,优化了 KV Cache 管理、Attention 计算和内存调度,从而实现可