展开目录
#Kimi K3#本地部署#MoE#AI教程#Deltafin#开源

单机跑起 Kimi K3(2.8T 参数):Deltafin 本地部署完全指南

Deltafin 让 Kimi K3 的 2.8T MoE 参数在单台 64GB M1 Max 上以 0.27 tok/s 运行,本文详解其原理、安装与使用。

预计阅读 7 分钟

一句话总结

Deltafin 是一个开源实验项目,把月之暗面 Kimi K3(2.8T 参数 MoE)塞进一台普通工作站——64GB M1 Max 上实测 0.27 tok/s,且不牺牲模型质量。本文带你从零安装到跑通推理。

为什么要在本地跑 Kimi K3?

Kimi K3 发布以来,大家都知道它强——2.8T 参数、MoE 架构、开源权重。但「下载」和「跑起来」之间隔着一座大山:

  • 模型大小:完整权重约 1.7TB,普通电脑根本装不下
  • 显存需求:官方推荐多卡 A100/H100,个人开发者望而却步
  • 推理速度:即使用 HuggingFace 加载,单 token 也可能要几分钟

Deltafin 解决了这三个问题。它的核心思路是:MoE 模型每次推理只激活少数专家——通过智能缓存和流水线预取,让那 1.7TB 的权重躺在磁盘上,只在需要时才加载需要的部分。

在 64GB M1 Max 上,Deltafin 的参考解码速度是 0.2660 tok/s(中位数 3.76 秒/token),运行在可复现的 greedy 模式下。慢吗?跟 API 比确实慢。但这是一台笔记本电脑在跑一个2.8T 参数的模型——这在 Deltafin 出现之前是不可想象的。

Deltafin 是怎么做到的?

Deltafin 的架构做了三件关键的事:

1. 专家磁盘缓存 + 按需加载

Kimi K3 是 MoE 模型,每层有 16 个路由专家。单次 token 生成只激活其中一部分。Deltafin 不把整个模型加载到内存——它把专家权重存在磁盘上,推理时只加载当前 token 需要的专家。一次单 token 推理需要读取 16 专家 × 92 层 = 约 25.8 GB 专家数据,从本地 SSD 读取大约 4 秒,从网络读取则是分钟级别。

这就是为什么 Deltafin 提供了两种模式:

模式磁盘需求下载时间推理速度
--full(推荐)~1.7 TB5-10 小时3.76 s/token
--stream~215 GB~30 分钟3+ 分钟/token

2. 投机解码(Speculative Decoding)

Deltafin 使用两个小型草稿模型(1.19 GB + 3.44 GB)来「猜测」K3 接下来可能生成的 token。K3 只需要验证这些猜测是否正确——如果正确,一次前向传播就能确认多个 token,大幅提升吞吐。草稿模型不能独立生成 token,只能提议让 K3 裁决,所以速度提升不以牺牲质量为代价。

3. MXFP4 原生专家计算

Deltafin 在支持的硬件上使用 MXFP4 精度做专家计算——比 FP16 更省内存和带宽,但保持了足够的数值精度。在 Apple Silicon 上走 MPS、在 NVIDIA GPU 上走 CUDA、纯 CPU 也能跑。

安装指南

前置条件

  • macOS(Apple Silicon)或 Linux(x86-64 / aarch64)
  • Python 3.12+
  • 至少 64GB 统一内存(M1 Max 基准)或等效内存 + GPU
  • 至少 1.7TB 可用磁盘空间(full 模式)或 215GB(stream 模式)
  • macOS 需安装 Xcode Command Line Tools(xcode-select --install
  • Linux 需安装 GCC/Clang 编译工具链

完整安装步骤

# 1. 克隆仓库
git clone https://github.com/gavamedia/deltafin.git
cd deltafin

# 2. 创建虚拟环境并安装依赖
python3 -m venv venv
./venv/bin/python -m pip install torch
./venv/bin/python -m pip install -r requirements.txt

# 3. 构建本机原生库
./venv/bin/python tools/build_native.py

# 4. 下载 K3 模型 + 草稿助手(约 1.7TB,需 5-10 小时)
./venv/bin/python tools/setup_k3.py --full

# 5. 构建 int8 主干(参考基准用)
./venv/bin/python tools/convert_spine_int8.py

NVIDIA GPU 用户注意:在步骤 2 安装 PyTorch 时使用 CUDA 版本(参考 PyTorch 官方安装指南),build_native.py 会自动检测 NVCC。

升级已有安装

# 一键升级(不重新下载模型)
./venv/bin/python tools/upgrade.py

运行推理

安装完成后,Deltafin 提供 OpenAI 兼容的 API 服务器:

# 启动 API 服务器
./venv/bin/python -m deltafin.serve

# 或者用 curl 直接调用
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "kimi-k3",
    "messages": [{"role": "user", "content": "解释 MoE 架构的原理"}],
    "temperature": 0
  }'

因为是 greedy 解码(temperature=0),结果完全可复现——同样的输入永远产生相同的输出。

性能参考

以下数据来自项目方在 64GB M1 Max 上的实测:

指标数值
解码速度0.2660 tok/s(中位数)
单 token 延迟3.76 秒
草稿助手内存占用约 4.63 GB(占 64GB 总内存的 7.2%)
专家计算精度MXFP4(原生)
解码模式Greedy(可复现)

这里有几个重要细节:

  • 3.76 秒/token 是中位数,投机解码的效果因文本而异——有些 token 只花 0.5 秒,有些花 10 秒
  • 64GB M1 Max 是 2021 年的第一代机器——M3 Max 或 M4 Max 会更快
  • 质量零妥协:所有 16 个路由专家完整保留,K3 是每 token 的唯一裁决者

实际场景案例

场景 1:本地代码审查助手

启动 Deltafin API 服务器后,配置 Claude Code 或 Continue 指向 http://localhost:8000,用 Kimi K3 做本地代码审查——完全离线,代码不离机。

场景 2:长文档分析与摘要

投喂一份几十页的 PDF 或合同,让 K3 在本地逐段分析。虽然速度慢,但敏感文档不需要上传到任何云服务。

场景 3:模型行为研究

因为 Deltafin 保证 greedy 模式可复现,研究人员可以用它精确研究 K3 在特定输入下的专家路由模式、注意力分布等内部行为。

常见问题

Q: 1.7TB 太大了,我能用更小的磁盘吗? A: 可以选 --stream 模式,只需 215GB。但推理时每个 token 需要从网络拉取权重,速度会降到 3+ 分钟/token,体验很差。如果你有足够带宽和耐心,这是一个选项。

Q: Windows 能跑吗? A: 目前官方只支持 macOS 和 Linux。Windows 用户可以通过 WSL2 运行。

Q: 能用多张显卡加速吗? A: 当前版本是单机单卡/单 CPU 设计。多 GPU 张量并行尚未实现。

Q: 和大厂 API 比,本地跑有什么优势? A: 三个字:隐私、可控、零费用。API 调用记录在你的服务器上,模型行为完全可复现,没有速率限制和月度账单。

同类方案对比

方案硬件需求速度质量安装难度
Deltafin64GB 统一内存0.27 tok/s完整 K3中等
llama.cpp + GGUF取决于量化级别更快(量化后)有损(量化)简单
HuggingFace + Accelerate多卡 A100完整复杂
Moonshot API实时完整

Deltafin 的价值在于:它是目前唯一能在消费级硬件上跑完整无损 Kimi K3 的方案。

总结

  • Deltafin 证明了「大模型必须用数据中心跑」不是铁律——MoE 的稀疏性让本地部署成为可能
  • 0.27 tok/s 很慢,但它跑在一台笔记本上,且不牺牲任何模型质量
  • 投机解码 + MXFP4 + 磁盘缓存的三重优化是这套方案的精髓
  • 适合需要完全离线推理、隐私敏感、或做模型行为研究的开发者
  • 开源 MIT 协议,代码完全透明,可以随意魔改

仓库地址github.com/gavamedia/deltafin

数据来源:Deltafin GitHub README(2026-07-31),基准数据来自项目方在 M1 Max 64GB 上的实测。

Related

相关文章

延伸阅读

查看全部 →