DeepSeek-V4-Flash 离线算力服务方案
DeepSeek-V4-Flash 离线算力服务方案
基于 AMD Ryzen AI Max+ 395 集群的"消费即送 AI"线下基础设施
目标:在开发者聚集型线下空间(共享办公、程序员主题咖啡馆、科技园区配套等)本地部署 DeepSeek-V4-Flash,提供"连 Wi-Fi 即用、兼容 OpenAI API、店内不限量"的离线 AI 推理服务
一、背景:AI 算力正成为线下基础设施
1.1 AGI Bar 模式(对标案例)
2026 年 8 月,北京一家 AGI Bar 开创了"消费即送 DeepSeek V4 Flash 无限量 API"的玩法(AIbase 报道):
- 顾客到店消费 → 连接店内 Wi-Fi → 免费获得 DeepSeek-V4-Flash 的 API Token,店内使用期间完全不限量。
- 用户拿到 Base URL + API Key,填入 Claude Code、Codex、Cursor、Cherry Studio 等兼容 OpenAI API 格式的客户端,即可直接调用。
- AI 推理从"注册 + 订阅 + Token 计费"的传统模式,变成像 Wi-Fi 一样即连即用的基础服务。
1.2 趋势判断
| 过去 | 现在(AGI Bar 信号) |
|---|---|
| AI 服务绑定账号、订阅、Token 计费 | 消费即送、店内不限量 |
| 算力集中在云端,按量付费 | 算力下沉到线下空间,本地部署 |
| AI 是付费工具 | AI 是水电 Wi-Fi 一样的普惠基础设施 |
随着大模型推理成本持续下降,"赠送 AI 算力"有望在共享办公、程序员主题咖啡馆、科技园区配套、孵化器等开发者聚集型空间普及。但并非所有线下空间都适配——AI 算力服务的核心前提是"客群会用 AI 工具 + 愿意长驻深度使用",详见 5.5 适用场所分析。 谁先用低成本方案把"AI 算力"做成线下标配服务,谁就能拿到差异化引流与社区属性。
1.3 本方案定位
本方案回答一个核心问题:用多少钱、什么硬件、怎么部署、怎么运营,才能在线下空间复刻"AGI Bar 式"的本地不限量 AI 服务? 答案是用 4 台 AMD Ryzen AI Max+ 395(128GB)迷你主机组成集群,本地跑 DeepSeek-V4-Flash,约 ¥9.1 万一次性投入即可对外提供兼容 OpenAI API 的离线推理服务。
二、方案概述
2.1 服务形态
2.2 技术底座
| 层 | 选型 | 作用 |
|---|---|---|
| 模型 | DeepSeek-V4-Flash(284B MoE,激活 13B,1M 上下文,MIT 许可) | 可商用本地部署的开源旗舰 |
| 硬件 | 4 × AMD Ryzen AI Max+ 395 + 128GB + 2TB SSD | 统一内存 APU,单机可划 96GB 显存,性价比远超 GPU |
| 推理 | llama.cpp RPC / vLLM + ROCm | 跨节点张量并行 |
| 网关 | LiteLLM / New API / One API | OpenAI 兼容 endpoint、认证、限流、多 Key 管理 |
2.3 核心价值主张
- 离线可用:不依赖公网与云端,店内自洽,数据不出局域网。
- 不限量体验:对顾客"不限量",靠本地算力池支撑,无按 token 计费焦虑。
- 低成本:一次性 ¥9.1 万,3–5 年折旧,月运营仅电费级(¥200–400),远低于同等用量走云端 API 的持续开销。
- 兼容生态:OpenAI API 格式,直接对接 Claude Code、Cursor、Codex 等主流客户端,顾客零学习成本。
三、服务架构(离线服务核心)
3.1 分层架构
| 层 | 组件 | 职责 |
|---|---|---|
| 接入层 | API 网关(LiteLLM/New API) | OpenAI 兼容 endpoint、API Key 认证、限流、路由、用量记录 |
| 调度层 | 推理引擎(llama.cpp/vLLM) | 连续批处理、KV pool 管理、PagedAttention、prefix caching |
| 推理层 | 4 节点 AI Max+ 395 集群 | 张量并行跑 V4-Flash FP4 权重 |
| 运营层 | 点单系统 + Token 发放服务 | 消费触发发 Key、限时/限并发、用量看板 |
| 监控层 | Prometheus + Grafana | 节点健康、显存、QPS、延迟、并发数 |
3.2 用户接入流程
3.3 网关关键能力(复刻 AGI Bar 的关键)
| 能力 | 实现 | 说明 |
|---|---|---|
| OpenAI 兼容 | LiteLLM/New API 原生 | /v1/chat/completions、/v1/models,客户端零改造 |
| 多 Key 管理 | 网关后台 | 每顾客一 Key,可设配额/有效期/并发上限 |
| 限流 | 网关 + 推理引擎 max_num_seqs | 防止单用户占满集群 |
| 用量记录 | 网关日志 | 可做"不限量"下的公平使用审计 |
| 模型别名 | 网关路由 | 对外暴露 deepseek-v4-flash,后端可切换/灰度 |
四、硬件配置
4.1 方案选型
| 方案 | 节点数 | 量化 | 总显存 | 参考成本 | 1M 并发能力 | 适用场景 |
|---|---|---|---|---|---|---|
| 本方案 | 4 台 | FP4 原生(无损) | 384GB | ≈ ¥9.1 万 | ~20 驻留 / 10–14 调度 | 开发者聚集型空间公共服务,多人并发 |
4 台的价值在于多人并发、速度与稳定性,更适合"开发者聚集型空间对外公共服务"场景。下文以 4 节点方案为基准展开。
4.2 硬件清单与单价
| 组件 | 规格 | 数量 | 单价(参考) | 小计 |
|---|---|---|---|---|
| 迷你主机 | 极摩客 AI Max+395 128G2TB ssd | 4 | ¥23,000 | ¥92,000 |
| 万兆交换机 | 8 口 10GbE | 1 | ¥1,200 | ¥1,200 |
| 万兆网卡 | USB4/USB3 转 10GbE | 4 | ¥400 | ¥1,600 |
| 网线 | Cat6a 万兆网线 | 4 | ¥50 | ¥200 |
| 合计 | ≈ ¥95,000 |
价格为 2026-08 京东公开行情估算,随促销波动。整机可选阿迈奇、Framework Desktop 等机型。
五、服务容量评估(能服务多少顾客)
5.1 显存与并发能力
基于 V4-Flash 1M KV ≈ 10GB 的实测数据(UltraLAB 部署、DGX Spark 验证):
- 总显存 384GB − 权重 160GB − 开销 15GB ≈ 209GB 可用 KV pool
- KV pool 容量 ≈ 20M tokens,可同时驻留 ~20 个满 1M 上下文会话
- 建议调度并发
max_num_seqs:10–14
5.2 生成速度(受 10GbE 网络限制)
| 并发数 | 每用户 decode | 体验 |
|---|---|---|
| 单流 | 6–12 tok/s | 可用 |
| 2 并发 | 8–15 tok/s | 流畅 |
| 4 并发 | 6–12 tok/s | 流畅 |
| 6–8 并发 | 5–10 tok/s | 可用 |
| 10–14 并发 | 4–8 tok/s | 可接受 |
| 20 并发(满驻留) | 2–4 tok/s | 偏慢 |
1M 上下文 prefill 单次 5–15 分钟且基本串行,是冷启动瓶颈。建议默认限制顾客最大上下文(如 128K),1M 需申请,避免少数人占满集群。
5.3 服务容量换算(以高适配场所为例)
假设空间日均客流 80–150 人,AI 使用率 10–20%:
| 指标 | 估算 | 说明 |
|---|---|---|
| 同时在线 AI 用户峰值 | 6–12 人 | 高峰期并发 |
| 每人体验 | 5–12 tok/s | 多数场景流畅 |
| KV pool 利用 | <60% | 留有缓冲,不至 OOM |
| 全天可服务会话 | 数百至上千次 | 受 prefill 速度与并发限制 |
结论:4 节点方案可支撑一家中大型开发者聚集型空间(共享办公/程序员主题咖啡馆/科技园区配套)的"不限量 AI"公共服务,高峰时段也能保持稳定体验。具体场合适配性见 5.5。
5.4 性能对照(同模型不同硬件)
| 平台 | 显存 | 带宽 | 单流 decode | 1M 并发 |
|---|---|---|---|---|
| MI300X 单卡 | 192GB | 5.3 TB/s | 168 tok/s | ~7 个 |
| DGX Spark 2× | 256GB | 高速互连 | 67 tok/s | 6 个 |
| 本方案 4 节点 | 384GB | 1TB/s + 10GbE | 6–12 tok/s | ~20 驻留 / 10–14 调度 |
本集群显存最大、可驻留会话最多,但带宽与互连最弱(10GbE 是 AllReduce 瓶颈)。升级 25/40GbE 可让单流提升到 15–25 tok/s,是性价比最高的提速手段。
5.5 适用场所分析(重要)
这套服务的本质不是"给咖啡馆加个 AI 功能",而是"给 AI 工具重度用户提供线下驻留空间"。它的前提条件决定了并非所有"酒吧/咖啡馆/共享空间"都适用:
核心前提:顾客得会用 Claude Code / Cursor / Codex 这类客户端(有技术门槛)、且愿意坐 1 小时以上深度使用、店里要有电源/Wi-Fi/桌面条件、消费要能覆盖成本。
5.5.1 五个评估维度
| 维度 | 考察点 | 不满足的后果 |
|---|---|---|
| ① 客群匹配 | 常客中会用 AI 编程工具的人占比(≥5% 为佳) | 算力闲置,无人使用 |
| ② 驻留时长 | 顾客平均停留是否 ≥60 分钟 | 用不够时间,价值感知弱 |
| ③ 硬件条件 | 电源插座、Wi-Fi 质量、桌面空间 | 无法支撑笔记本长驻办公 |
| ④ 消费支撑 | 客单价 × 翻台能否覆盖 ¥9.1 万投入 + 电费 | 纯烧钱不产出 |
| ⑤ 运营匹配 | 店主/员工是否愿意维护、组织 AI 社群活动 | 服务体验差,口碑反噬 |
5.5.2 场所分级
| 适配度 | 场所类型 | 判断理由 |
|---|---|---|
| 高(直接上) | 共享办公/联合空间 | 客群天然是开发者,会员制+长驻留,五维全高分 |
| 高(直接上) | 程序员主题咖啡馆 | 客群精准(AGI Bar 原型),自带技术社群属性 |
| 高(直接上) | 科技园区配套餐饮 | 园区全是 AI 从业者,午休/下午茶场景高频 |
| 高(直接上) | 孵化器/众创空间 | 创业团队重度使用 AI,算力即基础设施 |
| 中(要改造运营) | 写字楼商圈咖啡馆 | 白领多但 AI 用户占比不确定,需活动引流激活 |
| 中(要改造运营) | 科技书店/学习空间 | 阅读学习场景契合,但客单价低、停留偏短 |
| 中(要改造运营) | 网吧/电竞馆升级 | 硬件和驻留都满足,但客群偏游戏向,需转化 |
| 低(不建议) | 传统酒吧/夜店 | 夜间社交场景,没人坐着敲代码,客群不匹配 |
| 低(不建议) | 社区家庭咖啡馆 | 客群是居民/带娃家庭,AI 工具用户趋近于零 |
| 低(不建议) | 快餐/奶茶店 | 翻台快、停留短,无驻留深度使用场景 |
| 低(不建议) | 酒店大堂吧 | 过路客为主,无重复消费,算力闲置 |
5.5.3 快速自测(满足 ≥4 条才值得投入)
- 常客里有没有 ≥5% 会用 Claude Code / Cursor 的人?
- 顾客平均停留 ≥60 分钟(有电源插座)?
- 你愿意每周花几小时维护 / 做 AI 社群活动?
- 单客消费能到 ¥30–50 且会返店?
注意:AGI Bar 报道中"酒吧"能成立,是因为它本质是程序员主题酒吧——客群和场景都是围绕 AI 从业者设计的,普通酒吧照搬大概率失败。选址时应按上述维度先做评估,而不是按"酒吧/咖啡馆"的标签决定。
六、软件栈与部署
6.1 软件栈
| 层 | 选型 | 说明 |
|---|---|---|
| OS | Ubuntu 24.04 LTS | ROCm 支持最佳 |
| GPU 驱动 | ROCm 7.2.1+ | 支持 gfx1151(Radeon 8060S) |
| 推理引擎 | llama.cpp + RPC(验证)/ vLLM + ROCm(生产) | 跨节点张量并行 |
| API 网关 | LiteLLM / New API | OpenAI 兼容、多 Key、限流、用量 |
| 模型格式 | GGUF(FP4) | llama.cpp 原生支持 |
6.2 部署步骤
1. BIOS(每节点):iGPU Memory Size 设 512MB,可变显存分配 96GB。
2. 安装 ROCm + 推理引擎
pip install -f https://repo.radeon.com/rocm/linux/rel-7.2.1/ torch
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp && make GGML_HIP=1 AMDGPU_TARGETS=gfx1151
3. 模型获取:HuggingFace deepseek-ai/DeepSeek-V4-Flash-0731(MIT,FP4 原生),用 Unsloth 脚本转 GGUF。
4. 集群启动(llama.cpp RPC)
# 工作节点(3 台)
./llama-rpc-server --host 0.0.0.0 --port 50052
# 主节点按层切分到 4 节点
./llama-cli -m DeepSeek-V4-Flash-FP4.gguf \
--rpc 127.0.0.1:50052,<node2-ip>:50052,<node3-ip>:50052,<node4-ip>:50052 \
-n 1000000 --ctx-size 1048576 -t 32
5. 网关部署:LiteLLM/New API 容器化部署,配置 OpenAI 兼容路由到推理引擎,开启 Key 管理、限流、用量记录。
6. 对接点单系统:消费成功回调 → 生成限时 API Key → 推送给顾客。
七、运营设计
7.1 Token 发放机制
| 机制 | 设计 | 说明 |
|---|---|---|
| 触发 | 消费满额 / 任意消费 | 复刻 AGI Bar"消费即送" |
| 形态 | 限时 API Key + Base URL | 扫码或小程序推送 |
| 有效期 | 当日 / 离店失效 | 释放并发槽位 |
| 并发上限 | 每用户 1–2 路 | 防止单人占满集群 |
| 上下文上限 | 默认 128K,1M 需申请 | 保护 KV pool |
7.2 公平使用与限流
- "不限量"是相对的:对顾客不按 token 收费,但靠并发与上下文限制保证多人公平。
- 网关层:每 Key 并发上限、每分钟请求数上限。
- 推理层:
max_num_seqs=10–14,超出排队。 - 异常熔断:单用户异常高频调用自动降级。
7.3 监控与运维
| 监控项 | 工具 | 告警阈值 |
|---|---|---|
| 节点显存占用 | Prometheus + node_exporter | >90% 告警 |
| 推理 QPS / 延迟 | 网关日志 | P95 >30s 告警 |
| 并发会话数 | 推理引擎指标 | 接近 max_num_seqs 预警 |
| 节点健康/温度 | IPMI / lm-sensors | 温度 >85℃ 降频 |
| 离店失效清理 | 定时任务 | 失效 Key 滞留 >1h 告警 |
八、成本与商业测算
8.1 成本结构
| 项 | 金额 | 性质 |
|---|---|---|
| 一次性硬件投入 | ≈ ¥9.5 万 | 3–5 年折旧 |
| 月电费 | ¥200–400 | 4 节点 7×24 中等负载 |
| 月网络/带宽 | 已有宽带即可 | 局域网为主 |
| 年持有成本(折旧+电费) | ≈ ¥2.1–3.5 万 | 不含人力 |
8.2 与云端 API 对照
| 方案 | 月成本(假设日均 8 人 × 10万 token) | 说明 |
|---|---|---|
| 本方案自建 | 折旧 ~¥2K + 电费 ~¥300 ≈ ¥2.3K/月 | 固定成本,用量越大越划算 |
| DeepSeek 官方 API | 输入¥1/输出¥2 每百万 token,约 ¥5–10K/月 | 按量计费,流量波动大 |
| 商业闭源 API | 数倍于上 | 更贵 |
临界点:当空间月 AI 用量超过约 300–500 万 token,自建即比云端 API 更经济;且自建带来"离线可用、数据不出店、不限量体验"的额外价值。
8.3 商业价值
| 维度 | 价值 |
|---|---|
| 差异化引流 | "消费送不限量 DeepSeek"成为空间招牌,吸引 AI 从业者与爱好者 |
| 社区属性 | 成为本地 AI 社区据点(对标 AGI Bar 接待 Midjourney CEO 的效应) |
| 留存 | 顾客为用 AI 延长驻留时间,带动二次消费 |
| 数据合规 | 本地推理,敏感代码/对话不出店,企业客户更安心 |
| 可扩展 | 后续可接入更多模型、对周边团队输出算力、做会员体系 |
九、风险与实施路线
9.1 风险与应对
| 风险 | 影响 | 应对 |
|---|---|---|
| 网络是速度瓶颈 | 高峰期生成变慢 | 至少 10GbE,预算允许可上 25/40GbE |
| 1M 上下文 prefill 慢 | 冷启动数分钟 | 默认限上下文 128K,1M 需申请;开 prefix caching |
| 高峰并发拥堵 | 用户体验下降 | 网关限流 + 排队提示;4 节点已预留余量 |
| 迷你主机长时间满载降频 | 速度波动 | 选散热良好机型,必要时降 cTDP |
| FP4 精度一致性 | 输出偶有偏差 | 上线前对比官方 API 抽测 |
| 模型/许可证变更 | 合规风险 | V4-Flash 为 MIT 许可,可商用;持续跟踪官方更新 |
9.2 实施路线
| 阶段 | 周期 | 交付 |
|---|---|---|
| ① 硬件采购与组网 | 1–2 周 | 4 节点 + 10GbE 就绪 |
| ② 推理集群部署 | 1 周 | llama.cpp/vLLM 跑通 V4-Flash,验证速度与并发 |
| ③ 网关与运营系统 | 1–2 周 | API 网关、Key 发放、点单对接、监控 |
| ④ 内测与调优 | 1 周 | 压测、限流参数、上下文策略调优 |
| ⑤ 对外试运营 | 持续 | 收集反馈,迭代模型/限流/体验 |
十、方案要点
4 节点 AMD AI Max+ 395 集群(FP4 无损 / ¥9.1 万)
│
├─ 1M 上下文 · ~20 会话驻留 · 10–14 路流畅并发
├─ 公共服务 · 多人并发 · 数据不出店
└─ 兼容 OpenAI API · 离线不限量
提速选项:10GbE → 25/40GbE(单流 6-12 → 15-25 tok/s)
扩容选项:4 → 6 节点(参考 AMD 官方多节点方案)
附录:关键参数依据
A.1 DeepSeek-V4-Flash 模型规格(2026-07-31 正式版)
| 项目 | 数值 |
|---|---|
| 架构 | MoE(DeepSeekMoE),256 路由 + 1 共享专家,每层激活 6 个 |
| 总参数 / 激活 | 284B / 13B |
| 原生存储精度 | FP4(路由专家原生 FP4,FP4 推理即无损) |
| 注意力 | MLA + CSA + HCA 混合稀疏注意力,1M KV 仅 ~10GB |
| 上下文窗口 | 1M tokens |
| 许可证 | MIT(可商用本地部署) |
A.2 AMD Ryzen AI Max+ 395 规格
| 项目 | 数值 |
|---|---|
| CPU | 16 核 Zen 5 / 32 线程 |
| 集成 GPU | Radeon 8060S(RDNA 3.5,40 CU,gfx1151) |
| 内存 | 128GB LPDDR5X-8000,256-bit,带宽 256 GB/s |
| 可分配显存 | BIOS 96GB / Linux TTM 120GB |
| 官方验证 | AMD 文档:4 节点 AI Max+ 395 跑 Kimi-K2.5(375GB),llama.cpp RPC |
A.3 显存需求(单会话)
| 量化 | 权重 | KV(1M) | 开销 | 总需求 |
|---|---|---|---|---|
| FP4 原生 | 152GB | 10GB | 15GB | ~177GB |
4 节点 × 96GB = 384GB 总显存,扣除权重与开销后约 209GB 可用作 KV pool,可同时驻留约 20 个满 1M 上下文会话。
方案基于 2026-08 公开信息与社区实测编制(AGI Bar 报道、UltraLAB/DGX Spark/MI300X 部署数据)。背景案例来源:AIbase《北京 AGI Bar 创新玩法》。模型权重与 KV 实际占用建议部署前复测。