DeepSeek-V4-Flash 离线算力服务方案

基于 AMD Ryzen AI Max+ 395 集群的"消费即送 AI"线下基础设施
目标:在开发者聚集型线下空间(共享办公、程序员主题咖啡馆、科技园区配套等)本地部署 DeepSeek-V4-Flash,提供"连 Wi-Fi 即用、兼容 OpenAI API、店内不限量"的离线 AI 推理服务


一、背景:AI 算力正成为线下基础设施

1.1 AGI Bar 模式(对标案例)

2026 年 8 月,北京一家 AGI Bar 开创了"消费即送 DeepSeek V4 Flash 无限量 API"的玩法(AIbase 报道):

  • 顾客到店消费 → 连接店内 Wi-Fi → 免费获得 DeepSeek-V4-Flash 的 API Token,店内使用期间完全不限量
  • 用户拿到 Base URL + API Key,填入 Claude Code、Codex、Cursor、Cherry Studio 等兼容 OpenAI API 格式的客户端,即可直接调用。
  • AI 推理从"注册 + 订阅 + Token 计费"的传统模式,变成像 Wi-Fi 一样即连即用的基础服务

1.2 趋势判断

过去 现在(AGI Bar 信号)
AI 服务绑定账号、订阅、Token 计费 消费即送、店内不限量
算力集中在云端,按量付费 算力下沉到线下空间,本地部署
AI 是付费工具 AI 是水电 Wi-Fi 一样的普惠基础设施

随着大模型推理成本持续下降,"赠送 AI 算力"有望在共享办公、程序员主题咖啡馆、科技园区配套、孵化器等开发者聚集型空间普及。但并非所有线下空间都适配——AI 算力服务的核心前提是"客群会用 AI 工具 + 愿意长驻深度使用",详见 5.5 适用场所分析。 谁先用低成本方案把"AI 算力"做成线下标配服务,谁就能拿到差异化引流与社区属性。

1.3 本方案定位

本方案回答一个核心问题:用多少钱、什么硬件、怎么部署、怎么运营,才能在线下空间复刻"AGI Bar 式"的本地不限量 AI 服务? 答案是用 4 台 AMD Ryzen AI Max+ 395(128GB)迷你主机组成集群,本地跑 DeepSeek-V4-Flash,约 ¥9.1 万一次性投入即可对外提供兼容 OpenAI API 的离线推理服务。


二、方案概述

2.1 服务形态

2.2 技术底座

选型 作用
模型 DeepSeek-V4-Flash(284B MoE,激活 13B,1M 上下文,MIT 许可) 可商用本地部署的开源旗舰
硬件 4 × AMD Ryzen AI Max+ 395 + 128GB + 2TB SSD 统一内存 APU,单机可划 96GB 显存,性价比远超 GPU
推理 llama.cpp RPC / vLLM + ROCm 跨节点张量并行
网关 LiteLLM / New API / One API OpenAI 兼容 endpoint、认证、限流、多 Key 管理

2.3 核心价值主张

  • 离线可用:不依赖公网与云端,店内自洽,数据不出局域网。
  • 不限量体验:对顾客"不限量",靠本地算力池支撑,无按 token 计费焦虑。
  • 低成本:一次性 ¥9.1 万,3–5 年折旧,月运营仅电费级(¥200–400),远低于同等用量走云端 API 的持续开销。
  • 兼容生态:OpenAI API 格式,直接对接 Claude Code、Cursor、Codex 等主流客户端,顾客零学习成本。

三、服务架构(离线服务核心)

3.1 分层架构

组件 职责
接入层 API 网关(LiteLLM/New API) OpenAI 兼容 endpoint、API Key 认证、限流、路由、用量记录
调度层 推理引擎(llama.cpp/vLLM) 连续批处理、KV pool 管理、PagedAttention、prefix caching
推理层 4 节点 AI Max+ 395 集群 张量并行跑 V4-Flash FP4 权重
运营层 点单系统 + Token 发放服务 消费触发发 Key、限时/限并发、用量看板
监控层 Prometheus + Grafana 节点健康、显存、QPS、延迟、并发数

3.2 用户接入流程

3.3 网关关键能力(复刻 AGI Bar 的关键)

能力 实现 说明
OpenAI 兼容 LiteLLM/New API 原生 /v1/chat/completions/v1/models,客户端零改造
多 Key 管理 网关后台 每顾客一 Key,可设配额/有效期/并发上限
限流 网关 + 推理引擎 max_num_seqs 防止单用户占满集群
用量记录 网关日志 可做"不限量"下的公平使用审计
模型别名 网关路由 对外暴露 deepseek-v4-flash,后端可切换/灰度

四、硬件配置

4.1 方案选型

方案 节点数 量化 总显存 参考成本 1M 并发能力 适用场景
本方案 4 台 FP4 原生(无损) 384GB ≈ ¥9.1 万 ~20 驻留 / 10–14 调度 开发者聚集型空间公共服务,多人并发

4 台的价值在于多人并发、速度与稳定性,更适合"开发者聚集型空间对外公共服务"场景。下文以 4 节点方案为基准展开。

4.2 硬件清单与单价

组件 规格 数量 单价(参考) 小计
迷你主机 极摩客 AI Max+395 128G2TB ssd 4 ¥23,000 ¥92,000
万兆交换机 8 口 10GbE 1 ¥1,200 ¥1,200
万兆网卡 USB4/USB3 转 10GbE 4 ¥400 ¥1,600
网线 Cat6a 万兆网线 4 ¥50 ¥200
合计 ≈ ¥95,000

价格为 2026-08 京东公开行情估算,随促销波动。整机可选阿迈奇、Framework Desktop 等机型。


五、服务容量评估(能服务多少顾客)

5.1 显存与并发能力

基于 V4-Flash 1M KV ≈ 10GB 的实测数据(UltraLAB 部署、DGX Spark 验证):

  • 总显存 384GB − 权重 160GB − 开销 15GB ≈ 209GB 可用 KV pool
  • KV pool 容量 ≈ 20M tokens,可同时驻留 ~20 个满 1M 上下文会话
  • 建议调度并发 max_num_seqs10–14

5.2 生成速度(受 10GbE 网络限制)

并发数 每用户 decode 体验
单流 6–12 tok/s 可用
2 并发 8–15 tok/s 流畅
4 并发 6–12 tok/s 流畅
6–8 并发 5–10 tok/s 可用
10–14 并发 4–8 tok/s 可接受
20 并发(满驻留) 2–4 tok/s 偏慢

1M 上下文 prefill 单次 5–15 分钟且基本串行,是冷启动瓶颈。建议默认限制顾客最大上下文(如 128K),1M 需申请,避免少数人占满集群。

5.3 服务容量换算(以高适配场所为例)

假设空间日均客流 80–150 人,AI 使用率 10–20%:

指标 估算 说明
同时在线 AI 用户峰值 6–12 人 高峰期并发
每人体验 5–12 tok/s 多数场景流畅
KV pool 利用 <60% 留有缓冲,不至 OOM
全天可服务会话 数百至上千次 受 prefill 速度与并发限制

结论:4 节点方案可支撑一家中大型开发者聚集型空间(共享办公/程序员主题咖啡馆/科技园区配套)的"不限量 AI"公共服务,高峰时段也能保持稳定体验。具体场合适配性见 5.5。

5.4 性能对照(同模型不同硬件)

平台 显存 带宽 单流 decode 1M 并发
MI300X 单卡 192GB 5.3 TB/s 168 tok/s ~7 个
DGX Spark 2× 256GB 高速互连 67 tok/s 6 个
本方案 4 节点 384GB 1TB/s + 10GbE 6–12 tok/s ~20 驻留 / 10–14 调度

本集群显存最大、可驻留会话最多,但带宽与互连最弱(10GbE 是 AllReduce 瓶颈)。升级 25/40GbE 可让单流提升到 15–25 tok/s,是性价比最高的提速手段。

5.5 适用场所分析(重要)

这套服务的本质不是"给咖啡馆加个 AI 功能",而是"给 AI 工具重度用户提供线下驻留空间"。它的前提条件决定了并非所有"酒吧/咖啡馆/共享空间"都适用:

核心前提:顾客得会用 Claude Code / Cursor / Codex 这类客户端(有技术门槛)、且愿意坐 1 小时以上深度使用、店里要有电源/Wi-Fi/桌面条件、消费要能覆盖成本。

5.5.1 五个评估维度

维度 考察点 不满足的后果
① 客群匹配 常客中会用 AI 编程工具的人占比(≥5% 为佳) 算力闲置,无人使用
② 驻留时长 顾客平均停留是否 ≥60 分钟 用不够时间,价值感知弱
③ 硬件条件 电源插座、Wi-Fi 质量、桌面空间 无法支撑笔记本长驻办公
④ 消费支撑 客单价 × 翻台能否覆盖 ¥9.1 万投入 + 电费 纯烧钱不产出
⑤ 运营匹配 店主/员工是否愿意维护、组织 AI 社群活动 服务体验差,口碑反噬

5.5.2 场所分级

适配度 场所类型 判断理由
高(直接上) 共享办公/联合空间 客群天然是开发者,会员制+长驻留,五维全高分
高(直接上) 程序员主题咖啡馆 客群精准(AGI Bar 原型),自带技术社群属性
高(直接上) 科技园区配套餐饮 园区全是 AI 从业者,午休/下午茶场景高频
高(直接上) 孵化器/众创空间 创业团队重度使用 AI,算力即基础设施
中(要改造运营) 写字楼商圈咖啡馆 白领多但 AI 用户占比不确定,需活动引流激活
中(要改造运营) 科技书店/学习空间 阅读学习场景契合,但客单价低、停留偏短
中(要改造运营) 网吧/电竞馆升级 硬件和驻留都满足,但客群偏游戏向,需转化
低(不建议) 传统酒吧/夜店 夜间社交场景,没人坐着敲代码,客群不匹配
低(不建议) 社区家庭咖啡馆 客群是居民/带娃家庭,AI 工具用户趋近于零
低(不建议) 快餐/奶茶店 翻台快、停留短,无驻留深度使用场景
低(不建议) 酒店大堂吧 过路客为主,无重复消费,算力闲置

5.5.3 快速自测(满足 ≥4 条才值得投入)

  1. 常客里有没有 ≥5% 会用 Claude Code / Cursor 的人?
  2. 顾客平均停留 ≥60 分钟(有电源插座)?
  3. 你愿意每周花几小时维护 / 做 AI 社群活动?
  4. 单客消费能到 ¥30–50 且会返店?

注意:AGI Bar 报道中"酒吧"能成立,是因为它本质是程序员主题酒吧——客群和场景都是围绕 AI 从业者设计的,普通酒吧照搬大概率失败。选址时应按上述维度先做评估,而不是按"酒吧/咖啡馆"的标签决定。


六、软件栈与部署

6.1 软件栈

选型 说明
OS Ubuntu 24.04 LTS ROCm 支持最佳
GPU 驱动 ROCm 7.2.1+ 支持 gfx1151(Radeon 8060S)
推理引擎 llama.cpp + RPC(验证)/ vLLM + ROCm(生产) 跨节点张量并行
API 网关 LiteLLM / New API OpenAI 兼容、多 Key、限流、用量
模型格式 GGUF(FP4) llama.cpp 原生支持

6.2 部署步骤

1. BIOS(每节点):iGPU Memory Size 设 512MB,可变显存分配 96GB。

2. 安装 ROCm + 推理引擎

pip install -f https://repo.radeon.com/rocm/linux/rel-7.2.1/ torch
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp && make GGML_HIP=1 AMDGPU_TARGETS=gfx1151

3. 模型获取:HuggingFace deepseek-ai/DeepSeek-V4-Flash-0731(MIT,FP4 原生),用 Unsloth 脚本转 GGUF。

4. 集群启动(llama.cpp RPC)

# 工作节点(3 台)
./llama-rpc-server --host 0.0.0.0 --port 50052
# 主节点按层切分到 4 节点
./llama-cli -m DeepSeek-V4-Flash-FP4.gguf \
  --rpc 127.0.0.1:50052,<node2-ip>:50052,<node3-ip>:50052,<node4-ip>:50052 \
  -n 1000000 --ctx-size 1048576 -t 32

5. 网关部署:LiteLLM/New API 容器化部署,配置 OpenAI 兼容路由到推理引擎,开启 Key 管理、限流、用量记录。

6. 对接点单系统:消费成功回调 → 生成限时 API Key → 推送给顾客。


七、运营设计

7.1 Token 发放机制

机制 设计 说明
触发 消费满额 / 任意消费 复刻 AGI Bar"消费即送"
形态 限时 API Key + Base URL 扫码或小程序推送
有效期 当日 / 离店失效 释放并发槽位
并发上限 每用户 1–2 路 防止单人占满集群
上下文上限 默认 128K,1M 需申请 保护 KV pool

7.2 公平使用与限流

  • "不限量"是相对的:对顾客不按 token 收费,但靠并发与上下文限制保证多人公平。
  • 网关层:每 Key 并发上限、每分钟请求数上限。
  • 推理层:max_num_seqs=10–14,超出排队。
  • 异常熔断:单用户异常高频调用自动降级。

7.3 监控与运维

监控项 工具 告警阈值
节点显存占用 Prometheus + node_exporter >90% 告警
推理 QPS / 延迟 网关日志 P95 >30s 告警
并发会话数 推理引擎指标 接近 max_num_seqs 预警
节点健康/温度 IPMI / lm-sensors 温度 >85℃ 降频
离店失效清理 定时任务 失效 Key 滞留 >1h 告警

八、成本与商业测算

8.1 成本结构

金额 性质
一次性硬件投入 ≈ ¥9.5 万 3–5 年折旧
月电费 ¥200–400 4 节点 7×24 中等负载
月网络/带宽 已有宽带即可 局域网为主
年持有成本(折旧+电费) ≈ ¥2.1–3.5 万 不含人力

8.2 与云端 API 对照

方案 月成本(假设日均 8 人 × 10万 token) 说明
本方案自建 折旧 ~¥2K + 电费 ~¥300 ≈ ¥2.3K/月 固定成本,用量越大越划算
DeepSeek 官方 API 输入¥1/输出¥2 每百万 token,约 ¥5–10K/月 按量计费,流量波动大
商业闭源 API 数倍于上 更贵

临界点:当空间月 AI 用量超过约 300–500 万 token,自建即比云端 API 更经济;且自建带来"离线可用、数据不出店、不限量体验"的额外价值。

8.3 商业价值

维度 价值
差异化引流 "消费送不限量 DeepSeek"成为空间招牌,吸引 AI 从业者与爱好者
社区属性 成为本地 AI 社区据点(对标 AGI Bar 接待 Midjourney CEO 的效应)
留存 顾客为用 AI 延长驻留时间,带动二次消费
数据合规 本地推理,敏感代码/对话不出店,企业客户更安心
可扩展 后续可接入更多模型、对周边团队输出算力、做会员体系

九、风险与实施路线

9.1 风险与应对

风险 影响 应对
网络是速度瓶颈 高峰期生成变慢 至少 10GbE,预算允许可上 25/40GbE
1M 上下文 prefill 慢 冷启动数分钟 默认限上下文 128K,1M 需申请;开 prefix caching
高峰并发拥堵 用户体验下降 网关限流 + 排队提示;4 节点已预留余量
迷你主机长时间满载降频 速度波动 选散热良好机型,必要时降 cTDP
FP4 精度一致性 输出偶有偏差 上线前对比官方 API 抽测
模型/许可证变更 合规风险 V4-Flash 为 MIT 许可,可商用;持续跟踪官方更新

9.2 实施路线

阶段 周期 交付
① 硬件采购与组网 1–2 周 4 节点 + 10GbE 就绪
② 推理集群部署 1 周 llama.cpp/vLLM 跑通 V4-Flash,验证速度与并发
③ 网关与运营系统 1–2 周 API 网关、Key 发放、点单对接、监控
④ 内测与调优 1 周 压测、限流参数、上下文策略调优
⑤ 对外试运营 持续 收集反馈,迭代模型/限流/体验

十、方案要点

4 节点 AMD AI Max+ 395 集群(FP4 无损 / ¥9.1 万)
│
├─ 1M 上下文 · ~20 会话驻留 · 10–14 路流畅并发
├─ 公共服务 · 多人并发 · 数据不出店
└─ 兼容 OpenAI API · 离线不限量

提速选项:10GbE → 25/40GbE(单流 6-12 → 15-25 tok/s)
扩容选项:4 → 6 节点(参考 AMD 官方多节点方案)

附录:关键参数依据

A.1 DeepSeek-V4-Flash 模型规格(2026-07-31 正式版)

项目 数值
架构 MoE(DeepSeekMoE),256 路由 + 1 共享专家,每层激活 6 个
总参数 / 激活 284B / 13B
原生存储精度 FP4(路由专家原生 FP4,FP4 推理即无损)
注意力 MLA + CSA + HCA 混合稀疏注意力,1M KV 仅 ~10GB
上下文窗口 1M tokens
许可证 MIT(可商用本地部署)

A.2 AMD Ryzen AI Max+ 395 规格

项目 数值
CPU 16 核 Zen 5 / 32 线程
集成 GPU Radeon 8060S(RDNA 3.5,40 CU,gfx1151)
内存 128GB LPDDR5X-8000,256-bit,带宽 256 GB/s
可分配显存 BIOS 96GB / Linux TTM 120GB
官方验证 AMD 文档:4 节点 AI Max+ 395 跑 Kimi-K2.5(375GB),llama.cpp RPC

A.3 显存需求(单会话)

量化 权重 KV(1M) 开销 总需求
FP4 原生 152GB 10GB 15GB ~177GB

4 节点 × 96GB = 384GB 总显存,扣除权重与开销后约 209GB 可用作 KV pool,可同时驻留约 20 个满 1M 上下文会话。


方案基于 2026-08 公开信息与社区实测编制(AGI Bar 报道、UltraLAB/DGX Spark/MI300X 部署数据)。背景案例来源:AIbase《北京 AGI Bar 创新玩法》。模型权重与 KV 实际占用建议部署前复测。