核心结论:瓶颈是 14B 大模型,不在知识库本体。知识库本身很轻,重的是本地推理所需的显卡显存。
⚠️ 保密红线:档案审核语义判定默认必须走本地 Ollama / 内网模型(OPEN_REVIEW_LLM_BACKEND="local"),严禁在数据落地的客户环境接公网云端。
一、需求拆分(为什么这么配)
| 组件 | 主要消耗 | 说明 |
|---|---|---|
| 知识库本体(Streamlit + Python + 检索) | 轻 | 跑起来只占几百 MB 内存,CPU 即可 |
| 向量 Embedding(bge-small / bge-m3) | 轻 | 本地哈希或轻量模型,CPU 可跑 |
| Ollama + Qwen2.5-14B | 重(显存) | 14B 模型是决定性因素 |
Qwen2.5-14B 不同量化的体积(决定显存)
- 推荐Q4_K_M(14B 推荐量化):约 9 GB
- Q5_K_M:约 10.8 GB
- Q8_0:约 15.4 GB
- fp16 原版:约 28.6 GB(需专业卡,不推荐)
提示:Ollama 跑模型时,显存占用 = 模型文件 + KV 缓存/上下文开销(约 +1~2GB)。所以 Q4 至少要 12GB 显存才稳,16GB 更从容。
二、最低配置(能跑起来,Q4 量化,速度一般)
| 项目 | 最低要求 |
|---|---|
| 操作系统 | Windows 10/11 64 位,或 Ubuntu 20.04+(Linux 对 Ollama 更友好) |
| GPU(关键) | NVIDIA 独立显卡,≥12GB 显存(如 RTX 3060 12G / RTX 4070 12G);必须支持 CUDA |
| CPU | 4 核 8 线程以上(Intel i5 / R5 同级) |
| 内存 | 16 GB(模型在 GPU,内存压力不大,但系统+浏览器+Streamlit 共占) |
| 硬盘 | 系统盘 SSD 256GB+;模型缓存约 10GB(Q4)+ 知识文档/索引 |
| 网络 | 首次需联网拉取 Ollama 与 14B 模型(约 10GB);完全脱机前必须预下载模型 |
| 软件 | Python 3.10~3.13、Ollama 最新版、Git(部署用) |
单台带独显跑 14B 的机器约 5~6k 元,
三、推荐配置(流畅,留余量)
| 项目 | 推荐 |
|---|---|
| GPU | NVIDIA ≥16GB 显存(RTX 4060 Ti 16G / 4070 Ti Super 16G / 4080 16G);想上 32B 则 24GB(如 4090) |
| CPU | 6~8 核(i7 / R7) |
| 内存 | 32 GB(同时跑知识库+模型+浏览器更稳,也方便以后升 32B) |
| 硬盘 | 512GB~1TB NVMe SSD |
| 显卡品牌 | 首选 NVIDIA(CUDA 生态最稳);AMD/Intel 在 Ollama 上支持弱、易踩坑,交付客户不建议 |
价位参考:跑 32B的计算机约 9k~19k 元。
四、部署关键提醒
- GPU 是硬门槛:用 CPU 跑 14B 会极慢(几十秒到几分钟/件),语义审核基本不可用。必须独显。
- 量化选择:交付默认用 Q4_K_M(9GB) 即可,质量对档案开放审核够用;显存宽裕可上 Q5/Q8 提升准确性。
