元泰档案知识库部署配置要求

元泰档案知识库部署配置要求

核心结论:瓶颈是 14B 大模型,不在知识库本体。知识库本身很轻,重的是本地推理所需的显卡显存

⚠️ 保密红线:档案审核语义判定默认必须走本地 Ollama / 内网模型(OPEN_REVIEW_LLM_BACKEND="local"),严禁在数据落地的客户环境接公网云端。

一、需求拆分(为什么这么配)

组件主要消耗说明
知识库本体(Streamlit + Python + 检索)跑起来只占几百 MB 内存,CPU 即可
向量 Embedding(bge-small / bge-m3)本地哈希或轻量模型,CPU 可跑
Ollama + Qwen2.5-14B重(显存)14B 模型是决定性因素

Qwen2.5-14B 不同量化的体积(决定显存)

  • 推荐Q4_K_M(14B 推荐量化):约 9 GB
  • Q5_K_M:约 10.8 GB
  • Q8_0:约 15.4 GB
  • fp16 原版:约 28.6 GB(需专业卡,不推荐)

提示:Ollama 跑模型时,显存占用 = 模型文件 + KV 缓存/上下文开销(约 +1~2GB)。所以 Q4 至少要 12GB 显存才稳,16GB 更从容

二、最低配置(能跑起来,Q4 量化,速度一般)

项目最低要求
操作系统Windows 10/11 64 位,或 Ubuntu 20.04+(Linux 对 Ollama 更友好)
GPU(关键)NVIDIA 独立显卡,≥12GB 显存(如 RTX 3060 12G / RTX 4070 12G);必须支持 CUDA
CPU4 核 8 线程以上(Intel i5 / R5 同级)
内存16 GB(模型在 GPU,内存压力不大,但系统+浏览器+Streamlit 共占)
硬盘系统盘 SSD 256GB+;模型缓存约 10GB(Q4)+ 知识文档/索引
网络首次需联网拉取 Ollama 与 14B 模型(约 10GB);完全脱机前必须预下载模型
软件Python 3.10~3.13、Ollama 最新版、Git(部署用)

单台带独显跑 14B 的机器约 5~6k 元

三、推荐配置(流畅,留余量)

项目推荐
GPUNVIDIA ≥16GB 显存(RTX 4060 Ti 16G / 4070 Ti Super 16G / 4080 16G);想上 32B 则 24GB(如 4090)
CPU6~8 核(i7 / R7)
内存32 GB(同时跑知识库+模型+浏览器更稳,也方便以后升 32B)
硬盘512GB~1TB NVMe SSD
显卡品牌首选 NVIDIA(CUDA 生态最稳);AMD/Intel 在 Ollama 上支持弱、易踩坑,交付客户不建议

价位参考:跑 32B的计算机约 9k~19k 元

四、部署关键提醒

  • GPU 是硬门槛:用 CPU 跑 14B 会极慢(几十秒到几分钟/件),语义审核基本不可用。必须独显
  • 量化选择:交付默认用 Q4_K_M(9GB) 即可,质量对档案开放审核够用;显存宽裕可上 Q5/Q8 提升准确性。