我来做Agent
📖 权威智库专题 🏷️ 私有化与断网部署 ⏱️ 16 分钟实战手册 📅 发布:2026-09-23

企业级 AI Agent 本地私有化与局域网断网部署实战指南(DeepSeek/Qwen + vLLM/Ollama)

零公网泄漏隐患!从算力硬件显存核算、内网离线向量库搭建到生产级权限沙箱配置全流程手册。

AI
企业算力与安全实验室 大模型私有化部署资深专家 · 审校出品
专有二级域名:deploy-agent
📌 专题导读与核心价值背景
背景与行业痛点:

数据安全是政企与实体制造业的生命线。财务报表、核心生产配方、客户名录绝不能流向第三方公网云端,物理断网运行 Agent 成为众多企业的刚性底线。

认知与技术演进:

从早期动辄数十万的 A100/H800 算力集群,演进为 2026 年借助 GGUF / AWQ 深度量化与 DeepSeek-R1、Qwen2.5 等开源模型的普及,单台工作站即可跑起高性能智能体。

核心商业价值:

用极低的硬件固定资产投资,换取 100% 自主可控、零公网数据泄漏隐患、且无需为商业 Token 持续付费的高投资回报率 (ROI) 企业私有大脑。

一、为什么制造、金融与政企客户必须坚持 100% 物理断网私有化?

任何通过公网传输商业秘密的做法,在严格的数据合规与商业保密审计面前都是不可承受之重。
许多企业起初尝试使用公网大模型,但很快遭遇三道无法逾越的“合规红线”: 1. 商业泄密与知识产权风险:制造业的工程 CAD 图纸、CNC 加工参数、未公开专利说明书一旦输入公网 API,可能沦为公网大模型的训练材料; 2. 财务与客户数据出境红线:根据《数据安全法》与《个人信息保护法》,客户身份证号、企业流水账目向境外商业模型传输属于严重违规; 3. 公网波动与单点封禁风险:国际网络链路波动、商业 API 突然限流或账号风控,可能导致企业依赖的核心业务瞬间瘫痪。

物理断网私有化部署彻底根除了以上隐患。 服务器置于企业自身物理机房或防火墙内网,网线物理拔除或路由策略完全阻断出网,数据在局域网内流转,安全级别达到军工与金融标准。

二、硬件算力核算公式:单卡 24G 到中小企业高并发配置

彻底打破“必须百万集群才能跑大模型”的认知误区,精准核算显存与吞吐量。
大模型私有化部署的显存占用核心计算公式: $$\text{显存总需求} = \text{模型权重显存} + \text{KV Cache 上下文显存} + \text{激活显存开销}$$

在 2026 年的主流工业量化标准下: - 14B 模型 (如 Qwen2.5-14B-Int4/AWQ):模型仅需 ~9GB 显存,留出 15GB 用于并发 KV Cache。单台 RTX 4090 (24GB) 或国产昇腾/摩尔线程 24GB 卡,即可稳定支撑 15~25 人日常并发问答,总硬件预算仅约 2.5 万元; - 32B 模型 (如 DeepSeek-R1-Distill-Qwen-32B):采用 W4A16 量化后权重占用 ~20GB,需要 双卡 24GB (共 48GB) 或单卡 48GB (如 RTX 6000 Ada / A40),可支撑 50 人以上规模的中型企业核心逻辑推理; - 70B 顶尖旗舰模型:采用 4-8 卡分布式张量并行 (TP),适合集团级跨部门综合调度。

三、私有化推理引擎选型:vLLM vs Ollama 工业实战对比

根据并发吞吐需求挑选最适合企业局域网的推理引擎底座。
1. vLLM (高并发生产级首选): - 核心杀手锏:PagedAttention 内存分页管理与连续批处理 (Continuous Batching),显存利用率接近 95% 以上; - 并发表现:在多员工并发调用场景下,吞吐量是普通推理框架的 4~8 倍; - 接口兼容:原生提供完全对齐 OpenAI 的 /v1/chat/completions 接口,现成 Agent 系统可无缝对接。

2. Ollama (单机极简与边缘终端选型): - 核心优势:一键安装、命令行拉取模型、开箱即用,适合内网单机或研发个人工作站快速验证; - 局限性:高并发批处理能力较弱,并发超过 5 个人时排队延迟显著上升。

“我来做”工程推荐规范:内网生产环境统一使用 Docker 编排部署 vLLM 作为核心推理底座,配合 Nginx 实现本地安全鉴权与负载均衡。

四、100% 离线环境下的企业 RAG 知识库与向量检索搭建

断网状态下如何保障知识检索的高召回率与零幻觉?
在物理断网环境中,知识检索增强 (RAG) 的所有环节必须完全本地化:

1. 离线 Embedding 向量模型:推荐采用 bge-large-zh-v1.5 或 bge-m3,离线下载模型权重后,在局域网服务器启动独立向量化服务,单次编码耗时 < 15ms; 2. 离线重排模型 (Reranker):必须引入 bge-reranker-large 对初筛召回的前 20 篇文档进行二次交叉打分,取前 3~5 篇注入 Prompt,能直接降低 80% 的检索噪声; 3. 向量数据库:采用 Milvus 或内嵌式 Chroma / PGVector,数据完全持久化保存在局域网 SSD 阵列,杜绝任何外部数据外泄。

五、工具调用权限白名单与内网安全沙箱隔离

智能体拥有了手脚,必须防止其误删内网数据或越权操作。
企业断网私有部署必须落实“最小权限”沙箱体系: - 只读数据库账号:Agent 检索 ERP 或生产数据库时,强制仅分配 SELECT 权限,严禁赋予 UPDATE/DELETE; - Docker 代码执行沙箱:若 Agent 具备自动生成并执行 Python 脚本统计报表的能力,必须在无外网权限且 CPU/内存严格限额的独立 Docker 临时容器中运行; - 关键操作人工审批 (HITL):对任何修改系统配置、发送财务通知等高危动作,系统强制暂停并向管理员企业微信/钉钉推送审批卡片,必须人工点击确认方可继续。

❓ 专家解答:关于本专题的 8 大高频认知与落地问答 (FAQ)

全面涵盖底层大模型选型、ReAct思维范式、多智能体协同、企业局域网私有化算力成本及系统打通等深度疑问。

01. 企业在物理断网的环境下,如何安装部署所需的 Docker 镜像和 Python 依赖?

在有公网的安全跳板机上,使用脚本统一下载依赖的离线 Wheel 包与 Docker 镜像并打成 .tar 压缩包,通过合规审核的专用加密 U 盘或内网安全摆渡机拷贝导入机房服务器,配置本地离线私有 Docker Registry 和本地 pip 源即可顺畅部署。

02. 单台 24GB 显存的工作站,真的能支撑 50 人左右的公司日常使用吗?

完全可以。企业日常使用并非 50 人在同一毫秒按下回车,而是呈现随机分布。结合 vLLM 的连续批处理 (Continuous Batching) 技术,即使有 5~8 个人同时发起请求,GPU 也能在并发多流中同时推理,首字响应延迟通常在 1 秒以内,完全满足企业日常办公节奏。

03. 开源模型在本地断网运行,其智能水平和推理逻辑能跟公网最新商业模型比吗?

在通用泛知识领域,公网万亿参数模型有优势;但在企业特定领域(如根据企业产品手册回答技术参数、根据内网报表统计利润),经过 RAG 增强与企业专属工作流编排后的 14B~32B 开源模型,其输出准确率和专业度往往反超没有企业私域数据的公网通用模型。

04. 企业目前没有专职的 AI 算法工程师,如何维护断网服务器?

选择“我来做”定制服务时,交付系统均提供全套容器化一键启动脚本、Web 端直观管理面板以及自动监控报警机制。日常运维仅需如同普通内网办公软件一样开机关机,并提供定期的内网巡检与模型升级服务。

05. 国产算力卡(如华为昇腾、摩尔线程、天数智芯)在私有化部署中的适配成熟度如何?

截至 2026 年,主流国产算力芯片的 CANN 和 MUSA 软件栈对 vLLM 与主流开源大模型(如 Qwen2.5、DeepSeek 系列)的支持度已极其成熟,部分算力卡在单精度推理吞吐上甚至超越同价位进口显卡,完全可以满足自主可控国产化替代指标。

06. 老旧 Windows Server 局域网服务器是否支持部署私有化 Agent?

如果服务器具备兼容的独立 GPU,可通过启用 WSL2 或安装原生 Windows Docker 运行推理容器;若为老旧无 GPU 服务器,我们建议采购一台独立的 Linux 算力工作站置于内网,通过局域网 REST API 向 Windows 终端分发智能体服务。

07. 断网部署后,智能体如何定期获取外界最新的行业知识?

可通过人工审核合规机制定期同步:由企业业务负责人定期将最新发布的行业标准、新品规格文档放入安全内网同步盘,离线智能体知识库后台一键触发全量增量切片与向量索引更新,几分钟内即可完成知识吸收。

08. “我来做”在本地私有化部署服务中,提供哪些上门落地支持?

我们提供“架构师现场硬件勘测 → 算力配置与采购建议 → 局域网机房离线安装部署 → 老旧业务系统 API 联调 → 企业内部管理员全套实操内训”端到端交钥匙服务,确保系统在 100% 物理断网环境下稳定跑通并产生业务效益。

从理解概念到业务增效

读懂了 Agent,如何为您企业的实际业务创造利润?

通用大模型是玩具,深入企业私域工作流的定制 Agent 才是生产力武器。“我来做”提供企业知识库搭建、外贸跨境智能体、ERP/CRM无缝对接与私有化断网部署交钥匙工程。