一句话答案
AI Agent 本地部署 = 把 Agent 的三样东西(模型、知识库、编排程序)放进自己的机器或内网,让资料和对话都不出门。 企业里真正可落地的是三种做法:①单机验证(一台机器跑通);②本地知识库 + 云端模型(资料留在内网,只把问题发出去);③容器化私有部署(内网多人共用、带权限和审计)。 选哪一种,只看两件事:数据敏感度和使用人数。
它到底指什么:三个「本地」要分清
很多人说「本地部署」,其实只做到了三分之一。Agent 跑起来牵扯三样东西,各自可以本地、也可以云端:
| 层次 | 是什么 | 放本地意味着 |
|---|---|---|
| 模型层 | 生成回答的那个大模型 | 回答由本机算,速度取决于你的硬件 |
| 知识层 | 企业自己的文档、数据与检索索引 | 资料一个字节都不出内网(最该本地化的一层) |
| 编排层 | 让 Agent 会调工具、走流程的那套程序 | 流程与日志自己掌握,不依赖第三方平台 |
判断一个方案算不算「真本地」:问它知识层放在哪。模型搬进内网、资料还在公有云上的,等于没本地化。
需要什么:三档硬件,别看错重点
真正吃资源的是模型,不是 Agent 框架。检索这一步几乎不吃资源,一台普通机器就能做。
| 档位 | 适合谁 | 大致配置 | 能做什么 |
|---|---|---|---|
| 单机验证 | 先跑通、先看效果 | 16GB 内存以上,无需显卡 | 本地知识库 + 检索,回答走云端模型 |
| 小团队内网 | 3–20 人日常用 | 32–64GB 内存 + 一张 24GB 显存卡 | 本地跑中小模型,资料与对话全留内网 |
| 企业内网 | 几十人以上、要权限与审计 | 服务器 + GPU 或内网推理服务 | 多部门分库、权限隔离、操作留痕 |
如果预算有限又想要好回答质量,第二档配混合方案往往是最划算的:硬件不贵,质量接近云端。
三种做法,分别怎么做
做法 A:单机跑通(半天到一天)
目的:先验证「本地知识库能不能答对我公司的问题」,别一上来就买卡。
- 一台内存 16GB 以上的机器,装知识库与检索服务(我们实践里用 RAGFlow 这类可私有化部署的开源方案);
- 把少量真实文档入库,切好片,把常见问题问一遍;
- 回答先接云端模型,先把链路跑顺。
坑:这一步最常见的失败不是技术,而是文档本身不成体系——同一件事三个版本,谁都不知道哪份是准的。
做法 B:本地知识库 + 云端模型(我们最常交付的形态)
目的:既保住数据边界,又不牺牲回答质量。
- 文档、向量库、日志、备份全部留在内网;
- 员工提问时,检索在内网完成,只把检索出来的少量片段 + 问题发给模型;
- 回答回来后再拼给人看,整个过程的原始资料不外传。
坑:片段切得不好,等于把错的东西发给模型,它会用很自信的口气答错。切片要能人工过一遍,这是质量的分水岭。
做法 C:容器化私有部署(内网多人共用)
目的:从「一个人用」变成「一个公司用」。
- 用容器把知识库、模型服务、前端门户打成一套,一次部署多处可用;
- 配权限:谁能看哪个库、谁能改哪份文档;
- 配运维:模型服务挂了要有兜底,别让客服页面直接白屏。
坑:没有兜底的系统在生产环境撑不过一次模型服务抖动。员工问一句没人理,信任就没了。
企业里最容易踩的四个坑
- 假本地化:模型进内网了,知识库还在公有云——资料早就出去了。
- 切片没人看:入库全自动,切片错乱无人复核,答错了也没人发现。
- 没有兜底:模型一抖动就整站哑火,员工试两次就不用了。
- 没有owner:没人负责更新知识,三个月后库里全是过期答案——这是本地部署最常见的死法。
怎么选:一张决策表
| 你的情况 | 建议 |
|---|---|
| 只是想知道「能不能做」 | 做法 A,一台机器先跑通,成本最低 |
| 资料敏感(客户名单、病历、工艺) | 做法 B,资料绝不出内网,只发问题 |
| 几十人要用、要权限和留痕 | 做法 C,容器化 + 权限 + 审计 |
| 完全没有运维人手 | 先做 B,把「更新知识」这件事固化到一个人身上,再谈 C |
我们做的事
合尘猫 SavantCat 帮小微企业把自己的知识变成 AI 用得上、也敢用的东西:企业知识库本地化交付、AI 客服落地,默认本地私有化、数据不出本机;涉及敏感数据的场景不走境外 API。
- 小微企业知识库本地化交付:5000 元起,年费 2000–3000 元(含搭建、入库与年度维护);
- 看看我们怎么做:企业知识库 | AI 客服落地 | 网站 GEO 优化;
- 想直接调用接口:我们的两个 MCP 接口(合规问答 / AI 可引用性体检)。
常见问题
AI Agent 本地部署是什么意思?
指把 Agent 运行需要的三样东西——模型、知识库、编排程序——放到自己的机器或内网里,而不是用厂商的云端服务。关键是「数据不出门」:你喂给它的资料、它检索到的片段、以及对话记录,都留在自己这边。
AI Agent 本地部署需要显卡吗?
看你要做的部分:检索和知识库不需要显卡,普通 CPU 服务器就能跑;需要显卡的是本地生成回答的模型。如果走「本地知识库 + 云端模型」的混合方案,只有问题文本发出去、资料不发,那么本机可以完全不要显卡。
本地部署的 AI 回答质量会比云端差吗?
同等参数下本地模型通常不如云端大模型,这是实话。企业里更实用的折中是:把「资料」留在内网(检索在本地做),只把检索出来的少量片段和问题交给云端模型生成——既保住数据边界,又拿到好得多的回答质量。
怎么确认数据真的没有出本机?
要逐项查四个地方,缺一项都算没做到:①生成回答的模型跑在哪里;②知识库和向量库的存储位置;③访问日志与对话记录存在哪里;④备份和同步流向哪里。很多所谓「本地部署」是模型搬进内网了,知识库还在公有云上。
本地部署一套要花多少钱?
分两笔账:硬件是一次性投入(自建服务器或复用现有机器),交付与维护是按年的服务费。我们做的小微企业知识库本地化交付是 5000 元起,年费 2000–3000 元,含搭建、入库和年度维护。
小企业只有几台电脑,也能本地部署吗?
能。最轻的形态是单机部署:一台内存 16GB 以上的机器装知识库与检索服务,模型先走云端 API,资料不出内网。等问答量上来了,再决定要不要加本地模型和显卡。