每次和 AI 聊天,你的问题都要发到别人的服务器上。有人不在乎,有人在乎——比如要处理工作文档、代码,或者单纯不想联网也能用。这时候,“本地部署大模型"就是另一条路,而 Ollama 是目前上手最简单的一条。

本地部署到底是什么意思

平时你用的 ChatGPT、Claude 这类,模型跑在厂商的服务器上,你通过网页或 App 访问, essentially 是"租用"别人的算力。

本地部署反过来:把模型文件下载到你自己的电脑上,用你自己的 CPU/GPU 跑。好处很直接:

  • 隐私:数据不出你的电脑,断网也能用
  • 免费:没有订阅费、没有按量计费(电费另算)
  • 可折腾:换模型、调参数,自己说了算

代价也直接:效果取决于你的硬件。家用电脑能跑的模型,和云端几千亿参数的旗舰模型不是一个量级。别指望本地小模型写出惊艳的文案,它更适合做翻译、摘要、写代码片段这类"够用就好"的任务。

适合谁,不适合谁

适合:

  • 对隐私敏感,处理工作文档、代码不想上传云端的人
  • 想离线使用 AI 的人(出差、网络不稳定)
  • 爱折腾,想了解大模型到底是怎么跑起来的人
  • 开发者,想在本地搭一个免费的 AI 接口做实验

不适合:

  • 追求最强效果的人——云端旗舰模型目前仍然明显更强
  • 电脑配置很低,又不想花时间折腾的人

一句话:本地模型是"够用、免费、私密”,云端大模型是"最强、省心、要钱",两者不冲突,很多人是搭配着用。

硬件要求:内存是硬通货

大模型吃的是内存(显存也算内存的一种)。有个粗略的对应关系,记住"参数量"这个概念就行:

  • 8GB 内存:能跑 70 亿参数左右的量化小模型,日常问答、翻译够用
  • 16GB 内存:选择多不少,体验明显更顺
  • 32GB 及以上:可以尝试更大的模型,或者跑得更快

几个实在的建议:

  1. 苹果芯片的 Mac 相对友好,统一内存架构下同样内存能跑更大的模型
  2. Windows/Linux 用户,有独立显卡(NVIDIA)会好很多
  3. 不用纠结具体跑分——模型、量化版本、提示词都会影响速度,先跑起来再说,够不够用你自己一试便知
  4. 硬盘留足空间,一个模型文件通常几个 GB

通用流程:四步跑起来

Ollama 把流程压到了最简:

第一步:安装 Ollama

去 Ollama 官网下载对应系统的安装包,一路下一步。装完后它会在后台运行一个服务。

第二步:选一个模型拉下来

打开终端(Windows 叫 PowerShell/CMD),执行类似这样的命令:

ollama run llama3.1

第一次运行会自动下载模型文件,几个 GB,耐心等它下完。模型名字可以换,比如 qwen2.5、mistral 等都是热门选择,新手从 70 亿参数左右的版本开始就行。

第三步:开始聊天

下载完成后直接就能在终端里对话了。输入问题,回车,等它回答。虽然界面简陋,但模型是实打实跑在你电脑上的。

第四步(可选):换个好看的界面

终端聊天用久了会腻,可以装一个 Web 界面(比如 Open WebUI),用浏览器打开,体验接近 ChatGPT。这一步 purely 可选,不影响使用。

给新手的几点提醒

  • 第一次别贪大:先从小模型开始,跑通流程、感受效果,再决定要不要上更大的
  • 模型是消耗品:觉得这个不好用,换一个就是一条命令的事,不用有心理负担
  • 本地模型也会"胡说八道":小模型的幻觉问题更明显,重要信息一样要核验(参考《AI 对话入门:和 AI 聊天的 5 个技巧》第 5 条)
  • 中文能力看模型:选模型时留意它对中文的支持程度,Qwen 系列这类国产开源模型中文通常更好

写在最后

Ollama 的意义不在于替代 ChatGPT,而在于给了你一个选择权:数据敏感的放本地,要最强效果的走云端。花一个晚上装上、跑通,你对"大模型到底是个什么东西"的理解会深很多——这比看十篇科普都有用。