Ollama 入门:在自己电脑上跑大模型
每次和 AI 聊天,你的问题都要发到别人的服务器上。有人不在乎,有人在乎——比如要处理工作文档、代码,或者单纯不想联网也能用。这时候,“本地部署大模型"就是另一条路,而 Ollama 是目前上手最简单的一条。
本地部署到底是什么意思
平时你用的 ChatGPT、Claude 这类,模型跑在厂商的服务器上,你通过网页或 App 访问, essentially 是"租用"别人的算力。
本地部署反过来:把模型文件下载到你自己的电脑上,用你自己的 CPU/GPU 跑。好处很直接:
- 隐私:数据不出你的电脑,断网也能用
- 免费:没有订阅费、没有按量计费(电费另算)
- 可折腾:换模型、调参数,自己说了算
代价也直接:效果取决于你的硬件。家用电脑能跑的模型,和云端几千亿参数的旗舰模型不是一个量级。别指望本地小模型写出惊艳的文案,它更适合做翻译、摘要、写代码片段这类"够用就好"的任务。
适合谁,不适合谁
适合:
- 对隐私敏感,处理工作文档、代码不想上传云端的人
- 想离线使用 AI 的人(出差、网络不稳定)
- 爱折腾,想了解大模型到底是怎么跑起来的人
- 开发者,想在本地搭一个免费的 AI 接口做实验
不适合:
- 追求最强效果的人——云端旗舰模型目前仍然明显更强
- 电脑配置很低,又不想花时间折腾的人
一句话:本地模型是"够用、免费、私密”,云端大模型是"最强、省心、要钱",两者不冲突,很多人是搭配着用。
硬件要求:内存是硬通货
大模型吃的是内存(显存也算内存的一种)。有个粗略的对应关系,记住"参数量"这个概念就行:
- 8GB 内存:能跑 70 亿参数左右的量化小模型,日常问答、翻译够用
- 16GB 内存:选择多不少,体验明显更顺
- 32GB 及以上:可以尝试更大的模型,或者跑得更快
几个实在的建议:
- 苹果芯片的 Mac 相对友好,统一内存架构下同样内存能跑更大的模型
- Windows/Linux 用户,有独立显卡(NVIDIA)会好很多
- 不用纠结具体跑分——模型、量化版本、提示词都会影响速度,先跑起来再说,够不够用你自己一试便知
- 硬盘留足空间,一个模型文件通常几个 GB
通用流程:四步跑起来
Ollama 把流程压到了最简:
第一步:安装 Ollama
去 Ollama 官网下载对应系统的安装包,一路下一步。装完后它会在后台运行一个服务。
第二步:选一个模型拉下来
打开终端(Windows 叫 PowerShell/CMD),执行类似这样的命令:
ollama run llama3.1
第一次运行会自动下载模型文件,几个 GB,耐心等它下完。模型名字可以换,比如 qwen2.5、mistral 等都是热门选择,新手从 70 亿参数左右的版本开始就行。
第三步:开始聊天
下载完成后直接就能在终端里对话了。输入问题,回车,等它回答。虽然界面简陋,但模型是实打实跑在你电脑上的。
第四步(可选):换个好看的界面
终端聊天用久了会腻,可以装一个 Web 界面(比如 Open WebUI),用浏览器打开,体验接近 ChatGPT。这一步 purely 可选,不影响使用。
给新手的几点提醒
- 第一次别贪大:先从小模型开始,跑通流程、感受效果,再决定要不要上更大的
- 模型是消耗品:觉得这个不好用,换一个就是一条命令的事,不用有心理负担
- 本地模型也会"胡说八道":小模型的幻觉问题更明显,重要信息一样要核验(参考《AI 对话入门:和 AI 聊天的 5 个技巧》第 5 条)
- 中文能力看模型:选模型时留意它对中文的支持程度,Qwen 系列这类国产开源模型中文通常更好
写在最后
Ollama 的意义不在于替代 ChatGPT,而在于给了你一个选择权:数据敏感的放本地,要最强效果的走云端。花一个晚上装上、跑通,你对"大模型到底是个什么东西"的理解会深很多——这比看十篇科普都有用。