摘要:Ollama 是在自己电脑上运行开源大模型最省事的工具,macOS、Windows、Linux 都能装,一条命令就能下载并运行模型。本文讲安装、怎么按内存或显存挑模型尺寸、常用命令、本地 API 调用,以及本地模型适合和不适合做什么。
想让数据完全不出本机,或者想离线用大模型,Ollama 是门槛最低的选择:它把模型下载、量化格式和运行环境都打包好了,用起来和装一个普通软件差不多。
1. 安装
打开官网下载页 ollama.com/download,选择你的系统:

- macOS / Windows:下载安装包,双击安装。
- Linux:执行官网给的安装命令(建议先点“View script source”看一眼脚本内容)。
安装后,在终端输入 ollama --version,能看到版本号就说明装好了。
2. 按硬件挑模型
模型的参数量越大,效果通常越好,但需要的内存和显存也越多。Ollama 默认下载的是量化版本(常见 4-bit),可以粗略这样估算:
| 模型规模 | 大约需要的内存 / 显存 | 适合的机器 |
|---|---|---|
| 1B~4B | 2~4 GB | 轻薄本、老电脑 |
| 7B~9B | 6~8 GB | 16GB 内存的笔记本、8GB 显存的显卡 |
| 12B~14B | 10~12 GB | 32GB 内存的 Mac、12GB 以上显存 |
| 30B 以上 | 20 GB 以上 | 高配 Mac 或多卡工作站 |
这只是经验值,实际占用还和上下文长度有关。第一次先从小模型开始,跑得顺再往上换。在 Ollama 模型库 能看到每个模型不同尺寸的下载大小,中文场景可以优先看 Qwen 等中文能力强的系列。
3. 常用命令
ollama run qwen3:8b # 下载(第一次)并开始对话
ollama pull qwen3:8b # 只下载不运行
ollama list # 看已下载的模型
ollama ps # 看正在运行的模型和占用
ollama rm qwen3:8b # 删除模型,释放磁盘
模型名和标签以模型库页面为准。对话中输入 /bye 退出。
4. 本地 API:让其他软件调用
Ollama 运行后,会在本机的 11434 端口提供 API,而且兼容 OpenAI 的格式,很多客户端、编辑器插件都能直接接入:
curl http://localhost:11434/api/chat -d '{
"model": "qwen3:8b",
"messages": [{"role": "user", "content": "用一句话介绍你自己"}],
"stream": false
}'
用 OpenAI SDK 的话,把 base_url 设成 http://localhost:11434/v1,api_key 随便填一个非空字符串就可以。详细参数见官方 API 文档。
注意:默认只监听本机。如果要改成让局域网访问(设置 OLLAMA_HOST=0.0.0.0),不要把这个端口暴露到公网,它没有鉴权。
5. 本地模型适合做什么
适合:
- 处理不想上传的资料:合同、病历、内部文档的摘要和改写。
- 离线翻译、润色、分类、提取信息这类“小任务”。
- 开发调试:先在本地把流程跑通,再换成云端 API。
不太适合:
- 需要最新知识、联网搜索的问题。
- 复杂推理、长篇写作。小尺寸模型明显弱于云端大模型。
- 硬件太弱的电脑:速度会慢到无法实际使用。
常见问题
速度很慢? 用 ollama ps 看模型是不是跑在 CPU 上,换一个更小的模型,或者关掉其他占显存的程序。
磁盘满了? 模型文件都比较大,用 ollama rm 删掉不用的模型。
全部评论:1条