摘要:Ollama 是在自己电脑上运行开源大模型最省事的工具,macOS、Windows、Linux 都能装,一条命令就能下载并运行模型。本文讲安装、怎么按内存或显存挑模型尺寸、常用命令、本地 API 调用,以及本地模型适合和不适合做什么。

想让数据完全不出本机,或者想离线用大模型,Ollama 是门槛最低的选择:它把模型下载、量化格式和运行环境都打包好了,用起来和装一个普通软件差不多。

1. 安装

打开官网下载页 ollama.com/download,选择你的系统:

用 Ollama 在自己电脑上跑大模型:安装、选模型、显存估算与本地 API-有序
Ollama 官网下载页截图:支持 macOS、Linux、Windows,Linux 用一条 curl 命令安装
  • macOS / Windows:下载安装包,双击安装。
  • Linux:执行官网给的安装命令(建议先点“View script source”看一眼脚本内容)。

安装后,在终端输入 ollama --version,能看到版本号就说明装好了。

2. 按硬件挑模型

模型的参数量越大,效果通常越好,但需要的内存和显存也越多。Ollama 默认下载的是量化版本(常见 4-bit),可以粗略这样估算:

模型规模大约需要的内存 / 显存适合的机器
1B~4B2~4 GB轻薄本、老电脑
7B~9B6~8 GB16GB 内存的笔记本、8GB 显存的显卡
12B~14B10~12 GB32GB 内存的 Mac、12GB 以上显存
30B 以上20 GB 以上高配 Mac 或多卡工作站

这只是经验值,实际占用还和上下文长度有关。第一次先从小模型开始,跑得顺再往上换。在 Ollama 模型库 能看到每个模型不同尺寸的下载大小,中文场景可以优先看 Qwen 等中文能力强的系列。

3. 常用命令

ollama run qwen3:8b        # 下载(第一次)并开始对话
ollama pull qwen3:8b       # 只下载不运行
ollama list                # 看已下载的模型
ollama ps                  # 看正在运行的模型和占用
ollama rm qwen3:8b         # 删除模型,释放磁盘

模型名和标签以模型库页面为准。对话中输入 /bye 退出。

4. 本地 API:让其他软件调用

Ollama 运行后,会在本机的 11434 端口提供 API,而且兼容 OpenAI 的格式,很多客户端、编辑器插件都能直接接入:

curl http://localhost:11434/api/chat -d '{
  "model": "qwen3:8b",
  "messages": [{"role": "user", "content": "用一句话介绍你自己"}],
  "stream": false
}'

用 OpenAI SDK 的话,把 base_url 设成 http://localhost:11434/v1,api_key 随便填一个非空字符串就可以。详细参数见官方 API 文档。

注意:默认只监听本机。如果要改成让局域网访问(设置 OLLAMA_HOST=0.0.0.0),不要把这个端口暴露到公网,它没有鉴权。

5. 本地模型适合做什么

适合:

  • 处理不想上传的资料:合同、病历、内部文档的摘要和改写。
  • 离线翻译、润色、分类、提取信息这类“小任务”。
  • 开发调试:先在本地把流程跑通,再换成云端 API。

不太适合:

  • 需要最新知识、联网搜索的问题。
  • 复杂推理、长篇写作。小尺寸模型明显弱于云端大模型。
  • 硬件太弱的电脑:速度会慢到无法实际使用。

常见问题

速度很慢? 用 ollama ps 看模型是不是跑在 CPU 上,换一个更小的模型,或者关掉其他占显存的程序。

磁盘满了? 模型文件都比较大,用 ollama rm 删掉不用的模型。

相关阅读