
Ollama
的使用方法、功能与可解决的业务课题
添加书签
Ollama是什么?
美国 Ollama Inc. 提供的本地 LLM 运行工具,可将 Gemma、Qwen、DeepSeek、gpt-oss 等开放模型下载到自己的电脑(Mac、Windows、Linux)上运行。只需“ollama run”一条命令即可使用,还可作为兼容 OpenAI 的 API 服务器运行。本地运行免费且不限次数。在云端运行大型模型的付费方案为 Pro 每月 20 美元、Max 每月 100 美元。界面为英语。
可解决的业务课题
「Ollama」的服务详情
什么是 Ollama
Ollama 是一款可以把 Gemma、Qwen、DeepSeek、gpt-oss 等开放 AI 模型下载到自己的电脑上运行的工具。支持 Mac、Windows 和 Linux,安装后只需像 ollama run gemma4 这样指定一个模型名,就能完成从下载到开始对话的全部步骤。核心部分开源(MIT 许可证),GitHub 星标约 18 万(截至 2026 年 10 月 10 日)。官方网站标示每月安装量超过 900 万次,模型下载量超过 10 亿次。
启动后,电脑中会运行一个 API 服务器(http://localhost:11434)。由于它还支持兼容 OpenAI 的 API,可以把为 ChatGPT API 编写的应用,或 Cline、Kilo Code 等编程辅助工具的连接目标切换为本地模型。在本地运行期间,输入的内容不会发送给 Ollama 公司。
本地运行免费且不限次数。此外还有付费方案(Pro、Max、Team、Enterprise),可在 Ollama 的云端运行本地电脑难以承载的大型模型。
使用方法
- 安装
从官方网站的“Download”获取 macOS 或 Windows 安装程序。也可以在终端中安装:macOS 和 Linux 使用
curl -fsSL https://ollama.com/install.sh | sh,Windows 在 PowerShell 中使用irm https://ollama.com/install.ps1 | iex。 - 运行模型
打开应用,或在终端中运行
ollama,按照提示选择模型。像ollama run gemma4这样指定模型名后,首次会先下载,然后直接开始对话。模型大小从数 GB 到数百 GB 不等,需要预留磁盘空间。 - 管理模型
使用
ollama pull(下载)、ollama ls(列表)、ollama ps(正在运行的模型)、ollama rm(删除)进行管理。在 Modelfile 中写入系统提示词等设置,还可以创建自己定制的模型。 - 从应用和编程智能体中使用
通过
ollama launch claude、ollama launch codex、ollama launch opencode,可以用 Ollama 的模型启动 Claude Code 等编程智能体。自己开发的应用可调用http://localhost:11434的 API(包括兼容 OpenAI 的/v1/chat/completions等)。 - 使用云端模型(可选)
用
ollama signin登录后,可以用gemma4:cloud这样的名称调用云端模型。签发 API 密钥后,即使在未安装 Ollama 的环境中,也能直接向https://ollama.com/v1发送请求。
主要功能
01本地运行
- 一条命令运行 — 只需指定模型名,即可完成下载、加载并开始对话
- 自动使用 GPU — 可利用 Apple M 系列、NVIDIA、AMD Radeon 的 GPU 运行(Intel Mac 仅使用 CPU)
- 模型库 — 可按文本、可读取图像的模型(Vision)、工具调用、推理(Thinking)、嵌入等用途筛选查找
- Modelfile — 可在基础模型上加入系统提示词和设置,创建自己的模型
02API 与集成
- 本地 API 服务器 — 除了运行在 `localhost:11434` 上的自有 API,还支持兼容 OpenAI 和兼容 Anthropic 的 API(均为部分功能)
- ollama launch — 以连接 Ollama 模型的状态启动 Claude Code、Codex、OpenCode 等
- 连接桌面应用 — 在 macOS 上,可以设置让 Claude Desktop 或 ChatGPT 桌面应用(Codex 模式)使用 Ollama 的模型
03云端
- 云端模型 — 无需下载,即可在 Ollama 的云端运行本地难以运行的大型模型
- 数据处理 — 官方明确表示,云端的提示词和回答不会被保存或记录,也不会用于训练。服务器主要位于美国,为满足需求可能会路由到欧洲
- 停用云端功能 — 可通过环境变量 `OLLAMA_NO_CLOUD=1` 等方式,设置为仅使用本地模型
价格
在电脑上运行模型免费,且没有次数限制。只有在云端运行模型时才需要付费。价格以美元计,依据2026 年 10 月 10 日时官方价格页面的标示。
| 方案 | 价格 | 每月额度 | 并发数 | 主要内容 |
|---|---|---|---|---|
| Free | 0 美元 | 试用额度(仅部分模型) | 1 | 本地运行、试用云端模型。购买额度后可使用全部模型 |
| Pro | 每月 20 美元(年付 200 美元) | 60 美元 | 3 | 更大的模型、同时运行多个模型 |
| Max | 每月 100 美元 | 300 美元 | 10 | 抢先使用最新模型 |
| Team(早期提供) | 每月 500 美元 | 1,000 美元(团队共享) | 10 | 用户数不限、集中管理账单与管理、优先支持 |
| Enterprise | 单独报价 | — | — | 限制可用模型、按用户和 API 密钥设置预算上限、专属支持 |
额度的机制:云端用量按各模型的单价(每百万 token)计算。先使用方案包含的额度,不足部分从购买的额度中扣除。包含的额度在每月续费日重置,不能结转到下个月。购买的额度有效期为添加后 1 年(据服务条款)。付费方案在用量达到包含额度的 90% 时会发送邮件提醒。
云端模型单价示例(每百万 token,摘自官方价格页面)
| 模型 | 输入 | 输出 |
|---|---|---|
| gpt-oss:20b | 0.07 美元 | 0.30 美元 |
| gemma4 | 0.14 美元 | 0.40 美元 |
| deepseek-v4.1-flash | 0.30 美元 | 1.20 美元 |
| mistral-large-4 | 0.68 美元 | 2.09 美元 |
| kimi-k3 | 3.00 美元 | 15.00 美元 |
部分模型(如 DeepSeek)设有更便宜的非高峰价格,适用于工作日 UTC 12:00–18:00 以外的时段以及周末全天。超过并发数的请求会排队等待,队列已满时请求会被拒绝。
运行所需环境
- macOS — Sonoma(14)及以上。Apple M 系列可同时使用 CPU 和 GPU,Intel(x86)Mac 仅使用 CPU 运行。
- Windows — Windows 10 22H2 及以上(家庭版、专业版)。NVIDIA GPU 需要 551.61 及以上版本的驱动。AMD Radeon 也可通过 ROCm 或 Vulkan 使用。安装本体需要至少 4GB 的可用空间。
- Linux — 除安装脚本外,还提供手动安装方式以及面向 AMD GPU、ARM64 的安装包。
- 模型容量 — 单个模型可能达到数十 GB 甚至数百 GB。模型越大,需要的内存(GPU 显存)越多。
日语支持
- 界面与文档 — 官方网站和文档为英语。
- 用日语对话 — 能否使用日语取决于模型。选择 Qwen、Gemma 等多语言模型即可用日语交流。
- 价格 — 以美元计价,没有日元标价。
优点与缺点
优点
- 本地运行免费且不限次数,输入的内容不会发送到外部
- 一条命令即可运行模型,试用本地 LLM 的门槛很低
- 提供兼容 OpenAI 的 API,可将现有应用和编程工具的连接目标切换为本地模型
- 本地无法运行的大型模型,可以用同样的方式在云端运行
缺点
- 要在本地流畅运行,需要配备高性能 GPU 或大容量内存的电脑
- 界面和文档为英语
- 默认上下文长度(一次可处理的文本长度)为 4,096 token,处理长文本需要修改设置
- 云端付费方案以美元计价,官方未说明退款条件
口碑与评价
GitHub 星标约 18 万,官方网站标示每月安装量超过 900 万次,是在本地运行 LLM 的常用方式。在本站介绍的 Cline、Kilo Code、Vanna AI 等页面中,Ollama 也作为本地模型的连接目标出现。在不希望数据离开公司,或想在不支付 API 费用的情况下试用模型时,它是常见的选择。另一方面,受本地电脑性能所限,大型模型可能无法运行或速度较慢,云端付费方案正是为弥补这一不足而提供的。
常见问题(FAQ)
Q. Ollama 可以免费使用吗? A. 可以。在自己的电脑上运行模型免费,且没有次数限制。只有在 Ollama 的云端运行模型时才需付费,可通过 Pro(每月 20 美元)等方案或购买的额度支付。
Q. 输入的内容会被发送到外部吗? A. 使用本地模型期间,提示词和数据不会发送给 Ollama 公司。使用云端模型时,内容会为生成回答而被处理,但官方明确表示不会保存、记录,也不会用于训练。
Q. 可以用日语吗? A. 界面和文档为英语。对话方面,选择 Qwen、Gemma 等支持日语的模型即可使用日语。
Q. 需要什么性能的电脑? A. 取决于所运行模型的大小。搭载 Apple M 系列芯片的 Mac,或配备 NVIDIA、AMD GPU 的电脑,可以用 GPU 高速运行。模型越大需要的内存越多,建议先从小模型开始试用。
Q. 能用于为 OpenAI API 开发的应用吗?
A. 可以。将连接地址改为 http://localhost:11434/v1/,即可从 OpenAI 客户端调用本地模型(需要填写 API 密钥的值,但在本地会被忽略)。仅支持 OpenAI API 的部分功能。
Q. 取消付费方案后可以退款吗? A. 可以在账户设置中取消,但服务条款和价格页面均未提及退款(截至 2026 年 10 月 10 日)。
与其他 AI 工具的区别
| 服务 | 类型 | 适合的用法 |
|---|---|---|
| Ollama | 在本地运行开放模型的运行工具+云端推理 | 想在自己的电脑上运行模型,想把应用的连接目标设为本地 LLM |
| Hugging Face | 模型与数据集的共享平台+推理 API | 想查找并获取各种模型,想发布自己的模型 |
| Qwen | 阿里巴巴的 LLM(聊天、API、开放权重) | 想直接使用已公开的模型本身 |
| Cline | 在 VS Code 中运行的编程智能体 | 想连接 Ollama 等运行的模型来编写代码 |
Qwen 和 Mistral 是“模型”,Hugging Face 是分发和共享模型的“场所”,Ollama 则是在本地运行这些模型的“运行环境”。Cline 等工具可以把 Ollama 运行的模型作为连接目标使用。
本页信息截至 2026 年 10 月 10 日,依据 Ollama 官方网站(首页、价格页面、模型库、服务条款、隐私政策)和官方文档(快速入门、CLI、OpenAI 兼容、云端、macOS・Windows・Linux、FAQ)。价格和功能可能会变更,最新信息请查看官方网站。
