用 Ollama 在本地运行大模型:从安装到 Python 集成

2026-09-01 36 预计阅读时间: 1 分钟
来源: realpython.com AI 摘要 Original link

Disclaimer: This article is an AI-assisted summary. Read it together with the original source when precision matters. The summary may omit context, version differences, or edge cases and is not official documentation.

预计阅读时间:6 分钟

Ollama 把本地大模型的使用流程压缩成了几条命令:安装运行时、拉取模型、通过命令行或 API 调用。对于希望在本机实验、保护数据隐私,或把模型能力接入 Python 应用的开发者来说,这是一条低门槛的起点。

安装并确认 Ollama

根据操作系统安装 Ollama。macOS 和 Windows 可以从 Ollama 官方安装包开始,Linux 则可以使用安装脚本:

curl -fsSL https://ollama.com/install.sh | sh

安装完成后,确认命令可用:

ollama --version

在 Linux 或服务器环境中,如果 Ollama 服务没有自动启动,可以手动运行:

ollama serve

默认情况下,Ollama 会在本机提供服务。运行服务的终端需要保持打开,或者将它交给系统服务管理器维护。

拉取并运行本地模型

使用 ollama pull 下载模型。下面以 llama3.2 为例:

ollama pull llama3.2

模型下载完成后,可以直接进入交互式对话:

ollama run llama3.2

也可以用一次性提示验证模型是否正常工作:

ollama run llama3.2 "用三句话解释什么是 REST API"

模型文件可能占用较多磁盘空间,实际下载时间取决于模型大小和网络速度。部署到资源有限的机器前,应先确认可用内存、磁盘空间以及模型对硬件的要求。

通过 Python 调用聊天和文本生成接口

Ollama 提供本地 HTTP 服务,也可以通过 Python 客户端调用。先安装 Python 包:

python -m pip install ollama

下面的程序分别演示聊天接口和文本生成接口。运行前请确保 Ollama 服务已启动,并且已经执行过 ollama pull llama3.2

from ollama import chat, generate

MODEL = "llama3.2"

chat_result = chat(
    model=MODEL,
    messages=[
        {"role": "system", "content": "你是一名简洁、准确的 Python 助手。"},
        {"role": "user", "content": "写一个函数,判断字符串是否为回文。"},
    ],
)
print("聊天接口结果:")
print(chat_result["message"]["content"])

generate_result = generate(
    model=MODEL,
    prompt="用一句话说明单元测试的价值。",
)
print("\n文本生成接口结果:")
print(generate_result["response"])

chat 适合带有角色和多轮上下文的对话;generate 更适合只需要一个提示词和一段文本结果的简单任务。实际项目中,可以把 MODEL 放到环境变量或配置文件中,并为模型调用增加超时、异常处理和日志记录。

如果应用不使用 Python 客户端,也可以直接调用本地 HTTP API。下面是一个可复制的请求示例:

curl http://localhost:11434/api/generate \\
  -H "Content-Type: application/json" \\
  -d '{
    "model": "llama3.2",
    "prompt": "列出三个编写清晰日志的建议。",
    "stream": false
  }'

stream 设为 false 便于脚本直接读取完整响应;交互式应用则可以根据需要使用流式输出,减少等待完整结果的感知延迟。

从实验走向应用时的边界

本地运行模型不等于模型行为已经稳定。上线前应固定模型版本或至少记录使用的模型标签,针对真实输入建立评测集,并检查响应延迟、内存占用和错误率。涉及敏感数据时,还要确认日志、提示词和生成结果不会被意外写入共享目录或外部服务。

可以按下面的顺序开始:

  1. 安装 Ollama 并运行 ollama --version
  2. 使用 ollama pull 下载一个适合机器资源的模型。
  3. ollama run 验证交互式推理。
  4. 在 Python 中选择 chatgenerate 接口接入业务代码。
  5. 为模型、超时、错误处理和评测结果建立配置与记录。

Ollama 的价值在于把本地模型实验变成了普通开发流程的一部分。真正接入产品时,仍然需要像管理其他依赖一样管理模型的版本、资源和质量边界。


相关推荐