Ollama 把本地大模型的使用流程压缩成了几条命令:安装运行时、拉取模型、通过命令行或 API 调用。对于希望在本机实验、保护数据隐私,或把模型能力接入 Python 应用的开发者来说,这是一条低门槛的起点。
安装并确认 Ollama
根据操作系统安装 Ollama。macOS 和 Windows 可以从 Ollama 官方安装包开始,Linux 则可以使用安装脚本:
curl -fsSL https://ollama.com/install.sh | sh
安装完成后,确认命令可用:
ollama --version
在 Linux 或服务器环境中,如果 Ollama 服务没有自动启动,可以手动运行:
ollama serve
默认情况下,Ollama 会在本机提供服务。运行服务的终端需要保持打开,或者将它交给系统服务管理器维护。
拉取并运行本地模型
使用 ollama pull 下载模型。下面以 llama3.2 为例:
ollama pull llama3.2
模型下载完成后,可以直接进入交互式对话:
ollama run llama3.2
也可以用一次性提示验证模型是否正常工作:
ollama run llama3.2 "用三句话解释什么是 REST API"
模型文件可能占用较多磁盘空间,实际下载时间取决于模型大小和网络速度。部署到资源有限的机器前,应先确认可用内存、磁盘空间以及模型对硬件的要求。
通过 Python 调用聊天和文本生成接口
Ollama 提供本地 HTTP 服务,也可以通过 Python 客户端调用。先安装 Python 包:
python -m pip install ollama
下面的程序分别演示聊天接口和文本生成接口。运行前请确保 Ollama 服务已启动,并且已经执行过 ollama pull llama3.2:
from ollama import chat, generate
MODEL = "llama3.2"
chat_result = chat(
model=MODEL,
messages=[
{"role": "system", "content": "你是一名简洁、准确的 Python 助手。"},
{"role": "user", "content": "写一个函数,判断字符串是否为回文。"},
],
)
print("聊天接口结果:")
print(chat_result["message"]["content"])
generate_result = generate(
model=MODEL,
prompt="用一句话说明单元测试的价值。",
)
print("\n文本生成接口结果:")
print(generate_result["response"])
chat 适合带有角色和多轮上下文的对话;generate 更适合只需要一个提示词和一段文本结果的简单任务。实际项目中,可以把 MODEL 放到环境变量或配置文件中,并为模型调用增加超时、异常处理和日志记录。
如果应用不使用 Python 客户端,也可以直接调用本地 HTTP API。下面是一个可复制的请求示例:
curl http://localhost:11434/api/generate \\
-H "Content-Type: application/json" \\
-d '{
"model": "llama3.2",
"prompt": "列出三个编写清晰日志的建议。",
"stream": false
}'
将 stream 设为 false 便于脚本直接读取完整响应;交互式应用则可以根据需要使用流式输出,减少等待完整结果的感知延迟。
从实验走向应用时的边界
本地运行模型不等于模型行为已经稳定。上线前应固定模型版本或至少记录使用的模型标签,针对真实输入建立评测集,并检查响应延迟、内存占用和错误率。涉及敏感数据时,还要确认日志、提示词和生成结果不会被意外写入共享目录或外部服务。
可以按下面的顺序开始:
- 安装 Ollama 并运行
ollama --version。 - 使用
ollama pull下载一个适合机器资源的模型。 - 用
ollama run验证交互式推理。 - 在 Python 中选择
chat或generate接口接入业务代码。 - 为模型、超时、错误处理和评测结果建立配置与记录。
Ollama 的价值在于把本地模型实验变成了普通开发流程的一部分。真正接入产品时,仍然需要像管理其他依赖一样管理模型的版本、资源和质量边界。