使用 Ollama 部署 Qwen2 模型

概述

Ollama 是一个强大的本地 AI 模型部署工具,可以让你在本地计算机上轻松运行各种大型语言模型。本教程将详细介绍如何使用 Ollama 部署 Qwen2 模型。

环境要求

硬件要求

  • 内存: 至少 8GB RAM(7B 模型),推荐 16GB+

  • 存储: 至少 10GB 可用空间

  • GPU(可选): NVIDIA GPU 可获得更好的性能

软件要求

  • Windows 10/11, macOS 10.14+, 或 Linux

  • 已安装 Ollama(安装方法见下文)

安装 Ollama

Windows 系统


# 下载并运行安装程序

# 访问 https://ollama.ai/download 下载 Windows 版本

# 或使用 winget 安装

winget install Ollama.Ollama

macOS 系统


# 使用 Homebrew 安装

brew install ollama

# 或下载 DMG 安装包

Linux 系统


# 使用一键安装脚本

curl -fsSL https://ollama.ai/install.sh | sh

# 或使用 Docker

docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama

部署 Qwen2 模型

1. 拉取 Qwen2 模型


# 拉取基础版本的 Qwen2 模型(7B)

ollama pull qwen2:7b

# 如果需要更多参数版本

ollama pull qwen2:7b-instruct

ollama pull qwen2:14b

ollama pull qwen2:72b

2. 查看已安装的模型


ollama list

3. 运行 Qwen2 模型


# 交互式对话模式

ollama run qwen2:7b

# 或直接输入问题

ollama run qwen2:7b "请介绍一下人工智能"

高级配置

创建自定义模型配置

创建 Modelfile 文件:


FROM qwen2:7b

# 设置系统提示词

SYSTEM """你是Qwen2,一个有用的AI助手。请用中文回答用户的问题。"""

# 设置参数

PARAMETER temperature 0.7

PARAMETER top_p 0.9

PARAMETER num_ctx 4096

创建自定义模型:


ollama create my-qwen2 -f ./Modelfile

GPU 加速配置(如可用)


# 查看可用的 GPU

ollama serve

# 强制使用 GPU(NVIDIA)

OLLAMA_GPU_DEVICE=0 ollama run qwen2:7b

使用示例

基本对话


ollama run qwen2:7b

>>> 你好,请帮我写一段 Python 代码来计算斐波那契数列

API 调用

启动 Ollama 服务后,可以通过 API 调用:


# 启动服务

ollama serve

# 使用 curl 调用 API

curl -X POST http://localhost:11434/api/generate -d '{

  "model": "qwen2:7b",

  "prompt": "请解释机器学习",

  "stream": false

}'

Python 客户端示例


import requests

import json

def ask_qwen2(prompt):

    url = "http://localhost:11434/api/generate"

    data = {

        "model": "qwen2:7b",

        "prompt": prompt,

        "stream": False

    }

    

    response = requests.post(url, json=data)

    return response.json()["response"]

# 使用示例

answer = ask_qwen2("什么是深度学习?")

print(answer)

性能优化技巧

1. 调整运行参数


# 限制 GPU 层数(减少显存使用)

ollama run qwen2:7b --num-gpu-layers 20

# 设置上下文长度

ollama run qwen2:7b --num-ctx 2048

2. 内存优化


# 使用量化版本(如果可用)

ollama pull qwen2:7b-q4_0

# 设置系统交换空间(Linux/Mac)

sudo sysctl vm.swappiness=10

常见问题解决

1. 内存不足错误


# 尝试较小的模型

ollama pull qwen2:1.5b

# 或使用量化版本

ollama pull qwen2:7b-q4_0

2. 下载速度慢


# 使用镜像源(如果可用)

OLLAMA_HOST=mirror.example.com ollama pull qwen2:7b

3. 模型无法加载


# 重新拉取模型

ollama rm qwen2:7b

ollama pull qwen2:7b

# 检查磁盘空间

df -h

进阶功能

模型管理


# 复制模型

ollama cp qwen2:7b my-copy:latest

# 删除模型

ollama rm qwen2:7b

# 显示模型信息

ollama show qwen2:7b

批量处理

创建批处理脚本 batch_process.sh


#!/bin/bash

while IFS= read -r question; do

    echo "问题: $question"

    ollama run qwen2:7b "$question"

    echo "---"

done < questions.txt