在 Ubuntu 24.04 LTS 上安装“千问”(Qwen,通义千问)大模型时,首先需要澄清一个概念:你通常不需要选择 Ubuntu 的特定“版本”来安装 Qwen,因为 Qwen 是一个软件/模型,而 Ubuntu 是操作系统。
但你的问题可能是在问:应该下载哪个版本的 Qwen 模型? 或者 如何在 Ubuntu 24.04 上正确部署 Qwen?
以下是详细解答:
✅ 一、你应该选择哪个版本的 Qwen 模型?
Qwen 系列由阿里云提供多个开源版本,推荐根据硬件资源选择:
| 模型名称 | 参数量 | 适用场景 | 推荐硬件(最低) |
|---|---|---|---|
Qwen2.5-0.5B |
0.5B | 轻量级、边缘设备 | CPU + 4GB RAM |
Qwen2.5-1.5B |
1.5B | 小型应用 | CPU + 8GB RAM |
Qwen2.5-3B |
3B | 中等性能需求 | GPU (4GB VRAM) 或高性能 CPU |
Qwen2.5-7B |
7B | 主流桌面/服务器 | GPU (8GB+ VRAM, NVIDIA) |
Qwen2.5-14B |
14B | 高性能需求 | GPU (16GB+ VRAM) |
Qwen2.5-32B |
32B | 专业推理 | 多 GPU 或高配服务器 |
Qwen2.5-72B |
72B | 企业级 | 多 GPU (A100/H100) |
📌 推荐新手从
Qwen2.5-7B开始,它在性能和资源消耗之间平衡较好,且社区支持丰富。
🔗 官方下载地址:
https://huggingface.co/Qwen/Qwen2.5-7B-Instruct
(注意选择 -Instruct 版本,适合对话任务)
✅ 二、Ubuntu 24.04 LTS 上部署 Qwen 的步骤简述
1. 系统要求
- Ubuntu 24.04 LTS(已满足)
- Python 3.10+(Ubuntu 24.04 默认包含)
- CUDA 12.x(如果使用 NVIDIA GPU)
- PyTorch >= 2.0
2. 安装依赖
sudo apt update
sudo apt install python3-pip python3-venv git -y
# 创建虚拟环境
python3 -m venv qwen-env
source qwen-env/bin/activate
# 安装 PyTorch(根据你的 CUDA 版本选择)
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121
# 安装 transformers 和 accelerate
pip install transformers accelerate sentencepiece
3. 加载并运行 Qwen 模型(示例代码)
from transformers import AutoModelForCausalLM, AutoTokenizer
model_name = "Qwen/Qwen2.5-7B-Instruct"
tokenizer = AutoTokenizer.from_pretrained(model_name, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
model_name,
device_map="auto", # 自动分配 GPU/CPU
torch_dtype="auto",
trust_remote_code=True
)
messages = [{"role": "user", "content": "你好,请介绍一下你自己"}]
text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = tokenizer(text, return_tensors="pt").to(model.device)
outputs = model.generate(**inputs, max_new_tokens=512)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))
4. (可选)使用 Ollama 或 LM Studio 简化部署
如果你不想写代码,可以使用工具如:
- Ollama:
ollama run qwen2.5:7b - LM Studio:图形界面,直接下载模型运行
✅ 三、常见问题
- 没有 GPU? → 使用
device_map="cpu",但速度较慢。可考虑量化版本(如Qwen2.5-7B-Int4)。 - 内存不足? → 使用
bitsandbytes进行 4-bit 量化加载:model = AutoModelForCausalLM.from_pretrained( model_name, load_in_4bit=True, device_map="auto" )
✅ 总结
| 问题 | 答案 |
|---|---|
| 该选哪个 Ubuntu 版本? | Ubuntu 24.04 LTS 即可,无需特别选择 |
| 该选哪个 Qwen 模型? | 新手推荐 Qwen2.5-7B-Instruct |
| 如何安装? | 通过 Hugging Face + Transformers 库,或使用 Ollama/LM Studio |
如需进一步帮助(如量化部署、API 服务化),欢迎继续提问!
云知识CLOUD