Qwen翻译站点

3周前更新 36 0 0

阿里通义千问开放权重大模型家族,Apache-2.0 许可为主。

所在地:
美国纽约
语言:
英文
收录时间:
2026-08-20

Qwen(通义千问)是阿里巴巴通义实验室开发的开放权重大模型家族,截至 2026 年 8 月最新开放权重版本为 Qwen3.8 系列。家族普遍采用 Apache-2.0 许可,覆盖从 0.6B 端侧模型到 2.4T MoE 旗舰的全尺寸矩阵,支持 200+ 语言、原生多模态、256K-1M 长上下文,是全球下载量最大的开源大模型家族,Hugging Face 累计下载超 30 亿次。

 

产品概述

Qwen 由阿里巴巴通义实验室开发,是全球下载量最大的开放权重大模型家族——阿里已累计开源 460+ 模型,全球下载超 30 亿次,衍生模型超 30 万个 。

 

版本演进(具体以官网实时信息为准):

  • Qwen3(2025 年 4 月):0.6B 到 235B 全尺寸矩阵,Apache-2.0 许可,支持思考/非思考模式切换
  • Qwen3.5(2026 年 2 月):推出 397B-A17B MoE 旗舰,Apache-2.0 许可
  • Qwen3.6(2026 年 4 月):35B-A3B MoE 与 27B 稠密,Apache-2.0 许可
  • Qwen3.8(2026 年 8 月):当前最新开放权重系列。Qwen3.8-27B 为稠密多模态模型,Apache-2.0 许可,262K 上下文,4-bit 量化后可在单张 RTX 4090(24GB)运行 ;Qwen3.8-Max(2.4T 参数 MoE)首次开放权重,但采用自定义 Qwen3.8-Max 许可

 

许可策略(关键):

Qwen 家族普遍采用 Apache-2.0 许可,商用无门槛。但需注意:

  • Qwen3.8-27B 及以下:Apache-2.0 ✅
  • Qwen3.8-Max(2.4T MoE):自定义 Qwen3.8-Max License,年营收 >5000 万美元的 AI 服务业务需单独授权
  • 建议用户在具体版本模型卡中确认许可条款

 

当前最新版本 Qwen3.8-27B 核心参数

  • 架构:27B 稠密多模态
  • 上下文:262K 原生,可通过 YaRN 扩展至 1M
  • 模态:原生支持文本、图像、视频输入
  • 许可:Apache-2.0
  • 硬件:4-bit 量化后约 17GB 显存,单张 RTX 4090 可运行

 

核心能力

  • 全尺寸覆盖:从 0.6B 端侧到 2.4T MoE 旗舰,一个技术栈覆盖端侧到数据中心
  • 多语种:支持 200+ 语言与方言,多语种能力开源第一梯队
  • 原生多模态:最新版本原生支持图像与视频理解
  • 长上下文:家族主流 256K-1M 上下文窗口
  • 思考/非思考双模式:可动态切换推理深度,灵活应对不同任务
  • Agent 工具调用:原生 function calling,与主流 Agent 框架深度适配
  • MoE 稀疏激活:旗舰版本 MoE 架构大幅降低推理成本

 

优势亮点

  • Apache-2.0 为主许可:商用无门槛,法务审核零障碍(Max 版本除外)
  • 全球下载量第一:Hugging Face 累计下载超 30 亿次,生态最成熟
  • 尺寸最全:0.6B 到 2.4T 全覆盖,端侧到云端统一技术栈
  • 国产算力适配完善:华为昇腾、寒武纪、海光等均已完成适配
  • 中文能力第一梯队:中文理解、生成、古诗文等任务长期领先
  • Ollama/vLLM/SGLang 全支持:主流推理引擎首发即适配
  • 消费级硬件可运行:最新 27B 版本 4-bit 量化后单张 RTX 4090 可跑

 

局限

  • 最新旗舰版本许可分化:Qwen3.8-Max 采用自定义许可,大规模商用需授权
  • Max 版开放权重为纯文本:Qwen3.8-2.4T-A95B 开放权重版不支持视觉输入,视觉能力仅在云端 API 提供
  • 默认思考模式易过度推理:社区实测需显式配置 reasoning_effort 来控制延迟
  • 封闭线领先开放线:Qwen3.7 等最新闭源版本能力领先同期开放权重版本,介意”最新能力”的用户需使用百炼 API
  • 英文生态略逊 Llama:英文社区教程丰富度仍略低于 Llama 系列

 

适用人群

  • 需要多语种能力的全球业务:200+ 语言覆盖,适合出海产品
  • 注重许可合规的商业化团队:Apache-2.0 版本商用零障碍
  • 端侧与云端统一技术栈:从手机端到云端 API 接口一致
  • 中文场景为主的国内企业:中文能力第一梯队,国产算力适配完善
  • 消费级硬件本地部署:最新 27B 版本单张 RTX 4090 即可运行

 

安装与部署

 

1. 通过 Ollama 一键运行(推荐入门)

# 拉取最新版本(以 Qwen3.8-27B 为例)
ollama pull qwen3.8:27b
ollama run qwen3.8:27b

# 其他尺寸
ollama pull qwen3.8:0.6b
ollama pull qwen3.8:7b

 

2. 通过 vLLM 部署(推荐生产环境)

vllm serve Qwen/Qwen3.8-27B \
  --tensor-parallel-size 1 \
  --max-model-len 262144

 

3. 通过 Hugging Face Transformers 推理

from transformers import AutoModelForCausalLM, AutoTokenizer

model_name = "Qwen/Qwen3.8-27B"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
    model_name, torch_dtype="auto", device_map="auto"
)

 

4. 量化部署(消费级硬件)

最新 27B 版本 4-bit 量化后约 17GB 显存,单张 RTX 4090(24GB)即可运行:

./llama-cli -m qwen3.8-27b-Q4_K_M.gguf -p "你的提示词"

 

5. 国产算力部署

已适配华为昇腾(MindIE + CANN)、寒武纪、海光等国产 AI 芯片,参考各厂商官方适配指南。

 

6. 云端 API 调用(不想自托管)

通过阿里云百炼 API(兼容 OpenAI 格式):

from openai import OpenAI
client = OpenAI(
    api_key="your-dashscope-api-key",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)
response = client.chat.completions.create(
    model="qwen3.8-plus",  # 云端最新版本
    messages=[{"role": "user", "content": "你好"}]
)

💡 自托管适合数据敏感、批量任务、定制化场景;百炼 API 适合快速集成、弹性扩缩容。具体版本与定价以官网实时信息为准。

相关导航