阿里通义 Qwen3-VL 系列全新成员 4B 与 8B 模型开源上线

IT之家 10 月 15 日消息,阿里通义今日官宣 Qwen3-VL 系列再添新成员 ——Dense 架构的 Qwen3-VL-8B、Qwen3-VL-4B 模型开源上线。

Qwen3-VL-4B / 8B 是密集(Dense)视觉理解模型,显存占用更低,拥有 Qwen3-VL 的全部能力项,每个尺寸都有 Instruct 和 Thinking 两大版本。

Qwen3-VL-8B 在 STEM、VQA、OCR、视频理解和 Agent 任务等公开评测上表现优异,不仅超越 Gemini 2.5 Flash Lite 和 GPT-5 Nano,甚至可以媲美上一代超大尺寸模型 Qwen2.5-VL-72B

而 4B 版本则在端侧展现更高的性价比,适合在需要 AI 视觉理解的智能终端部署。

值得一提的是,这两款视觉理解模型实现了「视觉精准」与「文本稳健」的协同突破:针对小模型常见的“跷跷板”问题(提升视觉能力往往牺牲文本性能,反之亦然),阿里通过架构创新和技术优化,让模型在保持文本理解能力的同时,增强多模态感知与视觉理解能力,小身板里塞进了更强的视觉和文本能力

新模型现已上线魔搭社区、Hugging Face,也提供 FP8 版本,IT之家附开源地址如下:

展开阅读全文

更新时间:2025-10-16

标签:科技   阿里   上线   模型   成员   系列   视觉   能力   文本   版本   架构   尺寸   跷跷板

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight 2020- All Rights Reserved. Powered By bs178.com 闽ICP备11008920号
闽公网安备35020302034844号

Top