Qwen 3.8 27B 表现出色,但默认推理强度过高导致过度思考

阿里 Qwen 实验室发布 Apache 2.0 开源的 Qwen 3.8 27B,视觉能力和自报基准令人惊喜,但默认把推理强度拉到“xhigh”,导致本地运行时常陷入过度思考——一个简单画圆请求能花几分钟“雕花”出一个炫技动画。

一句话看懂:阿里 Qwen 实验室发布 Apache 2.0 开源的 Qwen 3.8 27B,视觉能力和自报基准令人惊喜,但默认把推理强度拉到“xhigh”,导致本地运行时常陷入过度思考——一个简单画圆请求能花几分钟“雕花”出一个炫技动画。

事件核心:发生了什么

8 月 16 日前后,阿里 Qwen 实验室正式发布 Qwen 3.8 27B。这是一款采用 Apache 2.0 协议、约 270 亿参数的视觉理解大模型,27B 的规模被认为是兼顾笔记本级硬件的理想档位。官方自报基准显示,它在多个维度上同时超过前代 Qwen 3.6 27B 和此前最强的闭源模型之一 Qwen 3.7-Plus。

Simon Willison 在 M5 Max MacBook Pro 和 NVIDIA DGX Spark 两台设备上、通过 LM Studio 加载了 17GB 的 Q4_K_M 量化版本实测。他遇到的第一个问题不是性能,而是默认推理强度:Qwen 官方将 reasoning_effort 默认设为“xhigh”,模型会为“画一个圆”这类请求生成 2 万多 token 的推理链。实测中,一个“鹈鹕骑自行车”的 SVG 消耗了 22,276 个推理 token、耗时 21 分钟;关闭推理后,同样的任务只用 137 秒。

为什么重要

这次发布指向一个关键的产业信号:高效小模型正在快速逼近闭源旗舰的可用性。27B 模型能在本地硬件上完成复杂的视觉定位、结构化 JSON 输出和工具调用,验证了开源权重模型在“能力密度”上的快速提升。与此同时,默认“xhigh”的推理强度暴露了推理成本控制仍是开源模型产品化的核心课题。推理强度不是可调可不调的装饰项,而是决定部署成本、响应速度和用户留存的关键开关。一个默认拉满的配置,会让本来“够用”的 27B 模型在实际体验上变成“能跑,但急死人”。

对用户/开发者/创作者的影响

对本地模型用户,最直接的教训是:载入 Qwen 3.8 27B 后,第一件事就是检查 reasoning_effort 配置,不要使用默认的 xhigh;同时建议把 LM Studio 等工具的上下文限制从 8,192 token 拉高到 262,144,否则上下文很容易被推理 token 耗尽。开发者可以利用该模型的视觉和结构化输出能力,在离线环境完成边界框标注、页面原型生成、图像信息抽取等任务,效果接近云端大模型。创作者如果用这类模型生成 SVG、插画或动图,应优先关闭或调低推理强度,否则生成时间可能从分钟级恶化到半小时级。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

目前公开信息显示,Qwen 3.8 27B 的自报基准仍需第三方独立评测验证,值得关注 Hugging Face 等平台上的社区基准结果。另外,Qwen 是否会调整默认推理强度、或针对消费级硬件推出“低推理默认版”GGUF,将直接影响本地部署的实用性。最后值得留意的是,这种“高性能小模型 + 可控推理档位”的组合,会不会加速其他开源阵营厂商跟进,把推理效率作为下一代模型的宣传重点。

来源:Simon Willison 博客

celebrityanime
celebrityanime
文章: 18822

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注