一句话看懂:OrcaRouter 发布了专为 Apple Silicon 优化的 Qwen3.8-27B-Uncensored-MLX 模型,通过 Abliteration 技术实现本地无审查运行,4-bit 量化版本仅需约 15GB 内存,让 24GB 内存的 Mac 也能流畅跑 27B 稠密大模型。
事件核心:发生了什么
据 @NFT_Chen 发布的信息,OrcaRouter 在 Hugging Face 上放出了 Qwen3.8-27B-Uncensored-MLX 模型,专门针对 Apple Silicon 芯片的 Metal 加速进行了优化,无需 CUDA 环境即可本地运行。该模型基于阿里 Qwen3.8-27B 基座,采用 Abliteration 技术从残差流中移除拒答方向,而非简单的提示词改写。官方测试显示,4/6/8-bit 版本的拒绝率均为 0。模型提供 2/4/6/8-bit 四档量化,其中 4-bit 版本体积约 15GB,24GB 内存的 Mac 即可流畅运行;内存 32GB 以上用户建议选择 6/8-bit 版本,而 2-bit 版本被明确指出存在乱码崩溃问题,不建议使用。
为什么重要
这条新闻的意义在于把“本地无审查大模型”与“Mac 生态”这两件事接上了。此前,运行 27B 级别稠密模型通常依赖 NVIDIA GPU 和 CUDA 栈,Mac 用户要么用云端 API,要么只能退回到更小的模型。MLX 版本的发布意味着 Apple Silicon 用户可以在本地获得完整的多模态能力(图片+视频理解)、262K 超长上下文、Thinking 模式、Tool Calling 和 MTP 支持,同时保留官方基座在 SWE-bench Pro 61.7、Terminal Bench 73.0、OSWorld 84.3、AndroidWorld 81.9 等硬核基准上的表现。对依赖本地推理的开发者来说,这降低了硬件门槛,也减少了对云服务的依赖。
对用户/开发者/创作者的影响
对 Mac 用户而言,最直接的变化是:一台 24GB 内存的 MacBook 现在可以本地运行 27B 稠密模型,隐私和数据安全压力更小,断网也能用。对开发者来说,模型支持 OpenAI 兼容 API 服务器,意味着现有工具链和脚本可以无缝切换,无需重写调用逻辑。对创作者而言,无审查特性加上原生多模态能力,意味着图像理解、视频分析和长文本处理可以在本地完成,内容生产的敏感度约束也由用户自行掌控。需要提醒的是,无审查不等于无风险,使用时应遵守当地法律法规和平台政策。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
目前公开信息显示,该模型已可在 Hugging Face 上搜索 orcarouter/Qwen3.8-27B-Uncensored-MLX 获取。后续值得观察的点有三个:第一,OrcaRouter 是否会持续跟进 Qwen3.8 系列的更新,形成固定的“无审查 MLX 版”发布节奏;第二,其他开源模型社区是否会效仿 Abliteration 技术路线,推出类似的对齐移除版本;第三,阿里官方对这类第三方二次创作的态度,以及是否会影响 Qwen 系列模型的开源授权策略。
来源:@NFT_Chen


