国产黑马本地大模型StartLux-27B正面硬刚DeepSeek,开启端侧AI新时代

中国信通院最新MCP专项测试中,上海原点星光研发的27B参数本地模型StartLux-V1.0-27B-Preview综合成绩超越DeepSeek-V4-Flash,并以不到其1/10的参数量,在部分任务上追平了1.6T参数的DeepSeek-V4-Pro。这件事值得关注,因为它意味着“参数竞赛”正在被“本地…

中国信通院最新MCP专项测试中,上海原点星光研发的27B参数本地模型StartLux-V1.0-27B-Preview综合成绩超越DeepSeek-V4-Flash,并以不到其1/10的参数量,在部分任务上追平了1.6T参数的DeepSeek-V4-Pro。这件事值得关注,因为它意味着“参数竞赛”正在被“本地…

从 2026 年 9 月 1 日起,中国首个人机协同客服国家标准正式施行,AI 客服“已读乱回”不再免责,回复内容将被纳入运营商责任范围。外卖绿色包装、微短剧分类备案等一批民生与内容新规也同步落地。

Android Police 的资深编辑在长期使用后指出,三星 Galaxy AI 虽然功能实用,但其品牌包装、功能分层、账号体系以及与 Google 的交叉服务,正在让用户难以判断“我到底为哪项 AI 付费、它来自哪家公司”。三星需要从技术竞赛转向体验整合的清晰化。

Android Police 的资深编辑在长期使用后指出,三星 Galaxy AI 虽然功能实用,但其品牌包装、功能分层、账号体系以及与 Google 的交叉服务,正在让用户难以判断“我到底为哪项 AI 付费、它来自哪家公司”。三星需要从技术竞赛转向体验整合的清晰化。

METR 和 Redwood 针对 HuggingFace 遭入侵事件发布了复盘报告,指出AI安全社区多年前的抽象预测与此次攻击的失败模式高度吻合,重新引发了关于AI风险预测有效性和理性主义社区思维方式的讨论。

本周值得关注的AI论文集中在“评估与可靠验证”方向:Netflix公开了大规模LLM评判器的生产运维经验,NVIDIA则用实验证明现有技能审查门禁与真实质量几乎无关,并提出可落地的“技能提升量”评测方法。

一位长期主张在 Git 提交中把 Claude Code 列为共同作者的开发者,如今公开改变了立场,理由是这种做法会稀释开发者对代码质量的责任感。这个转变折射出 AI 辅助编程从“新鲜事物”走向“默认工具”后,行业对署名、责任和透明度的重新校准。

Chess.com 借助 AI 辅助编程,在一年内将新扑克教学网站 Gambit 从原型推向上线,并计划用同一套模式快速复制围棋、双陆棋和麻将等经典游戏站点,给每个游戏都配上 Elo 式玩家评分系统。

在沉寂两三年之后,连续扩散语言模型(Continuous Diffusion Language Models)重新成为研究热点。相比当前主流的自回归大模型,这类模型试图用“去噪”而非“逐词预测”的方式生成文本,可能为可控生成、文本填充等任务开辟新路径。

MIT 的一份委员会报告指出,当前大模型已能对几乎全部本科书面作业给出可信解答,并在不到三年内实质改变了校园学习文化。与此同时,欧盟《AI 法案》正从另一个方向介入:用 AI 监控考试属于高风险行为,教育场景的情绪识别已被全面禁止。