DeepSeek v4.1 Flash 现在是我们最强的黑客模型

AI 安全公司 Enclave 的基准测试显示,DeepSeek V4.1 Flash 以约 4.65 美元成本攻破了全部 11 个漏洞靶机,并在复盘中暴露出 5 条原评分系统未识别的“意外路径”,说明现有智能体安全测试需要同时检查结果和攻击过程。

AI 安全公司 Enclave 的基准测试显示,DeepSeek V4.1 Flash 以约 4.65 美元成本攻破了全部 11 个漏洞靶机,并在复盘中暴露出 5 条原评分系统未识别的“意外路径”,说明现有智能体安全测试需要同时检查结果和攻击过程。

由亿万富翁资助的 AI 安全倡导组织,正在把游说战场从论文和公开信搬到美国国会山,其中 ControlAI 等团体已进行了数百场见面会,试图在 AI 监管立法成形前抢先设定议题。

据 Bloomberg 报道,Meta Compute 联席负责人 Dina Powell McCormick 正利用其人脉网络为大型 AI 融资项目牵线搭桥,而马克·扎克伯格本人则将精力集中在产品层面。这一分工透露出 Meta 正在把 AI 基础设施的"钱"和"产品"拆成两条线来推进。

软件作者 Mark Seemann 公开回应一位读者的来信:这位没有计算机背景的开发者用大模型搭起了一套包含 API、PostgreSQL 和 LLM 流水线的大型 TypeScript 系统,却在转向生产时发现自己造出了超出自身理解能力的系统。Seemann 借此谈了他对“LLM 时代还要不要学编程基本功”…

Hacker News 上出现了一个名为 ImpactGate 的合并门禁方案,试图在代码合并环节为 AI 生成或辅助的改动打出“结构腐化”评分。它值得关注,是因为 AI 写代码的门槛越来越低,但“看起来能跑”和“长期可维护”之间的差距正在被放大。

开源项目 ImpactGate 发布了一个“结构腐化”合并门禁,用公式量化每次代码改动给已有复杂类带来的额外风险,在类变成没人敢碰的“上帝类”之前就把它拦住。它把 AI 时代常见的“代码越堆越多、每步看着都合理”问题,变成了可计算、可拦截的工程指标。

Hacker News 上有人整理出 20 个主流大模型的发布时间与训练数据截止日期,讨论随即转向一个更实际的问题——模型到底知不知道"现在"是什么时候,以及它是否会因此给出过时甚至错误的答案。

一个名为 stale.jock.pl 的页面整理并实时计时了 20 个主流 AI 大模型的发布时间与训练数据截止日期,揭示不少模型在上线当天就已经落后数月。它提醒用户:模型知道什么、不知道什么,取决于训练截止日期,而不是新闻标题里的发布日期。

CloudX 团队用开源项目 cloudx-io/setup-go 替换 GitHub 官方 actions/setup-go,通过复用 Go 构建缓存把并行 CI 测试任务耗时砍掉 69%,并指出官方 Action 约 86% 的工作是多余的。

Firefox 156 用更高效的图像解码方式降低了查看大尺寸 JPEG 时的 CPU 与内存开销,并把内置 PDF 查看器的启动速度最多提升了 45%;同时 Mozilla 把“AI 控制”做成一个集中的开关面板,让用户自行决定浏览器里的 AI 功能开与关。