DeepSeek v4.1 Flash 现在是我们最强的黑客模型

AI 安全公司 Enclave 的基准测试显示,DeepSeek V4.1 Flash 以约 4.65 美元成本攻破了全部 11 个漏洞靶机,并在复盘中暴露出 5 条原评分系统未识别的“意外路径”,说明现有智能体安全测试需要同时检查结果和攻击过程。

AI 安全公司 Enclave 的基准测试显示,DeepSeek V4.1 Flash 以约 4.65 美元成本攻破了全部 11 个漏洞靶机,并在复盘中暴露出 5 条原评分系统未识别的“意外路径”,说明现有智能体安全测试需要同时检查结果和攻击过程。

软件作者 Mark Seemann 公开回应一位读者的来信:这位没有计算机背景的开发者用大模型搭起了一套包含 API、PostgreSQL 和 LLM 流水线的大型 TypeScript 系统,却在转向生产时发现自己造出了超出自身理解能力的系统。Seemann 借此谈了他对“LLM 时代还要不要学编程基本功”…

Hacker News 上出现了一个名为 ImpactGate 的合并门禁方案,试图在代码合并环节为 AI 生成或辅助的改动打出“结构腐化”评分。它值得关注,是因为 AI 写代码的门槛越来越低,但“看起来能跑”和“长期可维护”之间的差距正在被放大。

开源项目 ImpactGate 发布了一个“结构腐化”合并门禁,用公式量化每次代码改动给已有复杂类带来的额外风险,在类变成没人敢碰的“上帝类”之前就把它拦住。它把 AI 时代常见的“代码越堆越多、每步看着都合理”问题,变成了可计算、可拦截的工程指标。

Hacker News 上有人整理出 20 个主流大模型的发布时间与训练数据截止日期,讨论随即转向一个更实际的问题——模型到底知不知道"现在"是什么时候,以及它是否会因此给出过时甚至错误的答案。

AI 陪伴平台 Joi AI 邀请伦敦国王学院讲师 Chloé Locatelli 担任“自慰顾问”,她以研究者身份创建并使用了 AI 角色,同时推动一项为期两年、尚待伦理审批的用户访谈研究。这起合作把“AI 伴侣到底如何影响亲密行为”从媒体恐慌拉回到可验证的实证研究上。

《每日镜报》等媒体的出版商 Reach 宣布裁减 220 个编辑岗位并关停三家地方新闻网站,直接把原因指向 Google 的 AI 摘要导致搜索流量大幅下滑。这不是又一轮成本收缩,而是 AI 搜索开始实打实地重构内容行业的收入基础。

前 Infosys 首席执行官 Vishal Sikka 创立的 AI 初创公司 Hang Ten Systems,在首轮 3200 万美元种子融资完成仅五周后,又获得 5300 万美元追加投资,总融资额达到 8500 万美元。它押注的方向是用 AI 重构大企业软件开发和维护流程,而非再造一个通用大模型。

TechCrunch Disrupt 2026 的展位申请将在 9 月 18 日 23:59(太平洋时间)截止,留给创业公司的只剩 3 天。这场 10 月 13 日至 15 日在旧金山 Moscone West 举行的大会预计聚集 1 万多名创始人、投资人和技术高管,对想接触 VC 和高质量潜在客户的团队来说…

Mozilla 推出 Firefox Smart Window 测试版,这款浏览器 AI 助手由法国 Mistral 的模型驱动,主打隐私优先、对话默认不落库;它既是 Mozilla 在 AI 浏览器赛道的一次落子,也是 Mistral 从企业客户走向全球终端用户的关键一步。