标签: Anthropic

turns out you can get indirect prompt injection to ~0 on unseen attacks if you stack enough layers (model training + input probes + a classifier checking intent). didn’t expect that a year ago. auto mode is default in…

turns out you can get indirect prompt injection to ~0 on unseen attacks if you stack enough layers (model training + input probes + a classifier checking intent). didn't expect that a year ago. auto mode is default in...

Anthropic 开发者关系负责人 Boris Cherny 透露,通过组合模型训练、输入探测和意图分类器三层防线,Claude 已将间接提示注入攻击在未见攻击样本上的成功率压到接近 0,且该方案将随 Claude Code 自动模式在下周成为默认配置。

v2.1.226

v2.1.226

Anthropic 于 8 月 8 日发布 Claude Code v2.1.226,官方说明仍是“Bug 修复和可靠性改进”。值得关注的是,这款开发者工具正以高频小版本迭代,重心明显从功能堆叠转向稳定性打磨。

BestBlogs 早报 · 08-08 # Intent Lab / 淘宝主播 Agent / RSI / 字节 5 万亿参数模型 / Cursor GPU [1] ★ 精讲|贾扬清:我所经历的「人工智能已死」到「AI 颠覆世界」的数年巨变丨串台「声东击西」S10E24 [播客] 贾扬清刚官宣第二家创业公司 Intent Lab——他的上一家 Lepton AI 第二年就实现盈利,随后被英伟达收购。这期与声东击西的串台里,他回溯从…

BestBlogs 早报 · 08-08 # Intent Lab / 淘宝主播 Agent / RSI / 字节 5 万亿参数模型 / Cursor GPU [1] ★ 精讲|贾扬清:我所经历的「人工智能已死」到「AI 颠覆世界」的数年巨变丨串台「声东击西」S10E24 [播客] 贾扬清刚官宣第二家创业公司 Intent Lab——他的上一家 Lepton AI 第二年就实现盈利,随后被英伟达收购。这期与声东击西的串台里,他回溯从…

8月8日的BestBlogs早报集中在AI从“模型能力展示”转向“工程化落地”的关键节点:贾扬清官宣新创业公司Intent Lab、田渊栋的递归自进化公司估值超46亿美元,同时淘宝、Cursor、OpenAI等技术进展揭示了Agent、算力优化和安全治理成为新的竞争焦点。

v2.1.225

v2.1.225

Anthropic 于 8 月 8 日发布 Claude Code v2.1.225,主要修复了多项会话稳定性与 OAuth 鉴权问题,并强化了网关支出限制和工作区信任机制。这是一个以安全性和体验修复为主的维护性版本,对高频使用 Remote Control 或多设备联动的开发者影响最直接。

OpenAI 表示因安全担忧放缓 Astra 模型开发

OpenAI 表示因安全担忧放缓 Astra 模型开发

OpenAI 在内部安全审查中发现,尚未发布的 Astra 模型已具备自主发起网络攻击的潜力,因此主动暂停了部分开发工作。这是前沿 AI 实验室罕见地公开承认“能力过强也是风险”,也让模型发布前的能力评估成为行业焦点。