标签: Anthropic

OpenAI 因“严重”网络风险放慢下一代模型

OpenAI 因“严重”网络风险放慢下一代模型

OpenAI 在内部测试中发现下一代模型 Astra 可能具备“严重”级别的自主网络攻击能力,因此暂停了部分开发工作并加强安全管控。这是前沿实验室首次公开因网络风险主动踩下自家模型的刹车,也直接暴露了“AI 能力越强、越难被安全关住”的行业难题。

AI公司不断毁掉旧书,原因如下。

AI公司不断毁掉旧书,原因如下。

一家图书数据公司曾公开提供“毁书扫描”服务,通过切掉书脊、整本粉碎的方式来制作AI训练数据,引发强烈争议后已悄然撤回。此事揭开了大模型训练背后一个不愿被正视的现实:为了获取高质量文本,AI公司正在大量销毁实体书籍。

turns out you can get indirect prompt injection to ~0 on unseen attacks if you stack enough layers (model training + input probes + a classifier checking intent). didn’t expect that a year ago. auto mode is default in…

turns out you can get indirect prompt injection to ~0 on unseen attacks if you stack enough layers (model training + input probes + a classifier checking intent). didn't expect that a year ago. auto mode is default in...

Anthropic 开发者关系负责人 Boris Cherny 透露,通过组合模型训练、输入探测和意图分类器三层防线,Claude 已将间接提示注入攻击在未见攻击样本上的成功率压到接近 0,且该方案将随 Claude Code 自动模式在下周成为默认配置。

v2.1.226

v2.1.226

Anthropic 于 8 月 8 日发布 Claude Code v2.1.226,官方说明仍是“Bug 修复和可靠性改进”。值得关注的是,这款开发者工具正以高频小版本迭代,重心明显从功能堆叠转向稳定性打磨。