日本Sakana AI放出Fugu Cyber:一个多智能体系统,把GPT-5.5-Cyber和Claude都挑落马下

日本AI初创公司Sakana AI于7月21日发布网络安全专用多智能体系统Fugu Cyber,在两项严苛基准测试中分别达到86.9%和72.1%的成功率,超过了OpenAI的GPT-5.5-Cyber和Anthropic的Claude Mythos-Preview,表明在特定垂直领域,专业化小模型已经能击败…

日本Sakana AI放出Fugu Cyber:一个多智能体系统,把GPT-5.5-Cyber和Claude都挑落马下

一句话看懂:日本AI初创公司Sakana AI于7月21日发布网络安全专用多智能体系统Fugu Cyber,在两项严苛基准测试中分别达到86.9%和72.1%的成功率,超过了OpenAI的GPT-5.5-Cyber和Anthropic的Claude Mythos-Preview,表明在特定垂直领域,专业化小模型已经能击败通用闭源旗舰模型。

事件核心:发生了什么

7月21日,日本AI初创公司Sakana AI发布了一款名为Fugu Cyber的多智能体系统,专门面向现代网络防御的复杂场景。该系统在两项业界公认高难度的安全基准评测中取得突破:在CyberGym测试中达到86.9%的成功率,在CTI-REALM测试中达到72.1%的成功率。两项成绩均超越了OpenAI的GPT-5.5-Cyber和Anthropic的Claude Mythos-Preview这两个闭源旗舰模型。

为什么重要

这一结果挑战了“通用大模型必然优于专用小模型”的普遍认知。Fugu Cyber作为一个多智能体系统,并非简单调大参数量或增加算力,而是通过多个专业智能体的协同完成网络攻防推理,展现出在垂直场景中的效率与精准度优势。对AI行业而言,它再次验证了“模型+系统架构”的优化方式可能比单纯扩展模型规模更具性价比,也意味着在安全、医疗、金融等需要高专业度的领域,定制化多智能体方案将成为闭源通用模型的强有力竞争者。

对用户/开发者/创作者的影响

对网络安全从业者来说,Fugu Cyber的数据意味着企业采购AI防护方案时有了更具体的对标对象——专业防御系统在特定测试中已能胜过通用旗舰模型。API开发者和安全产品团队可关注其是否提供开放接口或开源方案,用于集成到现有SOC(安全运营中心)或应急响应流程。对于普通用户,这类技术落地可能以更隐蔽的方式体现:未来你的企业邮箱或防火墙系统或许已经在运行类似的防御智能体。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

目前公开信息显示,Fugu Cyber尚未明确是否对开发者开放试用或API。后续值得观察三点:一是Sakana AI是否会发布更详尽的评测报告,包括防御场景的覆盖面;二是OpenAI和Anthropic是否会针对性地更新其安全模型版本或推出专用分支;三是该多智能体架构能否从安全领域快速复制到其他垂直行业,比如渗透测试或合规审计。

来源:AIbase

celebrityanime
celebrityanime
文章: 14485

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注