标签: Gemini

在我们的基准测试中,GLM 5.2 表现优于 Claude

在我们的基准测试中,GLM 5.2 表现优于 Claude

安全公司 Semgrep 在内部 IDOR(不安全的直接对象引用)漏洞检测基准测试中发现,智谱 AI 的开源权重模型 GLM 5.2 以 39% 的 F1 分数击败了 Claude Code(32%),且每条漏洞发现成本仅约 0.17 美元。这一结果打破了“开源模型在专业安全任务上必然落后于闭源前沿模型”的刻…

LLM 能通过镜像测试吗?

LLM 能通过镜像测试吗?

一篇来自 Hacker News 的热门讨论提出,当前 LLM(大语言模型)对“镜像测试”这类自我认知题的回答存在明显缺陷,而谷歌最新的小模型 Gemma 4 在非传统维度上展现出的“通用智能感”引发了对 AI 能力评估标准的新思考。