标签: 大模型

基于 Lean 的忠实性对齐评估

基于 Lean 的忠实性对齐评估

Millennium Research 发布了一款名为 leanscreen 的开源工具,用于检查 Lean 4 定理陈述是否存在“空洞承诺”——比如证明能编译通过,但定理本身只是恒等式,实际意义为空。这类问题正是大模型生成形式化证明时最隐蔽的风险点。

OpenSSH 10.5 发布,现已支持 AI 辅助

OpenSSH 10.5 发布,现已支持 AI 辅助

OpenSSH 10.5 正式发布,团队同时公开表示欢迎 AI 辅助提交的安全漏洞报告,前提是有人工研判、测试用例或修复建议。开源安全社区对“是否接受 AI 进代码树”仍有明显分歧,但至少在漏洞挖掘环节,AI 已被权威基础设施项目官方接纳。

窃取专有LLM API的推理轨迹

窃取专有LLM API的推理轨迹

安全研究者展示了一种针对专有大语言模型 API 的攻击思路:通过精心构造的查询,可以诱导模型暴露内部推理轨迹,从而在未接触权重的前提下,低成本获取闭源模型最核心的“思考过程”。