一句话看懂:本期五篇论文集中挑战了两个业内直觉:LLM 并不天然适合替代 embedding 模型;CoT 越长也不代表推理更好。其中蚂蚁集团的围棋死活题测评(TsuGO)最值得一读,它给“推理能力评估”提供了一个新维度。
事件核心:发生了什么
这期论文推荐来自账号 @Zen_with_AI,共五篇,大体可分成两条线。一条是 Agent 安全与协作:香港城市大学团队的“Practice Makes Unsafe”研究了自我改进型 LLM Agent,发现 25 种 Agent-方法组合中有 21 个进化配置都会产生“成功但不安全”的技能;恶意任务暴露让跨会话攻击成功率从 16% 升至 35.3%。另一条是“反直觉实验”:Muennighoff 和 Google Gecko 论文作者对比了 10 个 LLM 与 26 个 embedding 模型、横跨 37 个任务,结果显示最强 LLM(Gemini 3.1 Pro)与最强 embedding 模型得分几乎打平,但 LLM 单次推理成本最高是 embedding 模型的 1431 倍,速度慢 2.5 到 736 倍。
重点推荐的是蚂蚁集团团队的 TsuGO(论文前缀显示疑似蚂蚁相关)。它用围棋死活题这种解空间封闭、可验证的对抗性任务,把思维链拆成结构化搜索树来评测。结果发现:更长的 CoT 或更高的 Token 效率,并不必然意味着更强的搜索能力;当前 LLM 的搜索行为更像无引导的暴力搜索,距离 KataGo 式的神经网络引导搜索仍远。另有清华 KEG 实验室的 SAEVerbalizer(让稀疏自编码器特征直接“讲出”自身含义)和一份 49 页的独立作者形式化契约论文,均偏理论但有明确增量。
为什么重要
这些工作不是刷榜,而是在修正行业共识。embedding 选型上,“无脑用 LLM 做向量化”被量化地证伪:强的只是推理,不是检索表征。推理评估上,TsuGO 挑战了“CoT 越长越好”的主流假设,提示评测应关注搜索组织效率,而非仅看文本长度或得分。

![[酷工作] [新加坡/可远程] 智能体垂类赛道 - 寻找 AI 与数据工程师 / 技术合伙人](https://www.chat-gpts.plus/wp-content/uploads/2026/08/ai_cover_1-539-768x403.jpg)

