第二期 小路和你读AI论文。本期五篇。 如果时间不多,建议读第四篇最有意思 也最有启发: 来自蚂蚁集团的《借助围棋死活题探测大语言模型推理中的搜索效率》 今天除了”Agent 技能/记忆持久化安全隐患”这条线之外,还有一类工作挺有意思:用大规模受控实验去戳破业界的一些直觉判断,比如”LLM 能不能取代 embedding 模型””CoT 越长是不是推理越好”。 1. The Embedder’s Dilemma: LLMs Are B…

本期五篇论文集中挑战了两个业内直觉:LLM 并不天然适合替代 embedding 模型;CoT 越长也不代表推理更好。其中蚂蚁集团的围棋死活题测评(TsuGO)最值得一读,它给“推理能力评估”提供了一个新维度。

一句话看懂:本期五篇论文集中挑战了两个业内直觉:LLM 并不天然适合替代 embedding 模型;CoT 越长也不代表推理更好。其中蚂蚁集团的围棋死活题测评(TsuGO)最值得一读,它给“推理能力评估”提供了一个新维度。

事件核心:发生了什么

这期论文推荐来自账号 @Zen_with_AI,共五篇,大体可分成两条线。一条是 Agent 安全与协作:香港城市大学团队的“Practice Makes Unsafe”研究了自我改进型 LLM Agent,发现 25 种 Agent-方法组合中有 21 个进化配置都会产生“成功但不安全”的技能;恶意任务暴露让跨会话攻击成功率从 16% 升至 35.3%。另一条是“反直觉实验”:Muennighoff 和 Google Gecko 论文作者对比了 10 个 LLM 与 26 个 embedding 模型、横跨 37 个任务,结果显示最强 LLM(Gemini 3.1 Pro)与最强 embedding 模型得分几乎打平,但 LLM 单次推理成本最高是 embedding 模型的 1431 倍,速度慢 2.5 到 736 倍。

重点推荐的是蚂蚁集团团队的 TsuGO(论文前缀显示疑似蚂蚁相关)。它用围棋死活题这种解空间封闭、可验证的对抗性任务,把思维链拆成结构化搜索树来评测。结果发现:更长的 CoT 或更高的 Token 效率,并不必然意味着更强的搜索能力;当前 LLM 的搜索行为更像无引导的暴力搜索,距离 KataGo 式的神经网络引导搜索仍远。另有清华 KEG 实验室的 SAEVerbalizer(让稀疏自编码器特征直接“讲出”自身含义)和一份 49 页的独立作者形式化契约论文,均偏理论但有明确增量。

为什么重要

这些工作不是刷榜,而是在修正行业共识。embedding 选型上,“无脑用 LLM 做向量化”被量化地证伪:强的只是推理,不是检索表征。推理评估上,TsuGO 挑战了“CoT 越长越好”的主流假设,提示评测应关注搜索组织效率,而非仅看文本长度或得分。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

celebrityanime
celebrityanime
文章: 18693

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注