LLM 能通过镜像测试吗?

一项利用 Gemma 4 31B 模型的实验提出了新的 LLM 自我识别测试方法——通过修改模型自己的回答而非依赖视觉或直接提问来探测其自我模型。这可能比现有任何视觉镜像测试都更接近衡量大模型“自我意识”的实质。

一项利用 Gemma 4 31B 模型的实验提出了新的 LLM 自我识别测试方法——通过修改模型自己的回答而非依赖视觉或直接提问来探测其自我模型。这可能比现有任何视觉镜像测试都更接近衡量大模型“自我意识”的实质。

在2026年6月的ISC 2026大会上,第67期TOP500榜单公布,中国深圳的“LineShine”超级计算机以2.198 Exaflops的FP64持续性能登顶榜首。这是9年来中国首次有系统进入TOP500,且是一套纯CPU系统,打破了此前外界对中国超算“只跑LINPACK”的刻板印象。

近100万份全球护照照片因一家大麻药房的身份验证系统存在API漏洞而被公开暴露。这起事件暴露了一个深层风险:高价值凭证(护照)被用于低安全等级的商业场景,一旦低端系统被攻破,核心身份数据将全线失守。

OpenAI 发布 GPT-5.6 系统卡,显示其在安全性测试中,最关键的“Sol”指标远低于此前最令人担忧的“Mythos”用例阈值,意味着模型安全风险可控,所有版本具备立即发布的条件。

奥地利政府正在游说欧盟,积极争取美国 AI 公司 Anthropic 将欧洲总部或核心研究机构设立在奥地利境内。此举是欧盟试图摆脱对美国和中国科技巨头依赖,打造本土 AI 生态的重要信号。

欧盟资助的公共 DNS 解析器 DNS4EU 从荷兰反盗版组织 BREIN 获取了盗版网站阻止列表,但实际并未用于拦截任何盗版网站。该事件揭示了欧盟范围内 DNS 层内容过滤政策的模糊地带:技术上可行、法律上无强制、商业上暂无行动。
![非语言儿童的计算机辅助语言发展 (1968) [pdf]](https://www.chat-gpts.plus/wp-content/uploads/2026/06/ai_cover_4-998-768x403.jpg)
一篇1968年发表在《Arch Gen Psychiatry》上的学术论文,详细记录了如何利用计算机辅助系统帮助非语言儿童(包括自闭症儿童)发展语言能力。2026年6月28日,该论文的PDF扫描版被上传至互联网档案馆(archive.org),并因Hacker News的讨论在24小时内重新引发关注。

开发者 Alexandre Gomes Gaigalas 通过交叉测试14个shell发现,所谓“POSIX shell”脚本在不同系统上的行为并不一致——甚至连最基本的 echo 命令都因实现而异。POSIX 是一份规范,不是可执行程序,依赖抽象规范而不实际验证,正在损害脚本的可移植性。

喜剧大师梅尔·布鲁克斯在2026年迎来100岁生日,引发对这位奠定美国喜剧核心理念与创作范式人物的深度回顾。文章揭示其喜剧哲学与文学经典的内在联系,对AI内容创作者而言,提供了一个理解“人性化幽默”与“算法化笑点”差异的绝佳案例。

《剪刀手爱德华》《圣诞夜惊魂》导演蒂姆·伯顿公开批评AI图像生成器盗用其独特艺术风格,称这种感觉如同“机器人夺走了你的灵魂”,并将此类行为类比为某些文化中“照相会摄走灵魂”的禁忌。这一事件再次点燃了关于AI生成内容原创性与创作者权益的争论。