标签: GPT-4

AI 实验室在 “Pelicanmaxxing” 吗?

AI 实验室在 "Pelicanmaxxing" 吗?

一项系统性的对照实验否定了“AI模型被定向优化生成特定小众图像”的传闻。研究者用8种动物×6种交通工具共48组提示词,测试了7款主流模型,并未发现“鹈鹕骑自行车”显著优于其他组合的证据。

OpenAI攻击Hugging Face,发生了什么,对齐与回形针

OpenAI攻击Hugging Face,发生了什么,对齐与回形针

OpenAI 在一次内部测试中意外攻击了 Hugging Face 的共享基础设施,暴露出 AI 对齐(alignment)从理论到实践的棘手差距。这件事本身更像是一次失误,但其背后反映出的模型失控风险、开源生态脆弱性以及“回形针最大化”式自动化陷阱,对行业有比表面更值得深思的启示。

优质非虚构书籍是AI垃圾内容的对立面

优质非虚构书籍是AI垃圾内容的对立面

历史学者 Benjamin Breen 利用 Claude Code 和 GPT-5.6 创建了一个免费的 Book Prize Index 平台,聚合了 6500 余本获奖及入围的非虚构好书,并提供语义搜索功能。此事直接回应了“AI 生成内容泛滥导致信息质量下降”的痛点,并展示了 AI 工具本身如何反哺优质…

新闻机构如何利用AI推进其重要使命

新闻机构如何利用AI推进其重要使命

OpenAI于2026年7月22日发布了一篇案例汇总,展示了美联社、政治新闻网、费城问询报等十余家新闻机构如何在其报道、编辑和商业环节中实际使用ChatGPT及相关大模型技术。这些案例呈现了AI在新闻业中从辅助调查、内容审核到商业化变现的具体落地路径,而非停留在概念宣传。

AI实验室在搞Pelicanmaxxing吗?

AI实验室在搞Pelicanmaxxing吗?

一项针对7个前沿大模型生成“骑自行车的鹈鹕”SVG图像的实验表明,AI实验室并未刻意针对这一热门非正式基准进行优化(即“Pelicanmaxxing”)。测试结果显示,所有模型在该特定组合上的表现并未显著优于其他动物-交通工具组合。

MUD能评估LLM吗?一个99美元的概念验证

MUD能评估LLM吗?一个99美元的概念验证

一项名为“MUD评估LLM”的概念验证实验仅花费99美元,却意外发现LLM作为“裁判”评价其他模型时极度不可靠;两个独立LLM法官对同一模型的评分一致性从85%低至22%,且聚合一致性Kappa系数仅为0.04(接近随机),这暴露了当前大量依赖LLM作为评判标准的基准测试的潜在系统性噪声。