标签: GPT-4

优质非虚构书籍是AI垃圾内容的对立面

优质非虚构书籍是AI垃圾内容的对立面

历史学者 Benjamin Breen 利用 Claude Code 和 GPT-5.6 创建了一个免费的 Book Prize Index 平台,聚合了 6500 余本获奖及入围的非虚构好书,并提供语义搜索功能。此事直接回应了“AI 生成内容泛滥导致信息质量下降”的痛点,并展示了 AI 工具本身如何反哺优质…

新闻机构如何利用AI推进其重要使命

新闻机构如何利用AI推进其重要使命

OpenAI于2026年7月22日发布了一篇案例汇总,展示了美联社、政治新闻网、费城问询报等十余家新闻机构如何在其报道、编辑和商业环节中实际使用ChatGPT及相关大模型技术。这些案例呈现了AI在新闻业中从辅助调查、内容审核到商业化变现的具体落地路径,而非停留在概念宣传。

AI实验室在搞Pelicanmaxxing吗?

AI实验室在搞Pelicanmaxxing吗?

一项针对7个前沿大模型生成“骑自行车的鹈鹕”SVG图像的实验表明,AI实验室并未刻意针对这一热门非正式基准进行优化(即“Pelicanmaxxing”)。测试结果显示,所有模型在该特定组合上的表现并未显著优于其他动物-交通工具组合。

MUD能评估LLM吗?一个99美元的概念验证

MUD能评估LLM吗?一个99美元的概念验证

一项名为“MUD评估LLM”的概念验证实验仅花费99美元,却意外发现LLM作为“裁判”评价其他模型时极度不可靠;两个独立LLM法官对同一模型的评分一致性从85%低至22%,且聚合一致性Kappa系数仅为0.04(接近随机),这暴露了当前大量依赖LLM作为评判标准的基准测试的潜在系统性噪声。

开源模型季度盘点:Kimi K3、Qwen 3.8、WAIC 演讲、知识蒸馏与开源闭源差距

开源模型季度盘点:Kimi K3、Qwen 3.8、WAIC 演讲、知识蒸馏与开源闭源差距

随着 Kimi K3 发布、Qwen 宣布下一代模型将开放权重、以及中国高层在 WAIC 上明确支持开源策略,开源与闭源模型之间的性能差距正在被重新定义。季度盘点指出,评测数据的混乱让“领先几个月”的说法失去意义,真正的差距体现在实际任务层面,而知识蒸馏正在被过度简化。