标签: Midjourney

GulliBench:衡量前沿模型的怀疑精神

GulliBench:衡量前沿模型的怀疑精神

Vetto Research 发布名为 GulliBench 的评测集,用 150 个刻意设置“表面数据在说谎”的简单任务,检验大模型是会盲目采信现成字段,还是愿意多一步验证。它提示:模型变聪明和变得可信,是两回事。