一句话看懂:Andrej Karpathy 分享了一个极简评测思路——把经纬度坐标当作文本,反复问大模型“陆地还是水域”,问 16200 次并将结果渲染成图。模型答对了,这说明它从压缩互联网数据的过程中,隐式学会了地理信息。
事件核心:发生了什么
Andrej Karpathy 在 X 上转发并点评了一个评测:测试者只用一句话提示词——给大模型一段经纬度文本,问“Land or Water?”,重复 16200 次,再把每次的答案按坐标绘制成一张图。结果显示,模型能大致还原出全球海陆轮廓。Karpathy 的评价是“The models know”,并指出这种能力来自“压缩互联网”——也就是训练数据本身包含大量地理、地图与坐标相关信息。该帖发布时间为 2026 年 10 月 2 日,浏览量约 14.6 万,帖中还附带了一个网友整理的“所有 Claude 模型结果”链接。
为什么重要
这个测试的意义不在“模型会答地理题”,而在于它揭示了一种非显式的知识获取路径:没有人专门用海陆标注数据去训练模型,但模型在压缩互联网文本的过程中,间接建立了坐标到地理属性的映射。这为评测大模型的“世界知识”提供了一个低成本、可复现的思路——不需要标准数据集,只需一个二元问题和一张图。对闭源与开源模型来说,这类评测也能直观暴露知识覆盖的差异,甚至可能被开发者用来做模型选型的参考。
对用户/开发者/创作者的影响
对普通用户来说,这意味着大模型在旅行、物流、地图类问答中可能比预期更可靠,但也提醒使用者:模型的“知道”来自训练语料,边界和误差需要验证,不能当作权威地图 API 使用。对开发者而言,这类评测思路可以被复用为轻量 benchmark:用 API 批量调用模型,把输出结构化后做可视化,成本低、门槛也不高。对内容创作者,这类话题适合做“模型能力实测”系列,但要注意结论要基于可复现的提示词和样本量,避免拿个别错误放大成整体判断。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
目前公开信息显示,这只是单次社区评测,尚无官方基准或论文支撑,后续可观察三点:一是不同模型、不同语言提示下的准确率差异是否被系统整理;二是这类“隐式能力”是否会进入正规评测体系,比如地理知识维度的 benchmark;三是它是否会引发对训练数据来源与覆盖范围的更多讨论,尤其在数据合规日益重要的背景下。


