Cool eval. Simply ask an LLM “Land or Water?” and give it a latitude and longitude coordinate as text. Ask 16,200 times, plot as image. The models know. From compressing the internet. https://t.co/jTTAhBsMfu

Andrej Karpathy 分享了一个极简评测思路——把经纬度坐标当作文本,反复问大模型“陆地还是水域”,问 16200 次并将结果渲染成图。模型答对了,这说明它从压缩互联网数据的过程中,隐式学会了地理信息。

一句话看懂:Andrej Karpathy 分享了一个极简评测思路——把经纬度坐标当作文本,反复问大模型“陆地还是水域”,问 16200 次并将结果渲染成图。模型答对了,这说明它从压缩互联网数据的过程中,隐式学会了地理信息。

事件核心:发生了什么

Andrej Karpathy 在 X 上转发并点评了一个评测:测试者只用一句话提示词——给大模型一段经纬度文本,问“Land or Water?”,重复 16200 次,再把每次的答案按坐标绘制成一张图。结果显示,模型能大致还原出全球海陆轮廓。Karpathy 的评价是“The models know”,并指出这种能力来自“压缩互联网”——也就是训练数据本身包含大量地理、地图与坐标相关信息。该帖发布时间为 2026 年 10 月 2 日,浏览量约 14.6 万,帖中还附带了一个网友整理的“所有 Claude 模型结果”链接。

为什么重要

这个测试的意义不在“模型会答地理题”,而在于它揭示了一种非显式的知识获取路径:没有人专门用海陆标注数据去训练模型,但模型在压缩互联网文本的过程中,间接建立了坐标到地理属性的映射。这为评测大模型的“世界知识”提供了一个低成本、可复现的思路——不需要标准数据集,只需一个二元问题和一张图。对闭源与开源模型来说,这类评测也能直观暴露知识覆盖的差异,甚至可能被开发者用来做模型选型的参考。

对用户/开发者/创作者的影响

对普通用户来说,这意味着大模型在旅行、物流、地图类问答中可能比预期更可靠,但也提醒使用者:模型的“知道”来自训练语料,边界和误差需要验证,不能当作权威地图 API 使用。对开发者而言,这类评测思路可以被复用为轻量 benchmark:用 API 批量调用模型,把输出结构化后做可视化,成本低、门槛也不高。对内容创作者,这类话题适合做“模型能力实测”系列,但要注意结论要基于可复现的提示词和样本量,避免拿个别错误放大成整体判断。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

目前公开信息显示,这只是单次社区评测,尚无官方基准或论文支撑,后续可观察三点:一是不同模型、不同语言提示下的准确率差异是否被系统整理;二是这类“隐式能力”是否会进入正规评测体系,比如地理知识维度的 benchmark;三是它是否会引发对训练数据来源与覆盖范围的更多讨论,尤其在数据合规日益重要的背景下。

来源:Follow Builders · X · Andrej Karpathy

celebrityanime
celebrityanime
文章: 26855

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注