Ask HN:LLM 有哪些简单的事情特别不擅长?

一位 HN 用户发起提问——哪些简单事你反复让 ChatGPT、Claude 做,它们却依然搞砸?讨论集中暴露了当前大模型在空间推理、精确关键词检索和提示词自我优化上的系统性短板,这些并非小缺陷,而是架构层面的能力盲区。

一句话看懂:一位 HN 用户发起提问——哪些简单事你反复让 ChatGPT、Claude 做,它们却依然搞砸?讨论集中暴露了当前大模型在空间推理、精确关键词检索和提示词自我优化上的系统性短板,这些并非小缺陷,而是架构层面的能力盲区。

事件核心:发生了什么

在 Hacker News 上,一个名为“Ask HN:LLM 有哪些简单的事情特别不擅长?”的帖子引发大量共鸣。用户们列举的具体失败场景包括:大模型无法独立绘制合理的户型图,即使给定房间节点图等详细约束,输出依然“毫无意义”;无法可靠执行关键词搜索,例如反复询问“NHL 多伦多比分”这类含精确字符串的查询,模型往往过度解读语义而忽略字面匹配;此外,大模型难以有效修改自己的提示词,有用户表示让 Claude 优化提示词反而越改越差,最终只能自己重写。

讨论中还提到一点:大模型似乎缺乏对空间和正交投影图的直觉理解。当用户指出错误时,模型能够快速修正,但无法在无监督情况下独立完成,监督成本甚至高于用户亲自动手。这些案例不来自单一模型,而是覆盖 ChatGPT、Claude Opus 等主流产品。

为什么重要

这些“简单任务”的失败揭示了一个深层问题:大模型的能力分布极度不均匀。它们在语义理解、知识问答上表现出色,却在需要精确符号匹配、空间推理或自我反思的场景中系统性失灵。这反驳了“模型越大越全能”的直觉。

对于行业而言,这意味着依赖 LLM 进行自动化流程设计(如语义搜索优化、CAD 辅助设计、自动提示词工程)的产品,需要为这些“低垂果实”任务保留传统算法或规则引擎作为兜底。纯 LLM 无法独立完成端到端的空间或精确检索工作流,这或将影响 Agent 类产品在垂直行业的落地预期。

对用户/开发者/创作者的影响

对普通用户:不要假设模型能理解精确的文字指令,关键词搜索请直接使用原生搜索引擎;对空间设计、制图类请求需降低期望,并做好多轮人工修正的准备。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对开发者:在设计 Agent 工作流时,应避免让 LLM 直接输出坐标、户型图或精确代码片段,建议将 LLM 用于方案评估与纠错,而非初始生成。同时,提示词优化不应依赖模型自行迭代,已有案例表明模型在自改提示词时容易引入噪声。

对创作者:大模型生成文本后往往包含冗余信息,若需精简,需用户主动进行多轮压缩,且不能完全交给更弱的模型处理,否则会丢失关键信息。

值得关注的后续

第一,是否有模型厂商针对空间推理推出专门的微调版本或工具调用接口,这将直接决定 CAD/室内设计工具链的 AI 化进度。

第二,搜索场景中,LLM 能否与关键词匹配算法更深度地协同(而非取代),值得观察后续主流搜索产品的行为变化。

第三,提示词工程目前缺乏高质量规范,社区能否沉淀出系统的测试集(如讨论中提到的“Pelican Benchmark”),将是衡量模型改进的重要信号。

来源:hackernews

celebrityanime
celebrityanime
文章: 20383

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注