glm-ocr: failed to fully read image, stopped with “done”: false

当 glm-ocr 或其它 OCR/文本补全模型输出的内容里含有大量连续重复 token(例如书籍习题里成排的句点“.”)时,Ollama 的“token repeat limit”循环检测会被误触发,提前中止生成并返回 "done": false 。优先排查模型输出中是否存在这类重复串,而不是先怀

当 glm-ocr 或其它 OCR/文本补全模型输出的内容里含有大量连续重复 token(例如书籍习题里成排的句点“.”)时,Ollama 的“token repeat limit”循环检测会被误触发,提前中止生成并返回 "done": false 。优先排查模型输出中是否存在这类重复串,而不是先怀

这个报错通常出现在用 ollama launch claude 启动 Claude Code 并长时间对话、上下文逐渐填满时。Claude Code 侧按自己的默认上下文窗口做统计,而 Ollama 服务端实际只加载了更小的 num_ctx ,两者不一致,服务端就会截断输入。优先排查 Ollama

Anthropic 研究员 Jacob Coxon 本周公开辞职,称头部 AI 公司正像“失控列车”一样推进模型,并声称“造 AI 的人真心相信它可能在本十年内灭掉人类”;Anthropic 一位安全高管随后基本认同这一判断,把 AI 末日论再次推上舆论中心。

Meta 新推出的 AI agent 应用 Muse 上线后在美国 iOS 下载约 8.3 万次,冲到 App Store 总榜第二;但相比 Threads、Meta AI 和 ChatGPT 的同期表现,这个开局明显更慢,说明 agent 类产品的用户教育成本可能被低估。

Anthropic 为 Claude Code 发布 v2.1.268,重点强化了自托管网关的计费与访问控制能力,同时修掉了一个让第三方 Anthropic 兼容端点全部请求失败的高危回归问题。对依赖 Claude Code 做企业部署和 API 兼容接入的团队来说,这次更新更多是“止损+补管理能力”。

OpenAI 因新模型 Astra 需求过大,暂时关闭每月 200 美元的 Pro 订阅入口,以缓解算力压力。这是少见的“有钱也先别买”的供给端动作,说明顶级推理模型的算力瓶颈正在直接影响商业化节奏。

OpenAI 把支撑 Codex 的 Agent 工具链(业内常称为 Codex harness)封装成 Agents API 并进入公开测试,开发者一次 API 调用就能调用完整的代理执行能力,而不必自己搭建工具调度、执行循环和状态管理。

好莱坞演员马克·沃尔伯格将在 2026 年 10 月 13 日至 15 日登上 TechCrunch Disrupt 舞台,但聊的不是新片,而是他如何从演员转型为投资人,以及为什么把医疗健康和 wellness 创业赛道作为下一阶段的重点。

英伟达 CEO 黄仁勋在高盛科技会议上重申,公司下一财年营收有望同比增长约 70%,按分析师预期本财年约 4000 亿美元计算,明年营收可能逼近 6800 亿美元。这一判断的关键不是 GPU 卖得好,而是英伟达认为自己已经嵌入 AI 产业链的每一环。

NVIDIA 公布了面向生物分子推理的 BioNeMo Inference Runtime(BioIR),在 8 张 H100 上跑 Boltz-2 折叠模型时吞吐提升到 2.90 倍,达到每 GPU 小时 58.5K 残基。它说明 AI 蛋白质结构预测的竞争,正从“模型精度”转向“推理效率与单位算力产出”。