旧OCR文本拖累语言模型训练,FineBooks 想要大规模解决这个问题。

Hugging Face 与 EleutherAI 合作发起 FineBooks 项目,实测 14 款开源 OCR 模型后发现,当前最优模型能以不到每千页 2 美元的成本,把历史书籍扫描文本的字符准确率提升到 97% 以上,足以改善大模型训练数据的质量,但也还不能直接用于学术研究。

Hugging Face 与 EleutherAI 合作发起 FineBooks 项目,实测 14 款开源 OCR 模型后发现,当前最优模型能以不到每千页 2 美元的成本,把历史书籍扫描文本的字符准确率提升到 97% 以上,足以改善大模型训练数据的质量,但也还不能直接用于学术研究。

<section class="cge-quick-answer" data

Meta CEO 马克·扎克伯格发布了一篇超过 6500 字的 AI 宣言,系统阐述了 Meta 在超级智能 AI 时代的战略方向:推动数据中心建设获得社区支持、开放 AI 模型、减少训练数据限制,并加强与美国政府在安全审查上的协作。这篇宣言既是面向公众的愿景陈述,也是 Meta 在 AI 竞赛中争取政策与舆…

OpenAI 于 2026 年 8 月 10 日致函得克萨斯州州长 Greg Abbott,承诺在该州推动“负责任的 AI 基础设施建设”,并寻求与地方政府、公用事业公司和社区合作,为后续的算力与数据中心项目铺路。

GitHub 宣布将在 2026 年 8 月起移除“自定义线程订阅”功能,将其合并为简单的订阅/不订阅模式;如果你正在用它管理 AI 项目协作或大模型仓库的 issue 通知,后续需要改用其他筛选方式。

国际货币基金组织和英国央行相继警告AI可能冲击金融系统稳定,汇丰、巴克莱等机构开始设立AI主管或加入监管试点,金融机构正被迫从“尝试AI”转向“为AI建立可审计、可追溯的治理体系”。

华为在无锡举办的数据存储论坛上,发布了面向大规模 AI 推理的全栈数据基础设施方案,并提出业界首个 G3.5 上下文记忆存储概念。这意味着存储设备正在从“存放数据”的传统角色,进入模型推理和 Agent 运行的实时路径。

宇树科技(Unitree)今日在A股正式启动申购,成为“人形机器人第一股”。发行价150.80元/股,对应总市值约610亿元,市盈率高达219倍,显示资本市场正以极高估值押注人形机器人从实验室走向量产。

2026年8月,Artificial Analysis发布的最新文本生成视频模型评测中,前十名有九个来自中国AI实验室。这一结果意味着中国团队在视频生成这个AI核心赛道上已形成明显集群优势,并可能为下一阶段的世界模型研发积累关键能力。

当外界普遍担忧外包岗位被 AI 取代时,菲律宾外包产业反而借助 AI 工具持续扩张,并开始承接 AI 模型训练、AI 代理监督等更高价值的工作,说明 AI 对外包的影响不是简单替代,而是重新划分工作内容。