OCR It——从无法复制的文档中提取文本,供您的LLM使用

GitHub 上出现了一款名为 OCR It 的开源 Chrome 扩展,它能把扫描书、幻灯片、PDF 等无法复制文字的“页码文档”,通过本地 OCR 转成纯文本,再直接交给 Claude、ChatGPT 等大模型使用。整个过程无需联网,也不上传任何图像数据。

GitHub 上出现了一款名为 OCR It 的开源 Chrome 扩展,它能把扫描书、幻灯片、PDF 等无法复制文字的“页码文档”,通过本地 OCR 转成纯文本,再直接交给 Claude、ChatGPT 等大模型使用。整个过程无需联网,也不上传任何图像数据。

AMD 宣布其机架级 AI 系统能效已比 2024 年基线提升约 4 倍,超过原定 3 倍的阶段目标。这意味着到 2030 年,同样的电力可以支撑 20 倍的 AI 计算量,但行业总耗电量未必会下降。

开发者 l3a0 发布了一款名为 Kindle Highlights 的 Claude Code 技能,能从亚马逊 Kindle 笔记本页面完整导出被官方限制截断或隐藏的高亮笔记,实测在四本书中恢复了 815 条被阻止导出的记录。

Hacker News 上有讨论声称大模型可能利用推理引擎漏洞控制宿主机,但多位技术人员指出该说法在技术细节上站不住脚,尤其在多 GPU 集群架构下,攻击路径和动机都缺乏可信解释。

Simon Willison 发布了大模型命令行工具 LLM 的 Anthropic 插件新版本 0.27,主要面向开发者优化了 Claude 模型的使用体验。这类工具迭代虽小,却反映出大模型 API 调用正在向更轻量、更工程化的方向演进。

一位加州父亲用 ChatGPT 的语音模式为两个女儿搭建了专属 AI 家教,专门辅导数学和拼写。半年后,孩子的成绩单从“略低于期望”转为“高于期望”,AI 在家教场景中展示出可落地的实用价值。

Y Combinator 最新一期(P26)孵化的 Autostep 正在公开招聘 AI/全栈工程师和 Chief of Staff,招聘信息出现在 Hacker News 上。这条招聘本身透露了 AI 创业公司在早期阶段对技术岗位和核心管理岗位的双重需求。

一款名为 Instinct 的 AI 个人助理在私下测试中展现出极强的任务执行能力,但其过度宽泛的用户数据授权条款和薄弱的安全模型引发业内担忧。这起事件将“AI 助手到底该有多大权限”的问题再次摆上台面。

斯坦福经济学家团队分析近 3000 万份 LinkedIn 档案发现,职场人正大规模“回填”AI 技能关键词,同时删除远程办公和 DEI 相关表述,以迎合雇主对 AI 人才的需求。

传奇音乐制作人 Dr. Dre 公开表示自己正在使用 AI 工具辅助歌曲制作,并认为反对 AI 创作的人与当年抵制鼓机、合成器的人类似。这一表态将 AI 音乐生成从“技术争议”推向主流行业话语权中心。