OCR It——从无法复制的文档中提取文本,供您的LLM使用

GitHub 上出现了一款名为 OCR It 的开源 Chrome 扩展,它能把扫描书、幻灯片、PDF 等无法复制文字的“页码文档”,通过本地 OCR 转成纯文本,再直接交给 Claude、ChatGPT 等大模型使用。整个过程无需联网,也不上传任何图像数据。

一句话看懂:GitHub 上出现了一款名为 OCR It 的开源 Chrome 扩展,它能把扫描书、幻灯片、PDF 等无法复制文字的“页码文档”,通过本地 OCR 转成纯文本,再直接交给 Claude、ChatGPT 等大模型使用。整个过程无需联网,也不上传任何图像数据。

事件核心:发生了什么

OCR It 是一个新发布的 Chrome 扩展,主要解决“看得到文字但选不中、复制不了”的阅读场景。用户只需要用快捷键 ⌥⇧R 划定一次屏幕上的文字区域,之后按 ⌥⇧S 就能对当前页面截图并调用内置的 Tesseract 引擎执行 OCR,识别结果会追加到一份持续累积的文本记录中。

更进阶的用法是自动模式:用户设置好“翻页按钮”后,按 ⌥⇧A 扩展会自动循环执行“截图 → OCR → 翻页”,直到翻完整本电子书或幻灯片。识别结果可以一键复制或下载为 .txt 文件,方便直接导入大模型进行摘要、搜索或问答。

项目主页显示,OCR 完全在本地运行,扩展不发出任何网络请求,不需要 API key,安装时也不申请站点访问权限。仓库已提交全部代码,无构建步骤,npm install 仅用于跑测试或重新内置 Tesseract。

为什么重要

目前主流大模型主要接收文本输入,但大量真实世界的知识仍封存在扫描版 PDF、旧书、企业内部的文档阅读器、幻灯片等“文字不可选”的格式里。OCR It 提供了一条极简的本地化 pipeline,把这种封闭内容转成给 LLM 的“高质量投喂”文本,在未解决的技术痛点上给出了一个务实的补丁方案。

它的定位也很清晰:专门为配合大模型使用而设计,而不是传统意义上的文档管理工具。本地 OCR 加上“零外联数据”的特性,对需要处理敏感或版权受限文档的个人用户和机构也具备一定吸引力。该项目以开源方式发布,允许任何人审计代码逻辑,这在处理隐私敏感数据时是个加分项。

此外,它巧妙地绕过了跨域 iframe 和 Shadow DOM 对传统自动化脚本的限制——不用脆弱的 CSS 选择器,而是记录屏幕坐标“点”来定位翻页按钮,这一设计在产品思路和技术实现上都有一定参考价值。

对用户/开发者/创作者的影响

对普通用户:如果你经常需要从试读版电子书、行业报告 PDF 或在线课程幻灯片里摘取内容,OCR It 能大幅减少手动打字或截图的重复劳动。由于所有处理都在本机完成,不用担心文档内容被上传到第三方服务器。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对开发者:这是一个不错的开源参考案例,展示了如何在 Chrome 扩展中低成本集成本地 OCR,以及如何用“坐标点”而非选择器去操作那些被 iframe 或 Shadow DOM 包裹的复杂页面元素。项目无需构建步骤、依赖打包完整的设计也降低了二次开发门槛。

对创作者/研究者:处理扫描版文献或旧资料时,OCR It 可以把几百页不可搜索的 PDF 变成可喂给 Claude、ChatGPT 的文本文件,极大方便了文献综述、资料检索和信息提取流程。需注意,识别区域会包含页码和页眉,后续可能需要简单清理。

值得关注的后续

1. 准确率与维护节奏:Tesseract 对印刷体中文的识别效果不如商业 OCR 服务,后续是否支持更换更强大的本地模型(如 PaddleOCR)值得关注。

2. 翻页自动化的稳定性:项目依赖“屏幕坐标点”定位翻页按钮,这种方式在窗口缩放、页面缩放或响应式布局变化时会失效,开发者是否会引入更智能的元素匹配策略尚未可知。

3. 扩展生态的跟进:OCR It 是否会被整合进更全面的“网页转数据”工具链,或吸引其他开源作者开发类似本地优先的 AI 数据管道,目前公开信息显示仍处于早期阶段。

来源:github.com

celebrityanime
celebrityanime
文章: 20077

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注