OCR转可搜索PDF
把扫描件和纯图片PDF变成可搜索、可选中文字的PDF —— 支持10种语言
服务器端 FFmpeg 支持任意格式——包括浏览器放不了的 HEVC/H.265。文件在 30 分钟内自动从服务器删除。
⚠️ 处理完成前请不要关闭或刷新此页面,否则可能无法获取处理结果。
💡 大文件按你自己网络的速率传输:上传会自动继续、可安全断点续传,网速慢只影响时间,绝不会影响你的积分。
常见问题
这跟普通OCR工具有什么区别?
普通OCR工具给你的是识别出的文字,存成.txt文件。这个工具会保留原始页面画面完全不变,在下面加上一层看不见的文字层 —— 结果依然是一个看起来和原图一样的PDF,但现在可以选中、复制和搜索里面的文字了。
页面看起来会有变化吗?
不会 —— 看到的页面画面完全不变,只是在下面加了一层看不见的可搜索文字。
支持哪些语言?最多能处理多少页?
支持简体中文、繁體中文、英语、日语、韩语、法语、西班牙语、德语、俄语和葡萄牙语,单个文件最多20页。混合语言的文档可以选“中文 + English”这类组合选项。
OCR 会改变扫描件的外观吗?
不会——图像层逐字节保持原样,只是新增了一层隐藏的文字层,阅读器会对它建立索引,但从不显示出来。
OCR 管线细节
识别由 Tesseract 完成,覆盖 100 多种语言,并逐页检测所用文字体系:
- 文字层定位——识别出的词精确覆盖在对应像素之上,选中高亮和你看到的完全吻合。
- 混合语言——可选一种主语言外加英语兜底,双语扫描件逐页处理。
- 已有文字则跳过——本身就含真实文字的页面原样通过,不会被重复处理。
如何使用
- 1
上传扫描版PDF,或者一张文档的照片/截图。
- 2
选择文档的语言(支持和英语混合识别)。
- 3
下载可搜索的PDF —— 文字现在可以被选中、复制,也能用Ctrl+F搜索到。
让扫描件表现得像真正的文档
图片页面的下方会加上一层不可见但可搜索的文字层——复制粘贴和 Ctrl+F 都能用,画面本身分毫未动。
扫描件变得可搜索
扫描页在 PDF 里是图片,这个工具在其上叠加一层可搜索的文字层,让文件可以像数字文档一样被搜索。
看不见的隐形文字层
文字以不可见的方式位于每一页下方,支持 Ctrl+F、选择和复制粘贴,而可见的扫描内容保持原样。
保留原始观感不变
一次任务最多处理 20 页图片或 PDF,输出保留原始版式,不会重新排版文档。
相关工具
什么是可搜索 PDF?
可搜索 PDF 外表和你的扫描件一模一样,但页面图像下方压着一层看不见的文字层,于是整份文档在任何 PDF 阅读器里都能搜索、选中和复制——页面画面则与原扫描件完全相同。这款工具用服务器端 OCR 构建这层文字:上传扫描图片或纯图片 PDF,从 10 种语言中选择,Tesseract 读取页面并写出新 PDF,把识别出的文字以不可见方式嵌入原始页面图像之下。它面向数字化纸质档案的档案员、扫描合同的律师和会计,需要账号并消耗积分。
这款工具能做什么
- 给扫描件和纯图片 PDF 添加一层不可见但可选的文字层
- 识别 10 种语言,从简繁中文到英语、日语、韩语、法语、西班牙语、德语、俄语和葡萄牙语
- 原始页面画面保持原样——视觉上毫无变化
- 多页文档一次处理,输出一份完整的可搜索 PDF
- 在任意 PDF 阅读器中选中并复制文字
- 从页面直接下载成品可搜索 PDF
什么时候会用到
- 把扫描合同变成可按关键词搜索的文档
- 为纸质文件和发票搭建可搜索的电子档案
- 把扫描的课堂笔记转成可以引用原文的文档
- 为搜索和引用准备扫描的表单或证据
- 发给客户的 PDF 可以选中文字,而不是对着扫描件眯眼
隐私与限制:OCR 在网站 VPS 上运行——扫描件上传用于处理,任务结束后即被删除。需要账号,消耗积分。识别质量与来源一致:干净、端正、高对比度的扫描件能得到近乎完美的文字层;低质量或手写页面可能让隐藏文字层带上错误,重要文件转换后请务必核验。
最后更新 · 2026-09-01