tomai
登录
☁️ 云端 · 点数

OCR转可搜索PDF

把扫描件和纯图片PDF变成可搜索、可选中文字的PDF —— 支持10种语言

🪙 每个文件 2 积分 · 图片和PDF最多20页

服务器端 FFmpeg 支持任意格式——包括浏览器放不了的 HEVC/H.265。文件在 30 分钟内自动从服务器删除。

常见问题

这跟普通OCR工具有什么区别?

普通OCR工具给你的是识别出的文字,存成.txt文件。这个工具会保留原始页面画面完全不变,在下面加上一层看不见的文字层 —— 结果依然是一个看起来和原图一样的PDF,但现在可以选中、复制和搜索里面的文字了。

页面看起来会有变化吗?

不会 —— 看到的页面画面完全不变,只是在下面加了一层看不见的可搜索文字。

支持哪些语言?最多能处理多少页?

支持简体中文、繁體中文、英语、日语、韩语、法语、西班牙语、德语、俄语和葡萄牙语,单个文件最多20页。混合语言的文档可以选“中文 + English”这类组合选项。

OCR 会改变扫描件的外观吗?

不会——图像层逐字节保持原样,只是新增了一层隐藏的文字层,阅读器会对它建立索引,但从不显示出来。

OCR 管线细节

识别由 Tesseract 完成,覆盖 100 多种语言,并逐页检测所用文字体系:

如何使用

  1. 1

    上传扫描版PDF,或者一张文档的照片/截图。

  2. 2

    选择文档的语言(支持和英语混合识别)。

  3. 3

    下载可搜索的PDF —— 文字现在可以被选中、复制,也能用Ctrl+F搜索到。

让扫描件表现得像真正的文档

图片页面的下方会加上一层不可见但可搜索的文字层——复制粘贴和 Ctrl+F 都能用,画面本身分毫未动。

🔎

扫描件变得可搜索

扫描页在 PDF 里是图片,这个工具在其上叠加一层可搜索的文字层,让文件可以像数字文档一样被搜索。

📄

看不见的隐形文字层

文字以不可见的方式位于每一页下方,支持 Ctrl+F、选择和复制粘贴,而可见的扫描内容保持原样。

🔗

保留原始观感不变

一次任务最多处理 20 页图片或 PDF,输出保留原始版式,不会重新排版文档。

相关工具

什么是可搜索 PDF?

可搜索 PDF 外表和你的扫描件一模一样,但页面图像下方压着一层看不见的文字层,于是整份文档在任何 PDF 阅读器里都能搜索、选中和复制——页面画面则与原扫描件完全相同。这款工具用服务器端 OCR 构建这层文字:上传扫描图片或纯图片 PDF,从 10 种语言中选择,Tesseract 读取页面并写出新 PDF,把识别出的文字以不可见方式嵌入原始页面图像之下。它面向数字化纸质档案的档案员、扫描合同的律师和会计,需要账号并消耗积分。

这款工具能做什么

  • 给扫描件和纯图片 PDF 添加一层不可见但可选的文字层
  • 识别 10 种语言,从简繁中文到英语、日语、韩语、法语、西班牙语、德语、俄语和葡萄牙语
  • 原始页面画面保持原样——视觉上毫无变化
  • 多页文档一次处理,输出一份完整的可搜索 PDF
  • 在任意 PDF 阅读器中选中并复制文字
  • 从页面直接下载成品可搜索 PDF

什么时候会用到

  • 把扫描合同变成可按关键词搜索的文档
  • 为纸质文件和发票搭建可搜索的电子档案
  • 把扫描的课堂笔记转成可以引用原文的文档
  • 为搜索和引用准备扫描的表单或证据
  • 发给客户的 PDF 可以选中文字,而不是对着扫描件眯眼

隐私与限制:OCR 在网站 VPS 上运行——扫描件上传用于处理,任务结束后即被删除。需要账号,消耗积分。识别质量与来源一致:干净、端正、高对比度的扫描件能得到近乎完美的文字层;低质量或手写页面可能让隐藏文字层带上错误,重要文件转换后请务必核验。

最后更新 · 2026-09-01

相关工具