5分钟给扫描PDF加上可搜索文本层OCRmyPDF完整指南【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDFOCRmyPDF 是一款开源 OCR 命令行工具为扫描版 PDF 添加文本层让原本无法搜索、无法复制的文档立即可检索。如果你经常处理纸质档案、旧论文或手机拍照文档跟着本文几分钟就能跑通它。 它解决的问题你大概遇到过这些情况在扫描版 PDF 里搜合同金额什么都搜不到因为整份文档只是图片扫描时页面倾斜识别工具的准确率大打折扣想长期保存的文件用的是普通 PDF字体和显示方式多年后可能失真。OCRmyPDF 针对性地解决这三件事它基于 Tesseract 引擎自动检测并纠正倾斜把文本层精确对齐到图像下方默认输出面向长期归档的 PDF/A 格式。 快速上手5分钟跑通第一条命令三大系统各给一条安装命令# macOS brew install ocrmypdf # Debian/Ubuntu以及 Windows 的 WSL apt install ocrmypdf # Windows 原生已装 Python 和 Tesseract py -m pip install ocrmypdf安装完成后运行你的第一次 OCRocrmypdf input.pdf output.pdf # 添加文本层默认输出 PDF/A 格式参数不清楚时用ocrmypdf --help查看全部选项说明。⚙️ 核心能力用 --deskew 一键摆正歪斜页面--deskew自动检测页面倾斜角度并旋转到水平--rotate-pages则修正横放扫描的页面方向。ocrmypdf --deskew --rotate-pages tilted.pdf straight.pdf效果原本歪斜几度的页面被完全摆正后续文字识别率明显提升。生成与图像对齐的可搜索文本层这是工具的核心价值原始扫描图像原样保留识别出的文字精确放在图像下方。你看到的画面不变但从此可以搜索、选中并复制文字原始图像的分辨率也完全不受影响。PDF/A 格式文档保存数十年仍可正常打开输出默认采用 PDF/AISO 19005 标准这是专为长期保存设计的格式确保文件几十年后依然能正常打开。处理过程中还会优化图像压缩输出文件经常比输入文件更小。多核并行处理大文档默认把工作分发到所有 CPU 核心可用--jobs调整并行数上千页的文档也能在可接受时间内处理完。进阶技巧多语言识别-l参数接受语言代码多语言用连接例如ocrmypdf -l engfra mixed.pdf mixed_ocr.pdf。共支持上百种语言需要先安装对应的 Tesseract 语言包方法见 docs/languages.md。图像清洁--clean去除扫描噪点--remove-background淡化有色背景两者配合适合处理泛黄的旧文档。同时导出纯文本追加--sidecar output.txt可随 PDF 一并输出一份纯文本方便二次编辑和数据分析。典型使用场景批量处理一整个文件夹的扫描档案放进 shell 循环即可自动处理全目录更多批量策略见 docs/batch.mdfor file in *.pdf; do ocrmypdf --deskew $file ocr_$file # 摆正后识别结果加 ocr_ 前缀 done手机拍摄的文档手机拍照常伴随倾斜--image-dpi还能提高识别分辨率ocrmypdf --deskew --rotate-pages --image-dpi 300 scan.jpg document.pdf扫描版论文加文本层对阅读体验要求高的文档追加--optimize可进一步压缩体积ocrmypdf --optimize 3 research.pdf research_ocr.pdf无论你是整理家庭老档案、归档合同票据还是批量识别扫描材料OCRmyPDF 都能派上用场。现在就装上它把手头第一份扫描件试试。更多参数说明见 docs/advanced.md。【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考