Umi-OCR:把截图和扫描件变成可编辑文字的免费离线 OCR 指南
发布时间:2026/8/31 14:26:08 作者:尧图编辑部 阅读量:1,286

Umi-OCR把截图和扫描件变成可编辑文字的免费离线 OCR 指南【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR截图里的文字点不了扫描版 PDF 搜不到关键词纸质资料数字化靠手打——这三件事大概是日常办公里最耗时间的琐碎工作。Umi-OCR 是一款免费、开源的离线 OCR 工具解压即用不联网也能识别支持框选截图识别、批量导入图片、把扫描文档转成双层可搜索 PDF顺带能扫和生成二维码。它运行在 Windows 7 x64 和 Linux x64 上主程序就是一个Umi-OCR.exe。️ 功能总览五个标签页五类识别需求Umi-OCR v2 的界面由一组可自由开关的标签页组成每个标签页对应一类任务标签页输入解决什么问题输出截图 OCR框选截图、粘贴图片从软件界面、网页、电子书中取文字可编辑文本可复制到剪贴板批量 OCR本地图片批量导入jpg, jpe, jpeg, jfif, png, webp, bmp, tif, tiff无数量上限一次处理几百张图txt, jsonl, md, csv(Excel)文件文档识别pdf, xps, epub, mobi, fb2, cbz扫描版文档无法检索双层可搜索 PDF可再提取纯文本二维码含码图片支持一图多码读取/生成 QRCode、条码等 19 种协议的码文本内容 / 二维码图片全局设置—引擎切换、语言、主题、快捷键、开机自启—和常见的在线识别服务不同Umi-OCR 的所有识别都在本机完成图片内容不经过网络处理含敏感信息的文档时这一点比较关键。除了图形界面它还提供命令行和 HTTP 接口两种调用方式接口手册分别在 docs/README_CLI.md 和 docs/http/README.mdHTTP 接口默认监听本地端口 1224。软件内置 PaddleOCR 和 RapidOCR 两套离线识别引擎可在全局设置中切换。界面语言跟随系统自动选择也支持简体中文、繁体中文、英语、日语、葡萄牙语、俄语等多种语言手动切换 安装与首次运行从解压到复制出第一段文字下载并解压发行版。发布包为.7z压缩包或.7z.exe自解压包下载入口在 README.md 的「下载发行版」一节。解压后应能看到Umi-OCR.exe、umi-ocr.sh和UmiOCR-data目录。直接运行主程序。双击Umi-OCR.exe即可启动Linux 下运行umi-ocr.sh。预期看到主窗口弹出顶部有「截图OCR / 批量OCR / 全局设置」等标签页全程不需要安装步骤、不需要联网。确认一次基础设置。打开「全局设置」页按需调整语言、主题、字体大小也可以一键创建桌面快捷方式或设置开机自启。做一次截图识别。在「截图OCR」标签页按下截图快捷键屏幕变暗后框选一段带文字的区域。预期看到右侧「记录」栏出现识别出的文本带有时间和置信度。把结果拿走。在记录栏右键选择「复制」到任意输入框粘贴。预期看到纯文本可直接编辑。️ 三个典型场景从输入到输出场景一从屏幕里抠文字截图 OCR输入屏幕上任意一段文字网页、电子书、软件界面都行也支持在别处复制图片后粘贴进来识别。操作按快捷键框选区域识别完成后可编辑、划选多条记录。输出文本留在右侧记录栏右键复制即可带走也可以导出到文件。场景二批量识别一个文件夹的图片输入一个目录里的几十到几百张图片格式见上表。操作在「批量OCR」页点击「选择图片」在「设置」里勾选保存格式txt / md / csv 等和输出目录点「开始任务」。输出每张图旁生成对应的结果文件界面显示逐文件的耗时与置信度任务完成后可选择自动关机或待机。场景三扫描版 PDF 变成可搜索 PDF输入扫描件、影印本等没有文本层的pdf也支持xps, epub, mobi, fb2, cbz。操作在「文档识别」页添加文件如果每页都有页眉页脚水印可先设置忽略区域启动任务。输出双层可搜索 PDF——视觉上与原文件一致但新增的文本层可以被选中、搜索、复制。接口层面的流程说明见 docs/http/api_doc.md。⚙️ 进阶调优四个值得了解的参数1. 排版解析方案文本后处理识别引擎输出的是一堆文本块排版解析负责把它们排成顺次阅读的顺序同时自动处理横排和竖排从右到左方案适用情况效果多栏-按自然段换行默认大部分文档截图自动区分多栏按自然段换行多栏-总是换行 / 无换行需要强制断行或连成一行控制段落合并粒度单栏-保留缩进代码截图保留行首缩进和行中空格不做处理需要引擎原始输出每段语句换行不排序识别代码截图时用「单栏-保留缩进」得到的文本能保住原有缩进结构2. 限制图像边长批量页「设置 → 文字识别 → 限制图像边长」默认 960 像素超过的图片会被压缩后再识别速度快但精度略降。遇到像素很大的长图识别不全时把数值调高到 2880、4320 或「无限制」。3. 忽略区域批量 OCR 页右栏可打开忽略区域编辑器按住右键画若干矩形框框内的整个文本块会在任务中被跳过。注意框要画得足够大、完全包住水印可能出现的位置否则只去掉部分文字。文档识别页同样支持用来排除页眉页脚很合适。4. 纠正文本方向识别参数中开启后倾斜或倒置的文本也能被摆正再识别代价是速度变慢。扫描件拍摄歪斜时再开常规扫描件不必开。 常见问题速查现象截屏时窗口闪烁、界面错位。原因默认启用了显卡加速渲染个别机器不兼容。解决办法全局设置 →「界面和外观」→「渲染器」切换渲染方案或关闭硬件加速。现象超大长图识别慢或结果缺字。原因默认边长限制 960 像素大图被压缩。解决办法批量页设置中调高「限制图像边长」的数值。现象识别结果里混进水印、页眉页脚的文字。原因这些区域的文本块也被引擎识别了。解决办法用忽略区域画框排除记住被忽略的是框内的完整文本块框画小了可能只生效一部分。现象命令行指令没有反应。原因命令行依赖本地 HTTP 服务与后台进程通信服务被关闭或用的是备用启动器如UmiOCR-data/RUN_GUI.bat。解决办法确认全局设置中允许 HTTP 服务默认开启、主机选「仅本地」并用主程序Umi-OCR.exe作为调用入口指令查询用umi-ocr --help。现象HTTP 接口偶尔报ECONNREFUSED。原因后端组件并发支持较弱长时间大批量连续调用有小概率出错。解决办法避免并发调用重新发起请求即可接口注意事项见 docs/http/README.md。适合谁下一步做什么Umi-OCR 适合经常要从截图里复制文字、需要把一批扫描文档数字化、又希望数据留在本机的人Windows 7 以上的老机器也能跑。它不太适合这两类需求追求 macOS 版本目前只支持 Windows 7 x64 与 Linux x64以及以复杂手写体为主要识别对象的场景效果会打折扣。下一步可以做三件事先按本文走一遍批量识别的完整流程把「截图OCR」页的快捷键绑到顺手的位置如果想把识别嵌进自己的脚本从 docs/README_CLI.md 的--path、--output两条指令开始试起。版本变化可以看 CHANGE_LOG.md。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考