首页
/
行业洞察
/
正文
INDUSTRY INSIGHT · 深度
Umi-OCR离线OCR指南:从截图识别到扫描转可搜索PDF
📅 2026/10/7 9:52:35
✍️ 爱科研究院
👁 阅读 3,247
Umi-OCR离线OCR指南从截图识别到扫描转可搜索PDF【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款免费、开源、离线的 OCR 文字识别工具不联网也能用解压即用。它覆盖三个核心能力屏幕截图识别、批量图片转文本、扫描件转可搜索 PDF。整理文字资料的办公用户、想把识别接进脚本的开发者都适用。快速上手下载.7z发布包或.7z.exe自解压包解压到固定目录——无需安装。双击Umi-OCR.exe启动界面会按系统语言自动切换。打开默认的「截图OCR」标签按页面提示的快捷键唤起截图。框选屏幕上的文字区域等待识别完成。在左侧预览栏划选复制或到右侧「记录」面板编辑后再复制——懒得截图的话把别处复制的图片直接粘贴进来也行。三个典型场景把屏幕里的字抠出来网页、PDF 阅读器里的文字选不中、复制不出来时用它把看到的区域直接变成文本。打开「截图OCR」标签按快捷键截图。拖出文字区域等待识别完成。双栏报刊式文档把排版解析方案切到「多栏-按自然段换行」。代码截图选「单栏-保留缩进」——行首空格原样保留。结果一段排版顺序正确的文本横排、竖排都能处理可直接粘贴进文档。一文件夹照片批量转文本手机拍的一整文件夹讲义照片要逐张转成文字存档时。打开「批量OCR」标签把图片文件夹直接拖进去。在右栏勾选输出格式txt、jsonl、md、csv(Excel)可多选同时保存。图片有水印时在「忽略区域」编辑器里用右键画矩形包住水印位置。点「开始任务」可设置任务完成后自动关机/待机。结果与每张图一一对应的文本文件jpg、png、webp、bmp、tif等格式均可几百张一次跑完没有数量上限。扫描件变成能搜索的PDF纯扫描版 PDF 用 CtrlF 搜不到字需要归档检索时。打开「文档识别」标签拖入文档——支持pdf、xps、epub、mobi、fb2、cbz。输出勾选「双层可搜索PDF」。每页有页眉页脚时在「忽略区域」里用右键画框把页脚条包住。提交任务进度条逐页推进。结果与原文件同名的双层可搜索 PDF版式不变文字可搜索、可复制文档自带文本层的则直接提取不重复 OCR。设置对照设置项什么时候要动在哪里动调完的效果限制图像边长识别超大长图、大图前识别页 → 设置 → 文字识别大图不再被压缩截断结果完整排版解析方案处理多栏文档或代码截图时截图/批量页「文本后处理」换行顺序正确缩进保留OCR引擎插件想对比速度或准确率时全局设置 → 切换OCR插件在 Rapid 与 Paddle 两套离线引擎间切换语言/模型库要识别外语时OCR插件设置勾选对应语言即可识别——勾得越多内存占用越高渲染器老显卡出现截图闪烁、UI错位时全局设置 → 界面和外观 → 渲染器换渲染方案或关硬件加速界面恢复正常日志保存级别排查问题想留证据时全局设置标签页日志保存到UmiOCR-data/logs目录避坑速查批量识别大长图结果不完整。原因默认开启了图像边长限制超出部分被压缩或截断。 解决把「限制图像边长」的数值调高。识别结果里总有水印、页眉页脚混进来。原因没画忽略区域或框没包住整个文本块——机制是框内整个文本块被跳过而不是单个字符。 解决用右键画矩形把水印可能出现的所有位置完全框住。脚本里调命令行收不到识别结果。原因umi-ocr依赖本地 HTTP 接口通信系统的、|重定向会失效。 解决改用--output file.txt写文件完整用法见 docs/README_CLI.md。Linux 老系统启动报错。原因运行库依赖不满足。 解决选用release/开头的稳定版本Linux 侧要求 glibc 2.31 以上Debian 11、Ubuntu 20。文档与源码当前稳定版本为v2.1.52025.3.26新增日志机制与--reload配置重载指令完整沿革见 CHANGE_LOG.md。功能说明以 README.md 为准命令行与 HTTP 接口手册分别在 docs/README_CLI.md 和 docs/http/README.md——HTTP 接口可以传 Base64 图片直接识别适合写自动化脚本。需要源码时git clone --single-branch --branch main https://gitcode.com/GitHub_Trending/um/Umi-OCR注意main、dev分支可能含有开发中的不稳定功能日常使用请拿 release 版本或发行版压缩包。遇到 Bug 直接在项目 Issue 页面提交界面翻译通过 Weblate 平台协作已覆盖英文、繁中、日文、俄语等十余种语言也欢迎译者参与。解压一个发行版先框一次截图你会发现离线 OCR 离你的工作流只差一个快捷键 【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
📌 标签:
工业官网
设计趋势
AI 建站
SEO
获取完整报告 →
RELATED ARTICLES
推荐阅读
2026/10/7 9:52:35
【爱她就为她买龙虾】Open Claw 搭建使用全图文流程:从零到跑通的 TaoToken 配置实录
2026/10/7 9:47:34
openrig:把角色绑定变成可拆解、可复用的开源工程资产
2026/10/7 9:47:34
落地页首屏图片自适应分辨率(srcset)与 AVIF 格式压榨实录
2026/10/7 10:37:42
长江岷江沱江SHP数据加载与坐标系修复指南
2026/10/7 10:37:42
测控链路:从传感器到上位机
2026/10/7 10:37:42
Windows进程间通信完全指南:共享内存与命名管道实战解析
2026/10/7 10:37:42
PyCharm安装教程:Windows下Python开发环境配置与使用指南
2026/10/7 10:37:42
PyTorch DDP分布式训练全解析:机制、调优与踩坑实践
2026/10/7 10:32:41
Unity次世代写实手游渲染实战:URP管线与移动端性能优化
2026/10/7 0:01:56
基于sEMG与IMU的手语手势识别:从数据采集到实时部署避坑指南
2026/10/7 0:01:56
装配车间MES落地指南:SimpleMES工单流转、BOM与齐套检查实战
2026/10/7 0:01:56
AI获客怎样减少重复线索?意客AI的原文复用与版本筛选
2026/10/6 15:41:36
Jev+Agent接管浏览器:browser-use实战与jev-ultrafast性能优化
2026/10/7 9:55:49
多智能体集群实战:DeepAgents编排、MCP与A2A协议及Skills体系
2026/10/6 13:15:25
hindsight:面向LLM应用的事后可观测性工程实践
2026/10/6 21:51:29
我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频
2026/10/6 22:05:33
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证
2026/10/6 22:06:19
2026 大模型集体涨价:用 Python 做企业 Token 成本测算与选型避坑(附配置)