
Umi-OCR v2是一款功能强大、使用灵活的开源OCR软件。作为Umi-OCR的全新版本,v2在保留原有优势的基础上进行了全面升级,为用户提供了更加便捷高效的文字识别体验。
Umi-OCR v2继承了Umi-OCR的核心优势:
同时,v2版本还带来了诸多亮点:
这些特性让Umi-OCR v2成为一款功能全面且易用的OCR工具软件。无论是日常使用还是二次开发,都能满足用户的多样化需求。
Umi-OCR v2采用了全新的标签页式界面设计,主要包含以下几个功能页面:
截图OCR页面支持快捷键截图并识别图片中的文字。用户可以通过左侧的图片预览面板选择和复制文本,右侧的识别记录面板则可以编辑文本并多选复制记录。此外,该功能还支持从其他地方复制图片并粘贴到Umi-OCR中进行识别。
批量OCR页面支持批量导入本地图片进 行识别。识别结果可以保存为txt、jsonl、md、csv(Excel)等多种格式。该功能还支持"文本后处理"技术,可以智能识别并合并属于同一自然段落的文本。此外,批量OCR还提供了忽略区域功能,可以排除图片中不需要识别的水印等内容。
文档OCR是v2版本新增的功能,支持对PDF等文档格式进行OCR识别。这大大扩展了软件的应用场景,特别是对于需要处理大量PDF文档的用户来说非常实用。
二维码功能页面集成了二维码的识别和生成功能。用户可以通过截图、粘贴或拖拽本地图片来读取二维码和条形码,支持在一张图片中识别多个码。同时,该功能还支持生成多种协议的二维码图片,并可调整错误纠正等参数。
全局设置页面允许用户调整软件的各项参数,包括添加快捷方式、设置自启动、更改界面语言和主题、调整字体大小等。用户还可以在这里切换OCR插件,以及调整渲染方案来解决可能出现的屏幕闪烁或UI错位问题。
除了基本的OCR功能外,Umi-OCR v2还提供了一些高级特性:
OCR结果的段落合并功能可以让识别出的文本更加易读易用。软件提供了多种预设方案:
批量OCR中的忽略区域功能允许用户在识别前排除图片中的特定区域,比如水印或LOGO。用户可以通过鼠标右键绘制多个矩形框,框内的文字在任务中将被忽略。
Umi-OCR v2提供了命令行和HTTP API两种调用方式,方便开发者将OCR功能集成到自己的项目中。详细的API使用说明可以在项目文档中找到。
Umi-OCR是一个开源项目,欢迎社区成员参与贡献。项目支持多语言界面,目前已有简体中文、英语、日语等语言版本。开发者可以通过Weblate平台参与软件的本地化翻译工作。
此外,Umi-OCR还提供了插件系统,允许用户和开发者扩展软件功能。目前已有多个OCR引擎插件可供选择,用户可以根据需求进行切换。
Umi-OCR v2作为一款全面升级的开源OCR软件,不仅保留了免费、离线、高效的核心优势,还通过全新的界面设计和功能扩展,为用户提供了更加便捷和强大的文字识别体验。无论是个人用户还是开发者,都能在Umi-OCR v2中找到适合自己需求的OCR解决方案。
随着项目的持续更新和社区的积极参与,相信Umi-OCR v2将会在未来带来更多令人期待的功能和改进。对于需要进行文字识别的用户来说,Umi-OCR v2无疑是一个值得尝试的优秀工具。


全球首个AI音乐社区
音述AI是全球首个AI音乐社区,致力让每个人都能用音乐表达自我。音述AI提供零门槛AI创作工具,独创GETI法则帮助用户精准定义音乐风格,AI润色功能支持自动优化作品质感。音述AI支持交流讨论、二次创作与价值变现。针对中文用户的语言习惯与文化背景进行专门优化,支持国风融合、C-pop等本土音乐标签,让技术更好地承载人文表达。


阿里Qoder团队推出的桌面端AI智能体
QoderWork 是阿里推出的本地优先桌面 AI 智能体,适配 macOS14+/Windows10+,以自然语言交互实现文件管理、数据分析、AI 视觉生成、浏览器自动化等办公任务,自主拆解执行复杂工作流,数据本地运行零上传,技能市场可无限扩展,是高效的 Agentic 生产力办公助手。


一站式搞定所有学习需求
不再被海量信息淹没,开始真正理解知识。Lynote 可摘要 YouTube 视频、PDF、文章等内容。即时创建笔记,检测 AI 内容并下载资料,将您的学习效率提升 10 倍。


为AI短剧协作而生
专为AI短剧协作而生的AniShort正式发布,深度重构AI短剧全流程生产模式,整合创意策划、制作执行、实时协作、在线审片、资产复用等全链路功能,独创无限画布、双轨并行工业化工作流与Ani智能体助手,集成多款主流AI大模型,破解素材零散、版本混乱、沟通低效等行业痛点,助力3人团队效率提升800%,打造标准化、可追溯的AI短剧量产体系,是AI短剧团队协同创作、提升制作效率的核心工具。


能听懂你表达的视频模型
Seedance two是基于seedance2.0的中国大模型,支持图像、视频、音频、文本四种模态输入,表达方式更丰富,生成也更可控。


国内直接访问,限时3折
输入简单文字,生成想要的图片,纳米香蕉中文站基于 Google 模型的 AI 图片生成网站,支持文字生图、图生图。官网价格限时3折活动

