shawky.nasr 发表于 2026-9-2 20:00:09

OCRAIHub (多引擎 AI OCR 文档解析工具)

本帖最后由 shawky.nasr 于 2026-9-2 20:00 编辑

OCRAIHub (多引擎 AI OCR 文档解析工具)







OCRAIHub 是一款功能强大的多引擎桌面端 GUI 应用程序。它利用世界上最先进的视觉语言模型 (VLM),能够从图像和 PDF 中高精度地提取文本、Markdown 表格、数学公式和图表,实现完美的文档数字化。

目前支持 Gemini (2.5/3.7) 和 百度 PaddleOCR-VL (1.6)、合合信息 TextIn (v1 xparse) 和 MinerU (vlm)。
推荐用 3.5-flash-lite 或 3.1-flash-lite,任何模型需要API Key

核心功能

[*] 多引擎支持: 在 Google Gemini API 和百度 AI Studio PaddleOCR 接口之间无缝切换。

[*]智能 Markdown 格式化: 完美重构文档排版,包括标题、段落、复杂表格和 LaTeX 数学公式。

[*]原生 PDF 与页面切分:

[*] 本地模式: 使用 PyMuPDF 在本地将 PDF 转换为图像,支持高级图像预处理(Otsu 二值化 & 形态学降噪)。

[*] 原生模式(百度): 将原始 PDF 文件直接发送至云端引擎进行原生解析。

[*]自动下载插图: 自动检测、裁剪并下载文档中的图表、图片,保存至本地文件夹。

[*]✂️ 智能分栏切割: 智能分割多栏文档(如词典或学术论文),防止文本混版。

[*]自动保存与批量处理: 自动处理包含上百张图片的文件夹或超大 PDF 书籍,内置 API 频率限制处理机制,并自动保存为 .md 或 .csv 格式。


下载:官方项目

百度云盘 :**** Hidden Message *****

**** Hidden Message *****

特别鸣谢 klwo2 大,自 2 月份起持续协助在 Windows 环境下进行深度测试与 Bug 排查,为软件的跨平台稳定性做出了重要贡献!

人在上海 发表于 2026-9-2 20:57:14

感谢制作分享!

winn 发表于 2026-9-3 00:44:40

感谢分享。

RickVincent 发表于 2026-9-3 06:23:00

Thanks for sharing...

saw2021 发表于 2026-9-3 07:32:32

谢谢制作分享

江湖侠客 发表于 2026-9-3 09:27:48

谢谢S大分享

chigre3 发表于 2026-9-3 10:35:38

谢谢分享。

jmhqlw 发表于 2026-9-3 19:43:57

感谢楼主分享。

nanhw 发表于 2026-9-4 08:57:24

辛苦楼主了!

TJV 发表于 2026-9-9 15:56:03

谢谢分享
页: [1]
查看完整版本: OCRAIHub (多引擎 AI OCR 文档解析工具)