OCRAIHub (多引擎 AI OCR 文档解析工具)
本帖最后由 shawky.nasr 于 2026-9-2 20:00 编辑OCRAIHub (多引擎 AI OCR 文档解析工具)
OCRAIHub 是一款功能强大的多引擎桌面端 GUI 应用程序。它利用世界上最先进的视觉语言模型 (VLM),能够从图像和 PDF 中高精度地提取文本、Markdown 表格、数学公式和图表,实现完美的文档数字化。
目前支持 Gemini (2.5/3.7) 和 百度 PaddleOCR-VL (1.6)、合合信息 TextIn (v1 xparse) 和 MinerU (vlm)。
推荐用 3.5-flash-lite 或 3.1-flash-lite,任何模型需要API Key
核心功能
[*] 多引擎支持: 在 Google Gemini API 和百度 AI Studio PaddleOCR 接口之间无缝切换。
[*]智能 Markdown 格式化: 完美重构文档排版,包括标题、段落、复杂表格和 LaTeX 数学公式。
[*]原生 PDF 与页面切分:
[*] 本地模式: 使用 PyMuPDF 在本地将 PDF 转换为图像,支持高级图像预处理(Otsu 二值化 & 形态学降噪)。
[*] 原生模式(百度): 将原始 PDF 文件直接发送至云端引擎进行原生解析。
[*]自动下载插图: 自动检测、裁剪并下载文档中的图表、图片,保存至本地文件夹。
[*]✂️ 智能分栏切割: 智能分割多栏文档(如词典或学术论文),防止文本混版。
[*]自动保存与批量处理: 自动处理包含上百张图片的文件夹或超大 PDF 书籍,内置 API 频率限制处理机制,并自动保存为 .md 或 .csv 格式。
下载:官方项目
百度云盘 :**** Hidden Message *****
**** Hidden Message *****
特别鸣谢 klwo2 大,自 2 月份起持续协助在 Windows 环境下进行深度测试与 Bug 排查,为软件的跨平台稳定性做出了重要贡献!
感谢制作分享! 感谢分享。 Thanks for sharing... 谢谢制作分享 谢谢S大分享 谢谢分享。 感谢楼主分享。 辛苦楼主了! 谢谢分享
页:
[1]