本帖最后由 shawky.nasr 于 2026-9-2 20:00 编辑
6 O. W0 e3 K" |/ ?7 d0 q/ n: G' ^3 s2 ?+ ~/ U
, v- y% Y. G7 M
9 W0 D" b2 ]2 u6 b% @$ t
5 H, c/ J5 Q$ Q. G @% n) ?7 G
0 d0 _7 m0 x+ m/ N' o
y- v( b$ J7 T; \, D% z
& m2 S0 D6 n/ n8 j
# H$ S8 y0 v- k. t8 \$ P+ B) A. r; f |+ I- N( k3 b
OCRAIHub 是一款功能强大的多引擎桌面端 GUI 应用程序。它利用世界上最先进的视觉语言模型 (VLM),能够从图像和 PDF 中高精度地提取文本、Markdown 表格、数学公式和图表,实现完美的文档数字化。: X# Q& r0 x! S4 q0 a
' M, ?5 \4 m# a3 ^6 E目前支持 Gemini (2.5/3.7) 和 百度 PaddleOCR-VL (1.6)、合合信息 TextIn (v1 xparse) 和 MinerU (vlm)。 " w& o7 H+ b: g- w7 K C7 A; @
推荐用 3.5-flash-lite 或 3.1-flash-lite,任何模型需要API Key
! h! `' N6 ]9 ^4 L$ m0 S/ K$ f8 W; o; J' N: P6 k9 x
核心功能 ( D% @' x* p1 I" m
- 多引擎支持: 在 Google Gemini API 和百度 AI Studio PaddleOCR 接口之间无缝切换。
/ Y# X% ` @! e) e4 v6 ]) J - 智能 Markdown 格式化: 完美重构文档排版,包括标题、段落、复杂表格和 LaTeX 数学公式。
1 [; [1 m7 ]1 I, \6 \5 H! O - 原生 PDF 与页面切分:0 ^6 Y; R. E- ^& o9 N( V
- 本地模式: 使用 PyMuPDF 在本地将 PDF 转换为图像,支持高级图像预处理(Otsu 二值化 & 形态学降噪)。
' E u* C& U- `0 B6 B - 原生模式(百度): 将原始 PDF 文件直接发送至云端引擎进行原生解析。* Z/ I8 I4 d2 a% y& g' [. u
- 自动下载插图: 自动检测、裁剪并下载文档中的图表、图片,保存至本地文件夹。* z g1 t, h# z- H- V
- ✂️ 智能分栏切割: 智能分割多栏文档(如词典或学术论文),防止文本混版。
. w$ k `8 T+ t" F" z - 自动保存与批量处理: 自动处理包含上百张图片的文件夹或超大 PDF 书籍,内置 API 频率限制处理机制,并自动保存为 .md 或 .csv 格式。2 \% f+ T6 c! l( i& F. `$ _
% T5 C: q; P0 o" e/ r4 d
: R4 g- Y2 Q$ E6 \下载:官方项目
& \7 B, o+ X2 R+ D) [
: m1 j0 y9 ?$ N) H/ e百度云盘 : ! d8 i- W2 U- _ C4 v
( c5 e0 O. y% w _5 h$ L% H# F
8 l8 k0 n; g- p) {! o! k
$ P/ }$ x: Q: K X; J4 B
特别鸣谢 klwo2 大,自 2 月份起持续协助在 Windows 环境下进行深度测试与 Bug 排查,为软件的跨平台稳定性做出了重要贡献!7 T8 I6 u/ D& I w* b* A
# H& _' R6 q0 y7 C( H |