LLM OCR Bob 插件是一款新一代智能 OCR 工具,它突破了传统 OCR 技术的限制,利用大型语言模型 (LLM) 实现了对复杂文档的精准识别。该插件支持混合内容识别(如文本、公式、表格)、多栏排版解析,并且能够完整地保持原始文档的结构。
传统的 OCR 插件(例如百度 OCR)存在以下局限性:
- 难以处理复杂排版(如双栏、纵向排列等)
- 难以识别混合内容(如文本、公式、表格)
- 无法保持原始文档的结构
特色功能
- 多模态解析: 精准识别技术文档、学术论文中的公式、代码和表格。
- 智能排版: 自动处理双栏、纵向排列等复杂版式。
- 多模型支持: 兼容 OpenAI、Gemini 以及支持 OpenAI 格式的大模型 API。
- 格式输出: 支持 Markdown、纯文本以及自定义模板导出。
确实好