DS4SD/docling 项目安装与配置指南

DS4SD/docling 项目安装与配置指南

docling Get your documents ready for gen AI docling 项目地址: https://gitcode.com/gh_mirrors/do/docling

项目概述

DS4SD/docling 是一个功能强大的文档处理工具包,主要用于文档转换和光学字符识别(OCR)处理。该项目基于Python开发,支持多种OCR引擎,能够在不同操作系统和硬件架构上运行。

基础安装

安装DS4SD/docling非常简单,只需使用Python包管理工具执行以下命令:

pip install docling

该工具包支持以下平台:

  • macOS (包括Intel和Apple Silicon芯片)
  • Linux (各种发行版)
  • Windows

支持的处理器架构:

  • x86_64 (传统64位架构)
  • arm64 (如Apple M系列芯片)

高级安装选项

PyTorch依赖的特殊配置

DS4SD/docling的部分功能依赖于PyTorch深度学习框架。根据您的硬件配置,可能需要选择特定的PyTorch版本:

  1. 仅CPU支持的Linux系统安装:
pip install docling --extra-index-url https://download.pytorch.org/whl/cpu
  1. macOS Intel处理器特殊配置: 由于新版PyTorch(2.6.0+)不再提供Intel Mac的预编译包,需要指定兼容版本:
pip install "docling[mac_intel]"

注意:PyTorch 2.2.2要求Python版本不高于3.12

OCR引擎配置

DS4SD/docling支持多种OCR引擎,每种引擎都有其特点和适用场景:

默认引擎:EasyOCR

  • 安装:随Docling自动安装
  • 特点:开箱即用,支持多种语言

可选引擎及安装方法

  1. Tesseract OCR

    • 系统级安装:
      • macOS: brew install tesseract leptonica pkg-config
      • Debian系: apt-get install tesseract-ocr tesseract-ocr-eng libtesseract-dev
      • RHEL系: dnf install tesseract tesseract-devel tesseract-langpack-eng
    • 环境变量配置:
      export TESSDATA_PREFIX=/your/tessdata/path/
      
  2. Tesserocr链接库

    • 优化安装方式:
    pip uninstall tesserocr
    pip install --no-binary :all: tesserocr
    
  3. ocrmac (仅macOS)

    • 安装:pip install ocrmac
    • 要求:macOS 10.15+,使用Apple Vision框架
  4. RapidOCR

    • 安装:pip install rapidocr_onnxruntime
    • 特点:轻量高效
  5. OnnxTR

    • 安装:pip install "docling-ocr-onnxtr[cpu]"
    • 特点:基于ONNX运行时

引擎选择示例代码

from docling.datamodel.base_models import ConversionStatus, PipelineOptions
from docling.datamodel.pipeline_options import PipelineOptions, EasyOcrOptions, TesseractOcrOptions
from docling.document_converter import DocumentConverter

# 配置管道选项
pipeline_options = PipelineOptions()
pipeline_options.do_ocr = True
pipeline_options.ocr_options = TesseractOcrOptions()  # 使用Tesseract引擎

# 创建文档转换器实例
doc_converter = DocumentConverter(
    pipeline_options=pipeline_options,
)

开发环境搭建

如需参与DS4SD/docling的开发,需要设置开发环境:

poetry install --all-extras

此命令会安装所有开发依赖和可选功能,为代码贡献做好准备。

常见问题解决方案

  1. PyTorch兼容性问题

    • 确认Python版本与PyTorch要求匹配
    • 根据处理器架构选择合适的PyTorch版本
  2. Tesseract安装问题

    • 确保正确设置了TESSDATA_PREFIX环境变量
    • 路径末尾必须包含斜杠(/)
  3. OCR引擎选择

    • 对于一般用户,EasyOCR是最简单的选择
    • 需要更高精度时,可考虑Tesseract
    • macOS用户可优先尝试ocrmac以获得最佳性能

通过本文的指导,您应该能够顺利完成DS4SD/docling的安装和基本配置。根据您的具体需求选择合适的OCR引擎,可以充分发挥该工具包的文档处理能力。

docling Get your documents ready for gen AI docling 项目地址: https://gitcode.com/gh_mirrors/do/docling

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

郎轶诺

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值