开源文档解析引擎,把 PDF/Word/PPT/网页等非结构化文档清洗为可用的结构化数据。
Project story
Unstructured 解决 RAG 的第一公里:把 PDF、Word、PPT、图片、网页等非结构化文档自动解析为标题、段落、表格等结构化元素,并按类型智能切块,避免「一刀切」导致的语义割裂。
支持 OCR、表格抽取、多语言文档与图片,提供 Python 库与无代码平台,是数据清洗与知识库构建的常用前置组件。
适合场景:企业文档进知识库、合同与报表解析、多格式语料清洗。
上手方式:pip install unstructured,partition_pdf 等函数一行完成文档结构化。