返回顶部
热门问答 更多热门问答
技术文章 更多技术文章

港大新作:多模态RAG,支持图、文、表、公式等8种文档格式

[复制链接]
链载Ai 显示全部楼层 发表于 半小时前 |阅读模式 打印 上一主题 下一主题

RAG-Anything能处理和查询包含文本、图像、表格、公式等多模态内容的复杂文档的图RAG。

是在LightRAG基础上扩展的,LightRAG也真是火爆17.8K星了。

RAG-Anything继承了LightRAG架构,整体如下:

  • 文档解析阶段

    • 集成 MinerU 文档解析框架

    • 自动识别并提取文档中的文本块、图像、表格、公式等异构元素,保持元素间的语义关联关系。

    • 支持PDF、Office文档系列(DOC/DOCX/PPT/PPTX/XLS/XLSX)、图像等主流格式的统一处理与标准化输出。

  • 多模态内容理解与处理

    • 通过自主分类路由机制实现异构内容的智能识别与优化分发。

    • 自动识别、分类并将不同内容类型路由至优化的执行通道。

    • 通过专用处理流水线实现文本和多模态内容的并发执行。这种方法在保持内容完整性的同时最大化吞吐效率。

  • 多模态分析

    • 为自定义和新兴内容类型提供可配置的处理框架
    • 通过插件架构实现新模态处理器的动态集成
    • 支持专用场景下处理流水线的运行时配置
    • 高精度解析复杂数学表达式和公式

    • 提供原生LaTeX格式支持以实现与学术工作流的无缝集成

    • 建立数学方程与领域特定知识库间的概念映射

    • 对表格和结构化数据格式进行系统性解释

    • 实现数据趋势分析的统计模式识别算法

    • 识别多个表格数据集间的语义关系和依赖性

    • 图像分析和内容识别

    • 视觉语义生成上下文感知的描述性标题

    • 提取视觉元素间的空间关系和层次结构

    • 视觉内容分析,包括:

    • 结构化数据分析

    • 数学表达式解析

    • 可扩展模态

  • 创建多模态知识图谱

    • 多模态实体提取:将重要的多模态元素转换为结构化知识图谱实体。该过程包括语义标注和元数据保存。

    • 跨模态关系映射:在文本实体和多模态组件之间建立语义连接和依赖关系。通过自动化关系推理算法实现这一功能。

    • 层次结构保持:通过"归属于"关系链维护原始文档组织结构。这些关系链保持逻辑内容层次和章节依赖关系。

    • 加权关系评分:为关系类型分配定量相关性分数。评分基于语义邻近性和文档结构内的上下文重要性。

  • 多模态检索

    • 向量-图谱融合:集成向量相似性搜索与图遍历算法。该方法同时利用语义嵌入和结构关系实现全面的内容检索。

    • 模态感知排序:实现基于内容类型相关性的自适应评分机制。系统根据查询特定的模态偏好调整排序结果。

    • 关系一致性维护:维护检索元素间的语义和结构关系。确保信息传递的连贯性和上下文完整性。


回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

链载AI是专业的生成式人工智能教程平台。提供Stable Diffusion、Midjourney AI绘画教程,Suno AI音乐生成指南,以及Runway、Pika等AI视频制作与动画生成实战案例。从提示词编写到参数调整,手把手助您从入门到精通。
  • 官方手机版

  • 微信公众号

  • 商务合作

  • Powered by Discuz! X3.5 | Copyright © 2025-2025. | 链载Ai
  • 桂ICP备2024021734号 | 营业执照 | |广西笔趣文化传媒有限公司|| QQ