模型整体架构与mBART类似,遵循vision-encoder-decoder架构,这点和之前字节开源的dolphin架构类似。
版式分析识别的标签:标题、节、图例、索引、脚注、列表、表格、参考文献、图像
权重(已支持vllm推理):https://huggingface.co/nvidia/NVIDIA-Nemotron-Parse-v1.1