
TextIn-7+1+N 产品架构

我们的针对性方案
大模型加速器 1 - 文档解析

Layout-engine,输出版面元素

Catalog-engine,输出文档结构树
技术路径
输入:整份文档的段落内容,以序列化形式传入模型
推理:
· 提取当前段落的embedding值
· 推理每个段落和上一个段落的关系,分为子标题、子段落、合并、旁系、主标题、表格标题
· 如果是旁系类型,则再往上找父节点,并判断其层级关系,直到找到最终的父节点
输出:基于每个段落的情况,构造该文档的文档树,并按JSON 结构输出(右图中未渲染段落节点)。

还原阅读顺序,不受复杂版面排版影响

解析效果评测

工程性能

应用场景1:大模型预训练语料与数据治理快速入库

实现方案

最佳实践:优化数据治理范式
使用场景:启信宝-招投标数据的数据清洗、治理
调用量:上百万页/天
价值:数据清洗的提效、提质工具
业务痛点:
(1) 招投标文档格式多样,PDF、扫描件、网页
(2) 文档内部有大量的表格结构,版面结构相对复杂
(3) 数据更新时效有较高要求,对文档处理速度及稳定性提出极高的要求。

应用场景2:知识库(RAG)

应用场景3 - 研报精细化阅读

应用场景4:文档结构化
合合信息Textin智能文档抽取产品,依托合合信息自研的垂直领域语义模型,并结合了合合信息强大的文字识别、文档解析、文档检索和文本生成四项关键技术,让计算机模拟人类的推理方式,来识别在训练阶段从未见过的新事物,实现开箱即用的“零样本”抽取,让AI触手可及。

应用场景4:文档结构化
准确理解复杂版面
非结构化文档抽取的瓶颈之一在于对文档复杂版面解析的准确性,例如文档中插入的各类复杂表格,对表格结构的准确还原是进行表格信息结构化抽取的前提。
非标准、横线缺失,双栏结构表格
版面分析引擎精准还原复杂表格
精准抽取表格字段

最佳实践:企业内部合同库建设
最佳实践:企业内部合同库建设

公司发展历程
上海合合信息科技股份有限公司 ,是行业领先的人工智能及大数据科技企业,致力于通过智能文字识别及商业大数据领域的核心技术、C端和B端产品以及行业解决方案为全球企业和个人用户提供创新的数字化、智能化服务。

持续领跑:125项发明专利


