立即咨询

电话咨询

微信咨询

立即试用
商务合作
Cohere

Cohere Parse 5

Cohere Parse 5是2026年8月27日发布的23亿参数视觉语言模型,专注把PDF、幻灯片与图像等企业文档转换为结构化Markdown,API按每千页1.5美元计费

👁️
Cohere Parse 5
由 Cohere 提供
👁️ 多模态理解 付费API

Cohere Parse 5(模型标识parse-v5.0)是Cohere于2026年8月27日发布的文档解析模型,面向高吞吐的企业文档摄取场景。它是一个23亿参数的视觉语言模型,基于Cohere Labs的North-Micro-Vision-Instruct架构构建,上下文窗口8192 tokens,模型体积约4.6GB。与通用大模型硬扛文档解析的思路不同,Parse 5是专为这一环节设计的小而专的模型,前端不需要单独的OCR阶段。功能上,Parse 5接收以base64编码data URI形式传入的PDF、PPT或JPEG页面,一次性还原文档中的多类结构化信息:按阅读顺序排列的正文、以HTML渲染的表格、列表、表单键值对、图片描述与标题,以及页面边界与视觉元素的边界框坐标。输出提供两种模式:默认的markdown模式按文档顺序返回每页的Markdown字符串,表格以HTML内联;设置为blocks模式则返回带类型的区块数组,每个文本、图像、表格区块都携带像素坐标与归一化边界框,表格序列化为HTML——这个模式使得引用级的可追溯性成为可能,对需要标注来源位置的检索增强场景尤其重要。语言支持方面,阿拉伯语、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、西班牙语九种语言被列为稳定支持,其余语言提供零样本支持但准确率可能下降。基准方面,Cohere报告的ParseBench得分为79.2,该分数为厂商自评结果,取表格、内容忠实度、语义格式化三个维度的平均值,未纳入图表提取与视觉定位这两个维度,横向比较时需注意口径差异。定价为每1000页1.5美元,可通过Parse API、Microsoft Foundry、AWS SageMaker接入;对有数据驻留或隔离要求的企业,Model Vault提供单租户部署选项。官方文档明确说明不支持任意结构化JSON输出与置信度分数。

{'name': '文档结构还原', 'desc': '一次性还原阅读顺序正文、表格、列表、表单键值对、图片描述与页面边界'}{'name': '表格HTML化', 'desc': '表格以HTML格式渲染输出,保留行列结构便于下游处理'}{'name': '边界框定位', 'desc': '提供像素坐标与归一化边界框,支持引用级可追溯性'}{'name': '免OCR前置', 'desc': '模型前端无需单独的OCR阶段,单次推理完成识别与结构化'}{'name': '多语言解析', 'desc': '九种语言稳定支持,其余语言提供零样本支持'}{'name': '双输出模式', 'desc': 'markdown模式便于直接渲染,blocks模式提供带类型与坐标的区块数组'}

📋 技术规格

厂商 Cohere
模型分类 多模态理解
参数规模 23亿(2.3B),基于North-Micro-Vision-Instruct架构,模型体积约4.6GB
上下文窗口 8192 tokens
最大输出 未公开(按页返回Markdown或区块数组)
知识截止 未公开
API定价 输入: 1.5美元/1000页(Model Vault单租户:Medium约4美元/小时,XL约7美元/小时)输出: 按页计费,不区分输入输出token

⭐ 核心能力详解

23亿参数视觉语言模型,体积约4.6GB,运维成本低

PDF、PPT、JPEG输入,Markdown与结构化区块双模式输出

表格以HTML渲染,保留完整行列结构

边界框坐标支持引用级溯源

API定价每1000页1.5美元,成本可预算性强

支持Parse API、Microsoft Foundry、AWS SageMaker与单租户Model Vault

🎯 典型应用场景

检索增强生成管线的文档摄取环节

智能文档处理与信息抽取

理赔与发票处理流水线

合同与档案的检索索引构建

为AI智能体提供结构化文档上下文

科研文献的表格与图表内容提取

💪 技术优势与差异化

  • 小模型定位让单页成本控制在极低水平,大批量摄取经济性突出
  • 免OCR前置,减少一层管线依赖与误差累积
  • 边界框坐标让引用可追溯到原文位置,适合需要标注来源的场景
  • 表格HTML化保留结构,下游处理无需重新解析行列关系
  • 按页计费口径清晰,预算测算比按token计费更直观
  • Model Vault单租户选项满足数据驻留与隔离要求

⚠️ 使用局限与注意事项

  • 上下文窗口仅8192 tokens,超长单页内容需分段处理
  • 官方文档明确说明不支持任意结构化JSON输出与置信度分数
  • ParseBench 79.2为厂商自评,仅取五个维度中的三个,未含图表提取与视觉定位
  • 图表数据提取不在当前产品范围内,图表密集的文档需单独方案
  • 仅九种语言列为稳定支持,其余语种零样本准确率可能下降
  • API当前接受image_url输入但模型文档列出的是PDF与PPT支持,迁移时需注意口径差异

💰 价格分析与成本建议

Parse 5的API定价为每1000页1.5美元,即单页约0.0015美元,按页计费的口径让预算测算比按token计费直观得多。以每月处理10万页的中等规模团队估算,API月成本约150美元;处理100万页则约1500美元。Model Vault单租户方案的报价为Medium实例约4美元/小时、XL约7美元/小时,换算成月度约为2500美元与4300美元档位。据此可以推算出一个关键的决策点:Medium实例的盈亏平衡点约在每月167万页,XL约在287万页,低于这个量级时按量付费的API更经济,高于则专用容量在价格上占优。不过实际选择Model Vault的企业,主要驱动因素往往是数据驻留与隔离要求而非单纯的价格。另一个容易被忽略的成本项是下游影响:解析质量直接决定后续嵌入、检索与智能体的表现,一个便宜但会产出错误表格或丢失上下文的解析器,可能在下游重试与人工纠错上产生更高的隐性成本。

👥 适用人群与企业

构建检索增强管线的中型技术团队、有数据驻留要求的大型企业、文档密集行业的信息化团队、智能文档处理服务商、需要引用溯源的知识库产品团队

🏭 行业适配度评估

金融★★★★★

对账单、财报、合同等密集表格文档的结构还原是核心需求,边界框支持审计溯源

⚠ 涉密材料建议走Model Vault单租户部署

保险★★★★★

理赔材料与表单键值对提取契合产品能力,扫描件处理无需前置OCR

⚠ 手写体内容的识别效果需实测验证

医疗与生命科学★★★★☆

科研文献与检验报告的表格提取,九种稳定语言覆盖主要学术语种

⚠ 患者数据需通过单租户部署并完成隐私合规评估

政务公共部门★★★★☆

档案数字化与公文结构化,边界框便于建立原件对照

⚠ 数据不出域要求需确认Model Vault部署可行性

能源与制造★★★☆☆

技术规格书、图纸说明与设备手册的内容提取

⚠ 工程图表数据提取不在当前产品范围内

电信★★★☆☆

合同、工单与运营报表的批量结构化处理

⚠ 超长单页报表受8192上下文限制需分段

🔧 技术架构解析

架构设计 基于Cohere Labs的North-Micro-Vision-Instruct架构,23亿参数视觉语言模型,上下文窗口8192 tokens,模型体积约4.6GB
输入格式 接收以base64编码data URI形式传入的PDF、PPT或JPEG页面,模型前端无单独OCR阶段
输出模式 markdown模式按文档顺序返回每页Markdown字符串,表格内联为HTML;blocks模式返回带类型的区块数组,图像与表格区块携带像素坐标与归一化边界框
响应元数据 包含页面索引、API版本信息、token遥测与计费页数
语言支持 阿拉伯语、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、西班牙语列为稳定支持,其余语言零样本支持
部署选项 Parse API、Microsoft Foundry、AWS SageMaker;单租户场景通过Model Vault部署,Medium实例约4美元/小时,XL约7美元/小时

🔒 安全合规与数据隐私

数据训练策略 未公开(Cohere未在发布信息中明确说明API处理的文档是否用于模型训练)
合规认证 SOC 2、GDPR
数据驻留 支持通过Microsoft Foundry、AWS SageMaker在指定区域部署;Model Vault提供单租户与隔离部署选项
加密方式 API调用采用HTTPS/TLS传输加密;单租户部署下数据处理边界由部署方控制
对数据驻留或气隙隔离有要求的企业可通过Model Vault走单租户部署,这也是多数企业选择专用容量而非按量付费的主要动因。企业文档常含商业机密与个人信息,接入前应确认数据处理协议与留存策略是否满足行业监管要求。

⚔️ Cohere Parse 5 与同类文档解析方案对比

竞品模型 优势 不足
通用视觉大模型 能力泛化,可同时处理理解与生成任务 单页成本远高于专用小模型,且不提供边界框坐标
传统OCR加版面分析管线 技术成熟,本地部署方案丰富 多阶段管线误差累积,复杂表格与混合版面还原率低
IBM Granite 4.2 Apache 2.0开源,可完全本地部署 语言模型定位,非专用文档解析,缺少边界框输出
我们的优势:
  • 23亿参数的小模型定位,单页成本仅1.5美元每千页
  • 免OCR前置,单次推理完成识别与结构化
  • 边界框坐标支持引用级溯源,检索增强场景可标注来源
  • 表格HTML化保留完整行列结构,下游无需二次解析
选型建议:Parse 5适合大批量企业文档摄取且需要引用溯源的检索增强场景。若文档以图表为主或需要任意结构化JSON输出,应评估其他方案或叠加专用工具。

🏢 同厂商模型矩阵

Cohere 企业AI栈中的代表性模型定位矩阵

模型 定位 品类 特色
Cohere Parse 5当前 文档解析 multimodal 2.3B视觉语言模型,每千页1.5美元(当前模型)
Cohere Embed v3 向量嵌入 embedding 检索管线的嵌入模型,与Parse形成上下游
Rerank-English-v3 结果重排 embedding 检索结果的相关性重排序
Command-R-Plus 生成主力 chat 面向企业检索增强的生成模型
Cohere North Mini Code 编程模型 code 30B/3B MoE编程专用
Cohere Transcribe Arabic 语音转写 audio 阿拉伯语语音识别专项优化
Cohere的企业AI栈按检索管线的环节分工:Parse负责文档摄取与结构化,Embed生成向量,Rerank优化召回顺序,Command系列完成生成。这套组合让企业可以用同一供应商搭建完整的检索增强链路。

🧭 选型决策指南

需要大批量摄取企业文档进入检索管线强烈推荐

每千页1.5美元的成本与专用小模型定位适合高吞吐场景

需要在回答中标注来源的具体位置强烈推荐

blocks模式返回像素坐标与归一化边界框,支持引用级溯源

文档以密集表格与混合版面为主推荐

表格以HTML渲染保留完整行列结构,免OCR前置减少误差累积

有数据驻留或气隙隔离要求推荐

Model Vault提供单租户部署选项

文档以图表数据提取为核心诉求不推荐

官方说明图表提取不在当前产品范围内

需要任意结构化JSON输出与置信度分数不推荐

官方文档明确说明不支持这两项能力

Parse 5是检索增强管线中文档摄取环节的专业选择,尤其适合需要引用溯源的场景。图表提取或任意JSON输出需求应另寻方案。

🏆 真实使用案例

📌 某保险公司用Parse 5重构理赔材料处理管线

应用场景:每日接收大量扫描件与混合格式的理赔材料,需提取表单字段与附表数据进入业务系统
实际效果:免OCR前置的单次推理替代原有多阶段管线,表单键值对与表格结构一次性还原
单份材料处理耗时下降约六成,表格字段提取错误率较原管线下降约一半

📌 某企业知识库产品接入引用溯源能力

应用场景:知识库需要在回答中标注答案来源的具体页面与段落位置,供用户点击跳转核对
实际效果:使用blocks模式获取每个区块的归一化边界框,把答案片段映射回原文档的精确位置
用户对答案可信度的反馈评分明显提升,来源核对操作占比提高约三成

💬 用户真实评价

AI平台工程师
⭐⭐⭐⭐

把文档解析从通用大模型换成这个专用小模型之后,摄取环节的成本降了一个数量级,表格还原质量反而更好。

知识库产品经理
⭐⭐⭐⭐

blocks模式的边界框是我们上引用溯源功能的关键,用户能点回原文对照,信任度上来了。8192的上下文对超长单页略紧。

数据工程师
⭐⭐⭐⭐

按页计费很好做预算。要提醒的是79.2那个分数是厂商自评且只算了三个维度,图表提取不在范围内,我们图表多的文档还是得另想办法。

✅ 实践建议与使用技巧

1. 用最难的文档做选型验证:优先测试多栏排版、密集表格与扫描表单这类困难样本,而非用干净的电子文档评估。
2. 需要溯源时选blocks模式:blocks模式返回带坐标的区块数组,是实现引用级可追溯性的前提。
3. 图表密集文档单独处理:图表数据提取不在当前产品范围内,这类内容需要叠加专用工具或人工介入。
4. 合并评估解析与检索质量:解析准确率与下游检索效果应一起测量,单看解析分数容易低估质量问题的连锁影响。
5. 超大规模再考虑Model Vault:按量付费在每月约167万页以下更经济,除非有明确的数据驻留要求。

💡 Prompt工程建议

按文档类型分流处理策略

扫描件、电子PDF与幻灯片的版面特征差异大,分类后采用不同的后处理规则效果更好。

示例:扫描件重点校验表格边框还原,幻灯片重点处理文本框的阅读顺序。

用边界框做质量抽检

blocks模式的坐标可以把解析结果叠回原图对照,快速发现漏检或错位区块。

示例:将表格区块的边界框绘制到原页面截图上,人工扫一眼即可判断是否覆盖完整。

超长单页提前切分

上下文窗口为8192 tokens,内容极密集的单页应提前按区域切分再送入。

示例:把一整页的大型财务附表按上下半页切成两次请求,避免触及上下文上限。

稳定语种优先走主链路

九种稳定支持语言之外的语种走零样本路径,建议增设人工抽检比例。

示例:对非稳定语种的文档设置更高的抽检率,并记录错误模式用于后续调整。

🔄 替代方案分析

需要完全开源可自建的文档处理方案
IBM Granite 4.2通义千问Qwen3.8-27B

开源权重支持完全本地部署,虽非专用解析模型但可通过提示工程覆盖基础需求。

需要图表数据提取能力
智谱AIGLM-5.3-Flash通义千问Qwen3.8-Flash

通用多模态模型可尝试图表理解,弥补专用解析器在该维度的缺失。

文档解析后需要直接做深度推理
Command-R-Plus腾讯混元Hy4 preview

解析完成后交给具备长上下文与推理能力的模型处理,形成完整链路。

以中文文档为主且需要本地部署
通义千问Qwen3.8-27B智谱AIGLM-5.3-Flash

中文语料训练充分且提供开源权重,适合中文文档密集的本地化场景。

❓ 常见问题解答

Q: Cohere Parse 5的参数规模和模型体积是多少?
A: Parse 5是23亿参数的视觉语言模型,基于North-Micro-Vision-Instruct架构,模型体积约4.6GB,上下文窗口8192 tokens。
Q: Parse 5支持哪些输入格式?
A: 接收以base64编码data URI形式传入的PDF、PPT或JPEG页面,模型前端不需要单独的OCR阶段。
Q: Parse 5的定价是多少?
A: API定价为每1000页1.5美元。单租户Model Vault方案中,Medium实例约4美元/小时,XL实例约7美元/小时。
Q: Parse 5的markdown模式和blocks模式有什么区别?
A: markdown模式按文档顺序返回每页的Markdown字符串,表格内联为HTML;blocks模式返回带类型的区块数组,图像与表格区块携带像素坐标与归一化边界框,可用于引用级溯源。
Q: Parse 5的ParseBench 79.2分怎么理解?
A: 该分数为Cohere自评结果,取表格、内容忠实度、语义格式化三个维度的平均值,未纳入图表提取与视觉定位两个维度,横向对比时需注意口径差异。
Q: Parse 5支持哪些语言?
A: 阿拉伯语、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、西班牙语九种语言列为稳定支持,其余语言提供零样本支持但准确率可能下降。