Cohere Parse 5(模型标识parse-v5.0)是Cohere于2026年8月27日发布的文档解析模型,面向高吞吐的企业文档摄取场景。它是一个23亿参数的视觉语言模型,基于Cohere Labs的North-Micro-Vision-Instruct架构构建,上下文窗口8192 tokens,模型体积约4.6GB。与通用大模型硬扛文档解析的思路不同,Parse 5是专为这一环节设计的小而专的模型,前端不需要单独的OCR阶段。功能上,Parse 5接收以base64编码data URI形式传入的PDF、PPT或JPEG页面,一次性还原文档中的多类结构化信息:按阅读顺序排列的正文、以HTML渲染的表格、列表、表单键值对、图片描述与标题,以及页面边界与视觉元素的边界框坐标。输出提供两种模式:默认的markdown模式按文档顺序返回每页的Markdown字符串,表格以HTML内联;设置为blocks模式则返回带类型的区块数组,每个文本、图像、表格区块都携带像素坐标与归一化边界框,表格序列化为HTML——这个模式使得引用级的可追溯性成为可能,对需要标注来源位置的检索增强场景尤其重要。语言支持方面,阿拉伯语、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、西班牙语九种语言被列为稳定支持,其余语言提供零样本支持但准确率可能下降。基准方面,Cohere报告的ParseBench得分为79.2,该分数为厂商自评结果,取表格、内容忠实度、语义格式化三个维度的平均值,未纳入图表提取与视觉定位这两个维度,横向比较时需注意口径差异。定价为每1000页1.5美元,可通过Parse API、Microsoft Foundry、AWS SageMaker接入;对有数据驻留或隔离要求的企业,Model Vault提供单租户部署选项。官方文档明确说明不支持任意结构化JSON输出与置信度分数。
📋 技术规格
| 厂商 | Cohere |
|---|---|
| 模型分类 | 多模态理解 |
| 参数规模 | 23亿(2.3B),基于North-Micro-Vision-Instruct架构,模型体积约4.6GB |
| 上下文窗口 | 8192 tokens |
| 最大输出 | 未公开(按页返回Markdown或区块数组) |
| 知识截止 | 未公开 |
| API定价 | 输入: 1.5美元/1000页(Model Vault单租户:Medium约4美元/小时,XL约7美元/小时)输出: 按页计费,不区分输入输出token |
⭐ 核心能力详解
23亿参数视觉语言模型,体积约4.6GB,运维成本低
PDF、PPT、JPEG输入,Markdown与结构化区块双模式输出
表格以HTML渲染,保留完整行列结构
边界框坐标支持引用级溯源
API定价每1000页1.5美元,成本可预算性强
支持Parse API、Microsoft Foundry、AWS SageMaker与单租户Model Vault
🎯 典型应用场景
检索增强生成管线的文档摄取环节
智能文档处理与信息抽取
理赔与发票处理流水线
合同与档案的检索索引构建
为AI智能体提供结构化文档上下文
科研文献的表格与图表内容提取
💪 技术优势与差异化
- 小模型定位让单页成本控制在极低水平,大批量摄取经济性突出
- 免OCR前置,减少一层管线依赖与误差累积
- 边界框坐标让引用可追溯到原文位置,适合需要标注来源的场景
- 表格HTML化保留结构,下游处理无需重新解析行列关系
- 按页计费口径清晰,预算测算比按token计费更直观
- Model Vault单租户选项满足数据驻留与隔离要求
⚠️ 使用局限与注意事项
- 上下文窗口仅8192 tokens,超长单页内容需分段处理
- 官方文档明确说明不支持任意结构化JSON输出与置信度分数
- ParseBench 79.2为厂商自评,仅取五个维度中的三个,未含图表提取与视觉定位
- 图表数据提取不在当前产品范围内,图表密集的文档需单独方案
- 仅九种语言列为稳定支持,其余语种零样本准确率可能下降
- API当前接受image_url输入但模型文档列出的是PDF与PPT支持,迁移时需注意口径差异
💰 价格分析与成本建议
Parse 5的API定价为每1000页1.5美元,即单页约0.0015美元,按页计费的口径让预算测算比按token计费直观得多。以每月处理10万页的中等规模团队估算,API月成本约150美元;处理100万页则约1500美元。Model Vault单租户方案的报价为Medium实例约4美元/小时、XL约7美元/小时,换算成月度约为2500美元与4300美元档位。据此可以推算出一个关键的决策点:Medium实例的盈亏平衡点约在每月167万页,XL约在287万页,低于这个量级时按量付费的API更经济,高于则专用容量在价格上占优。不过实际选择Model Vault的企业,主要驱动因素往往是数据驻留与隔离要求而非单纯的价格。另一个容易被忽略的成本项是下游影响:解析质量直接决定后续嵌入、检索与智能体的表现,一个便宜但会产出错误表格或丢失上下文的解析器,可能在下游重试与人工纠错上产生更高的隐性成本。
👥 适用人群与企业
构建检索增强管线的中型技术团队、有数据驻留要求的大型企业、文档密集行业的信息化团队、智能文档处理服务商、需要引用溯源的知识库产品团队
🏭 行业适配度评估
对账单、财报、合同等密集表格文档的结构还原是核心需求,边界框支持审计溯源
⚠ 涉密材料建议走Model Vault单租户部署
理赔材料与表单键值对提取契合产品能力,扫描件处理无需前置OCR
⚠ 手写体内容的识别效果需实测验证
科研文献与检验报告的表格提取,九种稳定语言覆盖主要学术语种
⚠ 患者数据需通过单租户部署并完成隐私合规评估
档案数字化与公文结构化,边界框便于建立原件对照
⚠ 数据不出域要求需确认Model Vault部署可行性
技术规格书、图纸说明与设备手册的内容提取
⚠ 工程图表数据提取不在当前产品范围内
合同、工单与运营报表的批量结构化处理
⚠ 超长单页报表受8192上下文限制需分段
🔧 技术架构解析
| 架构设计 | 基于Cohere Labs的North-Micro-Vision-Instruct架构,23亿参数视觉语言模型,上下文窗口8192 tokens,模型体积约4.6GB |
|---|---|
| 输入格式 | 接收以base64编码data URI形式传入的PDF、PPT或JPEG页面,模型前端无单独OCR阶段 |
| 输出模式 | markdown模式按文档顺序返回每页Markdown字符串,表格内联为HTML;blocks模式返回带类型的区块数组,图像与表格区块携带像素坐标与归一化边界框 |
| 响应元数据 | 包含页面索引、API版本信息、token遥测与计费页数 |
| 语言支持 | 阿拉伯语、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、西班牙语列为稳定支持,其余语言零样本支持 |
| 部署选项 | Parse API、Microsoft Foundry、AWS SageMaker;单租户场景通过Model Vault部署,Medium实例约4美元/小时,XL约7美元/小时 |
🔒 安全合规与数据隐私
| 数据训练策略 | 未公开(Cohere未在发布信息中明确说明API处理的文档是否用于模型训练) |
|---|---|
| 合规认证 | SOC 2、GDPR |
| 数据驻留 | 支持通过Microsoft Foundry、AWS SageMaker在指定区域部署;Model Vault提供单租户与隔离部署选项 |
| 加密方式 | API调用采用HTTPS/TLS传输加密;单租户部署下数据处理边界由部署方控制 |
⚔️ Cohere Parse 5 与同类文档解析方案对比
| 竞品模型 | 优势 | 不足 |
|---|---|---|
| 通用视觉大模型 | 能力泛化,可同时处理理解与生成任务 | 单页成本远高于专用小模型,且不提供边界框坐标 |
| 传统OCR加版面分析管线 | 技术成熟,本地部署方案丰富 | 多阶段管线误差累积,复杂表格与混合版面还原率低 |
| IBM Granite 4.2 | Apache 2.0开源,可完全本地部署 | 语言模型定位,非专用文档解析,缺少边界框输出 |
- 23亿参数的小模型定位,单页成本仅1.5美元每千页
- 免OCR前置,单次推理完成识别与结构化
- 边界框坐标支持引用级溯源,检索增强场景可标注来源
- 表格HTML化保留完整行列结构,下游无需二次解析
🏢 同厂商模型矩阵
Cohere 企业AI栈中的代表性模型定位矩阵
| 模型 | 定位 | 品类 | 特色 |
|---|---|---|---|
| Cohere Parse 5当前 | 文档解析 | multimodal | 2.3B视觉语言模型,每千页1.5美元(当前模型) |
| Cohere Embed v3 | 向量嵌入 | embedding | 检索管线的嵌入模型,与Parse形成上下游 |
| Rerank-English-v3 | 结果重排 | embedding | 检索结果的相关性重排序 |
| Command-R-Plus | 生成主力 | chat | 面向企业检索增强的生成模型 |
| Cohere North Mini Code | 编程模型 | code | 30B/3B MoE编程专用 |
| Cohere Transcribe Arabic | 语音转写 | audio | 阿拉伯语语音识别专项优化 |
🧭 选型决策指南
每千页1.5美元的成本与专用小模型定位适合高吞吐场景
blocks模式返回像素坐标与归一化边界框,支持引用级溯源
表格以HTML渲染保留完整行列结构,免OCR前置减少误差累积
Model Vault提供单租户部署选项
官方说明图表提取不在当前产品范围内
官方文档明确说明不支持这两项能力
🏆 真实使用案例
📌 某保险公司用Parse 5重构理赔材料处理管线
📌 某企业知识库产品接入引用溯源能力
💬 用户真实评价
把文档解析从通用大模型换成这个专用小模型之后,摄取环节的成本降了一个数量级,表格还原质量反而更好。
blocks模式的边界框是我们上引用溯源功能的关键,用户能点回原文对照,信任度上来了。8192的上下文对超长单页略紧。
按页计费很好做预算。要提醒的是79.2那个分数是厂商自评且只算了三个维度,图表提取不在范围内,我们图表多的文档还是得另想办法。
✅ 实践建议与使用技巧
💡 Prompt工程建议
按文档类型分流处理策略
扫描件、电子PDF与幻灯片的版面特征差异大,分类后采用不同的后处理规则效果更好。
用边界框做质量抽检
blocks模式的坐标可以把解析结果叠回原图对照,快速发现漏检或错位区块。
超长单页提前切分
上下文窗口为8192 tokens,内容极密集的单页应提前按区域切分再送入。
稳定语种优先走主链路
九种稳定支持语言之外的语种走零样本路径,建议增设人工抽检比例。
🔄 替代方案分析
开源权重支持完全本地部署,虽非专用解析模型但可通过提示工程覆盖基础需求。
通用多模态模型可尝试图表理解,弥补专用解析器在该维度的缺失。
解析完成后交给具备长上下文与推理能力的模型处理,形成完整链路。
中文语料训练充分且提供开源权重,适合中文文档密集的本地化场景。








首页 



