
发展历程
腾讯云OCR凭借持续的技术迭代、行业深度适配及生态协同能力,已成为全球OCR领域的头部玩家。其从通用场景到垂直行业的扩展路径,为AI技术商业化提供了典型范例。

产品系列
支持通用文字识别、卡证文字识别、票据单据识别、文档智能共4大类,覆盖不同行业场景。

什么地方需要文字识别OCR?
从图像中检测并识别文字,转换为可编辑的文本,有效地代替人工录入信息。商用场景复杂多变。

文字识别OCR抽取场景及特性分析

技术演变过程 - OCR深度学习模型
· 检测->识别->结构化多阶段各阶段错误累积 难以突破检测识別难点
· 不具各阅读理解&推理能力模型指标上限低;
· 不同场景下模型能力无法复制定制成本高。

技术演变过程 - OCR多模态大模型

产品方案的演进

通用文字识别产品优势
能力全面:支持中英文、日语、韩语、西班牙语、法语、德语等多语言,以及阿拉伯数字及常用符号等的识别,并不断更新迭代模型,扩充支持的广度。
准确率高:支持图片中文字的自动定位和识别,印刷体整体识别准确率达95%以上,手写体达90%以上,1保证99.5%以上产品可用性。
鲁棒性强:支持多场景、任意版面、任意背景,可容忍透视畸变、光照不均等复杂场景,并可实现自动裁边、修正倾斜等。


卡证识别产品优势
鲁棒性强,准确率:支持模糊、可容忍透视畸变、光照不均等复杂场景,实现自动裁边、修正倾斜等功能,复杂场景中自测识别准确率达99%以上
场景丰富,服务稳定:服务金融、政务、交通出行、互联网等各行业客户,并应用于微信、QO、等内部业务,接受了海量用户和复杂场景的考验;
方式灵活,接入便捷:支持公有云API调用、私有云、移动端SDK等多种服务形式,适应不同客户需求,并提供多语言SDK供开发者使用。

卡证识别产品优势

卡证识别产品优势
OCR SDK,提供iOS和Android版移动端SDK,支持丰富的功能参数配置和多种拍照模式帮助开发者快速集成身份证等卡证识别能力开发应用,大幅降低开发成本。

票据单据识别产品优势
针对增值税发票、购车发票等票据类文件的识别服务,支持票据关键字段的精准提取与结构化输出,适配财务报销、税务管理等场景。


票据单据识别产品优势

票据单据识别产品优势
算法技术优势:在复杂场景 (模糊昏暗、畸变旋转、印章干扰、打印错位等) 下鲁棒性强,支持 26+ 细分票种,字段精度可达 98%,可快速轻量开发接入。

票据单据识别产品优势
混贴多页秒级返回
混合、拼贴和多页PDF同步识别 (最多支持30页中拼贴发票同步返回),只需要秒级耗时,将大量的发票信息快速地准确识别和结构化。

票据单据识别产品优势
支持票据信息核验
· 支持发票的准确性核验,通过输入发票关键字段提供所需的验证信息,返回真实的票面相关信息,包括发票代码、发票号码、开票日期、金额、消费类型、购方名称、购方税号、销方名称、销方税号等多个常用字段,支持国家税局和部分地方税局的发票信息核验,与税局电子底账库一致,信息准确率 100%。
· 支持检测和识别增值税普通发票/专用发票、机动车发票、二手车发票的 销售方印章、税局方主体印章文本内容,核査纸质增值税发票的可用性,辅助校验开票人信息。对于印章覆盖的文本识别能力更强,可适应各类浅色、模糊场景,印章内容准确率可达85%。

文档智能产品优势
集成OCR与多模态大模型的综合文档处理服务,支持多类型文档的自动化识别、解析与信息提取,实现内容结构化输出及业务场景智能化处理。

【智能结构化】产品优势
智能结构化,可由客户自定义建立键值,自定义结构化数据结构。模型底层识别算法精度高,针对各类版式综合识别准确率超过90%,识别对于1300+种常见版式,通过自定义设置后综合准确率可达98%。

【多模态文档智能】产品优势

客户和应用场景

通用文字识别 - 应用场景
印刷体、手写体等多场景、多语种的高精度整图文字检测和识别服务。

卡证文字识别 - 应用场景
身份证、银行卡、营业执照等各类个人和企业卡片证照的结构化识别服务。

票据单据识别 - 应用场景
财务报销票据、金融票据、电子运单等各类票据单据的结构化识别服。

特定场景识别 - 应用场景
车牌、车辆 VIN 码等机动车相关图片的结构化识别服务。

智能结构化 - 应用场景
要识别的单据证照、不限定版式,智能结构化全搞定。




