个人征信报告,OCR识别,OCR识别技术方案_征信 ocr识别-程序员宅基地

技术标签: 征信报告  征信报告ocr  征信报告OCR公司  征信报告OCR识别技术  

一、产品背景

1、业务需求

个人征信报告是反应个人信用最真实、直观的材料,通过评估个人的信用情况,从而给予信用贷款是国内金融信贷机构通行的做法。

目前个人征信报告都是从人民银行征信中心获取打印的,个人征信数据属于个人隐私信息,不能对金融信贷机构开放,因此,信贷机构从人民银行征信中心获取个人信用数据是比较困难的,必须通过央行的牌照申请。

基于以上情况,现行个人信用贷款的业务模式是:个人从人民银行征信官网查询打印本人的征信报告,提交纸质材料或者扫描影像件给信贷机构,信贷机构将信用数据录入到各自的风控模型中,进而对申请人给予评级和相应额的的贷款。

信贷机构在实际业务中遇到如下的问题:

1)贷款审批流程时间长,容易错过意向客户:由于个人征信报告数量大,而目前的风控系统都需要手工录入个人信用的数据,因此在数据录入环节,手工方式效率低下,阻碍了信用的快速评估。因此,数据从纸质信用报告转化到风控系统中的电子数据,是效率关键所在。

2)信用数据评估不精确,不全面,隐含风险:由于信用报告数据量大,信贷业务部门又希望能快速放款,所以对风控数据评估势必存在疏漏和主观判断。出现这种情况还是因为,信用数据的获取和录入耗费时间。信用数据评估的不精确,对信贷业务会留下潜在的风险,影响贷款决策。

以上是从影响信贷审批效率的一个方面分析的,不难看出,如果提高个人征信报告数据采集的效率将提升整个信贷活动的效率,提升信贷部门的作业效率,提升客户的体验度,从而获取更多的信贷客户。

2、数据获取方案

从实际情况出发,目前获取个人征信报告的途径有三种,简要说明如下:

1)直接对接人民银行的征信系统:目前央行只授权了8家征信企业可以获得个人征信牌照,意味着更多的信贷机构无法直接从官方拿到信用数据,如果从已授权的8家征信企业购买信用数据,即使有非公开渠道,在法律上应该也是禁止的,风险较大;

2)从人民银行查询征信的网页结果中解析征信数据:此方法属于技术手段,存在数据被篡改、数据不可信的问题;

3)通过征信中心,查询并打印个人的征信报告:此方法由于是官方提供了查询打印平台,所以对消费者来说,最便捷,数据也最可信。缺点是贷款人提交的征信报告是纸质版,需要将数据录入到风控系统中,数据采集工作量较大。

对比以上三种方式,信贷机构都选择了第三种,即由贷款人提交个人征信报告,提交方式为征信报告扫描件,大额贷款还需要本人带上征信报告面签。在第三种方式中,录入信用数据到风控系统中是必须的,如何提高数据采集的效率是提升信贷业务效率的关键所在。在经过多个项目的考察和探索、实践,我们研发出一套依托于OCR(光学字符识别)技术快速采集个人征信报告数据的解决方案,从而为信贷机构提供高可靠性的信用数据。

二、解决方案

1、方案工作流程说明如下

OCR(光学字符识别)技术,是通过图像处理技术手段,将图像(影像)上的文字、表格、图像转化为电子版的数据,通过计算机程序,快速实现数据信息的采集。个人征信报告中,存在大量的数据需要手工录入,使用OCR技术将极大提高数据采集的效率和准确度。

解决方案流程如下图所示:

①客户面签时,业务人员将客户的征信报告扫描为图像资料,扫描要求为300DPI(分辨率);

②业务人员将扫描的图像按顺序导入OCR自动识别软件中,软件开始自动分析图像特征和数据;

③表格分析识别/文字分析识别:通过版面分析、表格分析、文字分析,识别出征信报告的表格部分、文字部分。表格分析,检测所有的表格线,并组织成单元格结构,为之后的还原提供数据支撑;文字分析,对非表格部分,进行分析并识别。

④识别结果校验和汇总:表格中,存在多种文字类型和数据格式,通过识别后分析判断,进行二次识别,以提高识别精度。

⑤导出Excel/csv格式:对表格分析识别、文字分析识别的结果进行组织和导出,按照原表格样式进行原版书还原。

A.风控系统:在风控系统和OCR识别系统之间,通过Excel/csv方式进行数据交互。风控系统不需要改造即可使用OCR自动识别出来的数据。

2、方案技术特点

1)速度快:OCR的特点为速度快,识别一张征信报告平均耗时5秒,以一份征信报告6页计算,识别一份征信报告需要30秒的时间,风控系统可以导入Excel数据,那么在30秒内,风控系统就可以获得个人征信报告的数据,对比人工录入,完全录入一份报告的数据,可能需要30分钟。

2)数据详细:采用OCR识别方式,将获得申请人所有详细的信用数据;

3)数据精度高:有数据表明,OCR技术识别率比人工录入的精度要高,计算机作业不受环境、作业疲劳的影响,保证高精度;

4)表格原版式还原:传统的OCR文字识别软件只能处理全幅文字的识别,处理简单表格结构的识别,且有些OCR软件还需要制作识别模板才能识别,不能满足征信报告如此复杂的表格的识别。在本方案中,实现了表格自动检测自动识别的功能,且经过实际测试应用,表格检测的准确率高达99%。因为表格线检测精度高,才可以实现表格原版式还原,还原出一个逻辑结构和征信报告一样的表格。

版权声明:本文为博主原创文章,遵循 CC 4.0 BY-SA 版权协议,转载请附上原文出处链接和本声明。
本文链接:https://blog.csdn.net/etopliu18500233610/article/details/78688981

智能推荐

使用nginx解决浏览器跨域问题_nginx不停的xhr-程序员宅基地

文章浏览阅读1k次。通过使用ajax方法跨域请求是浏览器所不允许的,浏览器出于安全考虑是禁止的。警告信息如下:不过jQuery对跨域问题也有解决方案,使用jsonp的方式解决,方法如下:$.ajax({ async:false, url: 'http://www.mysite.com/demo.do', // 跨域URL ty..._nginx不停的xhr

在 Oracle 中配置 extproc 以访问 ST_Geometry-程序员宅基地

文章浏览阅读2k次。关于在 Oracle 中配置 extproc 以访问 ST_Geometry,也就是我们所说的 使用空间SQL 的方法,官方文档链接如下。http://desktop.arcgis.com/zh-cn/arcmap/latest/manage-data/gdbs-in-oracle/configure-oracle-extproc.htm其实简单总结一下,主要就分为以下几个步骤。..._extproc

Linux C++ gbk转为utf-8_linux c++ gbk->utf8-程序员宅基地

文章浏览阅读1.5w次。linux下没有上面的两个函数,需要使用函数 mbstowcs和wcstombsmbstowcs将多字节编码转换为宽字节编码wcstombs将宽字节编码转换为多字节编码这两个函数,转换过程中受到系统编码类型的影响,需要通过设置来设定转换前和转换后的编码类型。通过函数setlocale进行系统编码的设置。linux下输入命名locale -a查看系统支持的编码_linux c++ gbk->utf8

IMP-00009: 导出文件异常结束-程序员宅基地

文章浏览阅读750次。今天准备从生产库向测试库进行数据导入,结果在imp导入的时候遇到“ IMP-00009:导出文件异常结束” 错误,google一下,发现可能有如下原因导致imp的数据太大,没有写buffer和commit两个数据库字符集不同从低版本exp的dmp文件,向高版本imp导出的dmp文件出错传输dmp文件时,文件损坏解决办法:imp时指定..._imp-00009导出文件异常结束

python程序员需要深入掌握的技能_Python用数据说明程序员需要掌握的技能-程序员宅基地

文章浏览阅读143次。当下是一个大数据的时代,各个行业都离不开数据的支持。因此,网络爬虫就应运而生。网络爬虫当下最为火热的是Python,Python开发爬虫相对简单,而且功能库相当完善,力压众多开发语言。本次教程我们爬取前程无忧的招聘信息来分析Python程序员需要掌握那些编程技术。首先在谷歌浏览器打开前程无忧的首页,按F12打开浏览器的开发者工具。浏览器开发者工具是用于捕捉网站的请求信息,通过分析请求信息可以了解请..._初级python程序员能力要求

Spring @Service生成bean名称的规则(当类的名字是以两个或以上的大写字母开头的话,bean的名字会与类名保持一致)_@service beanname-程序员宅基地

文章浏览阅读7.6k次,点赞2次,收藏6次。@Service标注的bean,类名:ABDemoService查看源码后发现,原来是经过一个特殊处理:当类的名字是以两个或以上的大写字母开头的话,bean的名字会与类名保持一致public class AnnotationBeanNameGenerator implements BeanNameGenerator { private static final String C..._@service beanname

随便推点

二叉树的各种创建方法_二叉树的建立-程序员宅基地

文章浏览阅读6.9w次,点赞73次,收藏463次。1.前序创建#include<stdio.h>#include<string.h>#include<stdlib.h>#include<malloc.h>#include<iostream>#include<stack>#include<queue>using namespace std;typed_二叉树的建立

解决asp.net导出excel时中文文件名乱码_asp.net utf8 导出中文字符乱码-程序员宅基地

文章浏览阅读7.1k次。在Asp.net上使用Excel导出功能,如果文件名出现中文,便会以乱码视之。 解决方法: fileName = HttpUtility.UrlEncode(fileName, System.Text.Encoding.UTF8);_asp.net utf8 导出中文字符乱码

笔记-编译原理-实验一-词法分析器设计_对pl/0作以下修改扩充。增加单词-程序员宅基地

文章浏览阅读2.1k次,点赞4次,收藏23次。第一次实验 词法分析实验报告设计思想词法分析的主要任务是根据文法的词汇表以及对应约定的编码进行一定的识别,找出文件中所有的合法的单词,并给出一定的信息作为最后的结果,用于后续语法分析程序的使用;本实验针对 PL/0 语言 的文法、词汇表编写一个词法分析程序,对于每个单词根据词汇表输出: (单词种类, 单词的值) 二元对。词汇表:种别编码单词符号助记符0beginb..._对pl/0作以下修改扩充。增加单词

android adb shell 权限,android adb shell权限被拒绝-程序员宅基地

文章浏览阅读773次。我在使用adb.exe时遇到了麻烦.我想使用与bash相同的adb.exe shell提示符,所以我决定更改默认的bash二进制文件(当然二进制文件是交叉编译的,一切都很完美)更改bash二进制文件遵循以下顺序> adb remount> adb push bash / system / bin /> adb shell> cd / system / bin> chm..._adb shell mv 权限

投影仪-相机标定_相机-投影仪标定-程序员宅基地

文章浏览阅读6.8k次,点赞12次,收藏125次。1. 单目相机标定引言相机标定已经研究多年,标定的算法可以分为基于摄影测量的标定和自标定。其中,应用最为广泛的还是张正友标定法。这是一种简单灵活、高鲁棒性、低成本的相机标定算法。仅需要一台相机和一块平面标定板构建相机标定系统,在标定过程中,相机拍摄多个角度下(至少两个角度,推荐10~20个角度)的标定板图像(相机和标定板都可以移动),即可对相机的内外参数进行标定。下面介绍张氏标定法(以下也这么称呼)的原理。原理相机模型和单应矩阵相机标定,就是对相机的内外参数进行计算的过程,从而得到物体到图像的投影_相机-投影仪标定

Wayland架构、渲染、硬件支持-程序员宅基地

文章浏览阅读2.2k次。文章目录Wayland 架构Wayland 渲染Wayland的 硬件支持简 述: 翻译一篇关于和 wayland 有关的技术文章, 其英文标题为Wayland Architecture .Wayland 架构若是想要更好的理解 Wayland 架构及其与 X (X11 or X Window System) 结构;一种很好的方法是将事件从输入设备就开始跟踪, 查看期间所有的屏幕上出现的变化。这就是我们现在对 X 的理解。 内核是从一个输入设备中获取一个事件,并通过 evdev 输入_wayland

推荐文章

热门文章

相关标签