level 8
中安未来12138
楼主

去车管所办业务的人都有体会:排队两小时,办事五分钟。其中一个原因是——材料审核。一辆车要过户,需要核验的证件就有驾驶证、行驶证、登记证书、购置税完税证明等好几份,每份都要人工录入信息、逐项比对。驾驶证和行驶证的OCR识别,正在把这件事变得不一样。
驾驶证和行驶证长什么样?
驾驶证(也叫驾照)主页面包含:证号(即身份证号)、姓名、性别、国籍、住址、出生日期、准驾车型、有效期起始日期、有效期截止日期。副页面记录了累积记分情况。
行驶证是机动车的”身份证”,主页面包含:号牌号码、车辆类型、所有人、住址、使用性质、品牌型号、车辆识别代号(VIN)、发动机号码、注册日期、发证日期。
两份证件的版式都是公安部统一标准,字段位置固定,印刷质量较高,表面看是OCR的理想对象。
但实际场景中问题不少。
识别难点在哪里?
塑封反光。 驾驶证和行驶证都有塑封膜,柜台灯光下拍照容易产生大面积反光,盖住关键字段。专业设备用红外光穿透塑封膜消除反光,但手机拍照识别就只能靠算法后处理了。
字段密度高。 行驶证正面的信息非常密集,”车辆识别代号”一行就有17位字母数字混排,每个字符之间间距小,容易粘连。VIN码中字母I、O和数字1、0极易混淆——系统必须靠校验规则来区分。
准驾车型代码多。 驾驶证上的”准驾车型”字段,可能是A1、A2、A3、B1、B2、C1、C2、C3、C4、D、E、F、M、N、P等十几种代码之一,还可能是多个代码组合(如”C1D”)。OCR不仅要识别字符,还要理解这个字段的编码规则。
磨损与旧版式。 早期发放的驾驶证和行驶证,经过多年使用后塑封膜起皱、字体褪色、边角磨损。不同年份的版式也有细微差异,需要模型覆盖所有版本。
技术方案:定位 + 识别 + 校验
和身份证OCR类似,驾驶证和行驶证的识别也分三步走:
第一步,证件检测与矫正。 目标检测模型找到证件位置,四点透视矫正把歪斜的证件”摆正”。这一步对手机拍照场景尤其重要——用户不可能每次都把证件摆得端端正正。
第二步,字段分割与识别。 驾驶证和行驶证各自有固定的字段布局,系统按预定义的区域位置提取每个字段,用文字识别模型读取内容。对于VIN码这类高密度字段,使用专门的字符级识别模型,配合校验规则(VIN码第9位是校验位,可以验证前8位和后8位是否正确)。
第三步,结构化输出。 识别结果按JSON格式输出,每个字段对应一个key-value对。系统可以和车管所数据库对接,自动核验证件信息是否一致。
4S店和保险公司的日常
4S店车辆登记。 客户购车后,4S店需要将车辆信息录入系统,办理临牌、保险、购置税。行驶证OCR扫一下,号牌号码、VIN码、发动机号自动填入,不用人工逐位录入17位VIN码。
保险公司理赔。 车险理赔时需要核验驾驶证和行驶证,OCR识别后自动比对被保险人信息,确认证件有效性,减少骗保风险。
二手车交易。 过户时双方证件和车辆证件一起扫描,信息批量录入交易系统,办理效率大幅提升。
交通执法。 交警移动执法终端扫一下驾驶证和行驶证,驾驶人信息和车辆信息秒级调出,违法记录一目了然。
环保检测。 汽车尾气检测站需要登记车辆信息和车主信息,证件OCR让登记窗口从排队五分钟变成十几秒。
一辆车从出厂到报废,要经过登记、过户、年检、保险、维修等无数环节,每个环节都要核验证件。OCR做的,是让每个环节的信息录入从”手工活”变成”自动活”。