TH-OCR SDK15:国产OCR自研路
ocr吧
全部回复
仅看楼主
level 8
做技术的人最烦一种论调:”国产软件不就是套个壳吗?”
前几天跟一个客户聊到TH-OCR SDK15,对方第一反应也是这个。我就直接给他看了几组数据,聊完之后他自己说:”好像跟我印象里的不太一样。”
先说说这个SDK是怎么来的。TH-OCR这条技术线其实可以追溯到30多年前,最初的OCR算法就是从头开始自己写的——不是拿开源框架套个皮,是真的一行代码一行代码抠出来的。这在OCR圈里算是个挺罕见的事。你现在去GitHub搜OCR,一大堆基于PaddleOCR或者Tesseract改的项目,甚至有些商业产品都是这样搞的。但问题是,开源项目底层依赖的框架和模型,你不知道里面有什么,外部审计也审不明白。对于涉密单位、档案机构来说,这种”来路不明”的东西根本上不了台面。
SDK15另一个让我觉得拿得出手的点,是它对国产硬件的适配范围。鲲鹏、飞腾、海光、兆芯、龙芯、申威——不是只支持一两种充门面,是六个平台全跑了。GPU/NPU方面,昇腾300I系列和海光K100-Ai也都做了深度适配。市面上能把适配做这么全的OCR厂商,真不多。
部署这块也挺省心的。SDK15的安装包很小,单路CPU就能跑推理,不需要额外配AI加速卡。对于预算有限的政企客户来说,这意味着信创改造成本不会暴涨,不用为了上个OCR还得额外采购昂贵的算力硬件。
技术上还有一些细节值得说。比如今年新增了角标识别、透视畸变矫正、表格补线这些功能,都是冲着政务场景去的——老旧档案扫描件歪歪扭扭的、手写公文潦草的、异形单据拍摄角度奇葩的,这些在真实业务里太常见了。以前这些场景的识别率堪忧,现在能稳在比较高的水平。
当然,这东西也不是完美的。跟顶级的英文OCR引擎比,在某些特殊排版场景下还是有差距。但作为一款完全自研、全栈国产化的OCR引擎,能在真实的政企环境里跑得稳、跑得快,我觉得已经算是对得起”30年”这三个字了。
产品好不好,最终还是数据说了算。
2026年08月04日 08点08分 1
1