Github Star 11.5K项目最新发版:AAAI 2021 顶会论文开源,80+多语言模型全新升级

PaddleOCR在OCR领域取得新进展,发布了AAAI2021顶会论文开源的PGNet模型,实现任意形状文本实时检测与识别,速度提升三倍,达到SOTA效果。此外,还增加了对80多种语言的支持,包括中文、韩文、日文等,提供标准化API接口和私有化部署选项。开发者可以通过PR和issue参与共建。

摘要生成于 C知道 ,由 DeepSeek-R1 满血版支持, 前往体验 >

点击左上方蓝字关注我们

熟悉飞桨的的开发者们,一定会知道飞桨的重磅开源项目:PaddleOCR

短短半年时间,累计Star数量已超过11.5K

频频登上Github Trending和Paperswithcode 日榜月榜第一,

在《Github 2020数字洞察报告》中被评为中国Github Top20活跃项目

称它为 OCR方向目前最火的repo绝对不为过。

最近,它又带来两项全新发布:

  • AAAI 2021 顶会论文开源:PGNet: Real-time Arbitrarily-Shaped Text Spotting with Point Gathering Network 提出了一种简单且有效的任意方向端到端文本识别模型,在精度可比的基础上,与之前大火的ABCNet相比,预测速度快了三倍,达到SOTA效果。 

  • 多语言支持种类提升至80+种,开源SOTA效果:基本覆盖国际主流语言种类,在开源测试集MLT2017评估,中文、韩文、日文、拉丁语系、阿拉伯语系等,识别效果均显著优于EasyOCR。

传送门:

Github:https://github.com/PaddlePaddle/PaddleOCR

AAAI 2021 顶会论文:

端到端SOTA算法PGNet开源

直接先看指标评测表现:PGNet算法在ICDAR2015数据集上的检测及端到端性能表现,在精度接近的条件下,速度上与之前大火的ABCNet相比翻了三倍,达到了SOTA的效果。

图1:PGNet模型的速度与精度性能对比

详细数据指标:

表1:ICDAR2015数据集上的检测及端到端性能

PGNet提出的方法框架如下图所示,输入的图象经过Backbone网络得到1/4下采样特征图,通过多任务学习,同时回归四个任务的内容,包括文本边缘偏移量预测(TBO),文本中心线预测(TCL),文本方向偏移量预测(TDO)以及文本字符分类图预测(TCC)。其中文本行的检测结果由TBO以及TCL经过后处理得到,文本行的识别结果由TCL,TDO以及TCC的输出得到。

图2 网络流程框架

在ICDAR2015以及Total-Text数据集上可以看一下模型效果:

图3 Total-Text及ICDAR2015数据集可视化效果图

PGNet论文地址: 

https://www.aaai.org/AAAI21Papers/AAAI-2885.WangP.pdf

【基于顶尖算法,开放拿来即用的成熟印章识别能力】同时,基于PGNet研发的印章识别能力已经在百度AI开放平台开放,可以有效检测并识别合同文件或常用票据中的印章,输出文字内容、印章位置信息以及相关置信度,已支持圆形章、椭圆形章、方形章等常见印章。提供标准化API接口,快速集成,同时支持私有化部署至本地,保障业务数据私密性。

开放能力地址:https://ai.baidu.com/tech/ocr/seal

注:此处非模型直接开源,但可以申请免费试用。

丰富的多语言种类

支持全球80+ 语言模型

简单对比一下目前主流OCR方向开源repo的核心能力:

中英文模型性能及功能对比

其中,部分多语言模型性能及功能(F1-Score)对比(仅EasyOCR提供)

模型效果

值得一提的是,目前已经有全球开发者通过PR或者issue的方式为PaddleOCR提供多语言的字典和语料,在PaddleOCR上已经完成了全球80+ 主流语言的广泛覆盖:包括中文简体、中文繁体、英文、法文、德文、韩文、日文、意大利文、西班牙文、葡萄牙文、俄罗斯文、阿拉伯文、印地文、维吾尔文、波斯文、乌尔都文、塞尔维亚文(latin)、欧西坦文、马拉地文、尼泊尔文、塞尔维亚文、保加利亚文、乌克兰文、白俄罗斯文、泰卢固文、卡纳达文、泰米尔文等等,也欢迎更多开发者可以参与共建。

良心出品的中英文文档教程

别的不需要多说了,大家访问GitHub点过star之后自己体验吧:

https://github.com/PaddlePaddle/PaddleOCR

直播活动预告

百度飞桨高级研发工程师刘威威,将为我们带来PaddleOCR最新进展,快来报名吧!

课程亮点

  • OCR领域前沿进展概述

  • 万星项目PaddleOCR全介绍

  • AAAI 2021 顶会论文PGNet详细解读

  • 80+多语言模型全新发布,效果升级

直播时间

4月13日晚19:00-20:00

扫描下方二维码,加入技术交流群

如果您想详细了解更多飞桨的相关内容,请参阅以下文档。

·飞桨官网地址·

https://www.paddlepaddle.org.cn/

·飞桨开源框架项目地址·

GitHub: https://github.com/PaddlePaddle/Paddle 

Gitee: https://gitee.com/paddlepaddle/Paddle

·PaddleOCR项目地址·

GitHub: https://github.com/PaddlePaddle/PaddleOCR 

Gitee: https://gitee.com/paddlepaddle/PaddleOCR

·PGNet论文地址·

https://www.aaai.org/AAAI21Papers/AAAI-2885.WangP.pdf

·印章识别开发能力·

https://ai.baidu.com/tech/ocr/seal

飞桨(PaddlePaddle)以百度多年的深度学习技术研究和业务应用为基础,是中国首个开源开放、技术领先、功能完备的产业级深度学习平台,包括飞桨开源平台和飞桨企业版。飞桨开源平台包含核心框架、基础模型库、端到端开发套件与工具组件,持续开源核心能力,为产业、学术、科研创新提供基础底座。飞桨企业版基于飞桨开源平台,针对企业级需求增强了相应特性,包含零门槛AI开发平台EasyDL和全功能AI开发平台BML。EasyDL主要面向中小企业,提供零门槛、预置丰富网络和模型、便捷高效的开发平台;BML是为大型企业提供的功能全面、可灵活定制和被深度集成的开发平台。

直播课精彩内容抢先看????


END

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值