合合信息亮相CCIG2023:多位大咖共话智能文档未来,文档图像内容安全还面临哪些技术难题?-程序员宅基地

技术标签: 安全  人工智能  

近日,中国图象图形大会(CCIG 2023)(简称“大会”)在苏州圆满落幕。本届大会以“图象图形·向未来”为主题,由中国科学技术协会指导,中国图象图形学学会主办,苏州科技大学承办,特邀谭铁牛院士、赵沁平院士、吴一戎院士等百余位国内外知名学者,来自代表企业的技术专家,共话图像图形学术研究与技术创新趋势,共谋行业新发展。

(金连文主持 《文档图像智能分析与处理》 论坛)

技术论坛《文档图像智能分析与处理》是本次大会的亮点之一,由华南理工大学二级教授、中国图象图形学学会常务理事金连文担任主持,合合信息智能技术平台事业部副总经理、高级工程师丁凯博士出席该论坛,并与来自中科院自动化所、北大、中科大的学术专家,华为等知名企业的研究者们,围绕文档图像处理的前沿技术展开“头脑风暴”,寻找文档图像处理领域的未来进阶方向。

大模型技术提升文字识别效率,智能文档处理难题突破

近期,ChatGPT的爆火让“大模型”技术进入了公众的视野。随着人工智能技术的飞速发展,作为图像图形技术的重要应用场景之一,文档图像智能处理逐步应用到医疗、教育等诸多领域,为各行各业提供更加高效、智能的文档管理和数据分析解决方案,大模型技术的崛起也为文档处理带来了新的机遇。

中国科学院自动化研究所副所长刘成林认为,大模型与光学字符识别(OCR)技术的结合,能够对海量数据进行理解、处理。具体到实践层面,大模型技术还有可观的提升空间。从识别性能来说,大模型技术在场景文本、逻辑版面、文档问答等方面还有很多工作可以做;此外,大模型的可解释性、安全度十分重要,还需要研究者们进行更为深入的探讨。

刘成林就《人工智能大模型时代的文档识别与理解》研究课题进行分享

北京大学邹月娴教授认为,在与文档图像处理技术密切相关的OCR领域中,专业化大规模的预训练模型是可行的。“大模型是一个大的趋势,对于小团队来说做工具是一个非常好的方法,做工具对大家都是有好处的。”邹月娴说。

邹月娴就《视觉-语言预训练模型及迁移学习方法》研究课题进行分享

 华为AI研究员廖明辉提到,企业作为文档图像处理的应用方,普遍面临一个挑战:当有众多API时,维护难度较高,急需一个垂直领域的通用的OCR大模型,能够覆盖所有的使用场景。廖明辉认为,OCR垂直领域的大模型在数据量方面,数据的数量不是最关键的,最关键的是数据的多样性。

除了引入大模型等新技术外,如何实现文档图像的智能分析与处理还面临着诸多来自现实的挑战。丁凯博士认为,文档的多样性和复杂性是文档图像处理中的难点:文档类型和格式繁多,包括报告、合同、发票、证明、证件等。不同类型的文档有不同的格式和布局,例如文档中常常包含图片、表格、图形等各种图像,难以用统一的方法处理。

丁凯就《智能文档处理技术在工业界的应用与挑战》研究课题进行分享

丁凯提到,文档图像中的弯曲、阴影、摩尔纹,字迹不清晰等问题对文档图像的识别与处理产生了影响,刘成林也表示,“过去我们只关注文字,现在文档中的图像也十分重要。但是,现有文档图像识别技术在识别精度和可靠性、可解释性、自适应性等方面还有明显不足,还有很多技术问题有待解决。”

值得关注的是,人工智能大模型的快速发展为文档分析与识别带来了一些机遇,除了解决识别层次的遗留问题,在性能提升、应用拓展上大有可为。合合信息通过ROI提取、干扰去除、形变矫正、图像恢复以及图像增强这一整体架构对文档进行智能扫描与识别分析,将文档图像的弯曲矫正、摩尔纹去除,图像质量大幅提升。

除文档图像的通用场景外,合合信息对特定垂直场景下的图像也能进行预处理,针对手写板图片中出现的反光问题,通过算法模型对反光进行“擦除

由于版面复杂多变、文本内容多样化等原因,文档被拍照、扫描成电子文档过程中时常出现漏字、错位,合合信息持续突破版面分析技术在版面分割、区域间的逻辑关系处理等方面的难题,通过智能文字识别、智能图像处理等核心技术,确定文档中的文字位置、字体、大小和排版方式等信息,实现版面的分析和还原。

  文档篡改检测技术为视觉内容安全提供保障

目前,人工智能的合成技术导致伪造的多媒体信息在网络上泛滥成灾,文本图像显然是重灾区之一。针对资质证书、文案、聊天截图等文本图像的伪造被用于散播谣言、经济诈骗、编造虚假新闻,给个人、社会造成恶劣的负面影响。图像内容安全是AI安全的重点领域,如可对文本篡改痕迹进行精准检测,将为图像内容安全提供保障。

中科大教授谢洪涛指出,随着基于深度学习的伪造与取证技术的出现,目前文本图像的真伪鉴定问题进入了攻防博弈阶段。“文本图像的篡改生成视觉质量高、字体风格统一、背景纹理协调、篡改字迹清晰,文本图像的篡改检测可以说是‘道高一尺、魔高一丈’,适应多种篡改方法、多域空间感知、区域文理区分、时间复杂度适中。”谢洪涛表示。

(谢洪涛就《篡改文本图像的生成与检测》研究课题进行分享)

谢洪涛所在的课题组正在探索基于文本笔迹的文本图像生成,以及基于频域关系的局部纹理差异性建模,最终实现高质量的场景文本图像篡改生成、准确的场景文本图像篡改检测。相关研究可应用于文本图像的多个领域,例如文档图像、自然场景图像、票据图像等。

合合信息在文档图像内容安全领域也进行了深入的部署。据丁凯介绍,合合信息研发了基于深度学习的图像篡改检测技术及相关系统,通过学习图像被篡改后统计特征的变化,该系统智能捕捉图像在篡改过程中留下的细微痕迹,可检测出复制粘贴、拼接、擦除等多种篡改形式,让人工智能准确识别出图片篡改的不同类型并进行针对性的处理,提升识别精度和场景通用性。据悉,合合信息图像篡改检测技术已被银行、保险、制造业等多个行业引入。

作为一家人工智能企业,合合信息依托智能文档处理技术,对复杂场景下的多版式、多语种文字内容进行精准提取,打造的合同机器人、财报机器人及行业解决方案,已在金融、政务、制造、物流等30个行业落地,服务的世界500强公司超过80家。未来,合合信息将持续为全球C端用户和多元行业B端客户提供数字化、智能化的产品及服务,促进AI技术在文档处理领域的应用落地与信息安全保障。

版权声明:本文为博主原创文章,遵循 CC 4.0 BY-SA 版权协议,转载请附上原文出处链接和本声明。
本文链接:https://blog.csdn.net/INTSIG/article/details/130726403

智能推荐

如何配置DNS服务的正反向解析_dns反向解析-程序员宅基地

文章浏览阅读3k次,点赞3次,收藏13次。root@server ~]# vim /etc/named.rfc1912.zones #添加如下内容,也可直接更改模板。[root@server ~]# vim /etc/named.conf #打开主配置文件,将如下两处地方修改为。注意:ip地址必须反向书写,这里文件名需要和反向解析数据文件名相同。新建或者拷贝一份进行修改。nslookup命令。_dns反向解析

设置PWM占空比中TIM_SetCompare1,TIM_SetCompare2,TIM_SetCompare3,TIM_SetCompare4分别对应引脚和ADC通道对应引脚-程序员宅基地

文章浏览阅读2.5w次,点赞16次,收藏103次。这个函数TIM_SetCompare1,这个函数有四个,分别是TIM_SetCompare1,TIM_SetCompare2,TIM_SetCompare3,TIM_SetCompare4。位于CH1那一行的GPIO口使用TIM_SetCompare1这个函数,位于CH2那一行的GPIO口使用TIM_SetCompare2这个函数。使用stm32f103的除了tim6和tim7没有PWM..._tim_setcompare1

多线程_进程和线程,并发与并行,线程优先级,守护线程,实现线程的四种方式,线程周期;线程同步,线程中的锁,Lock类,死锁,生产者和消费者案例-程序员宅基地

文章浏览阅读950次,点赞33次,收藏19次。多线程_进程和线程,并发与并行,线程优先级,守护线程,实现线程的四种方式,线程周期;线程同步,线程中的锁,Lock类,死锁,生产者和消费者案例

在 Linux 系统的用户目录下安装 ifort 和 MKL 库并配置_在linux系统的用户目录下安装ifort和mkl库并配置-程序员宅基地

文章浏览阅读2.9k次。ifort 编译器的安装ifort 编译器可以在 intel 官网上下载。打开https://software.intel.com/content/www/us/en/develop/tools/oneapi/components/fortran-compiler.html#gs.7iqrsm点击网页中下方处的 Download, 选择 Intel Fortran Compiler Classic and Intel Fortran Compiler(Beta) 下方对应的版本。我选择的是 l_在linux系统的用户目录下安装ifort和mkl库并配置

使用ftl文件生成图片中图片展示无样式,不显示_ftl格式pdf的样式调整-程序员宅基地

文章浏览阅读689次,点赞7次,收藏8次。些项目时需要一个生成图片的方法,我在网上找到比较方便且适合我去设置一些样式的生成方式之一就是使用Freemarker,在对应位置上先写好一个html格式的ftl文件,在对应位置用${参数名}填写上。还记得当时为了解决图片大小设置不上,搜索了好久资料,不记得是在哪看到的需要在里面使用width与height直接设置,而我当时用style去设置,怎么都不对。找不到,自己测试链接,准备将所有含有中文的图片链接复制一份,在服务器上存储一份不带中文的文件。突然发现就算无中文,有的链接也是打不开的。_ftl格式pdf的样式调整

orin Ubuntu 20.04 配置 Realsense-ROS_opt/ros/noetic/lib/nodelet/nodelet: symbol lookup -程序员宅基地

文章浏览阅读1.5k次,点赞6次,收藏12次。拉取librealsense。_opt/ros/noetic/lib/nodelet/nodelet: symbol lookup error: /home/admin07/reals

随便推点

操作系统精选习题——第四章_系统抖动现象的发生由什么引起的-程序员宅基地

文章浏览阅读3.4k次,点赞3次,收藏29次。一.单选题二.填空题三.判断题一.单选题静态链接是在( )进行的。A、编译某段程序时B、装入某段程序时C、紧凑时D、装入程序之前Pentium处理器(32位)最大可寻址的虚拟存储器地址空间为( )。A、由内存的容量而定B、4GC、2GD、1G分页系统中,主存分配的单位是( )。A、字节B、物理块C、作业D、段在段页式存储管理中,当执行一段程序时,至少访问()次内存。A、1B、2C、3D、4在分段管理中,( )。A、以段为单位分配,每._系统抖动现象的发生由什么引起的

UG NX 12零件工程图基础_ug-nx工程图-程序员宅基地

文章浏览阅读2.4k次。在实际的工作生产中,零件的加工制造一般都需要二维工程图来辅助设计。UG NX 的工程图主要是为了满足二维出图需要。在绘制工程图时,需要先确定所绘制图形要表达的内容,然后根据需要并按照视图的选择原则,绘制工程图的主视图、其他视图以及某些特殊视图,最后标注图形的尺寸、技术说明等信息,即可完成工程图的绘制。1.视图选择原则工程图合理的表达方案要综合运用各种表达方法,清晰完整地表达出零件的结构形状,并便于看图。确定工程图表达方案的一般步骤如下:口分析零件结构形状由于零件的结构形状以及加工位置或工作位置的不._ug-nx工程图

智能制造数字化工厂智慧供应链大数据解决方案(PPT)-程序员宅基地

文章浏览阅读920次,点赞29次,收藏18次。原文《智能制造数字化工厂智慧供应链大数据解决方案》PPT格式主要从智能制造数字化工厂智慧供应链大数据解决方案框架图、销量预测+S&OP大数据解决方案、计划统筹大数据解决方案、订单履约大数据解决方案、库存周转大数据解决方案、采购及供应商管理大数据模块、智慧工厂大数据解决方案、设备管理大数据解决方案、质量管理大数据解决方案、仓储物流与网络优化大数据解决方案、供应链决策分析大数据解决方案进行建设。适用于售前项目汇报、项目规划、领导汇报。

网络编程socket accept函数的理解_当在函数 'main' 中调用 'open_socket_accept'时.line: 8. con-程序员宅基地

文章浏览阅读2w次,点赞38次,收藏102次。在服务器端,socket()返回的套接字用于监听(listen)和接受(accept)客户端的连接请求。这个套接字不能用于与客户端之间发送和接收数据。 accept()接受一个客户端的连接请求,并返回一个新的套接字。所谓“新的”就是说这个套接字与socket()返回的用于监听和接受客户端的连接请求的套接字不是同一个套接字。与本次接受的客户端的通信是通过在这个新的套接字上发送和接收数_当在函数 'main' 中调用 'open_socket_accept'时.line: 8. connection request fa

C#对象销毁_c# 销毁对象及其所有引用-程序员宅基地

文章浏览阅读4.3k次。对象销毁对象销毁的标准语法Close和Stop何时销毁对象销毁对象时清除字段对象销毁的标准语法Framework在销毁对象的逻辑方面遵循一套规则,这些规则并不限用于.NET Framework或C#语言;这些规则的目的是定义一套便于使用的协议。这些协议如下:一旦销毁,对象不可恢复。对象不能被再次激活,调用对象的方法或者属性抛出ObjectDisposedException异常重复地调用对象的Disposal方法会导致错误如果一个可销毁对象x 包含或包装或处理另外一个可销毁对象y,那么x的Disp_c# 销毁对象及其所有引用

笔记-中项/高项学习期间的错题笔记1_大型设备可靠性测试可否拆解为几个部分进行测试-程序员宅基地

文章浏览阅读1.1w次。这是记录,在中项、高项过程中的错题笔记;https://www.zenwu.site/post/2b6d.html1. 信息系统的规划工具在制订计划时,可以利用PERT图和甘特图;访谈时,可以应用各种调查表和调查提纲;在确定各部门、各层管理人员的需求,梳理流程时,可以采用会谈和正式会议的方法。为把企业组织结构与企业过程联系起来,说明每个过程与组织的联系,指出过程决策人,可以采用建立过程/组织(Process/Organization,P/O)矩阵的方法。例如,一个简单的P/O矩阵示例,其中._大型设备可靠性测试可否拆解为几个部分进行测试