关闭→
当前位置:科普经验站>综合知识>双层pdf是什么意思

双层pdf是什么意思

科普经验站 人气:2.11W

双层pdf是什么意思

演示机型:华为MateBook X    系统版本:win10    

双层pdf是一种具有多层结构的PDF格式文件,是PDF文件衍生的一种文件。文件既可以是文本型的(比如由word生成的文件),也可以是图像型的,既可以100%保留原始版面效果,又便于建立索引数据库,进行科学的管理。

小编还为您整理了以下内容,可能对您也有帮助:

演示机型:华为MateBook X    系统版本:win10    

双层pdf是一种具有多层结构的PDF格式文件,是PDF文件衍生的一种文件。文件既可以是文本型的(比如由word生成的文件),也可以是图像型的,既可以100%保留原始版面效果,又便于建立索引数据库,进行科学的管理。

什么是双层pdf文件

双层PDF格式文件是一种具有多层结构的PDF格式文件,是PDF文件衍生的一种文件。

操作步骤:

1、我可以现在Word里进行编辑,然后选中全部内容点击“开始”页面中的复制。

2、然后我们打开PDF编辑器,点击文件中的“新建文档”选择“从空白页”新建一个空白页面。

3、接着我们鼠标右击选择“粘贴”将Word中的文件粘贴进去。完成以上操作之后,保存文件就可以了。

注:迅捷PDF编辑器不仅能对PDF文件进行编辑和制作,还可以完成PDF添加水印,PDF提取页面哦。

扩展资料:

文件扫描识别双层PDF

一、公文扫描识别系统概述

公文扫描识别系统是一款扫描仪和OCR识别技术相结合的软硬一体化系统,通过扫描仪进行公文扫描,采集图像之后,利用OCR技术进行公文题录自动提取字段信息输出。例如公文扫描识别后可以直接提取出图像上的文字信息,实现信息的快速提取和录入。

二、公文扫描识别系统功能

公文扫描识别,利用快档通进行公文扫描识别,可以对公文题录自动提取,公文扫描识别结果支持生成可检索双层PDF。并且最新的公文扫描识别核心支持包含条码打印的公文识别,多用于公文电子化。

参考资料来源:百度百科—双层pdf

双层PDF的问题!

分类: 电脑/网络

问题描述:

能不能专业点介绍下什么是双层PDF?它有什么重要的技术指标(或技术参数),与其他的电子文本格式有那些区别?

解析:

所谓双层PDF就是上层是图像,下层是隐藏文字的PDF格式。利用这种文件格式,用户就可以对PDF文档进行正常的操作,同时安全共享网络文件。

=================

双层PDF是这样的PDF文件:PDF文件的每一页都包含两层,上层是从纸质文件扫描出来的原始图像,下层是用OCR软件对扫描图像进行识别后产生的文字结果。这样用户在阅读PDF文件时看到的是扫描图像,可以100%保留原始版面效果(包括公章、签名),在需要的时候,又可以通过下层的文字信息支持选择、复制、检索等功能。

与普通PDF文件相比,双层PDF能够同时兼顾视觉效果和使用方便性,因此在国内办公、档案领域正在引起重视,我个人相信会有美好的“钱途”。

显然,双层PDF的内容检索、内容复制与OCR识别结果有直接的关系。先不说目前国内OCR软件的识别率如何,最关键的一点是目前没有任何一个中文OCR引擎是免费、开源的(英文的则有gocr等一批),所以双层PDF生成工具也都不是免费的,而是“面向企业市场”,我相信穷困的个人用户在不违法的情况下很难消受得起。

双层扫描是什么意思啊

双层扫描(PDF)是把文档图像扫描后,将文字识别保存在相同位置,你可看到文档的原始图像,又可以检索和复制其中的电子文字内容的一种PDF格式。

双层pdf到底是怎样的啊?

什么是双层PDF文件?

PDF文件是一种具有多层结构的格式文件,其特点是:文件既可以是文本型的(比如由word生成的文件),也可以是图像型的(比如由扫描生成的文件);双层PDF文件是指文件内容既包含文本层,也包含图像层,且其位置上下一一相对应。

使用双层PDF文件有什么好处?

PDF文件格式已成为国际标准,越来越多的行业和单位正在使用它。其特点是具有多层结构,包括图层和文字层,这样,既可以100%保留原始版面效果(包括公章、签名),又可以通过下层的文字信息支持选择、复制、全文检索等功能。因此,双层PDF同时兼顾视觉效果和检索方便性,极大地方便了电子文件的管理。

双层PDF文件加工是什么意思?

是将tif、jpg、bmp、gif、png、单层PDF(图像)等图像类文件经加工后输出为可全文检索的双层(图层和文字层)PDF文件。

彩色双层二值pdf特点

双层PDF格式文件是一种具有多层结构的PDF格式文件,是PDF文件衍生的一种文件,其特点是:文件既可以是文本型的(比如由word生成的文件),也可以是图像型的(比如由扫描生成的文件);双层PDF格式文件是指文件内容既包含文本层,也包含图像层,且其位置上下一一相对应。双层PDF是指将标准资料通过扫描仪快速录入后,经过去污、纠偏和OCR识别,然后可以直接生成可以检索的PDF文件,这个PDF文件是双层的,上层是原始图像,下层是识别结果,这样可以100%保留原始版面效果,并且支持选择/复制/检索等功能,这样的PDF文件便于建立索引数据库,进行科学的管理。

双层pdf和书签的区别

双层pdf和书签的区别如下:

1、双层pdf第一层是图片,第二层是文字,书签就只有一层。

2、双层PDF是一种结合了图像层和文本层的PDF格式,书签是做标记的格式。

3、双层PDF格式文件是一种具有多层结构的PDF格式文件,是PDF文件衍生的一种文件。

如何制作双层PDF?

1、下面是扫描生成的PDF文档,可以看出,文字是无法直接复制的。

2、点击Acrobat软件工具栏右上角的“工具”选项,打开“文本识别“,然后点击“在本文件中”。

3、在弹出的“识别文本”对话框中,点击“编辑”进行文字识别参数的设置。

5、文字识别参数设置:OCR识别的主要语言(这里选择简体中文);PDF输出样式:可搜索的图像、可搜索的图像(精确)、ClearScan(这里保持默认);缩减像素采样至:600、300、150、72dpi(如果要打印建议不要小于150dpi)。

6、文字识别参数设置完成后,点击确认开始文字识别。

7、文字识别完成,可以看到,可以通过文本选择工具进行选择了,可以看出,识别准确率还是比较高的。

双层OFD版式文件是什么意思

您是问OFD文件如何打开打印,或者转换为其他格式吧!首先,你需要一个OFD阅读器,这里我们用的是数科OFD阅读器;可以在数科网维官网选择版式阅读软件进行下载,也可以网上百度搜索“数科OFD阅读器”进行下载

2、下载安装完成后,左上角点击“打开”浏览选择你需要查看的OFD文件

3、打开后即可查看文档内容。如果需要将文档打印,还是左上角文件,选择打印。配置打印机即可打印。

4、如果想要转换为PDF格式的,就在刚刚打印页面中选择打印为PDF即可。

5、通过阅读器即可实现打开、打印、转换格式的需求,如果是文件还直接可以进行验证,在签章处右键选择验证,即可查看签章详情。

双层PDF在地质资料数字化中的应用

郭慧锦 贾国锋 马飞飞 张茜

(全国地质资料馆)

摘要 本文在描述双层PDF及OCR技术特点及应用前景基础上,探讨了地质资料数字化图文数据双层PDF转换的意义;提出了转换方法的选择,并详细介绍了OCR数字加工系统,以及提高识别率的方法;最后提出了双层PDF在地质资料馆建设中的意义。

关键词 双层PDF OCR识别率

当前,地质资料馆藏机构都在加紧开展数字化工作。截至2013年底,全国已有20多个省级资料馆完成馆藏资料的数字化工作,全国地质资料馆的成果地质资料数字化工作也接近尾声,所形成的海量数据已成为地质资料信息社会化服务重要数据资源。此类数字化数据是静态的,有利于阅览使用,但无法进行全文检索,也不利于进一步分析处理。因此,在现有数据的基础上,开展OCR识别,使之转化成双PDF文件,实现静态向动态的转变,建立全文数据库,完成对地质资料的全文信息的检索,成为地质资料馆藏机构推进资料数字化工作。

1 关于双层 PDF与OCR技术

双层PDF是在扫描数据的基础上通过OCR识别生成的可检索的PDF文件,即上层是原始图像,下层是识别结果,且位置上下一一对应。双层PDF文件不仅可以100%保留原始版面效果,而且支持选择、复制、检索等功能,这样的PDF文件最后可以存储在光盘、硬盘或磁盘阵列中,并通过建立索引数据库进行科学的管理。

OCR(Optical Character Recognition),即光学字符识别,是指电子设备(如扫描仪或数码相机)检查纸上打印的字符,通过检测暗、亮的模式确定其形状,然后用字符识别方法将形状翻译成计算机文字的过程。即对文本资料进行扫描,然后对图像文件进行分析处理,获取文字及版面信息的过程。随着计算机网络飞速发展,信息电子化已经成为一个时代必然趋势。文字作为信息中最重要、最集中的载体,其电子化进程显得尤为重要。而OCR技术则是文字电子化过程中最重要的环节,它改变了传统的纸介质资料输入的概念。通过OCR技术,用户可以将通过摄像机、扫描仪等光学输入方式得到的报刊、书籍、文稿、表格等印刷品的图像信息转化为可以供计算机识别和处理的文本信息。因此,与传统的手工录入方式相比,OCR技术大大提高了人们进行资料存储、检索、加工的效率。

2 应用现状

PDF正在世界各国、金融财务、法律、工程技术、医疗等诸多部门获得广泛的应用,并已成为、学术部门等单位标准的现代化公文格式规范,所以PDF电子格式文档将是未来档案部门收藏的主体。而双层PDF的出现有效解决了识别成本和阅读利用的矛盾,是一种较有潜力的资源格式。国外的OCR技术应用相对成熟,包括IBM、Motorola、HP和Microsoft等世界性大公司都陆续展开了这方面的研究,在他们的产品中绑定了OCR技术。

如今,OCR技术在我国的应用也极为广泛。信息检索技术研究,即双层PDF检索技术研究,中国“863”计划在2008年以前已经开始对中文OCR、自动分词、自动摘要、自动搜索、自动定位进行了统一测试评测。在此基础上,国内逐步建立了以数字图书馆、数字档案馆、数字报刊、数字校园网等一系列数字化为基础的实施案例,例如新闻出版总署、外联部、共青团等机关文献全文数据库;《中国青年》75年、《新华文摘》20年等期刊全文数据库。国家图书馆早在1999年就成立了“国家图书馆文献数字化中心”,对各类馆藏文献进行数字化加工和OCR识别,在此基础上形成书目型书库、题录型数据库和全文型数据库三大类,逐渐成为我国网上信息资源的中心枢纽。

随着我国信息化建设全面普及,OCR技术的应用前景更加广阔,数字图书馆、数字档案馆、数字资料馆等概念的提出也使OCR在纸质档案数字化过程中越来越发挥其独特的作用,不仅节省了人力物力,更使档案信息资源的利用价值达到最大化,能够更好地服务于民。

3 数字化数据双层PDF转换的意义

3.1 是地质资料信息化建设的重要内容

随着社会信息化程度的提高,人们对信息资源的依赖程度也越来越高,对高效率的档案资源管理、检索利用的需求也越来越迫切。数字化是信息化建设的重要内容,而信息化建设的核心是资源建设。资源建设包括三大任务:一是馆藏纸质资料的扫描数字化与目录数据库建设;二是电子文件的归档与管理;三是全文数据库和全文检索体系建设。根据各资料馆数字化工作进展,考虑到用户的利用需求,若要得到真正文本形态的电子信息,使资料数字化工作更加有效,更加彻底,最大限度拓宽用户利用面,就需要应用OCR技术进行扫描栅格文件的双层PDF转换,进而开展地质资料全文数据库建设和全文检索工作。

3.2 是地质资料实现全文检索与全文数据库建设的前提

实践证明,基于双层PDF文档的全文检索,有效地提高了查询利用效率。它通过对档案数据库的数据和双层PDF文档的Text层建立索引,查询时可以不访问数据库,有效减轻数据库和系统的压力。至少可以支持1000万级的数据,毫秒级的查询时间,每秒上千人的并发访问,从而实现大容量、高速度的目标,并且可以适应Linux和Windows平台,支持多种数据库接口。它具备通用搜索引擎的构架和功能,可以对用户的输入进行分词,可以进行多关键字搜索、关键词组合搜索,用户友好;同时能够根据客户的需求进行用户的数据挖掘,提高档案全文检索系统的价值。

3.3 是现代化数据中心标准化建设的前提

建设现代化的数据中心首先要实现电子文件存储结构标准化,即建立一个通用性强、应用广泛的电子文件信息存储和交换格式。基于PDF格式已经作为电子文件管理中电子文件长期保存格式的最新标准在国际上全面实施,且具有兼容性、原始记录性强,安全控制策略完善等优点,是电子文件长期保存的最佳选择。所以进行馆藏数字化数据PDF转换势在必行。

4 双层PDF转换方法

4.1 目前常见的双层PDF转换方法

目前国内双层PDF的转换技术已经相对成熟,从现有技术条件下来看,大体可分为以下3种:

4.1.1 软件转换

由目前市场上较流行的 Adobe Acrobat、ABBYY FineReader12(中英文识别)、Readiris Corporate 12(英文识别率高)、Foxit Phantom 5(可以单独显示文本层)、清华文通TH-OCR XP8(识别率较高)、汉王文本王5800(版面识别较好,纯中文识别率高)、尚书七号OCR等转换程序,可以经OCR识别处理后直接生成双层PDF文件,速度快,效率高。但识别率和纸质资料原件(如印刷方式、清晰度、纸张质量等)及操作人员技术水平成正比。如果纸质原件质量好,识别率相对就高;质量差,识别率就相对较低。

4.1.2 流程加工

根据相关技术要求,对图像进行全新的OCR识别流程加工处理,重新生成PDF文件,具有文字正确率高、文字定位准确等特点。这种方式相当于全流程化制作双层PDF文件,工作量大,耗时长,费用高。

4.1.3 识别重构

重新生成PDF文件,实现版面字体、字号、颜色的恢复和重构。文字正确率高,页面清晰,但和原版图差异较大,主要在图书方面应用较多。

4.2 地质资料双层PDF转换

全国馆于2011年开始在扫描数字化基础上开展双层PDF的转换试验工作,主要运用第一种方法进行软件转换,即经过软件自动OCR处理后直接形成双层PDF文件。由于地质资料不同于普通的文书档案,纸张样式和印刷方式多样,手写和老旧资料多,地层、数学等特殊符号多等特点,给OCR自动识别带来了困难,单一的软件识别并不能满足全文检索90%以上识别率的要求。

在转换试验基础上我们得到以下结论:

1)地质资料本身多种多样,实际的识别率主要受印刷质量、形成年代等因素影响,老旧资料、纸质质量差的资料识别率普遍较低;受执笔人书写习惯及书写清晰度的影响,手写文档的识别准确率一般在30%以下;油印文档识别准确率一般在50%以下;打印、铅印和胶印文档识别率较高,一般能达90%以上。无论在哪种类型的文档中,标点的识别率都很低,地层和数学符号及其他特殊符号的识别率几乎为零。

2)目前识别技术无法达到100%识别,必须根据实际需求对照纸质档案对初次识别结果进行人工校对才能满足全文检索需求。

3)地质资料扫描文件数量多、容量大,转换速度受计算机反应速度影响,大批量转换和识别需选择高配置计算机,且批量转换和人工识别耗时长,耗人工多,需专项经费支持开展工作。

4.3 OCR数字加工系统的引入与功能简介

经过对目前国内双层PDF转换方法的对比,结合地质资料情况复杂的特点,以及数据测试结果研究,建议地质资料的双层PDF转换主要采用软件识别和流程加工相结合的方法,即采用OCR数字加工系统,可以保证高效率、高质量地完成双层PDF转换。该系统主要包含以下几个主要流程:

图1 OCR数字加工系统示意图

1)图像处理。为提高识别率,对图像进行“消蓝去污”的处理,去掉图像上影响识别率的噪音,如麻点、下划线等,由图像质量控制程序自动监测图像处理质量。

2)版面分析。自动进行版面理解并定位,判别划框区域是横排文本区、竖排文本区、表格区还是图像区,并对不同属性的区域以不同颜色的线框标识出来。自动版面分析在后台运行,操作人员可在前台进行确认,必要时对自动版面分析结果加入手工干预。

3)识别。把文字图像转化为计算机文字内码,可以识别印刷体和手写体中文(包括简体字和繁体字)、中英文混排文字、表格,识别出来的文字内码可以是GB码、BIG5码、GBK码或者Unicode码。识别过程在后台运行。

4)纵向校对。具有很强的查错纠错能力,是将一个或若干个图像中识别成同一个字的文字图像列在一起显示,并以突出颜色标出可疑字,便于操作员发现错误和修改。

5)横向校对。是传统的人工校对方法,操作员直接对比识别结果文本和图像,以发现识别错误文字。系统自动调出文字对应的图像,进行比对。同时,以醒目的颜色标出识别可信度不离的文字。

6)版面还原。将识别并修改好的文本还原成跟扫描文稿版面的布局一样、可以供计算机阅读和查询检索的RTF、PDF、HTML、SGML/XML格式的数字文档。

7)数据入库。版面还原数字文档的保存。

4.4 提立OCR识别率的方法

利用OCR数字加工系统生成的双层PDF,文本层差错率最低可到万分之一,可呈现原版底纹和色彩风貌,可进行全文检索和复制引用,且检索信息可准确定位到字符,便于快速查找目标信息。为了减轻横向校对即人工校对工作量,提高工作效率,就要从根本上提高识别率。经过试验,以下几个方法可以提高栅格文件OCR识别率。

1)图像色彩设定。虽然灰度或彩色模式可以最大限度还原纸质资料原貌,是我们扫描数字化的首选,但是这两种色彩模式会增大影响识别率的背景噪音。若仅做文字识别及一般黑白插图选取,建议可将扫描程序的图像色彩设定设置为黑白,增大识别率。不过最终图像色彩的设定还要按照各类具体工作的规范要求来设置。

2)分辨率设置。我们都知道扫描分辨率设置越低,扫描速度越快,但同时也导致图像质量差,其文字识别准确率低。反之分辨率高,扫描速度慢,但文字识别准确率高。但这又不是绝对的,因为分辨率设置得太高后,纸张上的微小瑕疵也可能被认作标点符号或汉字等,文字识别准确率反而会有所降低。经反复测试,分辨率设为300dpi,是扫描速度及文字识别准确率的最佳平衡点。

3)图像处理。这里图像处理是指扫描输出图像前的倾斜校正和去污等。倾斜校正是为了调整文字方向使之正向,这样才能对OCR识别有所帮助。

双层PDF转换完成以后,在此基础上可以实现资料管理系统与PDF文件的挂接,对资料数据内容及其元数据等相关信息建立联系并形成数据包;然后通过调用全文数据库原数据创建索引文件,最后实现全文检索。通过全文数据库及全文检索的实现,得到高查全率和查准率,大幅度提高地质资料的利用价值,促进地质资料编研工作,为地质资料信息聚合的研究和深层次服务奠定了基础。

参考文献

[1]许呈辰.档案数字化过程中OCR技术的应用[J].档案管理,2011(1).

[2]徐永芳.OCR技术在档案数字化过程中的应用[J].艺术科技,2011(2).

[3]张旋.OCR技术研究进展及前瞻[J].科学技术,2010(4).

[4]郭金光.双层PDF技术及在档案数字化中的应用[J].新观察,2013(1).

[5]刘家真.文件保存格式与PDF文档[J].档案学研究,2002(2).

如何制作双层PDF

先打开abbyy 10,在setting里设置语言,一般设定chinese (traditional), japanese,english,和french。具体还得看要扫描的书使用什么文字。如果是扫描书,就逐页扫描,然后让abbyy识别,识别过程可能比较花时间,尤其是一本书里有多种语言和有很多内容的时候。

识别完毕,准备save的时候选择,这样,pdf就有了两层。用pdf阅读软件打开阅读时,读者看到的是image,这样就保证了pdf在阅读时不会有错误发生,绝对忠实原来的图像。而search或copy的时候,选择的就是图像下面的text了。

TAG标签:#pdf #双层 #