CAJ文件的识别 caj文字识别乱码

(2008-03-18 21:14:43)转载

很多科技文献,论文,都是用CAJViewer7.0称为“电子阅读器”的一个程序来阅读的。但CAJ文件像PDF文件一样,是些类似图片格式的文本。这些图片格式的文本转换成可编辑的真正文本是有点麻烦的。仅仅用“拷贝,粘贴”的办法,是不行的。需要进行一个格式的转换。

方法1:需要安装一个软件:Office2003,完整版大概680多兆。用CajViewer打开所要转的文件,工具栏里选“文件”——“打印”。

一般机器里安装了Office2003之后,会随着安装一个虚拟打印机MicrosoftOfficeDocumentImaging,就选择打印到这个虚拟打印机上。

先选打印“全部”,然后点“确定”。最后选择文件保存路径,但这时,保存的这个文件是MDI格式的,打印完后MicrosoftOfficeDocumentImaging会自动打开你刚才保存的文件。然后在工具栏里选择“工具”——“将文本发送到Word”这样就可以把CAJ格式的文件转变称为WORD格式了。

方法2:从CAJ等文件中提取全文本的方法
CAJ文件的识别 caj文字识别乱码

现在网上的许多资料都是以CAJ、PDF等文件格式提供的,其中的文本不能被直接编辑。网上提供了许多处理这种情况的软件,但是它们不是效率低,就是只能提取其中部分文本。本文所述利用微软提供的OCR识别技术从CAJ、PDF等文件中提取全部文本的方法,简便快捷,效率很高。从不同格式的文件中提取文本前需要做好以下准备工作,安装CAJViewer5.5浏览器软件和acrobat5专业版浏览器软件安装Office2003,并完全安装Office工具MicrosoftOfficeDocumentImaging,然后在打印机里面会增加MicrosoftOfficeDocumentImageWriter打印机

。MicrosoftOfficeDocumentImage可以非常准确的全文件识别转化中文、英文、表格。

一、CAJ文件的识别

(一)首先,从网上下载CAJ格式的资料文件保存到本地硬盘上。

(二)然后,启动CAJViewer浏览器程序,并在该程序中打开刚才保存的CAJ格式的文件。浏览文件到最后一页后,不要关闭CAJ浏览器程序。

(三)在CAJ浏览器程序窗口中,选择“文件”→“打印”,并选择打印机为MicrosoftOfficeDocumentImageWriter打印机,勾选打印到文件选项和确定打印页数。

(四)保存打印文件(*.prn)到适当位置。等待打印完成后,MicrosoftOfficeDocumentImage自动打开刚才保存的打印文件。

(五)在MicrosoftOfficeDocumentImage窗口中,选择“页面”菜单中的“选择所有页面”菜单项,然后选择“工具”菜单中的“使用OCR识别文本”提取文本。

(六)选择“工具”下的“将文本发送到word”,最后将把整个CAJ文件识别输出到word文件中。

PDF文件的识别

(一)以文本形式保存的PDF文件,用acrobat5专业版,识别整个文件。直接打开从网上下载的PDF格式文件另存为RTF文件,或者选择工具栏上的文字选择按钮,然后选择文字区域,然后复制到Word中即可。

(二)以图片形式保存的PDF文件,将PDF文件打印到MicrosoftOfficeDocumentImageWriter打印机,选择打印形成的文件的保存位置,然后会自动形成一个MDI文件,并且自动用MicrosoftOfficeDocumentImage打开此文件,然后在MicrosoftOfficeDocumentImage中选择“工具”菜单中的“使用OCR识别文本”,识别完成后,在选择“工具”下的,“将文本发送到word”,最后将把整个PDF文件识别输出到word文件中。

(三)加密的PDF文件先下载解密软件,解密后在参照上述步骤1),2)进行。

(四)繁体PDF文件用上述步骤2)的方法识别到word后,用word中的“工具”→“语言”→“中文繁简转换”

超星文件的识别

(一)全文件识别打印到MicrosoftOfficeDocumentImageWriter打印机,然后按上述PDF文件的识别步骤中第二点操作,要注意的是,超星打印功能有点区别,因为超星是目录和全文分开的,所以打印时,需要分别把目录和正文识别到Word中,再合并到一起。打印时要填入打印页码从1到最后一页,不要选择打印全部。在打印选项中,要将页面比例设成真实大小,而不是整宽。注意识别速度比其他格式要慢很多,请保持耐心。一般一本200多页的书,识别需要几分钟的时间。

(二)超星文件识别相对比较麻烦一些,如果还有问题,可以先把超星打印成完整的PDF文件,然后再用上述识别PDF文件的方法转成Word。

四、后记

经过试验,发现MicrosoftOfficeDocumentImage存在一些不稳定的问题,如在用CAJ打印到MicrosoftOfficeDocumentImageWriter时,发现用CAJ5.5版本比较快,而CAJ5.0有时出现假死机。页面显示大时,转化的识别率较高。如果页数多的文件,包括超星,可以分多次转化。由于虚拟打印到MicrosoftOfficeDocumentImageWriter比较慢,并且形成的虚拟文件很大,1本200多页的书大约是60M,因此会严重影响机器的运行速度、C盘和内存空间。建议配置好的机器一次转化不要超过200页,配置差的不要超过100页,同时打印时在任务栏中会出现打印机图标,可以双击,看到打印任务的进度,避免误以为死机。转化完成后请删除c:windowstemp目录下的虚拟打印文件,否则C盘很快会被用光。caj从5.5版本可以进行文字识别功能,我们的pdf文件用CAJ打开,然后用里面的文字识别功能即可得到我们需要的文字了,特别有优势的一个地方在于:即便是图片格式的PDF文件也能识别;另外一个功能就是:有时候pdf设置了密码保护,不允许打印,我们可以用CAJ打开然后再打印,大家不妨试试,这也是CAJ文档的两个用途吧。

(caj,PDF,超星,维普............)中文字提取,如大家常用的caj,超星,维普............只需要两个软件VIRTUALPRINTER;尚书六号,先装一个VIRTUALPRINTER(虚拟打印机)打成OCR软件(我用的是尚书六号)可识别的图像格式(如jpg)之后,就可以提取其中的文字了。这个方法尤其对于有些caj(转成PDF什么也看不清楚的caj)特别有效。从不同格式的文件中提取文本前需要做好以下准备工作,安装CAJViewer5.5浏览器软件和acrobat5专业版浏览器软件安装Office2003,并完全安装Office工具MicrosoftOfficeDocumentImaging,然后在打印机里面会增加MicrosoftOfficeDocumentImageWriter打印机。MicrosoftOfficeDocumentImage可以非常准确的全文件识别转化中文、英文、表格。

使用MicrosoftOfficeDocumentImageWriter虚拟打印机

1、前提需要完全安装Office2003-Office工具-MicrosoftOfficeDocumentImaging,一般默认的office安装没有OCR识别文本功能。

完全安装方法:在添加删除程序里,选择office2003,点击更改,出现了office2003安装修改界面,选择-更改删除-下一步-高级选项-office工具里找到MicrosoftOfficeDocumentImaging选择从本机安装(默认的是“第一次使用时安装”)一路下去就ok了。接下来就可以体验office的文字识别功能了。

2、以最麻烦的超星文件为例。(建议安装ssreader3.8版本,因为3.9版对虚拟打印有限制)

在3.8版本中使用虚拟打也需要一点前期工作,点击控制面板-打印机,列表中看到MicrosoftOfficeDocumentImageWriter,重命名(避免一些writer等字眼,防止超星的禁止功能),命名数字即可,比如2。打开下载的超星文件,由于超星对书目录和正文分别记录页数,所以,如果要全部转化,需要自己算一下页数(目录+正文最后页码既可)。然后选到开始打印的页面,选择:图书-打印-从当前页开始打印-打印页数(自己计算的页数)-确定-选择打印机中选择刚才改名的2打印机-打印,然后弹出对话框选择打印文件(.mdi)名字和存放路径。保存完毕后mdi文件会被MicrosoftOfficeDocumentImaging程序自动打开。

3、在MicrosoftOfficeDocumentImaging打开文件中选择:工具-使用OCR识别文本。注意,如果一次打印的超星页数较多,ocr识别会花较长时间。等待OCR识别完毕,选择:工具-将文本发送到word-保存。

其他:如果是pdf或caj文件,打开文件后直接选择:打印-打印页数……等等同2、3步骤。

  

爱华网本文地址 » http://www.413yy.cn/a/25101011/63765.html

更多阅读

删除系统临时文件的两种方法 系统临时文件

删除系统临时文件的两种方法——简介 删除系统临时文件的方法有两种,包括手动删除系统临时文件和使用第三方软件删除临时文件。下面就跟win7之家小编一起来了解一下吧!删除系统临时文件的两种方法——方法/步骤删除系统临时文件的两

如何识别图片上文字的字体 图片文字识别字体

? ??在百度知道里经常会看到有知友在询问其提供的图片上的文字是什么字体,今天向大家介绍一种简便、快速的识别途径。即通过一个在线的识别网站:http://www.qiuziti.com/,可以实现英文字母、中文汉字的字体识别,下面将我曾经帮知友

CD抓轨生成无损音频文件及CUE文件的方法 cd无损抓轨

使用ExactAudioCopy抓轨CD生成无损音频文件+CUE文件教程,音频发烧友必看。CD抓轨生成无损音频文件及CUE文件的方法——工具/原料有光驱的电脑、音乐CD光盘、ExactAudioCopy软件CD抓轨生成无损音频文件及CUE文件的方法——步骤/方法CD

windows-7纯净版镜像文件的下载 windows10纯净版镜像

windows-7纯净版镜像文件的下载——简介xp停止服务支持,升级到windows-7是不错的选择。但网上和电脑店里出售的windows-7光盘镜像都捆绑着许多根本用不上的软件,下载安装后不但占用硬盘空间,拖慢电脑运行速度,还可能隐藏着未知的木马病

怎么显示文件的扩展名 win10怎么看文件扩展名

怎么显示文件的扩展名——简介我们日常知道word文档时doc的扩展名,excel是xls,但是这些都仅限于是我们本身知道的,那电脑中文件的扩展名是怎么显示出来的呢?下面小编就来为大家介绍步骤:怎么显示文件的扩展名——方法/步骤怎么显示文件

声明:《CAJ文件的识别 caj文字识别乱码》为网友封我个睡神分享!如侵犯到您的合法权益请联系我们删除