2024年1月25日发(作者:)

毕业论文:如何将PDF、CAJ、KDH形式的论文转为Word(如果你还在上学,总有一天你会用到的!)

来源: 汤保涛的日志

从中国期刊数据库或者从中国知网下载而来的资料,大都是CAJ、NH、KDH、PDF等格式,需使用中国期刊网的专用全文格式阅读器 CAJViewer 全文浏览器进行查看,一般不能对它们进行编辑。为了方便对这些文档编辑,把其转化为WORD文档形式,在这里主要介绍了如何将PDF、CAJ、NH、KDH文件转换成.DOC格式文件,希望对大家有所帮助。

一、PDF文档转WORD文档

(一)以文本形式保存的PDF文件,用acrobat 5 专业版,识别整个文件。直接打开从网上下载的PDF格式文件另存为RTF文件,或者选择工具栏上的文字选择按钮,然后选择文字区域,然后复制到Word中即可。 也可用其它PDF转Word工具或相关软件,例如:SolidConverterPDF PRO v3.0。网上巳有很多这方面的论述可参阅:/

(二)以图片形式保存的PDF文件,将PDF文件打印到Microsoft Office Document Image Writer打印机,选择打印形成的文件的保存位置,然后会自动形成一个MDI文件,并且自动用Microsoft Office Document

Image打开此文件,然后在Microsoft Office Document Im age中选择“工具”菜单中的“使用OCR识别文本”,识别完成后,在选择“工具”下的,“将文本发送到word”,最后将把整个PDF文件识别输出到word文件中。操作之前电脑上须先安装“汉王ocr”或者“th-ocr”等光学识别软件。推荐:汉王ocr6.0 汉王ocr2.5 清华文通th-OCR 9.0

(注:OCR是英文Optical CharacterRecognition的缩写,意思为光学字符识别,通称为文字识别,它的工作原理为通过扫描仪或数码相机等光学输入设备获取纸张上的文字图片信息,利用各种模式识别算法分析文字形态特征,判断出汉字的标准编码,并按通用格式存储在文本文件中,由此可以看出,OCR实际上是让计算机认字,实现文字自动输入。它是一种快捷、省力、高效的文字输入方法。)

二、CAJ、KDH文档转WORD文档

从 不同格式的文件中提取文本前需要做好以下准备工作,安装CAJViewer5.5浏览器软件和acrobat 5

专业版浏览器软件安装Office2003,并完全安装Of fice工具Microsoft Office Document Imaging,然后在打印机里面会增加Microsoft Office Document Image Writer打印机。 Microsoft Office Document Image可以非常准确的全文件识别转化中文、英文、表格。

1、CAJ文件的识别

(一)首先,从网上下载CAJ格式的资料文件保存到本地硬盘上。

(二)然后,启动CAJViewer浏览器程序,并在该程序中打开刚才保存的CAJ格式的文件。浏览文件到最后一页后,不要关闭CAJ浏览器程序。

(三)在CAJ浏览器程序窗口中,选择“文件”→“打印”,并选择打印机为Microsoft Office Document Image

Writer打印机,勾选打印到文件选项和确定打印页数。

(四)保存打印文件(*.prn)到适当位置。等待打印完成后,Microsoft Office Document Image 自动打开刚才保存的打印文件。

(五)在Microsoft Office Document Image窗口中,选择“页面”菜单中的“选择所有页面”菜单项,然后选择“工具”菜单中的“使用OCR识别文本”提取文本。

(六)选择“工具”下的 “将文本发送到word”,最后将把整个CAJ文件识别输出到word文件中。

注:对PDF转DOC的识别率不是特别完美,转换后会丢失原来的排版格式,所以转换后还需要手工对其矫正,花了一下午的时间整理的一些资料,希望对大家有所帮助!