DA/T31_2005纸质档案数字化技术规范标准
- 格式:doc
- 大小:25.74 KB
- 文档页数:9
纸质档案数字化技术规范DA/T31-2005
1 范围
本标准规定了纸质档案数字化的主要技术要求。
本标准适用于用扫描仪对各种纸质档案的数字化加工处理。
2 规范性引用文件
下列文件中的条款通过本标准的引用而成为本标准的条款。凡是注日期的引用文件,其随后所有的修改单(不包括勘误的内容)或修订版均不适用于本标准,然而,鼓励根据本标准达成协议的各方研究是否可使用这些文件的最新版本。凡是不注日期的引用文件,其最新版本适用于本标准。
GB/T 17235.1 连续色调静态图像的数字压缩编码
GB/T 17235.2 连续色调静态图像的数字压缩编码
GB/T 18894?2002 电子文件归档与管理规范
ITU(CCITT)G3 二值图像压缩算法
ITU(CCITT)G4 二值图像压缩算法
DA/T18?1999 档案著录规则
档案管理软件功能要求暂行规定国家档案局档发[2001]6号
3 术语和定义
下列术语和定义适用于本标准。
3.1
数字化 Digitization
用计算机技术将模拟图像转换为数字图像的处理过程。
3.2
纸质档案数字化Digitization of Paper?Based Records
对普通(黑色字迹清晰)的油印、铅印、胶印等印刷件或复印件纸质档案进行数字化及应用的过程。
3.3
数字图像 Digital Image
表示景物图像的整数阵列。一个二维或更高维的采样并量化的函数,由相同维数的连续图像产生。在矩阵(或其他)网络上采样一连续函数,并在采样点上将值最小化后的阵列。
3.4
黑白二值图像 Binary Image
只有黑白两级灰度的数字图像。它对应于黑和白的两种状态文字稿、线条图、指纹图等。
3.5
连续色调静态图像 Continuous?tone Still Image
以多于两级灰度的不同浓淡层次或以不同颜色通道组合成的静态数字
图像。
3.6
失真度 Distortion Measure
对档案原件进行数字化转换后,在同等测试环境下,数字图像与档案原
件色彩、几何、压缩算法等差值。
3.7
可懂度 intelligibility
表示数字图像向人或机器提供信息的能力。
3.8
清除图像冗余或对图像近似的任一种过程,其目的是对图像以更紧凑的形式表现。
3. 9
分辨率Resolution
指单位长度内图像包含的点数或像素数。
3.10
TIFF Tagged Tmage File Format
标记图像文件格式。一种基于标记的无损(不丢失信息)压缩格式,用于在应用程序之间和计算机平台之间交换文件。因为它存储图像细微层次的信息非常多,图像的质量也得以提高,故而非常有利于原件为黑白档案的复制储存。
3.11
JPEG Joint photographic Experts Group
联合照片专家组。一种丢失少量信息的压缩格式,尤其适用于屏幕和打印显示,支持所有主要计算机平台和Web浏览器。JPEG格式文件小,影像质量多数情况下均可接受。考虑储存空间及传输效率,原件为彩色的档案可迁此格式复制储存。
4 数字化基本流程
纸质档案数字化的基本流程主要包括案卷整理、目录建库、批量扫描、数据处理、信息存储、检索利用等工序。
4.1 案卷整理
对需要扫描的案卷进行适当整理,做出标识。
4.2 目录建库
为数字化的档案检索而建立必要的目录数据库。
4.3 批量扫描
按照档案数字化具体任务的整体安排按计划分批次进行扫描。
4.4 数据处理
4.4.1 对扫描图像进行校对,确保图像完整无误,并视需要对有问题的扫描图像进行纠偏、去污、拼接等技术处理。
4.4.2 对裸数据进行验收前的相应处理,包括文件的格式转换、逻辑分盘处理、添加说明性文件,以及数据的挂接、检验、上载、质量检查和备份。
4.5 信息存储
根据不同的扫描图像选择适当数据格式、编码方式和存储介质对信息进行保存。
4.6 检索利用
按用户需求提供检索利用。
5 案卷整理
在批量扫描之前,按下述步骤对案卷进行整理,确保档案数字化质量。
5.1 分件
5.1.1 把同一案卷中的扫描件和非扫描件分开。
5.1.2 在扫描件中将大图、照片插入指示页,便于扫描工序批量扫描,实际图像放在图像处理时进行重扫,替换指示页。
5.1.3 填写《数据加工过程处理单》(见附录A),对需要特殊处理的页,标识清楚。
5.2 分页
对批量扫描前的档案进行页号、件号的标注。如在标注中与原档案中的件数、页号不一致,应以此为准。
5.3 拆卷
去除档案中原来的装订物,以便后续扫描工作的进行。
5.4 装卷
按档案保管要求恢复原装订。
6 建目录库
6.1 目录著录
根据DA/T18确定档案著录项,并进行著录。
6.2 数据格式选择
所选定的数据格式通用,应能直接或间接与DBF文件格式或通过XML文
档进行数据交换。
6.3 目录输入
将著录好的目录输入计算机内,建立机读目录数据库。
7 批量扫描
7.1 扫描方式
纸质档案扫描可采用黑白二值图像和连续色调图像两种方式。
7.1.1 页面为单色文字的纸质档案,宜采用黑白二值图像扫描;页面为多色文字图像的档案文件,可采用连续色调图像扫描。
7.1.2 字迹清晰、不带图片的档案材料,采用黑白二值图像扫描;清晰度较差或带有图片的档案材料,可采用连续色调图像扫描。
7.2 分辨率选择
7.2.1 单色页面档案文件,扫描分辨率一般建议选择100~200dpi。
7.2.2 彩色页面档案文件,扫描分辨率可选择100dpi以上参数值进行。
7.2.3 大幅面档案文件,如工程图纸、报纸等尺寸超过A3的,可选用大幅面图像扫描仪(如A0)、大幅面数码平台、缩微照像后胶片数字转换,也可以采用小幅面扫描后的图像拼接。扫描分辨率应选择1OOdpi以上。
7.2.4 需要时可根据原件的清晰度适当调整扫描分辨率。如原件质量较差且尺寸较小,可适当提高分辨率;反之也可相应减少分辨率,增减的多少以扫描后图像按原尺寸显示后是否清晰为准。
7.3 特殊页面的扫描
7.3.1 粘贴页与表格
对于粘贴折页,可用大幅面扫描仪扫描,或先分部扫描后拼接;对部分字体很小、字迹密集的情况,可适当提高扫描分辨率,选择灰度扫描或彩色扫描,采用局部深化技术解决;对字迹与表格颜色深度不同的,采用局部淡化技术解决
7.3.2 一般文本流程图
采用适当的分辨率扫描及局部深化技术,确保文本流程图清晰。同时采用不同设备满足文本流程图的扫描工作。
7.3.3 插图