扫描PDF第20页为什么不一定是书中第20页:封面、罗马数字页与引用定位怎么记录
查看器显示的文件页序、页面上印出的页码和文献结构位置并不是同一个字段。跨语言协作时应同时记录文件版本、文件页序、可见页码、章节标题和短引文,让不同扫描件中的同一段内容可以复查。
合作者说的“第20页”可能是三个位置
两位合作者拿到同一本书的不同扫描件。一人留言“见PDF第20页”,另一人翻到查看器显示的20,却只看到目录。问题未必是有人数错了,而是双方用同一个“页”字指向了不同位置。
第一种位置是文件页序,也就是这张图像在PDF容器中排第几。第二种是页面上实际印出的编号,例如小写罗马数字xii、正文阿拉伯数字20,或附录自己的编号。第三种是内容结构位置,例如“第二章第三节、表4下方第二段”。三者可能一致,也可能完全分开。
可靠引用的起点不是选一个数字,而是把这三层拆开记录。查看器页序用于在当前文件里快速跳转;可见页码连接原书的出版结构;章节标题和短引文则帮助另一版本重新定位。
封面与前置页怎样制造偏移
扫描件常把封面、书名页、版权页、献词、目录和空白页一起装入文件。它们都是文件页面,却未必进入正文从1开始的页码。一本书若在正文前有两张封面、十二页罗马数字前置页,文件中的第20张图像就不会等于正文印刷第20页。
同书的另一份扫描可能从书名页开始,也可能删掉空白页;还有的把封面分别扫描为正面和背面。正文没有改变,文件总页数和偏移量已经不同。因此“总页数接近”不是版本相同的充分证据,“PDF第20页”也不是可跨文件复用的定位。
先看正文第一页。记录它在查看器中的文件位置,以及页面上是否印着1。再看目录最后一页、第一章标题页和附录起点。几个锚点足以画出当前文件的偏移关系,不必凭感觉给所有页面统一加减一个数字。
页面标签不是装饰文字
PDF Association展示的修正版文件把封面标为Cover-A与Cover-B,前置页标为小写罗马数字i至xiii,正文标为阿拉伯数字1至1003,附录勘误再用Errata-1至Errata-17。这说明一个PDF可以给不同页面区间设置不同的逻辑标签。
支持页面标签的阅读器可以按照页脚显示的标签导航,减少物理页面位置与逻辑编号的混淆。也正因为如此,不同查看器里的“20”未必采用同一种口径:有的界面突出文件序号,有的会显示页面标签,有的同时显示“20(34/1035)”之类的组合。
交接资料时应写清楚自己看到的界面。例如“文件第34页,页面标签20,第二章开头”比“第20页”多了几个字段,却能让对方判断自己的软件使用哪一种编号。
页面标签正确时,查看器显示可能与印刷页码一致;这是一种方便的情况,不是所有PDF或所有阅读器的保证。扫描文件没有标签、标签设置错误或软件忽略标签时,仍要回到页面图像核对。
扫描顺序与完整性要另外验收
页码偏移只是定位问题,页面顺序还涉及扫描质量。FADGI把结构元数据用于表达数字对象组成部分之间的关系、章节等重要知识结构、不同表现形式、文件或页面数量以及正确顺序。换句话说,多页对象不是一堆图像的简单集合,顺序本身也是资料的一部分。
FADGI的质量保证清单还要求核对多页对象的正确顺序与完整性,确认页面按顺序排列且没有缺页,并让结构记录中的组成部分对应实际图像文件。这提供了一个重要边界:两份扫描件页数不同,不能立即断言较短的一份缺页;必须先确认多出来的是封面、空白页、折页、重复页还是正文。
检查时沿着连续印刷页码浏览几个区间,特别留意章节转换、跨页表格和插图。若19之后直接出现21,再结合目录和装订痕迹判断;若某页重复两次,总页数反而可能更长。没有逐页证据时,把结论写成“顺序待核对”或“疑似缺页”,不要写成确定事实。
OCR可以检索,不能替代页面证据
有文字层的扫描件很方便搜索姓名、地名和术语,但OCR结果可能漏字、错行或把波斯语与阿拉伯语字形混淆。搜索命中只能把读者带到候选页面,真正引用仍应看页面图像、可见页码和上下文。
如果两个扫描件的OCR分段不同,同一句话在搜索结果里的段落编号也会变化。此时短引文应取页面上可辨认、不过长且具区分度的一段,并保留原文字形;不要用自动识别后未经核对的文本充当原文。
OCR也不能证明扫描完整。缺失的页面当然不会出现在文字层中,而重复页可能产生重复命中。文字搜索和页面清点解决的是两种问题,应分别记录。
做一张五字段引用卡
第一栏记录文件身份:馆藏名称、稳定标识、文件名或下载日期,能区分你使用的是哪一份扫描。第二栏记录文件页序,写明查看器采用从1开始还是其他显示方式。第三栏抄下页面上可见编号,包括罗马数字、前缀或“无页码”。
第四栏记录结构位置,例如章名、小标题、表图编号或页眉。第五栏保留一段短引文,足以在另一份扫描件中搜索或目视确认。对于跨语言材料,还可附上原文字形和自己使用的转写,不要只留下译名。

例如:“馆藏A,文件第34页;印刷页20;第二章‘地方市场’,表2下方第一段;短引文‘……’。”合作者即使使用馆藏B,也能先找第二章,再找印刷页20,最后用短引文确认是否为同一段。
受控比较两份扫描件
不要同时更换文件、查看器和引用方法。先用同一软件打开两份文件,分别记录正文第一页、目标页和下一章第一页的五个字段。比较三个锚点的偏移是否固定。
若差值始终相同,原因可能是某一份多收录了固定数量的前置页;若差值在中途改变,应检查是否有插页、折页、重复或缺失。接着换一个支持页面标签的查看器,只验证显示方式是否改变,不重做内容结论。
同书两份扫描件即使正文相同,也可能因是否包含封面、空白页或附录而让查看器第20页对应不同内容。这种比较能把“软件显示不同”和“文件结构不同”拆开,避免用一个统一偏移量掩盖中途变化。
引用结果怎样交接
在论文注释、团队笔记或资料库中,正式书目信息仍放在首位;五字段引用卡作为定位补充。文件不能公开分享时,也可以交换馆藏标识、页面标签、章节和短引文,而不是重新上传受限制的扫描件。
如果之后换用质量更好的版本,不要覆盖旧记录。新增一条“馆藏B对应位置”,说明两者是同版不同扫描、不同版本,还是尚无法确认。这样他人可以追溯原引用是基于哪份文件,而不会把新页码倒填到旧结论中。
结论停在可复查的位置
“PDF第20页”只在双方拥有同一文件、同一显示口径时勉强够用。跨馆藏、跨软件或跨版本协作时,应该同时记录文件版本、文件页序、可见页码、章节标题与短引文,并在另一份扫描件中试着重定位。
这个方法不能替你证明扫描件完整,也不能让OCR文字取代页面图像。它能做的是把模糊的页码争论变成一组可以逐项检查的字段:哪里是容器位置,哪里是原书编号,哪里是内容本身。结论更窄,但下一位读者可以沿着同一条路径找到原文。
资料来源
- PDF Association:《PDF 2.0 Errata Collection 2 is now available》,发布或更新于 2024-07-25
- Federal Agencies Digital Guidelines Initiative (FADGI):《Technical Guidelines for Digitizing Cultural Heritage Materials, Third Edition》,发布或更新于 2023-05-09