详细方法
- 先判断 PDF 类型:如果能直接选中文字,它不是扫描版,可以直接复制;如果只能选中整页图片,就需要 OCR 文字识别。
- 确认来源和使用边界。只处理自己有权使用的试卷、学校授权材料或个人整理资料,不建议处理来源不明的盗版扫描件。
- 把 PDF 复制一份作为备份,文件名加“OCR处理版”。不要直接在原文件上改。
- 使用 WPS、Adobe Acrobat、福昕、ABBYY 或其他 OCR 工具,选择“识别文字/OCR/扫描件转 Word”。识别语言要选中文和英文,纯英文材料就选英文优先。
- 如果页面歪斜或拍照阴影明显,先做“纠偏/增强扫描/裁边”,再 OCR。歪页直接识别,题号和选项最容易错。
- 导出 Word 后不要急着排版,先全选正文,统一字体和字号;复制来的乱格式可以先“清除格式”。
- 用查找替换清理多余空行:把连续两个段落标记替换成一个,重复几次,直到空行正常。
- 检查题号:把 1. 2. 3. 这类题号统一成 Word 自动编号,或至少统一缩进。选择题 A/B/C/D 要对齐,避免一行一个位置。
- 重点人工核对英文:OCR 常把 l 和 I、rn 和 m、标点、撇号、连字符识别错。阅读题尤其要检查人名、数字、否定词和选项。
- 如果原 PDF 有答案区,单独放到最后一页,并在文件名标注“教师版”;学生版要删除答案。
- 打印前进入预览,检查有没有题目跨页、选项被分到下一页、表格太窄、页边距太小。
- 最后另存两个文件:可编辑 Word 和学生版 PDF。课堂发给学生优先发 PDF,自己保留 Word 方便下次修改。
完成标准
把不可编辑材料整理成可修改、可排版、可二次加工的 Word 文档。
