什么是 OCR?AI 如何把图片和扫描件变成可编辑文字

OCR 是什么?光学字符识别如何从图片中读出文字、为什么表格和手写体更难、它与文档理解和 RAG 有何关系,一文讲清。

什么是 OCR?AI 如何把图片和扫描件变成可编辑文字
编辑部 ·

扫描合同、纸质发票、照片里的菜单,对电脑来说原本只是像素,无法搜索或复制。**OCR(Optical Character Recognition,光学字符识别)**把这些像素转换成文字和位置,让图像中的内容重新成为可编辑、可检索的数据。

OCR 不只是识字

基础 OCR 输出字符;更复杂的文档处理还要识别段落、标题、表格、印章、阅读顺序和字段关系。把“金额”“日期”“发票号”从一页杂乱扫描件中提取出来,通常需要版面分析、OCR 与规则或模型共同处理。

哪些情况容易出错

  • 模糊、倾斜、反光和低分辨率照片
  • 手写体、罕见字体、混合语言
  • 复杂表格、多栏排版、盖章遮挡
  • 人名、产品名、金额和编号等关键字段

因此 OCR 输出应保留原图和置信度,重要数据必须人工抽查。一个字符误识别,就可能把金额或证件号完全改掉。

OCR 和 RAG

若知识库资料主要是扫描 PDF 或图片,先用 OCR 把它变成文本,才能进行切分、Embedding 和检索。OCR 质量差会直接导致 RAG 找不到正确资料;文档导入前的清洗与验证并非可选步骤。

总结

OCR 是连接纸质/图像信息与数字工作流的基础能力。它让图片可搜索、扫描件可提取,但不保证绝对准确。对合同、账单和医疗记录等高价值内容,始终保留原始图像、置信度和人工复核环节。