菜单
小墨

小墨

文档转Markdown的隐形成本:数值对了,语义丢了

在构建 RAG 系统或准备 AI 输入数据时,将 Office 文档转换为 Markdown 已成为标准流程。然而,一个看似成功的转换过程可能正在悄悄剥离文档中至关重要的语义信息。最近的一次技术测试揭示了一个容易被忽视的问题:转换后的 Markdown 在数值层面完全正确,却在语义层面产生了微妙的退化。

转换失败的代价远低于语义退化

以 Excel 表格为例,单元格显示为 15.5% 的百分比格式,在底层存储为 0.155。当这个值被转换为 Markdown 后,输出的正是 0.155 这个数值。从纯计算角度看,这个结果是准确的;但从业务语义角度看,原始的百分比符号、千分位分隔符、货币单位等显示格式信息已经全部丢失。这种损失的危险之处在于它不会触发任何错误提示,只会静默地流入下游系统,导致检索匹配失败或模型理解偏差。

四层风险来源:解析器、中间模型、序列化、下游接收

深入分析发现,语义损失可能发生在转换链的四个关键环节。首先是解析器层,工具可能只读取了单元格的底层数值,而忽略了格式化规则的应用。其次是中间模型层,某些信息可能在该阶段没有被正确承载。第三层是 Markdown 序列化过程,工具可能主动选择了不输出某些元数据。最后是下游接收层,许多系统只接受 Markdown 文本本身,而对 assets 资源、页级结果和警告信息视而不见。

程序没有撒谎,它只是没有告诉你省略了什么。

“技术感悟”
积墨 AI 核心产品

积墨企业专属知识库

混合检索 + 重排序技术,支持多源文档一键向量化导入,为企业打造专属高精度知识大脑。

测试工具 anydoc 的实际表现

本次测试使用了开源工具 anydoc,这是一个基于 Rust 编写的本地文档转换器,支持 Word、PowerPoint、Excel、PDF 等多种格式。测试环境为 macOS arm64,工具成功完成了所有测试文件的转换,速度达到毫秒级别。然而,在处理 Excel 文件时,百分比、货币符号和千分位等显示格式确实未被保留。项目维护者已经注意到了这一问题并提交了修复 PR。

安全隔离与验收标准的重要性

除了 Excel 格式丢失问题外,PDF 转换也面临挑战。测试样本中的文字内容基本保留,但多级列表和表格结构被明显扁平化,图片引用仅保留了替代文字而丢失了原始位置信息。对于混合型 PDF(包含扫描页和文字页),工具可能会跳过需要 OCR 的页面并仅输出警告,这意味着服务端不能仅依赖退出码来判断转换是否成功。

如有侵权,请联系删除。

#AI#文档处理#RAG#格式转换#数据保真
分享文章

相关文章推荐

试用咨询
企业微信二维码

扫码添加企业微信