PDF 深度取证级元数据清洗与底层结构重建
Python
QPDF
PyMuPDF
ExifTool
Poppler
正在基于该需求推演落地方案…
需求痛点(公开)
企业在分发敏感 PDF 文档时,极易因残留的增量版本历史、作者痕迹及底层结构元数据带来合规与隐私泄露隐患,而普通的清洗方式极易导致排版错位、内嵌字体失效以及视觉呈现损坏。
切入方向(公开)
基于 QPDF 与 PyMuPDF 构建底层文档处理流水线,深度解析 PDF 的 COS 对象树,彻底剔除增量修改流与取证元数据标记,并在保证版面排版与矢量渲染完全一致的前提下重构纯净二进制文档。
下方分析是尚待编辑复核的 AI 假设,分数与投入判断不代表已验证的推荐。
发布预算不代表已成交或付款;任务数量不等于独立买家数量,也不能证明订阅意愿。小样本仅作为初步线索。
原始需求溯源 · 2 条
"THIS CAN GET CONVERTED TO LONG TERM WORK ASSIGNMENT DONT APPLY IF YOU CANNOT MATCH 100% TO THE ORIGINAL DOCUMENT AND MATCH METADATA I have PDF that…"
"THIS CAN GET CONVERTED TO LONG TERM WORK ASSIGNMENT I have PDFs that must be rebuilt so the visual"
仅展示任务摘要与外链,不转载原文全文;个人信息已脱敏。数据来源已登记,可溯源。
💬 社区讨论