批量 Word 文档转录与字符级精度校验
Python
python-docx
diff-match-patch
Markdown
正在基于该需求推演落地方案…
需求痛点(公开)
团队在处理批量历史 DOC/DOCX 文档时,直接套用自动化脚本容易出现样式冲突或乱码,迫使业务人员耗费大量工时逐字重新输入,且极易在标点符号、英文字符大小写及段落间距等排版细节上产生人为疏漏。
切入方向(公开)
基于 python-docx 与字符级差分比对算法构建文档解析清洗流程,并配套轻量级双录校验界面,确保文稿在迁移为标准化 Markdown 或纯文本归档时实现字词与标点的零误差还原。
下方分析是尚待编辑复核的 AI 假设,分数与投入判断不代表已验证的推荐。
发布预算不代表已成交或付款;任务数量不等于独立买家数量,也不能证明订阅意愿。小样本仅作为初步线索。
原始需求溯源 · 2 条
"I have a collection of paper documents that need to be digitised quickly and accurately. Your task is straightforward data entry: type everything you…"
"I have a batch of digital Word files (DOC/DOCX) that need to be re-typed with absolute accuracy. All content is plain text—no formulas, images, or…"
仅展示任务摘要与外链,不转载原文全文;个人信息已脱敏。数据来源已登记,可溯源。
💬 社区讨论