双语扫描件精准转录与多编码字库排版数字化
Microsoft Word
Tesseract OCR
Kruti Dev Converter
Unicode
Python-docx
正在基于该需求推演落地方案…
需求痛点(公开)
翻拍或扫描的双语公函往往清晰度不足且版式繁杂,通用 OCR 工具难以准确识别复杂连字;加之受限于传统档案系统,客户常强制要求特定的输出字库(如基于 ASCII 编码的 Kruti Dev 字体或标准 Mangal Unicode),常规录入极易引发乱码、断字及段落错位。
切入方向(公开)
构建结合多语言 OCR 预识别与人工精细校对的排版流程,针对低质量纸质图像进行段落重构,支持 Kruti Dev 与 Unicode 之间的字库精准转码,交付样式统一、无冗余样式的 Microsoft Word 可编辑文档。
原始需求溯源 · 2 条
"I have a stack of bilingual articles—some lines in English, others in Hindi—written by hand in my notebooks. I need each piece re-typed faithfully…"
"I have a series of more than ten letters that must be faithfully re-typed into clean, editable Word files—each letter available in both Hindi…"
仅展示任务摘要与外链,不转载原文全文;个人信息已脱敏。数据来源已登记,可溯源。
💬 社区讨论