双语(天城文与英文)受保护文本高保真转录与 PDF 排版
Google Cloud Vision API
Tesseract OCR
Python
ReportLab
Typst
正在基于该需求推演落地方案…
需求痛点(公开)
许多数字阅读器或受限界面采用 Canvas 渲染或禁用复制机制,导致内容无法直接提取。当文本涉及印地语(天城文)与英语混合时,通用 OCR 往往会丢失元音附标(matra)、结合符(halant)或破坏连字结构,极易出现字符乱码、标点错乱及段落格式丢失。
切入方向(公开)
结合屏幕高分辨率捕获、针对印度语系优化的 OCR(如 Google Cloud Vision API)与人工双语校对流程,重点核验元音标音、连字结合与标点断句,并通过 ReportLab 或 Typst 等排版引擎重新构建结构对齐、样式一致的高保真 PDF 交付文件。
下方分析是尚待编辑复核的 AI 假设,分数与投入判断不代表已验证的推荐。
发布预算不代表已成交或付款;任务数量不等于独立买家数量,也不能证明订阅意愿。小样本仅作为初步线索。
原始需求溯源 · 2 条
"I have a collection of bilingual Hindi–English articles that exist only in handwritten form. I need every word re-typed with great accuracy into an…"
"I have 6–10 bilingual articles that exist only as digital text displays which cannot be directly copied. I need each piece re-typed from scratch,…"
仅展示任务摘要与外链,不转载原文全文;个人信息已脱敏。数据来源已登记,可溯源。
💬 社区讨论