高保真 PDF 纯文本无损提取与排版清洗
Python
pdfplumber
pdfminer.six
Regex
正在基于该需求推演落地方案…
需求痛点(公开)
直接复制或使用简陋的 PDF 解析工具时,极易引入异常硬回车、折行断词破损、残留项目符号以及隐藏控制字符,导致后续接入数据管道或语言模型前需要耗费大量人力逐行比对校正。
切入方向(公开)
利用 pdfminer.six 或 pdfplumber 读取底层字符流,自动过滤标题格式、列表标记与排版元数据,智能修复折行连字符并按自然阅读顺序重组,交付完全无格式噪音、字符零遗漏的纯文本数据。
下方分析是尚待编辑复核的 AI 假设,分数与投入判断不代表已验证的推荐。
发布预算不代表已成交或付款;任务数量不等于独立买家数量,也不能证明订阅意愿。小样本仅作为初步线索。
原始需求溯源 · 2 条
"I have a PDF made up of clearly defined headings, tables, and ordered paragraphs. I need every single character of that document—no sections skipped…"
"I will share one PDF that contains only text. Your job is to pull every word out of that file and give it back to me as clean, plain-text—no…"
仅展示任务摘要与外链,不转载原文全文;个人信息已脱敏。数据来源已登记,可溯源。
💬 社区讨论