PDF 与 Word 文档自动化切分及多 Sheet 结构化 Excel 重构
Python
pdfplumber
python-docx
openpyxl
Pandas
正在基于该需求推演落地方案…
需求痛点(公开)
业务团队经常需要整理分散在各类 PDF 与 Word 报告中的混杂数据与段落。若全靠人工复制粘贴,不仅效率低下,而且在需要依照章节或分类标题将内容有序拆分至各个独立工作表(Sheet)时,极易产生排版混乱与数据遗漏。
切入方向(公开)
开发轻量级文档解析与导出脚本,利用 python-docx 与 pdfplumber 自动识别源文件中的层级标题、表格及段落文本,以章节标题为逻辑分界点,通过 openpyxl 生成多 Tab 分类清晰、格式规范的 .xlsx 电子表格。
下方分析是尚待编辑复核的 AI 假设,分数与投入判断不代表已验证的推荐。
发布预算不代表已成交或付款;任务数量不等于独立买家数量,也不能证明订阅意愿。小样本仅作为初步线索。
原始需求溯源 · 3 条
"I have several digital files—mostly PDFs and Word documents—that contain a mix of numbers and text. I need everything transferred accurately into…"
"I have several raw data files that need to be transferred into a single, well-organised Excel workbook. Your first step will be to enter the…"
"I have several PDF and Word files that contain plain text tables and paragraphs which I need reorganised inside a clean .xlsx workbook. The data must…"
仅展示任务摘要与外链,不转载原文全文;个人信息已脱敏。数据来源已登记,可溯源。
💬 社区讨论