多格式异构商业文档联系人自动化提取与清洗管道
Python
Tesseract OCR
pdfplumber
Pandas
Google Sheets API
正在基于该需求推演落地方案…
需求痛点(公开)
销售与拓客团队常需从纸质扫描件、参会名录和多页 PDF 等非结构化文档中收集联系方式;人工逐条录入不仅效率低下,且模糊文本易引入拼写错误与脏数据,导致邮件退信并污染 CRM 数据库。
切入方向(公开)
构建融合 OCR 文字识别与正则规则校验的自动化提取流程,精准抽离异构文档中的姓名、企业邮箱、电话与职位属性,完成自动去重和格式清洗后直接输出到 Excel 或 Google Sheets 表格。
下方分析是尚待编辑复核的 AI 假设,分数与投入判断不代表已验证的推荐。
发布预算不代表已成交或付款;任务数量不等于独立买家数量,也不能证明订阅意愿。小样本仅作为初步线索。
原始需求溯源 · 2 条
"I have a set of PDF documents that each contain contact information presented as straightforward lists. Every entry in these lists must be…"
"The task is straightforward: I need contacts pulled from a collection of business documents and compiled into a clean spreadsheet. Source files range…"
仅展示任务摘要与外链,不转载原文全文;个人信息已脱敏。数据来源已登记,可溯源。
💬 社区讨论