pdf

数据 社区
  • 作者仓库星标 0
  • 许可证 Proprietary. LICENSE.txt has complete terms
  • 作者更新于 2026年8月22日 01:10
解读按原文结构重写,命令、链接、术语均保留;右侧可核对作者原始 SKILL.md

作者的方法

原文按操作选择工具,而不是把所有任务交给同一个库:pypdf 负责合并、拆分、旋转和加密;pdfplumber 负责保留布局的文本与表格提取;reportlab 负责创建 PDF;qpdfpdftk 与 Poppler 工具处理命令行任务。

关键流程

  • 普通 PDF 先用 PdfReader / PdfWriter;表格提取改用 page.extract_tables()
  • 扫描件没有可直接提取的文本,需要 pdf2image 转图后交给 pytesseract OCR。
  • 表单处理转到 FORMS.md,高级用法和 JavaScript 方案转到 REFERENCE.md,正文只保留常见操作的可运行示例。

关键取舍与边界

  • 创建 PDF 时,ReportLab 内置字体不含 Unicode 上下标字形;应使用 <sub> / <super>,否则可能渲染成黑框。
  • OCR、Poppler、qpdfpdftk 都是额外依赖,不能因为示例存在就假设环境已经安装。
  • 当前原文给的是处理配方和工具分工,不承诺视觉排版质量;产物仍需按页面、文本或表格结果复核。

流狐判断:适合批量处理、抽取或生成 PDF;如果任务核心是复杂视觉设计,应另选以版式设计为主的工作流。

流狐档案 作者与许可取自来源;运行、权限和网络为流狐检测或估算
流狐分类
数据
作者声明 Agent
未找到明确声明;不据此推断已兼容或已测试
静态检查
94 / 100 · 启发式扫描,不代表运行安全
作者 / 版本 / 许可
@anthropics · Proprietary. LICENSE.txt has complete terms
流狐 Token 估算
低消耗
流狐接入估算
即装即用
是否需要外部 API Key
未发现要求
检测到的系统要求
未声明
底层运行要求
Python
检测到的文件与系统行为
  • 只读
  • 允许写入 / 修改
检测到的网络行为
仅限本地
安装命令数
无(仅作为资料)

档案由构建时根据 SKILL.md 与安装命令自动衍生,可能与作者实际意图存在差异。

需要注意: 未限定 allowed-tools,默认拥有全部工具权限。

输出预览 pdf.preview
作者没有在当前 SKILL.md 中定义固定输出样例。

讨论

基于 GitHub Discussions。登录 GitHub 即可参与讨论、点赞、订阅更新。