社会专题
靓丽女人 黑白社会 硬件网络 天下军事 教育咨询 星新一代 汽车电子 幽默笑话 农村特色 有书有道 软件技术 玄幻奇幻 办公达人 便民服务 免费资源 代码效果 美文园地 寻医问药 健康保健 时尚酷玩 天文地理 科技科幻 美食天下 游山玩水 历史天空 制作教程
FLASH频道
女生游戏 益智游戏 有声艺术 有声故事 电脑运用 休闲游戏 MTV类 运动游戏
聚划算
商旅游玩 装潢装饰 家电家具 服装服饰 健康保健 二手特色 生活必备 数码产品
映讯频道
喜剧片 国内片 情感片 动作片 战争片 纪录之窗 欧美剧集 明星云集 动漫片 港澳台剧 大陆剧 科幻片 恐怖片 浓缩电影 教育教学 艺术无界 一技之长 邻国热剧
下载中心
音体美合 信息社政 英语外语 科学自然 常用软件 语文数学 手机软件 红绿软件
图片中心
制作美图 生活图片 美女欣赏 实物图片 艺术欣赏 风景欣赏
领券购
热销女装 热血男装 生活必须 电子电器 手机电脑 旅游出行 学习艺术 吃货优选
新闻中心
一语惊人 奇闻趣事 热点专栏 曝光台 消费警示 今日观察 IT业界 消费主张 动态备忘 专利之窗
关闭
当前位置:首页社会专题硬件网络
Python批量合并PDF,拿来就用

大家好,今天分享一个实用的办公脚本:将多个PDF合并为一个PDF,例如我手上现在有如下3个PDF分册,需要整合成一个完整的PDF

如果换成你操作的话,是不是打开百度搜索:PDF合并,然后去第三方网站操作,可能会收费不说还担心文件泄漏,现在有请Python出场,简单快速,光速合并,拿走就用!

首先导入需要的库和路径设置

import os
from PyPDF2 import PdfFileReader, PdfFileWriter
if __name__ == '__main__':
   # 设置存放多个pdf文件的文件夹
   dir_path = r'C:\Scientific Research\Knowladge\Ophthalmology\Chinese Ophthalmology'
   # 目标文件的名字
   file_name = "中华眼科学(第3版)合并版.pdf"

接着获取所有pdf文件的绝对路径,这里需要利用os库中的os.walk遍历文件和os.path.join拼接路径

for dirpath, dirs, files in os.walk(dir_path):
   print(dirpath)
   print(files)
# 结果返回当前路径、当前路径下文件夹,并以列表返回所有文件

建议直接将需要合并的pdf放在一个文件夹,这样就无需再对文件后缀进行判断,包装成函数后如下:

def GetFileName(dir_path):
   file_list = [os.path.join(dirpath, filesname) \
                for dirpath, dirs, files in os.walk(dir_path) \
                for filesname in files]
   return file_list
调用该函数的结果

现在建立合并PDF的函数

def MergePDF(dir_path, file_name):
   # 实例化写入对象
   output = PdfFileWriter()
   outputPages = 0
   # 调用上一个函数获取全部文件的绝对路径
   file_list = GetFileName(dir_path)

   for pdf_file in file_list:
       print("文件:%s" % pdf_file.split('\\')[-1], end=' ')

       # 读取PDF文件
       input = PdfFileReader(open(pdf_file, "rb"))
       # 获得源PDF文件中页面总数
       pageCount = input.getNumPages()
       outputPages += pageCount
       print("页数:%d" % pageCount)
       # 分别将page添加到输出output中
       for iPage in range(pageCount):
           output.addPage(input.getPage(iPage))
   print("\n合并后的总页数:%d" % outputPages)
   # 写入到目标PDF文件
   print("PDF文件正在合并,请稍等......")
   with open(os.path.join(dir_path, file_name), "wb") as outputfile:
       # 注意这里的写法和正常的上下文文件写入是相反的
       output.write(outputfile)
   print("PDF文件合并完成")

可以看到虽然待合并的PDF文件比较大,但是依旧快速的合并成功!

最后附上完整代码,只需将代码中PDF的路径和文件名修改即可使用!

import os
from PyPDF2 import PdfFileReader, PdfFileWriter

def GetFileName(dir_path):
file_list = [os.path.join(dirpath, filesname) \
for dirpath, dirs, files in os.walk(dir_path) \
for filesname in files]
return file_list

def MergePDF(dir_path, file_name):
output = PdfFileWriter()
outputPages = 0
file_list = GetFileName(dir_path)
for pdf_file in file_list:
print("文件:%s" % pdf_file.split('\\')[-1], end=' ')
# 读取PDF文件
input = PdfFileReader(open(pdf_file, "rb"))
# 获得源PDF文件中页面总数
pageCount = input.getNumPages()
outputPages += pageCount
print("页数:%d" % pageCount)
# 分别将page添加到输出output中
for iPage in range(pageCount):
output.addPage(input.getPage(iPage))
print("\n合并后的总页数:%d" % outputPages)
# 写入到目标PDF文件
print("PDF文件正在合并,请稍等......")
with open(os.path.join(dir_path, file_name), "wb") as outputfile:
# 注意这里的写法和正常的上下文文件写入是相反的
output.write(outputfile)
print("PDF文件合并完成")

if __name__ == '__main__':
# 设置存放多个pdf文件的文件夹
dir_path = r'C:\Scientific Research\Knowladge\Ophthalmology\Chinese Ophthalmology'
# 目标文件的名字
file_name = "中华眼科学(第3版)合并版.pdf"
MergePDF(dir_path, file_name)
提示:输入修改代码都可运行!
2
酒精度
108
顶一下
相关阅读
内容加载中……