首頁 > 軟體

python用pdfplumber提取pdf表格資料並儲存到excel檔案中

2022-07-22 22:01:57

pdfplumber操作pdf檔案

python開源庫pdfplumber,可以較為方便地獲取pdf的各種資訊,包含pdf的基本資訊(作者、建立時間、修改時間…)及表格、文字、圖片等資訊,基本可以滿足較為簡單的格式轉換功能。

一、pdfplumber安裝及匯入

跟其他包一樣,支援使用pip安裝,安裝命令:

pip install pdfplumber

安裝成功後,可直接用import匯入,匯入命令:

import pdfplumber

二、pdfplumber基礎使用

1、基礎知識

(1)pdfplumber有2個基礎類

PDF和Page,PDF用來處理整個檔案,Page用來處理整個頁面。

用法簡介
pdfplumber.PDF.metadata,獲取pdf基礎資訊,返回字典格式,包含作者、建立時間等。 .pages,返回pdfplumber.Page範例的列表,每一個範例包含pdf每一頁的資訊
pdfplumber.Pagepdfplumber核心功能,對PDF的大部分操作都是基於這個類,包括提取文字、表格等

(2)pdfplumber讀取pdf檔案方式

pdfplumber.open(‘檔案路徑’),返回pdfplumber.PDF類的範例。

如果pdf有密碼,加入password引數:

pdfplumber.open(‘檔案路徑’,password=‘密碼’)

2、獲取pdf基礎資訊

讀取pdf檔案,並輸出pdf檔案的基礎資訊

import pdfplumber
# 開啟pdf檔案,有密碼加入password引數
pdf_info =pdfplumber.open(r'test.pdf')
meta_data = pdf_info.metadata  # pdf的基礎資訊
page_con = len(pdf_info.pages)  # 獲取pdf的總頁數
print('pdf檔案的基礎資訊:n', meta_data)
print('pdf共%s頁' % page_con)

3、pdfplumber提取表格資料

提取表格資料主要用到extract_tables()和extract_table()兩種方法,這兩種提取方式各有不同。

用以下pdf檔案,作為演示檔案。

(1)extract_tables()方法

輸出檔案所有表格,返回一個巢狀列表,其結構層次為table-row-cell。如:

#extract_tables()用法
with pdfplumber.open(r'test.pdf') as pdf_info:  # 開啟pdf檔案
    page_one = pdf_info.pages[0]  # 選擇第一頁
    page_one_table =page_one.extract_tables()  # 獲取pdf檔案第一頁的所有表格資料
    for row in page_one_table:
       print('第一頁的表格資料:', row)


(2)、extact_table()方法

不會返回檔案的所有表格,僅返回行數最多的表格資料,如存在多個行數相等的表格,則預設輸出頂部表格資料。返回的資料結構層次為row-cell,表格的每一行都為一個單獨的列表,列表中的元素即為原表格的各個單元格的資料。如:

# extract_table()用法
with pdfplumber.open(r'test.pdf') as pdf_info:  # 開啟pdf檔案
    page_one = pdf_info.pages[0]  # 選擇第一頁
    page_one_table = page_one.extract_table()
    for row in page_one_table:
        print(row)

三、提取pdf表格資料並儲存到excel中

完整版,提取pdf表格資料並儲存到excel中

import pdfplumber
from openpyxl import Workbook

class PDF(object):
    def __init__(self, file_path):
        self.pdf_path = file_path
        # 讀取pdf檔案
        try:
            self.pdf_info = pdfplumber.open(self.pdf_path)
            print('讀取檔案完成!')
        except Exception as e:
            print('讀取檔案失敗:', e)

    # 列印pdf的基本資訊、返回字典,作者、建立時間、修改時間/總頁數
    def get_pdf(self):
        pdf_info = self.pdf_info.metadata
        pdf_page = len(self.pdf_info.pages)
        print('pdf共%s頁' % pdf_page)
        print("pdf檔案基本資訊:n", pdf_info)
        self.close_pdf()

    # 提取表格資料,並儲存到excel中
    def get_table(self):
        wb = Workbook()  # 範例化一個工作簿物件
        ws = wb.active  # 獲取第一個sheet
        con = 0
        try:
            # 獲取每一頁的表格中的文字,返回table、row、cell格式:[[[row1],[row2]]]
            for page in self.pdf_info.pages:
                for table in page.extract_tables():
                    for row in table:
                        # 對每個單元格的字元進行簡單清洗處理
                        row_list = [cell.replace('n', ' ') if cell else '' for cell in row]
                        ws.append(row_list)  # 寫入資料
                con += 1
                print('---------------分割線,第%s頁---------------' % con)
        except Exception as e:
            print('報錯:', e)
        finally:
            wb.save('\'.join(self.pdf_path.split('\')[:-1]) + 'pdf_excel.xlsx')
            print('寫入完成!')
            self.close_pdf()

    # 關閉檔案
    def close_pdf(self):
        self.pdf_info.close()

if __name__ == "__main__":
    file_path = input('請輸入pdf檔案路徑:')
    pdf_info = PDF(file_path)
    # pdf_info.get_pdf() # 列印pdf基礎資訊
    # 提取pdf表格資料並儲存到excel中,檔案儲存到跟pdf同一檔案路徑下
    pdf_info.get_table()

總結

到此這篇關於python用pdfplumber提取pdf表格資料並儲存到excel檔案中的文章就介紹到這了,更多相關python提取pdf資料儲存excel內容請搜尋it145.com以前的文章或繼續瀏覽下面的相關文章希望大家以後多多支援it145.com!


IT145.com E-mail:sddin#qq.com