首頁 > 軟體

Python 操作pdf pdfplumber讀取PDF寫入Excel

2022-08-12 18:01:01

1. Python 操作pdf(pdfplumber讀取PDF寫入Excel

1.1 安裝pdfplumber模組庫

安裝pdfplumber:

pip install pdfplumber

pdfplumber.PDF類

pdfplumber.PDF類表示單個PDF ,並具有兩個主要屬性:

屬性說明
pdf.metadata從PDF的Info中獲取後設資料鍵/值對字典。通常包括"CreationDate,“ModDater","Producer"等
pdf.pages返回一個包含pdfplumber. Page範例的列表,每一一個範例代表PDF每一頁的資訊

pdfplumber.Page類

pdfplumber.Page類常用屬性

屬性page_ number說明
.page_ number順序頁碼,從1第一頁開始,從第二頁開始2 ,依此類推
.width頁面的寬度
.height頁面的高度
.objects/ . chars/ .lines/ .rects/ . curves/ .figures/ . images這些屬性中的每一個都是一 個列表, 每個列表包含一個字典 ,用於嵌入頁面上的每個此類物件,有關詳細資訊,請參閱下面的“物件”。

常用方法:

方法名說明
.extract_ text( )用來提頁面中的文字,將頁面的所有字元物件整理為的那個字串
.extract_ words( )返回的是所有的單詞及其相關資訊
. extract_ tables()提取頁面的表格
.to_ _image()用於視覺化偵錯時,返回Pagelmage類的一個範例
.close()預設情況下, Page物件快取其佈局和物件資訊,以避免重新處理它,
但是在解析大型PDF時,這些快取的屬性可能需要大量記憶體。您可以使用此方法重新整理快取並釋放記憶體。

1.2 常用操作

PDF是Portable Document Format的縮寫,這類檔案通常使用.pdf作為其擴充套件名。在日常開發工作中,最容易遇到的就是從PDF中讀取文字內容以及用已有的內容生成PDF檔案這兩個任務。

  • 1.讀取pdf檔案資訊
  • 2.輸出總頁數
  • 3.讀取第一頁寬度、高度等資訊
  • 4.讀取文字第一頁

載入pdf:

  • pdfplumber.open( "路徑/檔名. pdf".pas sword="test "laparams={ "line_ _overlap'”0.7 })
  •  password : 要載入受密碼保護的PDF ,請傳遞password關鍵字引數
  • laparams :要將佈局分析引數設定為pdfminer. six的佈局引擎,請傳遞laparams關鍵字引數

1.2.1 Python讀取pdf檔案案例

pdf檔案如下:

1.2.2 Python讀取pdf檔案程式碼

import pdfplumber

# 載入pdf
path = "C:/Users/Administrator/Desktop/test08/test11 - 多頁.pdf"
with pdfplumber.open(path) as pdf:
    print(pdf)
    print(type(pdf))

    # 讀取pdf檔案資訊
    print("pdf檔案資訊:", pdf.metadata)

    # 輸出總頁數
    print("pdf檔案總頁數:", len(pdf.pages))

    # 1.讀取第一頁寬度、高度等資訊
    first_page = pdf.pages[0]  # pdfplumber.Page物件第一頁
    # 檢視頁碼
    print('pdf頁碼:', first_page.page_number)
    # 檢視頁寬
    print('pdf頁寬:', first_page.width)
    # 檢視頁高
    print('pdf頁高:', first_page.height)

    # 2.讀取文字第一頁
    first_page = pdf.pages[0]  # pdfplumber.Page物件第一頁
    text = first_page.extract_text()
    print(text)

執行結果:

"D:Program Files1Pythonpython.exe" D:/Pycharm-work/pythonTest/打卡/0811讀取pdf.py
<pdfplumber.pdf.PDF object at 0x0000000002846278>
<class 'pdfplumber.pdf.PDF'>
pdf檔案資訊: {'Author': '', 'Comments': '', 'Company': '', 'CreationDate': "D:20220812102327+02'23'", 'Creator': 'WPS 表格', 'Keywords': '', 'ModDate': "D:20220812102327+02'23'", 'Producer': '', 'SourceModified': "D:20220812102327+02'23'", 'Subject': '', 'Title': '', 'Trapped': 'False'}
pdf檔案總頁數: 2
pdf頁碼: 1
pdf頁寬: 595.25
pdf頁高: 841.85
姓名 年齡 性別 地址 學習技能
張三 20 女 北京 python
李四 25 男 深圳 java
趙五 28 男 上海 C++
孫六 23 女 廣州 python
錢七 27 男 珠海 python
張101 20 女 北京 python
.......
.......
張150 27 男 珠海 python
張151 20 女 北京 python
張152 25 男 深圳 java

Process finished with exit code 0

1.2.3 Python讀取pdf檔案存入Excel程式碼

import pdfplumber
import xlwt

# 載入pdf
path = "C:/Users/Administrator/Desktop/test08/test11 - 多頁.pdf"
with pdfplumber.open(path) as pdf:
    page_1 = pdf.pages[0]  # pdf第一頁
    table_1 = page_1.extract_table()  # 讀取表格資料
    print(table_1)
    # 1.建立Excel物件
    workbook = xlwt.Workbook(encoding='utf8')
    # 2.新建sheet表
    worksheet = workbook.add_sheet('Sheet1')
    # 3.自定義列名
    clo1 = table_1[0]
    # 4.將列表元組clo1寫入sheet表單中的第一行
    for i in range(0, len(clo1)):
        worksheet.write(0, i, clo1[i])
    # 5.將資料寫進sheet表單中
    for i in range(0, len(table_1[1:])):
        data = table_1[1:][i]
        for j in range(0, len(clo1)):
            worksheet.write(i + 1, j, data[j])
    # 儲存Excel檔案分兩種
    workbook.save('test88.xls')

執行結果:

到此這篇關於Python 操作pdf pdfplumber讀取PDF寫入Excel的文章就介紹到這了,更多相關Python 操作pdf內容請搜尋it145.com以前的文章或繼續瀏覽下面的相關文章希望大家以後多多支援it145.com!


IT145.com E-mail:sddin#qq.com