<em>Mac</em>Book项目 2009年学校开始实施<em>Mac</em>Book项目,所有师生配备一本<em>Mac</em>Book,并同步更新了校园无线网络。学校每周进行电脑技术更新,每月发送技术支持资料,极大改变了教学及学习方式。因此2011
2021-06-01 09:32:01
python開源庫pdfplumber,可以較為方便地獲取pdf的各種資訊,包含pdf的基本資訊(作者、建立時間、修改時間…)及表格、文字、圖片等資訊,基本可以滿足較為簡單的格式轉換功能。
跟其他包一樣,支援使用pip安裝,安裝命令:
pip install pdfplumber
安裝成功後,可直接用import匯入,匯入命令:
import pdfplumber
(1)pdfplumber有2個基礎類
PDF和Page,PDF用來處理整個檔案,Page用來處理整個頁面。
類 | 用法簡介 |
---|---|
pdfplumber.PDF | .metadata,獲取pdf基礎資訊,返回字典格式,包含作者、建立時間等。 .pages,返回pdfplumber.Page範例的列表,每一個範例包含pdf每一頁的資訊 |
pdfplumber.Page | pdfplumber核心功能,對PDF的大部分操作都是基於這個類,包括提取文字、表格等 |
(2)pdfplumber讀取pdf檔案方式
pdfplumber.open(‘檔案路徑’),返回pdfplumber.PDF類的範例。
如果pdf有密碼,加入password引數:
pdfplumber.open(‘檔案路徑’,password=‘密碼’)
讀取pdf檔案,並輸出pdf檔案的基礎資訊
import pdfplumber # 開啟pdf檔案,有密碼加入password引數 pdf_info =pdfplumber.open(r'test.pdf') meta_data = pdf_info.metadata # pdf的基礎資訊 page_con = len(pdf_info.pages) # 獲取pdf的總頁數 print('pdf檔案的基礎資訊:n', meta_data) print('pdf共%s頁' % page_con)
提取表格資料主要用到extract_tables()和extract_table()兩種方法,這兩種提取方式各有不同。
用以下pdf檔案,作為演示檔案。
(1)extract_tables()方法
輸出檔案所有表格,返回一個巢狀列表,其結構層次為table-row-cell。如:
#extract_tables()用法 with pdfplumber.open(r'test.pdf') as pdf_info: # 開啟pdf檔案 page_one = pdf_info.pages[0] # 選擇第一頁 page_one_table =page_one.extract_tables() # 獲取pdf檔案第一頁的所有表格資料 for row in page_one_table: print('第一頁的表格資料:', row)
(2)、extact_table()方法
不會返回檔案的所有表格,僅返回行數最多的表格資料,如存在多個行數相等的表格,則預設輸出頂部表格資料。返回的資料結構層次為row-cell,表格的每一行都為一個單獨的列表,列表中的元素即為原表格的各個單元格的資料。如:
# extract_table()用法 with pdfplumber.open(r'test.pdf') as pdf_info: # 開啟pdf檔案 page_one = pdf_info.pages[0] # 選擇第一頁 page_one_table = page_one.extract_table() for row in page_one_table: print(row)
完整版,提取pdf表格資料並儲存到excel中
import pdfplumber from openpyxl import Workbook class PDF(object): def __init__(self, file_path): self.pdf_path = file_path # 讀取pdf檔案 try: self.pdf_info = pdfplumber.open(self.pdf_path) print('讀取檔案完成!') except Exception as e: print('讀取檔案失敗:', e) # 列印pdf的基本資訊、返回字典,作者、建立時間、修改時間/總頁數 def get_pdf(self): pdf_info = self.pdf_info.metadata pdf_page = len(self.pdf_info.pages) print('pdf共%s頁' % pdf_page) print("pdf檔案基本資訊:n", pdf_info) self.close_pdf() # 提取表格資料,並儲存到excel中 def get_table(self): wb = Workbook() # 範例化一個工作簿物件 ws = wb.active # 獲取第一個sheet con = 0 try: # 獲取每一頁的表格中的文字,返回table、row、cell格式:[[[row1],[row2]]] for page in self.pdf_info.pages: for table in page.extract_tables(): for row in table: # 對每個單元格的字元進行簡單清洗處理 row_list = [cell.replace('n', ' ') if cell else '' for cell in row] ws.append(row_list) # 寫入資料 con += 1 print('---------------分割線,第%s頁---------------' % con) except Exception as e: print('報錯:', e) finally: wb.save('\'.join(self.pdf_path.split('\')[:-1]) + 'pdf_excel.xlsx') print('寫入完成!') self.close_pdf() # 關閉檔案 def close_pdf(self): self.pdf_info.close() if __name__ == "__main__": file_path = input('請輸入pdf檔案路徑:') pdf_info = PDF(file_path) # pdf_info.get_pdf() # 列印pdf基礎資訊 # 提取pdf表格資料並儲存到excel中,檔案儲存到跟pdf同一檔案路徑下 pdf_info.get_table()
到此這篇關於python用pdfplumber提取pdf表格資料並儲存到excel檔案中的文章就介紹到這了,更多相關python提取pdf資料儲存excel內容請搜尋it145.com以前的文章或繼續瀏覽下面的相關文章希望大家以後多多支援it145.com!
相關文章
<em>Mac</em>Book项目 2009年学校开始实施<em>Mac</em>Book项目,所有师生配备一本<em>Mac</em>Book,并同步更新了校园无线网络。学校每周进行电脑技术更新,每月发送技术支持资料,极大改变了教学及学习方式。因此2011
2021-06-01 09:32:01
综合看Anker超能充系列的性价比很高,并且与不仅和iPhone12/苹果<em>Mac</em>Book很配,而且适合多设备充电需求的日常使用或差旅场景,不管是安卓还是Switch同样也能用得上它,希望这次分享能给准备购入充电器的小伙伴们有所
2021-06-01 09:31:42
除了L4WUDU与吴亦凡已经多次共事,成为了明面上的厂牌成员,吴亦凡还曾带领20XXCLUB全队参加2020年的一场音乐节,这也是20XXCLUB首次全员合照,王嗣尧Turbo、陈彦希Regi、<em>Mac</em> Ova Seas、林渝植等人全部出场。然而让
2021-06-01 09:31:34
目前应用IPFS的机构:1 谷歌<em>浏览器</em>支持IPFS分布式协议 2 万维网 (历史档案博物馆)数据库 3 火狐<em>浏览器</em>支持 IPFS分布式协议 4 EOS 等数字货币数据存储 5 美国国会图书馆,历史资料永久保存在 IPFS 6 加
2021-06-01 09:31:24
开拓者的车机是兼容苹果和<em>安卓</em>,虽然我不怎么用,但确实兼顾了我家人的很多需求:副驾的门板还配有解锁开关,有的时候老婆开车,下车的时候偶尔会忘记解锁,我在副驾驶可以自己开门:第二排设计很好,不仅配置了一个很大的
2021-06-01 09:30:48
不仅是<em>安卓</em>手机,苹果手机的降价力度也是前所未有了,iPhone12也“跳水价”了,发布价是6799元,如今已经跌至5308元,降价幅度超过1400元,最新定价确认了。iPhone12是苹果首款5G手机,同时也是全球首款5nm芯片的智能机,它
2021-06-01 09:30:45