主要功能:利用Python扩展库pdfplumber解析中文核心期刊要目总览.pdf文件成excel文件
解析文件:中文核心期刊要目总览.pdf
官方文档:pdfplumber · PyPI
具体代码:
import pdfplumber
import pandas as pdwith pdfplumber.open("hexin.pdf") as pdf:print(len(pdf.pages))first = pdf.pages[0]ftable = first.extract_table()tables = ftable[2:]for page in pdf.pages[1:]:tables += page.extract_table()data_frame = pd.DataFrame(tables, columns=ftable[1])with pd.ExcelWriter('hexin.xlsx') as excel:data_frame.to_excel(excel, index=False)