如何使用pdfminer3k读取pdf文件? [英] How to read pdf file using pdfminer3k?
本文介绍了如何使用pdfminer3k读取pdf文件?的处理方法,对大家解决问题具有一定的参考价值,需要的朋友们下面随着小编来一起学习吧!
问题描述
我正在使用 python 3.5,我想从 pdf 文件中逐行读取文本.试图使用 pdfminer3k
但没有在任何地方获得正确的语法.如何正确使用?
I am using python 3.5 and I want to read the text, line by line from pdf files. Was trying to use pdfminer3k
but not getting proper syntax anywhere.
How to use it correctly?
推荐答案
我已更正 Lisa 的代码.现在可以使用了!
I have corrected Lisa's code. It works now!
fp = open(path, 'rb')
from pdfminer.pdfparser import PDFParser, PDFDocument
from pdfminer.pdfinterp import PDFResourceManager, PDFPageInterpreter
from pdfminer.converter import PDFPageAggregator
from pdfminer.layout import LAParams, LTTextBox, LTTextLine
parser = PDFParser(fp)
doc = PDFDocument()
parser.set_document(doc)
doc.set_parser(parser)
doc.initialize('')
rsrcmgr = PDFResourceManager()
laparams = LAParams()
laparams.char_margin = 1.0
laparams.word_margin = 1.0
device = PDFPageAggregator(rsrcmgr, laparams=laparams)
interpreter = PDFPageInterpreter(rsrcmgr, device)
extracted_text = ''
for page in doc.get_pages():
interpreter.process_page(page)
layout = device.get_result()
for lt_obj in layout:
if isinstance(lt_obj, LTTextBox) or isinstance(lt_obj, LTTextLine):
extracted_text += lt_obj.get_text()
这篇关于如何使用pdfminer3k读取pdf文件?的文章就介绍到这了,希望我们推荐的答案对大家有所帮助,也希望大家多多支持IT屋!
查看全文