Faturalar, banka ekstreleri, raporlar... Çoğu iş verisi PDF'te sıkışıp kalır. pdfplumber ile bu PDF'lerdeki metni ve tabloları Python'a çekebiliriz.
Kurulum
pip install pdfplumber
Metin çıkarmak
import pdfplumber
with pdfplumber.open("fatura.pdf") as pdf:
for sayfa in pdf.pages:
print(sayfa.extract_text())
Tablo çıkarmak
PDF'lerin en zor kısmı tablolardır. pdfplumber bunları liste listesine çevirir:
import pdfplumber
import pandas as pd
with pdfplumber.open("ekstre.pdf") as pdf:
tablo = pdf.pages[0].extract_table()
df = pd.DataFrame(tablo[1:], columns=tablo[0])
df.to_excel("ekstre.xlsx", index=False)
print("Excel'e aktarildi.")
💡
Bu yöntem, metni seçilebilen PDF'lerde çalışır. PDF aslında bir fotoğraf/tarama ise metin yoktur; o zaman OCR gerekir — bir sonraki konu.
PDF'ten veri çıkarma, elle veri girişini ortadan kaldıran en değerli otomasyonlardan biridir. Düzenli formatlı yüzlerce belge varsa kazanç muazzamdır.