Faturalar, banka ekstreleri, raporlar... Çoğu iş verisi PDF'te sıkışıp kalır. pdfplumber ile bu PDF'lerdeki metni ve tabloları Python'a çekebiliriz.

Kurulum

pip install pdfplumber

Metin çıkarmak

import pdfplumber

with pdfplumber.open("fatura.pdf") as pdf:
    for sayfa in pdf.pages:
        print(sayfa.extract_text())

Tablo çıkarmak

PDF'lerin en zor kısmı tablolardır. pdfplumber bunları liste listesine çevirir:

import pdfplumber
import pandas as pd

with pdfplumber.open("ekstre.pdf") as pdf:
    tablo = pdf.pages[0].extract_table()

df = pd.DataFrame(tablo[1:], columns=tablo[0])
df.to_excel("ekstre.xlsx", index=False)
print("Excel'e aktarildi.")
💡

Bu yöntem, metni seçilebilen PDF'lerde çalışır. PDF aslında bir fotoğraf/tarama ise metin yoktur; o zaman OCR gerekir — bir sonraki konu.

PDF'ten veri çıkarma, elle veri girişini ortadan kaldıran en değerli otomasyonlardan biridir. Düzenli formatlı yüzlerce belge varsa kazanç muazzamdır.