Problem
Ocena jednego klienta oznaczała ręczne czytanie stosu skanów: umowa kredytowa, harmonogramy spłat, aneksy, raport BIK — różne formaty, różna jakość skanów. Wyciągnięcie liczb, odtworzenie harmonogramu i oszacowanie, ile klient może realnie zyskać, zajmowało godziny na sprawę i decydowało o tym, jak szybko mogła wyjść oferta.
Przy ~50 umowach miesięcznie ręczna analiza była wąskim gardłem całej praktyki. A samo AI nie było odpowiedzią, którą kancelaria mogła zaakceptować — prawnik nie położy przed klientem liczby, której nie da się zweryfikować.
Co zbudowałem
Hybrydowy pipeline OCR (EasyOCR/Tesseract) + LLM, który ekstrahuje każdy parametr kredytu — z pełną ścieżką audytu. Każde pole niesie wartość, dokument źródłowy, numer strony, dokładny cytat i poziom pewności, więc człowiek weryfikuje dowolną liczbę w kilka sekund, zamiast czytać akta od nowa.
Ponad ekstrakcją: odtworzenie harmonogramu spłat, analiza kosztów poniesionych i przyszłych, korzyści z wcześniejszej spłaty i refinansowania, zwroty prowizji i ubezpieczeń oraz flagowanie kruczków prawnych i potencjalnie abuzywnych zapisów. Frontend podaje podsumowanie umowy — ryzyka prawne i obraz finansowy — gotowe do zamiany w ofertę dla klienta tego samego dnia.
Dokumenty to wrażliwe dane finansowe, więc cały system — frontend, backend w Pythonie i API modelu AI — działa lokalnie u klienta. Nic nie opuszcza jego infrastruktury (RODO).
Stack
Python · EasyOCR · Tesseract · LLM · OCR pipeline · On-premise