Přeskočit na obsah

OCR + LLM extrakce do schématu

Feed dává metadata, čísla jsou uvnitř PDF a ta PDF jsou převážně skeny formulářů. Význam v nich nese rozvržení — to, ve kterém poli číslo stojí, rozhoduje, jestli jde o jistinu nebo příslušenství. Pipeline zatím neexistuje; je na roadmapě jako fáze 1.

Stádia
stažení → klasifikace → OCR → extrakce modelem → validace → skóre
Výstup
deklarované JSON schéma podle typu dokumentu
Vstup modelu
text z OCR i obrazy stránek, protože rozvržení nese význam
Bez API klíče
běží jen OCR a všechno jde ke kontrole — pomalejší, ne nesprávné
Stav
plánováno (fáze 1: OCR, extrakce do schématu a validace)

Proč samotné OCR nestačí

Model nevolí tvar výstupu

Extrakce míří do deklarovaného JSON schématu pro daný typ dokumentu. Model doplňuje hodnoty do předem daného tvaru, nevymýšlí strukturu odpovědi.

Zadání nese typ dokumentu, příslušnou právní terminologii a výslovný pokyn vrátit prázdnou hodnotu místo odhadu. Odhadnuté číslo je horší než chybějící: chybějící jde k člověku, odhadnuté se zapíše a nikdo ho nenajde.

Validace stojí před zápisem, ne za ním

Výsledek se ověřuje proti schématu, doménovým pravidlům, konzistenci mezi poli a u účetních závěrek proti bilančním rovnicím. Teprve co projde, postupuje ke skórování a případnému zápisu.

Kvalita se měří na ručně anotované sadě nejméně 500 přihlášek a přeměřuje se u každé verze extraktoru. Verze, která na téhle sadě zhorší výsledek, nenasazuje se — bez ohledu na to, o kolik líp vypadá na nových dokumentech.

Známé těžké případy

Kde to v repozitáři žije

Souvisí

Zpět na sekci Architektura