Plánováno
Dokumentová pipeline
Feed dává metadata; čísla leží uvnitř dokumentů, které jsou převážně skeny. Tahle položka je místo, kde projekt uspěje nebo neuspěje — a zároveň jediné místo, kde se utrácí za každou stránku.
- Položky fáze
- 1.6 stahování a úložiště, 1.7 OCR, 1.8 extrakce do schématu a validace
- Závisí na
- 1.3 — akcích, které odkazují na dokument
- Klíč cache
- SHA-256 dokumentu plus verze extraktoru
- Bez LLM klíče
- poběží jen OCR a všechno půjde do fronty kontroly — pomaleji, ne špatně
- Stav
- plánováno; rozsah backfillu čeká na nákladový model (0.13)
Stádia
- Stažení do úložiště adresovaného obsahem — už známý hash se nestahuje podruhé.
- Klasifikace typu dokumentu a oddílu spisu.
- OCR na text a rozvržení stránky; layout nese význam, protože o povaze čísla rozhoduje kolonka, ve které stojí.
- Extrakce do deklarovaného JSON schématu z textu i obrázků stránek; model nevolí tvar výstupu.
- Validace proti schématu, doménovým pravidlům a křížové konzistenci; pak skóre spolehlivosti po polích i po záznamu.
Cache není optimalizace
Výsledky se ukládají podle hashe dokumentu a verze extraktoru. Bez toho by každá oprava projektoru znamenala znovu zaplatit celý backfill v OCR a tokenech — a tým by opravy přestal dělat.
Zvýšení verze extraktoru cache zneplatňuje záměrně a výběrově: znovu se vytěží jen ty typy dokumentů, které se změnily.
Co se lepším promptem nevyřeší
Přihlášky mimo úřední formulář nemají layout, na který by se dalo kotvit. Přílohy o stovkách stran narážejí na cenu i na kontext a potřebují výběr stránek. Řízení před novelou z roku 2017 mají místo zpráv o přezkumu protokoly z přezkumného jednání — jiný dokument a jiný slovník.
Každý z těchto případů potřebuje vlastní strategii a ve většině i cestu do fronty kontroly. Jsou vedené jako otevřené otázky, ne jako detaily implementace.
Kde to v repozitáři žije
docs/EXTRACTION.md— stádia pipeline, cache, těžké případy a měření kvalitydocs/ARCHITECTURE.md— proč je dokumentová pipeline oddělená od příjmu datdocs/development/COST-MODEL.md— cena za dokument, která rozhoduje o rozsahu backfillu
Souvisí
OCR + LLM extrakce do schématu
Klasické OCR na formulářích přihlášek selhává. Pipeline kombinuje OCR a multimodální extrakci do deklarovaného JSON schématu, výsledek validuje a teprve pak zapisuje.
Detail
Fronta lidské kontroly
PlánovánoZdrojový dokument na správné stránce vedle kandidátních hodnot, typované rozhodnutí a záznam kdo a kdy. Rozhodnutí budou data, která se přehrávají — ne editace v databázi.
Detail
Nákladový model
Čtyři ze sedmi vstupů změřené z živého archivu a vzorku (9. 9. 2026): tok dokumentů, struktura po druzích řízení, strany, textová vrstva a podíl doručenek. Rejstřík publikuje zhruba čtyři nové dokumenty na každý povolený požadavek denně — výběr dokumentů je podmínka, ne páka. Ceny OCR a LLM čekají na extrakční stupeň; rozhodnutí o rozsahu stále blokuje.
Detail