Metodika
Metodika: jak měříme
Každé číslo na webu jde dohledat ke konkrétnímu dokladu, výstupu modelu a ceně běhu. Tady je, jak vzniká.
Co měříme
Tři každodenní firemní úlohy: vytěžení 13 polí z faktury (dodavatel, identifikátory, číslo dokladu, variabilní symbol, data, základ a daň po sazbách, celkem, měna, účet); třídění e-mailů od zákazníků (kategorie, priorita, nálada, zákazník, číslo objednávky a faktury, částka, měna, termín); a hledání osobních údajů ve firemních textech, například před odesláním do AI služby (jména, e-maily, telefony, adresy, data narození, rodná čísla, účty). Uvádíme podíl správných polí a podíl dokumentů bez jediné chyby, protože pro firmu je často důležitější to druhé. Dokumenty jsou česky a americky anglicky.
Testovací sada
Všechny dokumenty jsou syntetické: vygenerované z náhodných, ale platných dat (IČO a rodná čísla s kontrolním součtem, účty podle pravidel ČNB, EIN, ABA routing numbers), takže správná odpověď jsou zdrojová data, ne ruční přepis, a nemá překlepy. Žádná skutečná osobní ani firemní data: e-maily používají domény .example, americká telefonní čísla fiktivní rozsah 555-01xx, SSN rozsah, který se nikdy nepřiděluje. Český a anglický dokument tvoří pár se stejnou strukturou, díky tomu měříme jazykovou mezeru.
Faktury mají osm rozvržení a realistické varianty (neplátce DPH, zálohová faktura, dobropis, cizí měna) a čtyři úrovně: 30 % text z PDF, 30 % čistý obrázek, 30 % sken (natočení, šum, JPEG), 10 % fotka (perspektiva, stín). Třetina každé sady je neveřejná; z ní zveřejňujeme jen souhrnné skóre, takže model nemůže uspět tím, že odpovědi už viděl.
E-maily jsou jako samostatná zpráva, s dlouhým podpisem, jako vlákno s citovanými staršími zprávami a jako e-mail přeposlaný kolegou; termíny jsou i relativní („do pátku“). Priorita se řídí pevnými pravidly napsanými v zadání, takže není věcí názoru. Texty s osobními údaji (personální záznamy, tikety, zápisy z porad, e-maily) záměrně obsahují i údaje, které osobní nejsou: názvy firem z příjmení, IČO, obecné adresy jako info@, čísla objednávek a data, která nejsou datem narození.
Jak probíhá běh
Všechny modely voláme přes OpenRouter se stejným zadáním v jazyce dokumentu a teplotou 0, každý model u jednoho pevného poskytovatele, aby šly výsledky zopakovat. Když model podporuje strukturovaný výstup (JSON schéma), použijeme ho; když poskytovatel schéma odmítne, zeptáme se znovu bez něj a zaznamenáme to. Když odpověď není platný JSON, zeptáme se ještě jednou a i to zaznamenáme. U každého volání ukládáme model, verzi zadání a sady, tokeny, cenu, latenci a poskytovatele. Výstupy cachujeme, takže každý týden platíme jen za nové modely, dokumenty a zadání.
Jak hodnotíme
Pole je správně, když se po sjednocení formátu přesně shoduje se správnou hodnotou: data na tvar RRRR-MM-DD, částky na číslo se dvěma desetinnými místy (obě konvence oddělovačů), mezery v identifikátorech a účtech se ignorují. Diakritika se nesjednocuje: „Horak“ místo „Horák“ je chyba. Chyby třídíme do kategorií (chybí pole, špatná hodnota, ztracená diakritika, prohozená data, základ místo celku, špatná sazba, formát čísla, nevalidní JSON). Laťka pro faktury je 95 % správných polí.
E-maily: kategorie, priorita a nálada se musí shodovat přesně; relativní termíny musí vyjít na správné datum. Osobní údaje: každé pole je seznam a je správně, jen když je úplný a nic nepřebývá; IČO firmy označené jako osobní údaj se počítá jako vymyšlená hodnota. Práh je u všech úloh 95 % správných polí.
Ceny a jazyková daň
Cena je skutečná útrata za tokeny, jak ji vrátí API v USD, přepočtená na 1000 dokladů. Do korun a eur přepočítáváme až při zobrazení kurzem uvedeným v patičce. Jazykovou daň měříme na paralelním korpusu 50 odstavců v češtině, němčině, francouzštině, španělštině, polštině a angličtině: pošleme text s minimálním limitem výstupu, odečteme režii prázdného zadání a porovnáme počet vstupních tokenů s angličtinou.
Skutečná cena přičítá práci člověka, který musí každý dokument s chybou najít a opravit: 3 minuty na dokument za 450 Kč / 35 EUR / 40 USD na hodinu. Rychlost je medián doby odpovědi (90. percentil v nápovědě); platné odpovědi jsou podíl dokumentů s platným JSON. Chyby API z omezení počtu dotazů modelu nepřičítáme: opakujeme je, dokud nemá odpověď každý dokument.
Kalkulačka skutečné ceny používá změřené ceny tam, kde máme dokumenty v daném jazyce. U ostatních jazyků odhaduje: příplatek změřený na skutečných dokumentech v jiném jazyce přepočte jazykovou daní zvoleného jazyka (obrázek faktury stojí v každém jazyce stejně, prostý poměr tokenů by příplatek nadsadil). Odhady jsou označené ≈ a nemají přesnost.
Jazyková mezera
Rozdíl přesnosti mezi českými a anglickými doklady počítáme jen na polích, která mají obě verze. Americká faktura nemá DIČ ani DUZP, proto tato pole do srovnání nevstupují.
Omezení
Syntetické doklady nepokryjí všechno, co se objeví ve skutečné firmě (ručně psané poznámky, vícestránkové faktury, neobvyklé layouty). S přibližně 150 doklady na jazyk je nejistota přesnosti zhruba ±1 procentní bod; menší rozdíly mezi modely neberte jako rozhodující. Modely i ceny se mění, proto u každého čísla uvádíme datum běhu.
Nezávislost
Pořadí ani doporučení se nedají koupit. Žádný výrobce modelů nás neplatí za umístění. Pokud najdete chybu ve správné odpovědi nebo v hodnocení, dejte nám vědět, opravíme ji a změnu uvedeme.
Aktuální běh: 20260928T085806Z-5d2ece ze dne 28. září 2026, verze sady 0.1.0.