Egy egészen új open source OCR modellt, az Alibaba OvisOCR2-t ismerhetjük meg részletesen, amely mindössze 0,8 milliárd paraméterrel rendkívül hatékony dokumentumfeldolgozásra képes. Az elhangzottak alapján bármilyen bonyolult dokumentumoldal – legyen az táblázatokkal, képletekkel, képekkel vagy sűrű szöveggel tele – gyorsan átalakítható jól strukturált, a természetes olvasási sorrendet követő markdown formátumba.
A bemutatóban kiemelt szerepet kap a modell technikai háttere, különös tekintettel arra, hogyan kombinálják a felügyelt tanítást, a megerősítéses tanulást és egy sajátos OPD nevű eljárást a képzés során. A kétirányú adatmérnöki folyamatrendszer, amely valódi és szintetikus dokumentumokat egyaránt használ, újszerű, magas minőségű tanítóadatot eredményez, megkülönböztetve ezzel a többi hasonló modelltől.
Gyakorlati példákon keresztül tesztelik a modellt: kézírás, bonyolult matematikai képletek, különböző nyelveken írt szövegek, űrlapok, régi újságok és táblázatok feldolgozását is bemutatják. A vizsgálat alatt álló esetek rávilágítanak arra, mennyire precízen képes az OvisOCR2 strukturált adatot előállítani, miközben a sebessége és memóriaköltsége is kiemelkedő.
Felmerül több izgalmas kérdés is: mik a modell fő korlátai a többnyelvűség terén, hogyan birkózik meg a különösen bonyolult vagy kisméretű betűket tartalmazó dokumentumokkal, illetve mire képes nagyobb méretű vagy speciális dokumentumok esetén? Ezek mind kifejtésre kerülnek a bemutató során, anélkül, hogy végleges értékelést vonnánk le.









