A PDF-ek és beszkennelt dokumentumok keresése során gyakran okoz problémát, hogy először szöveggé kell alakítani őket; ez a lépés viszont gyakran tönkreteszi a táblázatokat, ábrákat vagy éppen a vizuális struktúrát. Ez a videó bemutat egy új, vizuális dokumentumkereső modellt, az EVIE-t, amely ezt a problémát igyekszik megoldani.
Az EVIE egy 4,5 milliárd paraméteres modell, amely képi alapon, az egész oldal képét feldolgozva képes az üzenetet párosítani a szöveges keresésekhez, teljesen kihagyva az OCR lépést. Ezáltal a dokumentumok szerkezete, hierarchiája és a vizuális információk is megmaradnak, a keresés pedig pontosabbá válik — akár pénzügyi jelentések, akár tudományos cikkek vagy bonyolult számlák esetében.
Az architektúra érdekessége, hogy ugyanazt a mesterségesintelligencia-hálót használja a szöveges lekérdezésekhez és a képi dokumentumokhoz is, minden információt kis, 128 dimenziós vektorokká alakítva. Így a dokumentum szerkezete is megőrizhető, és a rendszer képes nagy pontossággal megtalálni, melyik dokumentumoldal felel meg legjobban egy adott kérdésre.
Felvetődik továbbá a kombináció lehetősége is: a modell megtalálja a megfelelő oldalakat, és egy külön olvasó-modell húzza ki onnan a szükséges konkrét adatokat. Ennek a dokumentumkereső rendszernek a jövőbeli lehetőségeit, a gyakorlati alkalmazás kihívásait és előnyeit járja körül a bemutató.










