Az internet korszakában a kutatás folyamata még mindig sok manuális lépést igényel: keresés, kattintás, olvasás, majd újabb keresés. Ezeket a repetitív lépéseket azonban ma már hatékonyan lehet automatizálni.
Egy izgalmas megközelítés az, hogy a Puppeteer nevű Node.js könyvtárral és egy nagy nyelvi modellel (LLM) kombinálva intelligens webes automatizációs feladatok végezhetők el. Node.js és Python együttműködésével a böngészés, keresés és az eredmények kiértékelése válik automatizálttá.
A munkafolyamat során a nyelvi modell nemcsak kiválasztja a legjobb keresési kulcsszavakat, hanem elemzi és összefoglalja a megtalált weboldalak tartalmát is. Ehhez mind Google, mind helyi nyelvi modellek is elérhetők, és a teljes kód viszonylag egyszerűen átlátható.
Az automatizálás fő akadályát az jelentheti, hogy a weboldalak – különösen a Google – felismerik a szkriptes lekérdezéseket. Ennek kezelésére egy speciális proxy szolgáltató, például a Data Impulse, használata jelent megoldást, amely forgó IP-címeket és magas fokú anonimitást biztosít.
A videóban bemutatott rendszer részletesen elemzi a szükséges beállításokat, a technikai kihívásokat és a lekérdezések megbízható végrehajtásához szükséges trükköket. A kérdés végig az, hogyan lehet minél automatizáltabb, mégis releváns és naprakész eredményeket kinyerni az internetről emberi beavatkozás nélkül.









