A
A
  • Angol
  • Magyar
  • 13 perc

Grok 4.7: Új szintre emelt mesterséges intelligencia tesztek és képességek elemzése

Fahad Mirza betekintést ad, mire képes a Grok 4.7 különféle valós problémák és multimodális feladványok megoldásában, miközben összehasonlítja más csúcstechnológiás AI modellekkel.

Fahad Mirza egy újszerű, részletes tesztsorozattal próbálja ki a Grok 4.7-es modellt, amelyről a SpaceX AI azt állítja, hogy jelenleg a legerősebb kódolásra és tudásmunkára tervezett fejlesztésük. Kiderül, hogy a modell nemcsak sebességben, hanem önellenőrzésben és hibatűrésben is felülmúlja elődeit, miközben relatíve alacsony árat kínál.

A bemutató során éles alkalmazásokon – például egy monster truck bajnokság értékelőrendszerén – vizsgálják, képes-e a modell önállóan hibadetektálásra és javításra, valamint hogyan reagál összetett technikai és jogi feladványokra.

Kiemelt figyelmet kapnak a pillanatok, amikor a Grok 4.7 multimodális tesztekben bizonyítja tudását: elektronikai rajzok hibadiagnosztikáján és összetett kulturális-jogi szituációk elemzésénél mutatja meg, mennyire megbízhatóan és tényszerűen dolgozik. Az is felmerül, hogy mennyire képes többnyelvű, pontos tartalmak előállítására különleges feladatokban.

A videó több pontján különböző benchmarkokat, összehasonlításokat és felhasználói élményeket tárgyal, amelyek érdekes kérdéseket vetnek fel arról, hogyan hasonlítanak egymáshoz a piacvezető AI modellek, illetve milyen irányba fejlődik a mesterséges intelligencia az alkalmazásokban.