A
A

Csak YouTube-on nézhető meg

  • Angol
  • Magyar
  • 16 perc

Új AI modellek barista kihívásban: Claude Opus 5.5 vs GPT-6 Soul összehasonlítása

A videó két új generációs AI-modell, a Claude Opus 5.5 és a GPT-6 Soul éles összehasonlítását mutatja be egy részletes barista-szimulációs feladaton keresztül.

Két vezető mesterséges intelligencia fejlesztő, az Anthropic és az OpenAI ugyanazon a napon mutatta be legújabb modelljeit: a Claude Opus 5.5-öt, illetve a GPT-6 Soul-t. Ezeket a friss AI modelleket nem csupán összehasonlító táblázatok vagy száraz benchmarkok alapján értékelik; egy komplex barista-szimulációs feladat során mérik össze őket.

A teszt során a modelleknek egy valós eszpresszógép képéből kiindulva kell szimulálniuk egy barista tréninget HTML környezetben, valós idejű fizikai folyamatokkal, például az extrakció dinamikájával, helyes vagy hibás őrlési beállításokkal, valamint a tejhabosítás menet közbeni hibalehetőségeivel. Lényeges elvárás, hogy a modellek ne sablonos vagy leegyszerűsített válaszokat adjanak, hanem a tényleges képből olvassanak és ok-okozati összefüggéseket modellezzenek.

A videó során bemutatásra kerül mindkét AI modell legfontosabb tulajdonsága, például a hatékonyság, ár-érték arány, valamint, hogy mennyire képesek valóban „gondolkodni” és alkalmazkodni a valós és változó helyzetekhez. Érdekes adat, hogy az Opus 5.5 akár 680 000 sornyi kódot is képes feldolgozni egy nap alatt, míg a GPT-6 Soul kiemelkedik közérthetőségével és vizuális prezentációival is.

Felmerülő kérdések: Hol húzódik a határ az AI mint sablonfelismerő eszköz és a valóság szimulációjára képes „gondolkodó” rendszer között? Mit jelent biztonság, kezdeményezőkészség vagy ár/érték arány, ha mesterséges intelligenciákat kell gyakorlati helyzetben, valós adatok alapján összehasonlítani? Miben nyújt újat egy barista szimulációs feladat, és milyen tanulságok vonhatók le ezekből a fejlesztésekből?