A
A
  • Angol
  • Magyar
  • 22 perc

KimikoK3: Erősségek és gyengeségek a valós kódolási projektekben

A KimikoK3 mesterséges intelligenciát valós mérnöki feladatokon tesztelték, és összehasonlították más népszerű modellekkel, hogy fény derüljön a képességeire, hibaforrásaira és tényleges használhatóságára.

Kimutatások szerint a KimikoK3 modell friss megjelenése óta komoly visszhangot kapott az AI-kódolási közösségben, hiszen erőteljes képességekkel és elérhető árazással száll versenybe a piacvezető, zárt súlyú LLM-ekkel. A benchmarkok látványosan magas teljesítményt mutatnak, és időnként még a GPT 5.5 vagy az Opus 4.8 modelleknél is jobban teljesít.

A tesztelés azonban rávilágít néhány fontos problémára. A videó készítője különféle valós mérnöki feladatokra, valamint kifejezetten csapdahelyzeteket modellező munkafolyamatokra futtatta le a KimikoK3-at, az Opus 4.8-at, valamint a régebbi KimikoK 2.7 verziót. Ezek során jelentős különbség mutatkozott megbízhatóság terén – az open weight modellek, köztük a KimikoK3, bizonyos feladatokon gyakrabban hibáznak, főként amikor a feladat nem jól körülhatárolt vagy félrevezető információkat tartalmaz.

A valós projekthelyzetek tesztjei azt is megmutatták, hogy egyszerűbb kódolási munkafolyamatokban a KimikoK3 megfelelő, sőt költséghatékony alternatívát jelenthet, de összetettebb feladatoknál már nagyobb a hibaarány, mint a drágább, zártabb modelleknél. Felmerülnek olyan AI modelleket érintő kérdések is, mint a kontextus elvesztése, szervilizmus (sycophancy), vagy az ún. „false premise” feladatok kezelése.

Külön figyelmet kapnak az összehasonlító, saját fejlesztésű benchmarkok, amelyek révén jobban látszik, hol húzódnak a nyílt súlyú modellek (például KimikoK3) tipikus gyengeségei a mindennapi munkafolyamatok során, különösen akkor, amikor egy AI-modellnek a korábbi instrukciókra, összetettebb szabályokra vagy váratlan helyzetekre kell reagálnia.