A
A
  • Angol
  • Magyar
  • 34 perc

Az MI újdonságai: modelláradat, láthatatlan vízjelek és intelligens ügynökök megjelenése

Soha nem látott mennyiségben jelentek meg új MI modellek, eszközök és funkciók – ezek között akad néhány, amely akár a mindennapokra is hatással lehet.

Az elmúlt hét az MI világában szokatlanul sűrű újdonságokat hozott: megjelentek új modellek, kulcsfontosságú frissítések és innovatív megoldások, amelyek nemcsak a technológiai haladást, hanem a mindennapi felhasználói élményt is átalakíthatják.

Érdekes fejlesztések tűntek fel a 3D generálásban is. A Tencent Worldclaw modellje például lehetővé teszi, hogy szöveges utasításra teljes 3D világokat hozzunk létre, ahol minden egyes elem külön szerkeszthető vagy exportálható. Így például egy havas falut vagy sivatagi harci jelenetet is egyetlen promptból állíthatunk össze. A háttérben több eljárás – például a GPT-Image 2 és a Meta SAM 3 – összjátékával készülnek ezek a vizuális élmények.

Szintén jelentős újdonság a Grockbot az XAI-tól, amely intelligens ügynököket tesz elérhetővé különféle feladatokhoz, legyen szó e-mailek rendszerezéséről vagy kutatásról. Ezek az agentek önállóan tanulhatnak felhasználói példák alapján, és automatikus rutinokat hajthatnak végre felhőben futó virtuális számítógépeken.

Az MI által generált tartalmak megkülönböztethetőségének kérdése is fókuszba került. Több cég – köztük az Anthropic és a Suno – láthatatlan vízjelekkel igyekszik nyomot hagyni a generált szövegekben és zenékben, miközben egyre szigorúbb szabályozást vezetnek be a platformokon, például a Spotify-on is.

Mindeközben futószalagon érkeznek az új AI modellek: például a Grock 4.6, a Gemini 3.7 Flash, a Meta Muse Glimmer, az Nvidia Neotron 3.5 Lightning vagy a DeepSeek V4 Pro. Ezek közül több is elérhető költséggel és nyílt súlyokkal futtatható akár otthoni gépeken is, de a legtöbb fejlesztés még csak mérsékelt előrelépést hoz a hétköznapi felhasználók számára.

Speciális alkalmazási példák is bemutatkoztak. Ilyen a Google DeepMind SL2T modellje, amely képes jelelt nyelvet valós időben szöveggé alakítani, vagy az LTX 2.5, amely képet alakít rövid videóvá. Felmerül a kérdés: milyen irányba halad az MI ökoszisztéma, ha a fejlődés tempója ilyen elképesztő?