Megszoktuk, hogy a neurális hálókat hibákon kapjuk rajta. Ezúttal azonban a helyes válasz buktatta le őket.

Az embereket megtévesztette egy optikai csalódás, kilenc neurális háló viszont nem dőlt be neki. Látszólag ez a gépek győzelme. De ha az emberi agyhoz hasonló rendszert akarunk létrehozni, a túl pontos válaszok is gyanúra adnak okot.
A kísérletről október 2-án számolt be a torontói York Egyetem. A tanulmány a Current Biology című biológiai folyóiratban jelent meg. A kutatók összehasonlították az emberek válaszait, a makákók agyi aktivitásának felvételeit és a gépi látás modelljeinek működését.

A „kettő meg kettőre” a számológép és a könyvelő is azt válaszolja, hogy „négy”. De máshogy számolnak. Ezért az agymodelleket a ránk jellemző hibák alapján is tesztelném. A közös tévedések olykor többet árulnak el két rendszer hasonlóságáról, mint a közös sikerek.
A part, amely kúszik
Nézz egy percig egy sebes folyót, majd pillants a partra. Úgy tűnhet, mintha a folyással szemben kúszna. 1834-ben Robert Addams hasonló jelenséget írt le a skóciai Foyers-vízesésnél: miután a lezúduló vízre nézett, a környező sziklák mintha felfelé emelkedtek volna. Innen ered az elnevezés: vízesés-illúzió.

A mozgás megfigyelése után a látás érzékenysége megváltozik a mozgás irányára. A jelek egyensúlya eltolódik, és a mozdulatlan dolog úgy tűnik, mintha az ellenkező irányba mozogna. Nem feltétlenül kell sokáig nézni: egy 2011-es laboratóriumi kísérletben ezt az utóhatást már 25 milliszekundum – a másodperc egynegyvened része – után is kiváltották.
Egy tárgy látszólagos helyzete is megváltozhat. Ezt 1998-ban mutatta be Robert Snowden pszichológus. A tárgy a helyén marad, de az ember úgy látja, mintha kissé elmozdult volna. Pontosan ezt a hatást használták fel az új kutatásban.
Egy kép, különböző válaszok

A kutatók meg akarták érteni, mit tükröznek az agyi jelek: a tárgy valós helyzetét, vagy azt a helyet, ahol az ember a tárgyat látja. Amíg ezek a koordináták egybeesnek, nehéz megkülönböztetni az egyiket a másiktól. Az illúzió azonban lehetővé teszi a szétválasztásukat.
A kísérletben 79 ember vett részt. Néhányan azonnal megjelölték a tárgyak helyzetét. Mások előbb fél percig jobbra vagy balra futó csíkokat néztek. Ezután a másodperc tizedrészére megjelent egy kép. Amikor eltűnt, a résztvevő oda kattintott, ahol az érzése szerint a tárgy középpontja volt.
A jobbra tartó mozgás után az emberek szisztematikusan balra tévedtek, a balra tartó mozgás után pedig jobbra. A két csoport átlagos válaszai közötti különbség körülbelül egyharmad fok volt – ami a Hold látszólagos átmérőjének nagyjából kétharmada.

Hasonló képeket mutattak rézuszmajmoknak is. Az állatok egy megadott pontra néztek, a kutatók pedig rögzítették az alsó halántéki kéreg aktivitását – ez a terület vesz részt a tárgyak felismerésében. Egy külön programot, egy dekódert tanítottak be arra, hogy ezekből a jelekből rekonstruálja az objektum helyzetét.
A futó csíkok után a dekóder becslései ugyanabba az irányba tolódtak el, mint az emberek válaszai. Az egyik mozgásirányban egyértelmű eredményt kaptak, a másiknál viszont az eltolódás statisztikailag nem bizonyult meggyőzőnek.
Maguk a makákók nem jelölték meg a tárgyak helyzetét. Ezért nem lehet kijelenteni, hogy pontosan ugyanazt látták, mint az emberek. Az idegi jelekben azonban megmutatkozott, hogy a közvetlenül előtte látott kép hasonló hatással volt az új képre.
Kilenc modell illúzió nélkül
A mintába képfelismerő hálózatok, egy videómodell és egy visszacsatolásokkal működő hálózat került: utóbbiban a jelek visszatérhetnek a feldolgozás korábbi szakaszaiba.

A neurális hálók belső jeleiből a dekóder olykor pontosabban határozta meg a tárgy helyzetét, mint a makákók agyi felvételeiből. Emberi eltolódás azonban nem alakult ki.
A kutatók megpróbáltak alkalmazkodási mechanizmust beépíteni a hálózatokba: szimulálták az aktivitás csökkenését, amelyet az élő neuronoknál figyeltek meg. Az aktivitás csökkent, az elvárt hiba viszont nem jelent meg.
A videómodell és a visszacsatolásokkal működő hálózat sem reprodukálta a hatást, noha a képkockák sorozatát a futó csíkokkal együtt dolgozták fel. A becslések változásai több tíz-, illetve több százszor kisebbek voltak az emberiénél.
Úgy tűnik, az előző képkockák figyelembevétele nem elég. Azt kell reprodukálni, ahogyan a látott dolgok megváltoztatják a látás további működését.
Ki tudja, talán még megjelenik egy olyan „Nem vagyok robot” ellenőrzés is, ahol a gépet a túl helyes válasz buktatja le.
Természetesen konkrét modellekről és konkrét optikai csalódásról van szó. Képeket elemezni képes chatbotokat itt nem vizsgáltak. Más illúzióknak pedig bedőlnek a neurális hálók. Japán kutatók már 2018-ban megmutatták: a videók következő képkockájának előrejelzésére betanított PredNet hálózat mozgást jósol az álló „Forgó kígyók” illúzióban.
Hogyan vitték át a hibát a gépbe
A kutatók kiszámították, hogyan változott a makákók idegsejtjeinek aktivitási mintázata a futó csíkok után. Ezután átültették ezt a korrekciót több neurális háló belső jeleire.

Egy ilyen beavatkozás után a tárgyak helyzetének becslései ugyanabba az irányba kezdtek eltolódni, mint az embereknél.
Ez azt jelenti, hogy a modellek belsejében található információk alapján a hatás reprodukálható. A korrekciót azonban készen vették át az agyi felvételekből. A hálózatok nem maguktól alakították ki, a kutatók pedig egyelőre még nem állapították meg, pontosan hogyan hoz létre az agy ilyen alkalmazkodást.
Számomra ez egy fontos határvonal: az emberi hibát sikerült megismételni, az eredetét teljesen megmagyarázni viszont még nem.
Két térkép egy asszisztensnek
A kutatás vezetője, Kohitij Kar olyan jövőbeli rendszerekhez köti az eredményt, amelyek emberek mellett fognak működni. Ezeknek hasznos lesz érteniük, hogyan érzékeli az ember a történéseket.
Egy jó MI-asszisztenstől kétféle térképet várnék el: azt, hogy hol van a tárgy a valóságban, és azt, hogy hol látja most az ember.
A gépnek nem feltétlenül kell osztoznia az illúzióinkban. Hasznosabb, ha előre jelzi, mikor fogunk tévedni miattuk.
A sofőröknél hasonló probléma merül fel a sebességérzékeléssel kapcsolatban. Hosszú, gyors vezetés után a mérsékelt sebesség alacsonyabbnak tűnhet, mint amilyen valójában. Egy vezetéstámogató asszisztensnek hasznos lenne figyelembe vennie a látás ilyen alkalmazkodását. A közlekedési táblák felismerésére szolgáló szokásos teszt nem vizsgálja ezt a képességet.
Ez egy lehetséges alkalmazási módja az ilyen kutatásoknak; az új tanulmányban ezt nem vizsgálták. Én azonban pontosan ebben látom a vizuális tévedéseink tanulmányozásának hasznát: a gép pontosan felméri a helyzetet, és képes előre látni, hol fogja az ember tévesen megítélni azt.

