Miről álmodnak a képfelismerő algoritmusok?

Bitport2015.06.22.Cloud & big data

Meghökkentő, vicces és egyben lenyűgöző alkotásokat produkált a Google képfelismerésre tanított algoritmusa, amikor a kutatók megfordították a feladatot.

Számos más kezdeményezés mellett természetesen a Google kutatóit is foglalkoztatja a gépek képfelismerési képességének fejlesztése. A cég fejlesztői blogján most egy érdekes bejegyzést tettek közzé, amely bepillantást enged a kulisszák mögé.

Mesterséges idegpályák

A keresőóriás kutatócsapata egy olyan algortimuson dolgozik, amely mesterséges ideghálózat segítségével igyekszik az emberi képfelismerést szimulálni. A mesterséges intelligencia rétegekből áll, ahol az egyes szintek más és más típusú ismertető jegyek után kutatnak, majd a kapott eredményt továbbítják a felsőbb, egyre bonyolultabb, elvontabb fogalmakkal is megbírkózni képes rétegek felé. Míg az alacsonyabb szinteken csak az alakzat éleit, sarkait igyekszik beazonosítani a program, addig a fejlettebb rétegek már alapvető formákat keresnek (például egy ajtóét vagy levélét), a legutolsó egységek pedig már olyan komplex alakzatokat képesek azonosítani, mint egy épület vagy egy fa.

A kutatók számára azonban nem triviális, hogy az egyes szinteken pontosan mi is zajlik és hogy jut arra a kimenetre a gép, amit végül továbbít a sorban következő szintnek. Ennek megértésére találták ki a feje tetejére állított módszert. Azaz nem egy ismeretlen képet mutatnak a gépi intelligenciának, amiről meg kell állapítania, hogy mit ábrázol, hanem arra utasítják, hogy alakítson át egyet úgy, hogy az egy korábban képek ezreivel "begyakoroltatot" tárgyat vagy élőlényt formázzon.

A fenti képeket egy teljesen értelmezhetetlen, véletlenszerű színes ponthalmazból (vizuális zajból) generálta a mesterséges intelligencia. Minden képnél az volt a feladata, hogy egy bizonyos formát igyekezzen megtalálni, majd felerősítenie az alapképen. A számítógép tehát megkereste például azokat a területeket, amelyek egy banánra hasonlítottak, majd kicsit felnagyította ezeket a halvány hasonlóságokat. A következő körben aztán még inkább be tudta határolni a banánok helyét, újra erősített rajtuk, és így tovább, egészen a kész "műalkotásokig".

Hogy miért fontos ez a visszafelé ellenőrzés, arra konkrét példát is kaptak a kutatók. A fenti képsorozatnál ugyanis súlyzót kellett alkotnia a gépnek. Mint látható, ez nagyjából sikerült is, ám a súlyzókhoz szinte minden esetben egy azokat mozgató emberi kart is odaképzelt a mesterséges intelligencia. Ebből kiderült, hogy a tanítási szakasz nem volt tökéletes, a gép nem tudta elválasztani egymástól a súlyzó és az azt tartó kéz fogalmát.

Pszichedelikus álmok

Még érdekesebb eredményt kaptak a szakemberek akkor, amikor a gépi intelligenciának nem mondták meg, mit is kellene belelátnia egy ábrába. Csak fogtak egy képet, és engedték, hogy szabadon asszociálva erősítse fel azokat a formákat, amelyeket felismerni vél. A történetet még azzal is megfűszerezték, hogy ezt a feladatot kifejezetten egy mesterséges idegi szintnek adták ki. Mivel ahogy már korábban írtuk, ezek a szintek teljesen más típusú és komplexitású mintázatokat keresnek, az átalakítás is eltérő eredményeket hozott.

A kép kattintásra nagyítható

A magasabb szintű felismerő rétegek nem egyszer elképesztően érdekes képeket gyártottak. Egyikről-másikról simán el lehetne hinni, hogy egy pszichedelikus stílusú művész alkotása, és nem egy álmodozó algoritmusé. Azok a rendszerek, amelyeket például állatok képével tanítottak a formák felismerésére, mindenhová be tudták csempészni a nekik "kedves" madarakat, kutyákat. Így lett a nyitóképen látható híres Edvard Munch festmény sikoltó embere is kutyafejű. De hasonló bravúrokat mutattak be azok a gépi tanulók is, amelyeket épületek, városok képeivel kondicionáltak.

Aki a gépi művészet további kortárs remekeiben akar gyönyörködni, látogasson el a kutatói képgalériára.

Ennyi nem elég? Iratkozzon fel hírlevelünkre!

Cloud & big data

Exkluzív hazai kutatás: CIO-szerep újraírva

Milyen volt, milyen ma és milyen lesz egy jó informatikai vezető? Erre kereste a választ a Budapesti Corvinus Egyetem CITO kutatócsoportja és a Bitport együttműködésében készült kutatás. Dr. Fehér Péter egyetemi docens, kutatásvezető írása.

Hirdetés

Az adatkezelés újragondolása 2026-ban: hogyan oldja meg a Synology DS sorozat a valós üzleti kihívásokat

2026-ban a vállalkozások minden eddiginél több adatot generálnak és használnak. Az előrelátó vállalatok ezért újraértékelik a megközelítésüket: mi lenne, ha a tárolás, a biztonsági mentés és az együttműködés egyetlen rendszerben kezelhető lenne?

A hónap témája

Hogyan vezessük be az MI-t szolgáltatásként?

Önmagukban a sikeres pilotprojektek nem kövezik ki a hosszútávon is jól működő AIaaS- és RPAaaS-használat útját. A szemléletváltáson kívül akad még pár dolog, amit figyelembe kell venni.

a melléklet támogatója a ONE Solutions

CIO Podcast

CIO Podcast #70: A mobiltelefónia csendes robotosai

CIO Podcast #69: A digitális kultúra hiánya a védelmi technológiákat is gyengíti

MÉG TÖBB CIO PODCAST »

Vendég cikk

Radikális fordulat várható a kormányzati IT-gazdálkodásban

Egy kormányrendelet alapjaiban formálják át 2026-tól az állami intézmények és vállalatok szoftvergazdálkodási gyakorlatát.

Projektek O-gyűrűje. Mit tanulhat egy projektvezető a Challenger tragédiájából?

CIO Klub

Akadémiai megerősítést kapott: szenior fejlesztő nem vén fejlesztő

A Corvinus Egyetem és a Complexity Science Hub kutatói megmérték: a Python kódok közel harmadát ma már mesterséges intelligencia írja, és ebből a szenior fejlesztők profitálnak.

Rengeteg ország áll át helyi MI-platformra

Exkluzív hazai kutatás: CIO-szerep újraírva

Hogyan vezessük be az MI-t szolgáltatásként?

CIO Podcast #70: A mobiltelefónia csendes robotosai

Radikális fordulat várható a kormányzati IT-gazdálkodásban

Akadémiai megerősítést kapott: szenior fejlesztő nem vén fejlesztő

PM JAM 2026: a projektmenedzsment elmélete gyakorlattá válik!