A mesterséges intelligencia menti meg az adatújságírást?

Bitport2019.09.11.Cloud & big data

Egy kaliforniai startup dob mentőövet az adatok erdejében tévelygő újságíróknak.

Mint kiderült, nem csak a Google és a Microsoft (no meg az NSA) térképezi fel a-tól z-ig az internetet, hanem egy kis kaliforniai startup is, amely most tudását a hiteles újságírás szolgálatába állítja. Az 2008-ban alapított Diffbot ugyanis partnerségre lépett egy európai újságíró szervezettel, az EJC-vel (European Journalism Centre), hogy olyan technológiai megoldásokkal segítse az adatújságírást, amik megkönnyítik a hamis információk kiszűrését.

Mint a ZDNet írja, az EJC mintegy kilencezer tagja a központ adatújságírásra specializálódott oldalán, a Data Journalismon keresztül férhet ingyenesen hozzá a startup legértékesebb eszközéhez, a Knowledge Graph-hoz.

A mesterséges intelligencia Szent Grálja

A Knowledge Graph lényegében egy tudásbázis, amely az interneten található több mint 10 milliárd entitásra és ezer milliárdot is meghaladó adatmennyiségre épül. Mindezt az információtömeget a Knowledge Graph mesterséges intelligencia segítésével olyan módon teszi lekérdezhetővé, mintha az egész internet egy strukturált adatbázis lenne. A Diffbot alapítója, Michael Tung egy tavalyi interjújában úgy írta le a rendszert, mint az interneten összegyűlt emberi tudás első átfogó térképét. Szerinte sikerült elkészítenie a gépi tanulás Szent Grálját, ami a világ összes tudását (már ami a neten elérhető) egy helyre gyűjti. Mint mondta, ehhez az internet minden oldalát elemezni kell, ami nyilvánvalóan elképzelhetetlen automatizálás és mesterséges intelligencia nélkül.

Az alapító, aki egyébként a Stanfordon, az egyetemi évei alatt kezdett el foglalkozni mélyebben a mesterséges intelligencia kutatásával, a számítógépes látás és a természetes nyelvfeldolgozás kombinációjára építette a rendszerét. Ez biztosítja, hogy a Diffbot webrobotja gyakorlatilag bármilyen felépítésű weboldalt képes elemezni, és az információkat szintetizálni.

A feldolgozás két lépésben történik: az információk begyűjtését robotok végzik – havonta mintegy 130 millió tényadattal gazdagodik a Knowledge Graph tudásbázisa –, és rendszerezik egy strukturált adatbázisban, ami a lekérdezéseket kiszolgálja. Mivel az információk rendszerezéséből kiiktatták az emberi tényezőt, ezért a rendszer mentes az előítéletektől és rendkívül pontos – állítja a cég. A szolgáltatás ismertetője szerint a Knowledge Graph bármilyen egyedi információt képes kinyerni, ha az az interneten megtalálható. A lekérdezésekhez, amiket egy egyszerű webes felületen kell megadni, készítettek egy saját lekérdező nyelvet is, a Diffbot Query Language-et.

Michael Tung, a Grál lovag

Ennek segítségével jól körül lehet írni a keresett információt. Ha például egy szerző cikkeire keres rá valaki, akkor állítólag a Knowledge Graph képes kiadni az adott szerző összes valaha megjelent cikkét bármilyen nyelven. Vagy ha valakinek az életútját szeretnénk megismerni, akkor a rendszer a különböző forrásokat szintetizálva adja meg az illető közel teljes – nyilvánosan elérhető információkból összeállítható – pályaképét/profilját.

Az adatok megjeleníthetők listában, táblázatban, de akár térképes formában is, hogy jobban megmutatkozzanak az összefüggések.

Gyorsítja az újságírók munkáját

Az újságírói munkához a Knowledge Graph kétségtelenül óriási segítség. Az eszközzel gyorsan ellenőrizhetővé válnak az információforrások, és pillanatok alatt feltárhatók a kapcsolatok különböző személyek, helyek, szervezetek között. Ez az információgyűjtés az (adat)újságírás legidőigényesebb része, az újságírók olykor heteket-hónapokat is eltöltenek azzal, hogy adatokat gyűjtsenek, azokat ellenőrizzék és rendszerezzék, hogy láthatóvá váljanak a köztük lévő összefüggések.

Ugyanakkor hiba lenne ezt – Tung szavaival – valamiféle Szent Grálnak tekinteni. Számtalanszor bebizonyosodott, hogy a mesterségesintelligencia-algoritmusok sem mentesek az előítéletektől. Emellett azzal is számolni kell, hogy az MI rosszul is tanítható. Mint azt a közelmúltban az intelligens asszisztensek kockázataival kapcsolatos körkérdésünkre Frész Ferenc, a Cyber Sertvices vezérigazgatója írta, a mesterséges intelligenciával és a gépi tanulással egy nagyon súlyos új támadási faktor lépett be: az adattorzítás. Ennek lényege, hogy olyan – hamis – adatokat visznek be az öntanuló algoritmusokba, melyek eredményeként az rossz-hibás válaszokat ad. Ennek hatása beláthatatlan.

Cloud & big data

Miért maradt le Európa az informatika nevű versenyszámban?

Az ARIS üzleti folyamatmenedzsment szoftver kitalálója szerint az európai (német) cégek nem látták a fától az erdőt, a hardvertől a szofvert.

A hónap témája

Mit kell tenni, amikor beüt a krach?

Előrelátó tervezés és meghatározott menetrend segíti az incidensek minél gyorsabb elhárítását. Ehhez azonban sok feladatot és felelősséget kell tisztázni – még jóval azelőtt, hogy bekövetkezik a baj.

a melléklet támogatója a ONE Solutions

CIO Podcast

CIO Podcast #70: A mobiltelefónia csendes robotosai

CIO Podcast #69: A digitális kultúra hiánya a védelmi technológiákat is gyengíti

MÉG TÖBB CIO PODCAST »

Vendég cikk

Radikális fordulat várható a kormányzati IT-gazdálkodásban

Egy kormányrendelet alapjaiban formálják át 2026-tól az állami intézmények és vállalatok szoftvergazdálkodási gyakorlatát.

Projektek O-gyűrűje. Mit tanulhat egy projektvezető a Challenger tragédiájából?

CIO Klub

Akadémiai megerősítést kapott: szenior fejlesztő nem vén fejlesztő

A Corvinus Egyetem és a Complexity Science Hub kutatói megmérték: a Python kódok közel harmadát ma már mesterséges intelligencia írja, és ebből a szenior fejlesztők profitálnak.

Rengeteg ország áll át helyi MI-platformra

Miért maradt le Európa az informatika nevű versenyszámban?

Mit kell tenni, amikor beüt a krach?

CIO Podcast #70: A mobiltelefónia csendes robotosai

Radikális fordulat várható a kormányzati IT-gazdálkodásban

Akadémiai megerősítést kapott: szenior fejlesztő nem vén fejlesztő

PM JAM 2026: a projektmenedzsment elmélete gyakorlattá válik!