Daugiau nei 170 vaizdų ir asmeninės informacijos apie vaikus iš Brazilijos buvo iškrapštyti naudojant atvirojo kodo duomenų rinkinį be jų žinios ar sutikimo. naudojamas AI mokytitvirtina a nauja ataskaita Pirmadienį paskelbė „Human Rights Watch“.
Ataskaitoje teigiama, kad vaizdai buvo nubraukti iš turinio, paskelbto dar 2023 m., o dar dešimtojo dešimtmečio viduryje, gerokai anksčiau nei bet kuris interneto vartotojas galėjo numanyti, kad jų turinys gali būti naudojamas dirbtiniam intelektui mokyti. „Human Rights Watch“ teigia, kad šių vaikų asmeninė informacija kartu su nuorodomis į jų nuotraukas buvo įtraukta į LAION-5B – duomenų rinkinį, kuris buvo populiarus AI pradedančiųjų mokymo duomenų šaltinis.
„Jų privatumas pirmiausia pažeidžiamas, kai jų nuotrauka nubraukiama ir įtraukiama į šiuos duomenų rinkinius. Tada šie dirbtinio intelekto įrankiai yra apmokomi remiantis šiais duomenimis ir todėl gali sukurti tikroviškus vaikų vaizdus“, – sako Hye Jung Han, „Human Rights Watch“ vaikų teisių ir technologijų tyrinėtojas ir šiuos vaizdus suradęs tyrėjas. „Technologija sukurta taip, kad bet kuriam vaikui, kuris internete turi kokią nors nuotrauką ar vaizdo įrašą, dabar gresia pavojus, nes bet kuris piktavalis veikėjas gali nufotografuoti šią nuotrauką ir naudoti šiuos įrankius manipuliuoti jais taip, kaip nori“.
LAION-5B yra pagrįstas „Common Crawl“ – duomenų saugykla, kuri buvo sukurta iškraunant žiniatinklį ir tapo prieinama tyrėjams – ir buvo naudojama mokant kelis AI modelius, įskaitant „Stability AI“ stabilios difuzijos vaizdo generavimo įrankį. Vokietijos ne pelno organizacijos LAION sukurtas duomenų rinkinys yra atvirai prieinamas ir dabar apima daugiau nei 5,85 milijardo vaizdų ir antraščių porų, teigiama jos svetainėje.
Vaikų vaizdai, kuriuos rado mokslininkai, paimti iš mamyčių tinklaraščių ir kitų asmeninių, motinystės ar tėvystės tinklaraščių, taip pat kadrų iš „YouTube“ vaizdo įrašų su nedideliu peržiūrų skaičiumi, kurie, atrodo, buvo įkelti, kad būtų galima dalytis su šeima ir draugais.
„Tiesiog pažvelgus į kontekstą, kur jie buvo paskelbti, jiems patiko lūkesčiai ir tam tikras privatumas“, – sako Hye. „Daugelio šių vaizdų nepavyko rasti internete naudojant atvirkštinę vaizdų paiešką.
LAION atstovas Nate'as Tyleris teigia, kad organizacija jau ėmėsi veiksmų. „LAION-5B buvo panaikintas reaguojant į Stanfordo ataskaitą, kurioje duomenų rinkinyje buvo rastos nuorodos į neteisėtą turinį viešajame žiniatinklyje“, – sako jis ir priduria, kad organizacija šiuo metu bendradarbiauja su „Internet Watch Foundation“, Kanados vaikų centru. Protection, Stanford ir Human Rights Watch, kad pašalintų visas žinomas nuorodas į neteisėtą turinį.
„YouTube“ paslaugų teikimo sąlygos neleisti grandyti, išskyrus tam tikras aplinkybes; atrodo, kad šie atvejai prieštarauja tai politikai. „Mes aiškiai pasakėme, kad neteisėtas „YouTube“ turinio iškrapštymas yra mūsų paslaugų teikimo sąlygų pažeidimas, – sako „YouTube“ atstovas Jackas Maonas, – ir toliau imamės veiksmų prieš tokio pobūdžio piktnaudžiavimą.
Gruodžio, Stanfordo universiteto mokslininkai nustatė kad LAION-5B surinktuose AI mokymo duomenyse buvo vaikų seksualinės prievartos medžiagos. Aiškių klastočių problema didėja net tarp JAV mokyklų mokinių, kur jie naudojami tyčiotis iš klasės draugų, ypač mergaičių. Hye nerimauja, kad ne tik vaikų nuotraukų naudojimas CSAM generuoti, bet ir tai, kad duomenų bazė gali atskleisti galimai neskelbtiną informaciją, pvz., vietas ar medicininius duomenis. 2022 m., JAV gyvenantis menininkas rado savo atvaizdą LAION duomenų rinkinyjeir suprato, kad tai iš jos privačių medicininių įrašų.