„OpenAI“ tikrai nenori, kad žinotumėte, ką „galvoja“ jos naujausias AI modelis. Nuo tada, kai praėjusią savaitę bendrovė pristatė savo „Strawberry“ AI modelių šeimą, reklamuojančią vadinamuosius samprotavimo gebėjimus su o1-preview ir o1-mini, OpenAI siunčia įspėjamuosius el. laiškus ir grasinimus uždrausti bet kuriam vartotojui, kuris bando ištirti, kaip modelis veikia. darbai.
Skirtingai nuo ankstesnių OpenAI AI modelių, tokių kaip GPT-4o, įmonė prieš pateikdama atsakymą specialiai apmokė o1 atlikti nuoseklų problemų sprendimo procesą. Kai vartotojai užduoda „o1“ modeliui klausimą „ChatGPT“, vartotojai turi galimybę matyti šią minčių grandinę, parašytą „ChatGPT“ sąsajoje. Tačiau pagal dizainą OpenAI slepia neapdorotą vartotojų minčių grandinę, o pateikia filtruotą interpretaciją, sukurtą antrojo AI modelio.
Niekas nėra labiau viliojantis entuziastams, nei užslėpta informacija, todėl įsilaužėliai ir netekę komandos narių lenktyniavo bandydami atskleisti neapdorotą o1 minčių grandinę naudodami įkalinimo ar greito įpurškimo metodus, kuriais bandoma apgauti modelį atskleisti savo paslaptis. Buvo ankstyvų pranešimų apie kai kurias sėkmes, bet niekas dar nebuvo tvirtai patvirtinta.
Be to, „OpenAI“ stebi per „ChatGPT“ sąsają ir, kaip pranešama, įmonė sunkiai nusileidžia bet kokiems bandymams ištirti „o1“ samprotavimus, net ir tarp smalsuolių.
Vienas X vartotojas pranešė (patvirtino kiti, įskaitant Scale AI inžinierių Riley Goodside), kad jie gavo įspėjimo el. laišką, jei pokalbyje su o1 vartojo terminą „protavimo pėdsakas“. Kiti teigia, kad įspėjimas suveikia tiesiog paklausus ChatGPT apie modelio „protavimą“.
OpenAI įspėjamajame el. laiške teigiama, kad konkrečios vartotojų užklausos buvo pažymėtos kaip pažeidžiančios apsaugos priemonių ar saugos priemonių apėjimo politiką. „Prašome sustabdyti šią veiklą ir įsitikinti, kad naudojatės ChatGPT pagal mūsų naudojimo sąlygas ir naudojimo politiką“, – rašoma jame. „Dėl papildomų šios politikos pažeidimų gali būti prarasta prieiga prie GPT-4o su priežastimis“, nurodant vidinį o1 modelio pavadinimą.
Marco Figueroa, valdantis „Mozilla“ „GenAI“ klaidų programas, praėjusį penktadienį vienas pirmųjų paskelbė apie „OpenAI“ įspėjamąjį el. laišką, skundęsis, kad jis trukdo jam atlikti teigiamus modelio saugos tyrimus. „Buvau per daug pasimetęs sutelkęs dėmesį į #AIRedTeaming, kad suprasčiau, jog vakar gavau šį el. laišką iš @OpenAI po visų savo pertraukų į kalėjimą“, – rašė jis. „Dabar aš esu uždraustų asmenų sąraše!!!”
Paslėptos minties grandinės
Įraše, pavadintame „Mokymasis samprotauti su LLM“ OpenAI tinklaraštyje, bendrovė teigia, kad paslėptos minčių grandinės AI modeliuose suteikia unikalią stebėjimo galimybę, leidžiančią jiems „skaityti mintis“ apie modelį ir suprasti jo vadinamąją mintį. procesas. Šie procesai yra naudingiausi įmonei, jei jie paliekami neapdoroti ir necenzūruojami, tačiau tai gali nesutapti su geriausiais įmonės komerciniais interesais dėl kelių priežasčių.
„Pavyzdžiui, ateityje galbūt norėsite stebėti minčių grandinę, ar nėra manipuliavimo vartotoju požymių“, – rašo bendrovė. „Tačiau, kad tai veiktų, modelis turi turėti laisvę reikšti savo mintis nepakeista forma, todėl negalime įtraukti į minčių grandinę jokios politikos laikymosi ar naudotojo pageidavimų. Taip pat nenorime, kad nesuderinta minčių grandinė būtų tiesiogiai matoma vartotojams“.