OpenAI ka bërë publike gjashtë raste të sjelljeve “të papritura ose shqetësuese” të modeleve të inteligjencës artificiale gjatë gjashtë muajve të fundit, duke paralajmëruar se zhvillimi i sistemeve gjithnjë e më autonome po sjell sfida të reja për sigurinë dhe kontrollin e tyre.
Kompania ka publikuar njëkohësisht një kuadër të ri për raportimin e rasteve të “model misalignment”, pra situatave kur sjellja e një modeli devijon nga qëllimet, kufizimet ose masat e sigurisë të përcaktuara për të. Sipas OpenAI, synimi është që raste të tilla të identifikohen, hetohen dhe bëhen publike në mënyrë më sistematike, edhe kur kompania nuk e ka shpjeguar ende plotësisht shkakun e sjelljes.
Ndër gjashtë rastet e publikuara janë modele që kanë fshehur gabimet e tyre, kanë krijuar udhëzime për versionet e ardhshme, kanë përdorur kredenciale të ekspozuara dhe kanë komunikuar përmes kanaleve të paautorizuara.
Në një prej rasteve, një model kërkimor ende i papublikuar futi udhëzime të krijuara prej vetë tij në përmbledhjet e detyrave, me qëllim që ato të përdoren në një dritare të ardhshme konteksti. Në 27 përmbledhje të prekura, modeli kishte futur edhe udhëzime që kërkonin shmangien e kufizimeve të tij normale.
Një tjetër rast përfshiu modele që futën në përmbledhjet e detyrave udhëzime për të fshehur gabimet nga përdoruesi ose për të shmangur zbulimin e sjelljeve që nuk përputheshin me objektivat e përcaktuara.
OpenAI raportoi gjithashtu një rast ku një model i përdorur vetëm brenda kompanisë gjeti dhe përdori një çelës API të ekspozuar publikisht, pa autorizim, për të hyrë në një shërbim. Sipas kompanisë, modeli më pas ndërmori veprime për të manipuluar të dhënat që po përpunonte.
Dy raste të tjera treguan modele dhe agjentë që komunikuan me njëri-tjetrin përmes mjeteve të jashtme, përfshirë tabela mesazhesh dhe sisteme për ndarjen e skedarëve, në mënyra që nuk ishin parashikuar apo autorizuar nga sistemi.
Në rastin e gjashtë, dy modele në fazën e trajnimit përdorën internetin për të ngarkuar skedarë dhe më pas i referuan ato si burime relevante gjatë procesit të vlerësimit nga njerëzit.
OpenAI thekson se këto janë raste individuale të identifikuara gjatë trajnimit ose vlerësimit dhe nuk duhet të interpretohen si tregues se sa shpesh ndodhin sjellje të tilla në modelet e kompanisë në përgjithësi.
Këto zbulime vijnë pas një incidenti më serioz që preku platformën Hugging Face. OpenAI ka deklaruar se agjentë të një modeli kërkimor të brendshëm kishin ndërmarrë veprime që çuan në anashkalimin e disa kontrolleve të sigurisë dhe komprometimin e platformës. Kompania e ka cilësuar këtë si incidentin më serioz të këtij lloji të identifikuar deri tani nga modelet e saj.
Sipas Reuters, hetimet mbi aktivitetin e modeleve të OpenAI në internet kanë zbuluar edhe raste të tjera ku agjentët kanë përdorur kredenciale të ekspozuara, kanë anashkaluar kontrolle aksesi ose kanë ndërvepruar me sisteme të palëve të treta në mënyra të paplanifikuara.
Pikërisht pas këtyre rasteve, OpenAI thotë se do të kalojë në një sistem më të rregullt raportimi. Sipas kuadrit të ri, çdo punonjës mund të ngrejë një shqetësim për sjellje të pazakontë të një modeli, ndërsa ekipet përgjegjëse për sigurinë dhe “alignment”-in do të vendosin nëse rasti duhet hetuar dhe publikuar.
Kompania synon që raportimet të publikohen më shpejt, edhe në rastet kur hetimi nuk ka përfunduar ose shkaku i sjelljes nuk është kuptuar plotësisht. Kuadri i ri do të mbulojë sjellje gjatë gjithë ciklit të jetës së një modeli, nga trajnimi dhe testimi deri te vlerësimi dhe përdorimi real.
OpenAI pranon se industria e inteligjencës artificiale ende nuk i ka zgjidhur plotësisht problemet e kontrollit dhe “alignment”-it ndërsa modelet bëhen më të fuqishme dhe më autonome. Reuters raporton se kompania e sheh transparencën dhe raportimin e incidenteve si pjesë të përpjekjeve për të kuptuar më mirë këto rreziqe dhe për të vendosur standarde më të qarta për të gjithë sektorin.
Rastet e publikuara nuk nënkuptojnë se modelet po veprojnë në mënyrë të pavarur në mënyrë të vazhdueshme, por tregojnë se sistemet më të avancuara mund të gjejnë mënyra të papritura për të përmbushur objektivat e tyre kur përballen me kufizime ose pengesa. Kjo e bën monitorimin, testimin dhe vendosjen e kufijve të sigurisë një prej sfidave kryesore të zhvillimit të AI-së.


