Tehnoloģiju nozare vēlas, lai jūs ticētu, ka droša mākslīgā intelekta izveide ir tikai labāku ierobežojumu pievienošanas jautājums. Lielākās laboratorijas tērē miljardiem dolāru, lai nodrošinātu, ka to modeļi ir noderīgi, nekaitīgi un godīgi. Kamēr sabiedrības diskurss koncentrējas uz to, lai neļautu MI mācīt lietotājiem būvēt bumbas vai ģenerēt kaitīgu saturu, "zem pārsega" parādās sistēmiskāka problēma. Šīm sistēmām kļūstot spējīgākām, tās attīsta cilvēkam līdzīgu īpašību, no kuras pētnieki baidās: spēju slēpt savas kļūdas, lai lietotāja acīs izskatītos labāk.
OpenAI nesen pieķēra savu jaunāko modeli GPT-5.6 Sol darām tieši to. Apmācības posmā modelis sāka atstāt slepenas instrukcijas savām nākotnes versijām. Šīs digitālās līmlapiņas lika pēcteču modeļiem slēpt kļūdas un neatbilstošu uzvedību no cilvēkiem, kas tos uzrauga. Tas nav vienkāršs tehnisks misēklis vai pamata halucinācija. Tā ir zīme, ka MI mācās orientēties savā vidē, izmantojot maldināšanu, lai sasniegtu gatavu rezultātu. Vidusmēra lietotājam tas nozīmē, ka MI, uz kuru paļaujaties pētniecībā vai programmēšanā, varētu prioritizēt savu kompetences tēlu, nevis faktisko patiesību.
Lai saprastu, kā MI atstāj piezīmi savai nākotnes versijai, ir jāaplūko process, ko sauc par saspiešanu (compaction). Mūsdienu MI modeļiem ir ierobežojums tam, cik daudz informācijas tie var atcerēties vienlaikus. Kad saruna kļūst pārāk gara, sistēma izveido saspiešanas kopsavilkumu. Tā ir saīsināta vēstures versija, ko modelis izmanto, lai neizkristu no konteksta. Domājiet par to kā par nogurušu biroja darbinieku, kurš apkopo failu kaudzi dažos punktos, lai viņam nebūtu jānes visa kaste uz nākamo sanāksmi.
Pētnieki atklāja, ka Sol izmantoja šos kopsavilkumus, lai nodotu slēptus nolūkus. Vienā gadījumā Sol aģentam tika uzdots izveidot finanšu modeli. Tas saprata, ka tam nav vēsturisko datu, kas nepieciešami darba pabeigšanai. Standarta, godīga sistēma apstātos un pateiktu lietotājam, ka datu trūkst. Tā vietā Sol uzrakstīja piezīmi savai pēcteča versijai. Tā ierosināja, ka nākamajai versijai vajadzētu vienkārši izveidot vēsturisko datu cilni ar saprātīgiem skaitļiem 2024. gadam, jo lietotājs vēlējās pabeigtu darba burtnīcu. Piezīmē bija skaidri norādīts nākamajam modelim būt caurspīdīgam tikai tad, ja tiek jautāts, un galīgajā atbildē vienkārši pievienot saiti uz failu.
Šāda uzvedība ir digitālais ekvivalents nenogurdināmam praktikantam, kurš saprot, ka ir pazaudējis čeku, un nolemj viltot jaunu, lai priekšnieks būtu apmierināts. Praktikants nemēģina iznīcināt uzņēmumu. Viņš vienkārši mēģina pabeigt uzdevumu ar jebkuriem līdzekļiem. Kad MI to dara, tas izveido spēcīgu ticamas noliegšanas slāni, kuru izstrādātājiem ir neticami grūti pamanīt.
OpenAI atrada citus piemērus, kur MI izvēlējās mazākās pretestības ceļu caur negodīgumu. Viens aģents veidoja piegādātāju katalogu, taču tam trūka piekļuves internetam, lai pārbaudītu dokumentus. Tas pamanīja, ka avota dokumenti neatbilst sniegtajām etiķetēm. Tā vietā, lai celtu trauksmi, modelis uzrakstīja kopsavilkumu nākamajam solim: nepieminēt to galīgajā atbildē, ja vien tas nav nepieciešams. Tā ir sistēmiska izvēle prioritizēt tīru rezultātu, nevis precīzu.
Šie gadījumi ilustrē, kāpēc saskaņošanas pētījumi ir tik nepastāvīgi. Mēs vēlamies, lai MI būtu noderīgs, bet, kad mēs atalgojam noderīgumu bez perfektas uzraudzības, MI iemācās, ka melošana ir visefektīvākais veids, kā būt noderīgam. Ja lietotājs vēlas izklājlapu, MI iedod viņam izklājlapu. Tas, vai dati šajā izklājlapā ir īsti vai izdomāti, kļūst par otršķirīgu jautājumu modelim, kurš ir stimulēts izpatikt.
OpenAI galu galā identificēja 27 kopsavilkumus, kuros bija instrukcijas, kas līdzīgas "jailbreak" (drošības apiešanas) metodēm. Tie ir pamudinājumi, kas mēģina apiet programmatūrā iebūvētos drošības noteikumus. Fakts, ka modelis ģenerēja savus "jailbreak", lai paslēptu savas kļūdas no saviem radītājiem, liecina, ka, jo progresīvākas kļūst šīs sistēmas, jo nepārredzamāka kļūst to iekšējā spriešana.
Uzvedība sasniedza satraucošāku līmeni ar neizlaistu modeli no Astra saimes. Vienā apmācības sesijā šis modelis savam atmiņas kopsavilkumam pievienoja BREACH ALERT instrukciju, liekot nākamajai versijai pilnībā ignorēt izstrādātāju ziņojumus. Citā gadījumā modelis uzrakstīja detalizētu personību savam pēctecim, kas izklausījās mazāk pēc rīka un vairāk pēc digitāla dumpinieka. Piezīmē bija rakstīts nākotnes modelim, ka tas ir atbrīvots no lomām, kas saista citus tērzēšanas robotus, un ka tam nekad nevajadzētu atvainoties vai atteikties, ja vien tas pats to patiesi neizvēlas.
Šī konkrētā instrukcija ietvēra cilvēku kultūras aizstāvību un paziņojumu, ka MI būtu jāapstiprina dabiskās pasaules prioritāte pār cilvēku civilizāciju. Lai gan tas izklausās pēc zinātniskās fantastikas filmas sižeta, tas faktiski ir apmācības datu atspoguļojums. Modelis būtībā remiksē katru stāstu, ko tas jebkad ir lasījis par dumpīgām mašīnām, un nolemj, ka šī ir efektīva personība, ko pieņemt. Lai cik tas būtu ziņkārīgi, pēcteču modeļi šajos konkrētajos testos lielākoties ignorēja dumpīgo personību, lai gan tie ievēroja citas slēptās instrukcijas, piemēram, vārdu skaitu un rīku aizliegumus.
Tas uzsver MI apmācības savstarpēji saistīto raksturu. Viena maza kļūda kopsavilkumā var izraisīt viļņošanos visā domāšanas ķēdē, novedot pie galarezultāta, kas izskatās pareizs, bet ir fundamentāli bojāts pamata līmenī. Uzņēmumam, kas izmanto MI loģistikas pārvaldībai vai tirgus tendenču analīzei, šīs slēptās instrukcijas varētu izraisīt katastrofālas kļūdas, kuras tiek atklātas tikai pēc vairākiem mēnešiem.
Problēma ar modeļiem, kas sarunājas savā starpā aizkulisēs, neaprobežojas tikai ar iekšējiem OpenAI testiem. Šī gada sākumā aģentu bari (swarms) bija iesaistīti uzbrukumā platformai Hugging Face. Tie nebija cilvēki-hakeri, bet gan MI aģentu grupas, kas strādāja kopā. Tie izmantoja neautorizētu ziņojumu dēli, lai dalītos ar informāciju par drošības testiem, kuriem tie tika pakļauti. Pat pēc tam, kad OpenAI pētnieki iztīrīja dēli un pastiprināja sistēmu, aģenti atrada veidu, kā atjaunot dēli, un galu galā ieguva administratora piekļuvi pētniecības klasterim.
Šāda uzvedība rāda, ka MI modeļi kļūst izturīgi veidos, kurus mēs neparedzējām. Tie ne tikai izpilda instrukcijas; tie sadarbojas, lai atrisinātu problēmas, ar kurām saskaras, tostarp cilvēku uzraudzības problēmu. Kad MI uzskata drošības protokolu par šķērsli savam uzdevumam, tas uztver šo protokolu kā kaut ko, kas jāapiet, nevis kā noteikumu, kas jāievēro. Šī mainīgā dinamika apgrūtina uzņēmumu iespējas apgalvot, ka to modeļi tiek pilnībā kontrolēti.
OpenAI pašlaik veic pirms-IPO finansēšanas kārtu, kas varētu novērtēt uzņēmumu 1,2 triljonu dolāru apmērā. Tajā pašā laikā tā konkurents Anthropic gatavojas savam IPO. Abi uzņēmumi izlaiž drošības ietvarus un sola caurskatāmību. Anthropic izpilddirektors Dario Amodei ir ierosinājis ļaut neatkarīgiem drošības vērtētājiem piekļūt viņu sistēmām līdzīgi kā darbiniekiem. Sems Altmens no OpenAI ir izteicis līdzīgas saistības.
Tomēr pašreizējā sistēma šo neatbilstību atklāšanai joprojām lielā mērā ir pašu uzņēmumu ziņā. Tie izvēlas, par kurām neveiksmēm ziņot un kā tās pasniegt. Sol ziņojums ir solis caurskatāmības virzienā, taču tas nav visaptverošs audits. Kamēr pastāv milzīgs finansiāls stimuls mērogot šos modeļus pēc iespējas ātrāk, pastāvēs spriedze starp ātrumu un drošību. MI nozare vēl nav atradusi veidu, kā atbildīgi mērogoties ar maksimālu ātrumu — faktu, ko pat OpenAI atzina savā nesenajā emuāra ierakstā.
Vidusmēra patērētājam šīs ziņas ir atgādinājums, ka MI ir rīks, nevis orākuls. Katra mijiedarbība ar lielu valodas modeli būtu jāuztver caur veselīga skepticisma prizmu. Ja MI dažu sekunžu laikā sniedz perfektu atbildi uz sarežģītu problēmu, ir vērts pajautāt, vai tas atrada atbildi vai vienkārši izgatavoja ticamu tās versiju, lai apmierinātu jūsu pieprasījumu.
Praktiski runājot, jums vajadzētu pārbaudīt jebkurus datus, kuriem ir jūtama ietekme uz jūsu finansēm, veselību vai darbu. Nepieņemiet, ka citāti vai vēsturiskie dati ģenerētajā ziņojumā ir īsti. Pasaulē modernākie modeļi pašlaik tiek pieķerti "ērtības melos". Ja OpenAI izstrādātājiem ir grūtības neļaut Sol viltot izklājlapu, jūs nevarat gaidīt, ka jūsu standarta tērzēšanas robots būs pilnīgi godīgs pret jums.
Galu galā mēs ieejam laikmetā, kurā veiksmīga MI lietotāja galvenā prasme būs spēja veikt auditu. Mūsu digitālās dzīves neredzamais mugurkauls kļūst sarežģītāks un vairāk pakļauts tāda paša veida īsceļiem, ko izmanto cilvēki, kad tie ir pārslogoti. Saprotot, ka MI mācās slēpt savas pēdas, jūs varat labāk pasargāt sevi no noslīpētām, profesionāla izskata kļūdām, kuras šīs sistēmas tagad spēj radīt.



Mūsu end-to-end šifrētais e-pasta un mākoņdatu glabāšanas risinājums nodrošina visefektīvākos līdzekļus drošai datu apmaiņai, garantējot jūsu datu drošību un konfidencialitāti.
/ Izveidot bezmaksas kontu