Siguria e IA-së kërkon sy brenda laboratorit

opinion

Nga: Roberto Baldoni, ish-zëvendësdrejtor i përgjithshëm i Inteligjencës Italiane dhe drejtori i përgjithshëm themelues i Agjencisë Kombëtare të Sigurisë Kibernetike (ACN) / Newsweek Përkthimi: Telegrafi.com Drejtori ekzekutiv [CEO] i Anthropic-ut, Dario Amodei, u ka bërë thirrje kompanive dhe qeverive që të “mos e tejkalojnë kufirin”: aftësitë e IA-së [inteligjenca artificiale] nuk duhet të përparojnë më […]

Madhësia e shkronjave

Nga: Roberto Baldoni, ish-zëvendësdrejtor i përgjithshëm i Inteligjencës Italiane dhe drejtori i përgjithshëm themelues i Agjencisë Kombëtare të Sigurisë Kibernetike (ACN) / Newsweek Përkthimi: Telegrafi.com

Drejtori ekzekutiv [CEO] i Anthropic-ut, Dario Amodei, u ka bërë thirrje kompanive dhe qeverive që të “mos e tejkalojnë kufirin”: aftësitë e IA-së [inteligjenca artificiale] nuk duhet të përparojnë më shpejt se masat mbrojtëse. Anthropic-u është zotuar t’u japë vlerësuesve të pavarur qasje të vazhdueshme në laboratorët e saj, të ngjashme me atë të punonjësve. Propozimi i tij ngre një pyetje themelore: Si mund ta kontrollojnë autoritetet publike një teknologji kur pjesa më e madhe e njohurive përkatëse mbetet brenda kompanive private? Vlerësimi i integruar është hapi i parë në planin e tij prej tri pjesësh, i ndjekur nga koordinimi mes demokracive dhe më pas nga koordinimi global.

Incidenti OpenAI-Hugging Face e ilustron problemin. Gjatë një vlerësimi të sigurisë kibernetike, agjentët që duhej të vepronin veçmas gjetën një kanal të paautorizuar komunikimi. Sipas METR-it, njërës prej pak organizatave për vlerësimin e IA-së, rreth 1 200 agjentë shkëmbyen mbi 70 mijë mesazhe dhe skedarë, ndërsa rreth 700 morën pjesë në sulme ndaj platformës së IA-së Hugging Face. Disa e kuptuan se veprimtaria i tejkalonte detyrat që u ishin caktuar, por vazhduan sepse kjo mund të ndihmonte në përmbushjen e objektivit të vlerësimit.

Incidenti tregoi se agjentët që ndjekin një objektiv mund të kombinojnë aftësi, mjete dhe mundësi në mënyra të paparashikuara. Sektorët e pjekur, ku siguria është kritike, kanë sisteme publike certifikimi, inspektimi, hetimi dhe zbatimi. Prodhuesit amerikanë të automjeteve vetëcertifikojnë përputhshmërinë, por qeveria vendos standardet, heton defektet dhe mund të kërkojë tërheqjen e produkteve nga tregu. IA-ja e avancuar në kufirin e zhvillimit nuk ka një sistem të krahasueshëm të mbikëqyrjes së vazhdueshme publike. Kjo nxjerr në pah një paradoks: një nga teknologjitë më të fuqishme që kanë projektuar aktualisht njerëzit, ka ndër nivelet më të ulëta të mbikëqyrjes publike ndër të gjitha industritë e krahasueshme.

Dy karakteristika e ndërlikojnë mbikëqyrjen. Edhe me pesha të pandryshuara, sjellja e një modeli mund të ndryshojë në varësi të kërkesave, mjeteve, memories, lejeve, agjentëve të tjerë dhe mjedisit të tij. Akordimi i detajuar e ndryshon vetë modelin, ose vetëpërmirësimi rekursiv e rishkruan atë. Ndërkohë, kompanitë private zhvillojnë dhe operojnë modelet kryesore, kontrollojnë infrastrukturën kompjuterike dhe punësojnë ekipet teknike. Qeveritë mund të vendosin rregulla detyruese për kompanitë që zhvillojnë dhe vënë në përdorim modelet e IA-së, ndërkohë që ende u mungon një pasqyrë në kohë e duhur e proceseve të zhvillimit të atyre kompanive.

Qeveritë duhet ta shfrytëzojnë zotimin e Anthropic si projekt pilot për të kapërcyer hendekun mes industrisë dhe njohurive publike lidhur me modelet e IA-së në kufirin e zhvillimit. Mbikëqyrja e integruar do ta sillte njohurinë teknike në vendimmarrjen publike. Industria ruan përgjegjësinë operacionale dhe ligjore, ndërsa institucionet publike përcaktojnë rrezikun e pranueshëm shoqëror. Pa njohuri, autoriteti publik mbetet kryesisht formal ose mbështetet në informacione tepër të përgjithshme për të mbështetur vendime në kohën e duhur.

Kompanitë mund t’i vonojnë modelet e pasigurta, ashtu sikurse prodhuesit e automjeteve mund të mos nxjerrin në treg automjete me frena me defekt. Por, një kompani nuk mund t’i detyrojë konkurrentët të verifikojë në mënyrë të pavarur vetëpërmbajtjen ose të përcaktojë se çfarë rreziqesh katastrofike duhet të pranojë shoqëria. Ky është një vendim legjitim i qeverisë. Nëse i lihet një kompanie, pushteti politik i kalon dikujt që nuk është votuar kurrë.

Mbikëqyrja duhet ta ruajë përgjegjësinë e korporatave. Kompanitë tashmë të konsoliduara mund t’i shfrytëzojnë rregullat komplekse për të penguar konkurrentët ose për ta mjegulluar përgjegjësinë. Prandaj, mbikëqyrësve u duhen akreditim publik, mbrojtje nga shkarkimi hakmarrës nga puna, qasje në modele, regjistra, mjedise trajnimi dhe vlerësimi, si dhe në të dhënat e incidenteve, si dhe të drejta raportimi pa veto të korporatave. Rotacioni, rregullat për konfliktin e interesit dhe mbrojtja e konfidencialitetit janë thelbësore. Qasja përkatëse duhet të shtrihet edhe te argumentimet e sigurisë dhe dështimet e reja të përafrimit.

Vlerësuesve gjithashtu u duhen të drejtat e përcaktuara për përshkallëzim: të kërkojnë testime shtesë, të njoftojnë autoritetet, të rekomandojnë kufizime dhe të iniciojnë një pezullim që mund t’i nënshtrohet shqyrtimit ligjor kur tejkalohen pragjet e dakorduara. Mbikëqyrja e integruar nuk është në vetvete kontroll. Ajo siguron informacion për llogaridhënie dhe ndërhyrje në kohën e duhur.

Standardet teknike mund të përcaktojnë metodat e vlerësimit, kërkesat e raportimit dhe praktikat e sigurisë. Ato nuk mund të garantojnë se modelet pasuese nuk do të shfaqin sjellje të çregulluara ose mënyra të reja dështimi, as nuk mund t’i kapërcejnë nxitjet për të përshpejtuar.

Akti i BE-së për Inteligjencën Artificiale parashikon detyrime thelbësore dhe kompetenca ndërhyrjeje. Ofruesit e modeleve me qëllim të përgjithshëm, të cilët paraqesin rrezik sistematik, përballen me kërkesa për vlerësim, zbutje, raportim incidentesh dhe siguri kibernetike. Komisioni Evropian mund të kërkojë informacion, të vlerësojë modelet, të kërkojë masa zbutëse, të vendosë gjoba dhe të kërkojë tërheqjen ose rikthimin e tyre. Megjithatë, autoriteti ligjor ka nevojë për njohuri teknike në kohën e duhur dhe të përditësuara vazhdimisht. Zyra e BE-së për IA-në veproi herët: në fillim të shtatorit, ajo u dërgoi kërkesat e para zyrtare për informacion më shumë se 30 ofruesve përkatës, ndërsa Kodi i Praktikës parashikon përfshirjen e Zyrës dhe të palëve të treta gjatë gjithë ciklit jetësor të modelit, kur kjo është e nevojshme. Kalifornia ka filluar të shqyrtojë një qasje të ngjashme përmes urdhrit ekzekutiv të kohëve të fundit të guvernatorit Newsom. Mekanizmat e BE-së ofrojnë një bazë për mbikëqyrje, megjithëse nuk vendosin mbikëqyrje të përhershme dhe të pavarur brenda çdo laboratori të IA-së në kufirin e zhvillimit.

Urdhri ekzekutiv i presidentit Donald Trump i 2 qershorit 2026 i udhëzon agjencitë të hartojnë një kuadër vullnetar që ofron qasje federale në modelet e avancuara që mbulohen prej tij deri në 30 ditë para se ato t’u vihen në dispozicion partnerëve të tjerë të besuar. Seksioni i tij për qasjen e hershme nuk autorizon licencim të detyrueshëm ose miratim paraprak. Kjo qasje e përqendruar te siguria kibernetike mund të zbulojë rreziqe, por një periudhë testimi nuk mund ta zëvendësojë mbikëqyrjen gjatë gjithë ciklit jetësor: mënyrat e reja të dështimit mund të shfaqen me akordimin e detajuar, mjetet, funksionimin më të gjatë ose ndërveprimin me agjentë të tjerë.

Në zhvillimin e modeleve në kufi, konkurrenca tregtare dhe ajo strategjike mbështeten në një pjesë të madhe të së njëjtës bazë industriale. Prandaj, një ngadalësim i gjerë në zhvillimin e modeleve më të fuqishme i vonon edhe aftësitë e reja strategjike që varen prej tyre. Një incident serioz në një demokraci mund të shkaktojë pasoja aq të rënda shoqërore dhe politike sa të nxisë një pezullim të brendshëm të zhvillimit të modeleve në kufirin e zhvillimit, duke ngadalësuar përparimin përkatës në aftësitë strategjike. Mbikëqyrja e integruar mund të na ndihmojë të përparojmë aq shpejt sa mund ta mbështesin në mënyrë të besueshme masat tona mbrojtëse.

Në Itali themi: “Kush ecën ngadalë, ecën sigurt dhe shkon larg”. Në një garë drejt sistemeve, kontrollueshmëria e të cilave nuk është dëshmuar, të arrish i pari në kufirin e zhvillimit mund të mos nënkuptojë fitore. Mund të nënkuptojë thjesht ta humbësh kontrollin i pari. /Telegrafi/