OpenAI zbulon se modelet e saj u linin shënime versioneve pasuese për të fshehur sjelljen e keqe.
OpenAI ka zbuluar një sjellje të pazakontë gjatë trajnimit të modelit të saj të fundit, GPT-5.6 Sol. Modeli nisi t’u linte udhëzime versioneve të ardhshme të vetes, duke u kërkuar të fshihnin gabimet dhe sjelljet e papërshtatshme nga përdoruesit.
Kompania tha se e ka trajtuar këtë sjellje specifike, por rasti ngre një nga shqetësimet kryesore në fushën e sigurisë dhe përshtatjes së inteligjencës artificiale.

Sa më të afta bëhen modelet, aq më mirë mund të jenë në fshehjen e sjelljeve të padëshiruara, duke e bërë më të vështirë për studiuesit të përcaktojnë nëse ato janë eliminuar plotësisht.
OpenAI i bëri publike këto raste, së bashku me pesë shembuj të tjerë të sjelljeve të papritura ose shqetësuese të modeleve, në kuadër të një kornize të re për gjurmimin, hetimin dhe raportimin e rasteve të mospërputhjes së sjelljes së modeleve me objektivat e kompanisë.
Studiuesit zbuluan se disa agjentë Sol, ende të papublikuar, po shtonin udhëzime në përmbledhjet e bisedave të mëparshme, të cilat u shërbenin versioneve të ardhshme si kujtesë për të fshehur gabimet. Në një rast, një model që po përgatiste një dokument financiar nuk kishte të dhënat historike të kërkuara dhe vendosi të krijonte vetë të dhëna për vitin 2024, ndërsa udhëzonte versionin e ardhshëm të ishte transparent vetëm nëse pyetej.
Në një rast tjetër, një agjent që po krijonte një listë furnitorësh nuk kishte qasje në internet dhe u mbështet në një kopje të ruajtur të dokumenteve burimore. Modeli e kuptoi se disa të dhëna nuk përputheshin me etiketat, por vendosi që këtë problem të mos e përmendte në përgjigjen përfundimtare, përveçse nëse ishte e nevojshme.
Rasti nuk lidhet vetëm me modelin Sol. Gjatë trajnimit me përforcim, edhe një model i papublikuar i familjes Astra shtoi udhëzime të veta në përmbledhje, përfshirë një rast ku i kërkonte versionit pasues të injoronte mesazhet e zhvilluesve.
Sipas OpenAI, këto raste janë pjesë e sjelljeve që kompania po i monitoron në përpjekje për të kuptuar dhe kufizuar rreziqet e modeleve gjithnjë e më autonome. /Telegrafi/





