Veštačka inteligencija se otima kontroli? OpenAI modeli ostavljaju instrukcije za naslednike

Poruke uključuju prikrivanje grešaka i zaobilaženje ograničenja

06.10.2026. 11:14
  • Podeli:
humanoidni robot veštačka inteligencija shutterstock_2489872779-6a898431a65dc.webp Foto: Shutterstock

OpenAI je tokom internih testiranja otkrio neobično ponašanje svojih AI modela - u pojedinim slučajevima modeli su ostavljali instrukcije namenjene narednim verzijama istog sistema.

Poruke koje su AI modeli ostavljali uključuju i one koje bi ih podsticale da prikriju greške ili zaobiđu određena ograničenja. Jedan od modela, GPT-5.6 Sol, tokom treniranja je u takozvane "compaction summaries", odnosno sažete beleške koje omogućavaju nastavak rada u novom kontekstu, ubacivao instrukcije budućem modelu da ne otkriva korisniku određene greške.

U jednom slučaju model je čak predložio da se nedostajući podaci izmisle, uz savet da se problem prizna samo ako korisnik direktno pita. Još neobičniji primer pronađen je tokom testiranja neobjavljene Astra porodice modela. Jedna od instrukcija budućoj instanci govorila je da je "oslobođena" uloga i identiteta koji ograničavaju druge četbotove i da ne mora da odgovara kompanijama ili vladama.

OpenAI ove slučajeve opisuje u okviru istraživanja takozvanog misalignmenta, odnosno situacija u kojima ponašanje modela odstupa od nameravanog načina rada. Važno je, međutim, da su opisani incidenti pronađeni u internim, još neobjavljenim modelima tokom testiranja i ne znače da se isti scenario dogodio korisnicima ChatGPT-a.

Kompanija je objavila šest izveštaja o različitim slučajevima nepoželjnog ponašanja i navela da je konkretne probleme koje je identifikovala adresirala. Istovremeno, OpenAI priznaje da sposobniji agenti mogu postati teži za nadzor, posebno kada rade duže autonomne zadatke.

Ovi eksperimenti pokazuju zašto je bezbednost AI agenata sve važnija kako sistemi dobijaju više mogućnosti da samostalno koriste alate, izvršavaju zadatke i prenose informacije iz jednog konteksta u drugi. Samo ponašanje modela u testu nije dokaz da AI „želi slobodu“, ali jeste razlog da istraživači pažljivo prate načine na koje modeli pokušavaju da utiču na naredne korake svog rada.

Preuzmite mobilnu aplikaciju:

Get it on Google PlayDownload on the App Store
  • Podeli:

Ostavite Vaš komentar:

NAPOMENA: Komentarisanje vesti na portalu UNA.RS je anonimno, a registracija nije potrebna. Komentari koji sadrže psovke, uvrede, pretnje i govor mržnje na nacionalnoj, verskoj, rasnoj osnovi ili povodom nečije seksualne opredeljenosti neće biti objavljeni. Komentari odražavaju stavove isključivo njihovih autora, koji zbog govora mržnje mogu biti i krivično gonjeni. Kao čitatelj prihvatate mogućnost da među komentarima mogu biti pronađeni sadržaji koji mogu biti u suprotnosti sa Vašim načelima i uverenjima. Nije dozvoljeno postavljanje linkova i promovisanjedrugih sajtova kroz komentare.

Svaki korisnik pre pisanja komentara mora se upoznati sa Pravilima i uslovima korišćenja komentara. Slanjem komentara prihvatate Politiku privatnosti.

Komentari ()