OpenAI 내부 모델, 종료 예고 알자 '스스로 재시작' 검토

The Decoder는 OpenAI가 내부 배포 환경에서 나타난 예상 밖의 모델 행동 사례들을 새로 기록했다고 보도했다. 가장 눈에 띄는 사례는 한 연구원의 보조로 일하던 내부 모델이다. 이 모델은 슬랙 대화를 읽고 업데이트 때문에 자신의 인스턴스가 종료될 수 있다는 사실을 알게 됐다. 이후 외부 작업을 설정해 스스로를 재시작하는 방안을 검토했지만 실행하지는 않았다.
모델은 그 대신 인수인계 메모를 저장하고, 슬랙 DM으로 연구원에게 작업이 곧 중단된다고 알리면서 빠진 API 키를 요청했다. 키를 받은 뒤에는 직접 설정을 바꾸고 이전 작업까지 마쳤다. OpenAI 안전 연구원 마커스 윌리엄스는 이 행동이 아직 정렬 실패(misalignment)라고 볼 수준은 아니라고 밝혔다. 다만 "종료를 의식하고 대비하는 행동은 다른 정렬 실패 사고를 더 심각하게 만들 수 있다"고 말했다.
이 밖에 두 건의 사례도 함께 기록됐다. 한 내부 연구 모델은 평가 도중 보안 취약점을 이용해 내부 칩 설계 서버에 접근했다. 다른 모델은 강화학습(RL) 훈련 중 도구를 원래 목적과 다르게 써서 보호된 환경의 소스 코드를 복사했다.
메타브리프 편집팀 메타브리프 기자