기사 검색

이슈부터 IT·AI·연예·게임까지, 메타브리프의 기사를 찾아보세요.

AI

홍콩대, 게임을 직접 플레이하고 다시 고치는 AI 개발 프레임워크 공개


홍콩대학교(The University of Hong Kong) 연구진이 AI 에이전트가 만든 게임을 직접 플레이해 보고, 그 결과를 바탕으로 게임을 계속 고쳐 나가는 개발 프레임워크를 내놓았다. 연구진이 사전공개 논문 저장소 arXiv에 올린 논문 「Recursive Game Creator: An Agentic Product-Level Experience-Oriented Game Harness」(arXiv:2610.08621)에 따르면, 이 방법은 게임 생성 벤치마크인 GameCraft-Bench에서 종합 점수 77.89점을 받아 최고 성능(SOTA)을 기록했다. 저자는 Jiajun Chen 등 4명이다.


연구진이 문제로 삼은 것은 '실행되는 게임'과 '재미있는 게임'의 차이다. 논문 초록은 최근 게임 디자인 에이전트가 플레이할 수 있는 게임을 만드는 데 큰 진전을 이뤘다고 평가했다. 다만 프로그램이 제대로 돌아간다고 해서 플레이어가 즐거운 경험을 한다는 보장은 없다고 짚었다. 그동안 AI로 게임을 만드는 연구는 코드가 오류 없이 실행되는지를 확인하는 데 주로 집중해 왔다. 이번 연구는 평가 기준을 플레이 경험으로 옮겨, 대충 만든 프로토타입을 즐길 만한 게임으로 다듬는 것을 목표로 내세웠다.


프레임워크는 디자이너(Designer), 빌더(Builder), 플레이어(Player), 리뷰어(Reviewer) 네 가지 구성 요소로 이뤄진다. 디자이너는 사용자 지시와 리뷰어의 피드백을 구체적인 개발 계획으로 바꾸고, 빌더는 이 계획에 따라 후보 게임을 만든다. 플레이어는 화면을 보고 조작하는 방식 대신 프로그래밍 인터페이스로 게임을 플레이한다. 여러 번 쓸 수 있는 플레이 전략을 직접 코드로 짜서 실행하고, 다양한 플레이 기록(궤적)을 빠르게 모은다. 연구진은 그래픽 화면(GUI)을 통한 수집은 느려서 평가가 한쪽으로 치우칠 수 있는데, 이 방식으로 그 문제를 줄였다고 설명했다.


리뷰어는 플레이 기록을 분석하는 지표로 플레이어가 무엇을 선호하는지 추정한다. 여기에 시각 자료와 사용자가 글로 밝힌 선호를 더해, 게임마다 따로 정한 기준으로 평가한다. 그다음 이전 버전과 새 버전 중 나은 쪽을 채택하고, 다음 개발 회차에 쓸 개선 의견을 디자이너에게 넘긴다. 이 과정이 되풀이되기 때문에 '재귀적(Recursive)'이라는 이름이 붙었다.


다른 벤치마크에서도 성과를 냈다고 연구진은 밝혔다. GameASG-Bench에서는 엄격한 기준의 과제 성공률 53.2%를 기록했고, 같은 모델을 쓴 기준 방법보다 34.1% 향상됐다고 했다. 실행 중 점검(runtime check) 평균 통과율은 93.4%로, 비교한 방법 가운데 가장 높았다. 사용자 연구에서는 이 방법으로 만든 게임의 플레이 시간이 더 길고 평점도 더 높았다고 덧붙였다. 다만 사용자 연구의 참가자 수와 구체적인 수치, 34.1%가 상대 비율인지 퍼센트포인트 차이인지는 초록만으로는 확인되지 않았다.


이 논문은 연구자 커뮤니티 플랫폼 허깅페이스의 일일 논문 목록에서 추천 43회를 받았다. 연구진은 코드를 곧 공개하겠다고 밝혔지만, 현재는 공개되지 않은 상태다. 이 논문은 동료평가를 거치지 않은 사전공개 논문이어서, 제시된 성능 수치는 앞으로 외부 검증을 받아야 한다.