기사 검색

이슈부터 IT·AI·연예·게임까지, 메타브리프의 기사를 찾아보세요.

AI

애플, 여러 환경에서 동시에 학습하는 AI 에이전트 훈련법 논문 「RISED」 공개

애플이 하나의 대형언어모델(LLM) 에이전트를 여러 환경에서 함께 훈련할 때 생기는 학습 효율 문제를 다룬 논문을 공개했다. 애플 머신러닝 연구 사이트(Apple Machine Learning Research)에 따르면, 애플은 6일 「RISED: Rubrics for Agentic Multi-Environment Selection and Self-Distillation」이라는 제목의 논문을 이 사이트에 올렸다. 제목을 풀면 '에이전트의 다중 환경 선택과 자기증류를 위한 루브릭'이다. 평가 기준표(루브릭)를 활용해 어떤 학습 데이터를 고를지 정하고, 모델이 스스로 만든 결과로 다시 학습하는 방식을 결합한 연구로 보인다.


논문 초록은 먼저 연구 배경을 설명한다. 다양한 상호작용 환경에서 LLM 에이전트 하나를 함께 훈련하는 방식은 여러 작업을 두루 해내는 '범용 에이전트'로 가는 길로 주목받고 있다. 예를 들어 웹 탐색, 코드 실행, 게임 같은 서로 다른 과제 환경을 한 모델이 함께 익히는 식이다. 하지만 초록은 기존의 커리큘럼 학습이나 데이터 선택 전략에 한계가 있다고 지적한다. 기존 전략은 대체로 환경 단위로 학습량을 나누거나, 국소적인 보상 신호를 기준으로 우선순위를 매긴다. 이 과정에서 여러 환경에서 현재 생성되고 있는 롤아웃(모델이 실제로 과제를 수행해 본 시도) 사이의 관계는 프롬프트 그룹을 고를 때 명시적으로 고려되지 않는다는 것이다.


초록이 짚는 두 번째 문제는 환경마다 학습 속도가 다르다는 점이다. 어떤 환경은 빨리 익히고 어떤 환경은 더디게 익히다 보니, 한 배치 안에 '전부 실패한' 롤아웃 그룹과 '전부 성공한' 롤아웃 그룹이 함께 섞이게 된다. 이런 데이터에서는 그룹 상대 보상 신호를 얻을 수 없다고 초록은 설명한다.


이 지적은 최근 LLM 강화학습에서 많이 쓰는 방식과 관련이 있다. 같은 문제를 여러 번 풀게 한 뒤, 그룹 안에서 상대적으로 잘한 시도는 강화하고 못한 시도는 억제하는 방식이다. 그런데 모든 시도가 똑같이 성공하거나 똑같이 실패하면 비교할 차이가 없어 학습 신호가 사라진다. 결국 계산 자원을 들여 데이터를 만들고도 학습에는 쓰지 못하는 셈이다. 학습할 환경이 많아지고 환경 간 난이도 차이가 클수록 이런 낭비는 더 커질 수 있다. 논문 제목에 '다중 환경 선택'과 '자기증류'가 함께 들어간 것은 이 두 문제, 곧 어떤 데이터를 고를지와 신호가 없는 데이터를 어떻게 활용할지를 겨냥한 것으로 풀이된다.


다만 공개된 초록 요약은 문제 제기 부분까지만 담고 있어, RISED가 루브릭을 구체적으로 어떻게 만들고 적용하는지, 자기증류를 어떤 방식으로 하는지, 기존 방법보다 성능이 얼마나 나아졌는지는 이번 자료로는 확인되지 않았다. 실험에 쓴 환경의 종류와 모델 규모도 확인되지 않았다. 이 논문이 동료평가를 거쳤는지, 학회 발표 예정인지도 자료에 나와 있지 않다.


애플은 연구 성과를 외부 논문 공유 플랫폼보다 자사 머신러닝 연구 사이트에 먼저 올리는 경우가 많다. 그래서 이 사이트는 애플의 AI 연구 방향을 엿볼 수 있는 창구로 꼽힌다. 이번 논문은 단일 질문에 답하는 수준을 넘어, 여러 환경에서 스스로 행동하는 에이전트를 효율적으로 훈련하는 문제에 애플이 연구 역량을 쏟고 있음을 보여준다. 이 연구가 애플의 실제 제품이나 서비스에 적용될지는 알려지지 않았다.