기사 검색

이슈부터 IT·AI·연예·게임까지, 메타브리프의 기사를 찾아보세요.

AI

애플, 범용 AI 에이전트 학습법 논문 'RISED' 공개… 여러 환경 동시 훈련의 비효율 짚어

애플이 지난 6일 자사 머신러닝 연구 사이트 'Apple Machine Learning Research'에 'RISED: Rubrics for Agentic Multi-Environment Selection and Self-Distillation' 논문을 공개했다. 하나의 대규모언어모델(LLM) 에이전트를 성격이 다른 여러 상호작용 환경에서 함께 훈련할 때 생기는 학습 비효율을 다룬 연구다.


공개된 초록을 보면 연구진은 여러 환경을 동시에 학습시키는 방식이 '범용 에이전트'로 가는 길로 주목받고 있다는 점에서 출발한다. 에이전트가 웹 탐색, 도구 사용, 게임형 과제처럼 서로 다른 환경을 하나의 모델로 처리하려면 어떤 환경의 어떤 과제를 언제, 얼마나 학습시킬지가 중요하다. 연구진은 지금까지 나온 커리큘럼 설계와 데이터 선별 전략에 한계가 있다고 지적했다. 학습 배분을 '환경 단위'로 하거나 국소적인 보상 신호를 우선하는 데 그쳤다는 것이다. 이 때문에 프롬프트 그룹을 고를 때 여러 환경에서 동시에 진행 중인 롤아웃(에이전트가 과제를 실제로 수행한 시도) 사이의 관계를 명시적으로 고려하지 못했다는 설명이다.


초록은 두 번째 문제도 제시한다. 환경마다 학습 속도가 다르다 보니 한 배치 안에 '전부 실패한' 롤아웃 그룹과 '전부 성공한' 롤아웃 그룹이 함께 섞인다는 점이다. 최근 LLM 강화학습에서 널리 쓰이는 그룹 상대 보상 방식은 같은 과제를 여러 번 시도한 뒤 결과를 서로 비교해 무엇이 나았는지를 학습 신호로 삼는다. 그런데 시도가 모두 실패하거나 모두 성공하면 비교할 차이가 없어 사실상 학습에 쓰이지 못한다. 연구진은 이런 데이터에 그룹 상대 보상 신호가 남지 않는다고 밝혔다. 아직 어려운 환경에서는 실패만 쌓이고 이미 익숙해진 환경에서는 성공만 반복되면서 연산 자원이 허비되는 구조라는 지적이다.


논문 제목에는 '루브릭(평가 기준표)', '다중 환경 선별', '자기 증류'가 함께 들어 있다. 제목대로라면 루브릭을 활용해 학습할 데이터를 고르고, 보상 신호가 사라진 롤아웃 그룹을 자기 증류 방식으로 다시 활용하는 접근으로 보인다. 다만 사이트에 공개된 초록 요지는 문제 제기 부분에서 끝나 있어, RISED의 구체적인 작동 방식과 실험 환경, 성능 개선 폭은 확인되지 않았다. 동료평가를 거쳤는지나 학회 발표 여부도 공개된 자료로는 확인되지 않는다.


이번 논문은 업계 흐름과 맞닿아 있다. 생성형 AI 경쟁의 초점은 단순히 답변을 생성하는 모델에서 여러 단계를 스스로 계획하고 실행하는 '에이전트'로 옮겨가고 있다. 그만큼 다양한 환경에서 강화학습을 효율적으로 돌리는 방법이 핵심 과제가 됐다. 특정 과제 하나에 특화된 모델이 아니라 여러 작업을 두루 처리하는 모델을 만들려면 환경 간 학습 불균형을 어떻게 조정하느냐가 성능과 비용을 함께 좌우한다.


애플은 연구 성과를 외부 논문 공유 플랫폼보다 자사 머신러닝 연구 사이트에 먼저 올리는 경우가 많다. 이 채널은 제품 발표만으로는 잘 드러나지 않는 애플의 AI 연구 방향을 엿볼 수 있는 통로로 꼽힌다. 이번 연구가 시리 등 애플 제품의 에이전트 기능 개발과 직접 연결되는지는 논문에 언급되지 않아 확인되지 않았다.