기사 검색

이슈부터 IT·AI·연예·게임까지, 메타브리프의 기사를 찾아보세요.

AI

"결과에서 배운 것을 행동 전 예측으로" 세일즈포스, 보상이 사라진 상황에서도 학습하는 AI 에이전트 기법 공개

세일즈포스 AI 리서치(Salesforce AI Research) 연구진이 새 학습 기법 '자기회고 증류(Self-Retrospection Distillation, SRD)'를 제안했다. 지금 AI 에이전트 학습에 널리 쓰이는 강화학습은 보상에 차이가 없으면 학습 신호가 사라진다. SRD는 이런 상황에서도 에이전트를 학습시키려는 방법이다. 사전공개 논문 저장소 arXiv에 올라온 논문 「Self-Retrospection Distillation: Turning Post-hoc Experiences into Prior Foresight」(arXiv:2610.08077)에 따르면, 연구진은 도구를 활용하는 추론 과제와 긴 단계의 에이전트 과제 10종에서 기존 방법보다 최대 24.2%포인트 높은 성능을 얻었다. 저자는 Haoxiang Zhang 등 12명이다.


이 연구는 '검증 가능한 보상 기반 강화학습(RLVR)'의 한계에서 출발한다. RLVR은 에이전트가 과제를 끝낸 뒤 성공했는지 실패했는지를 점수 하나로 매기고, 그 점수를 학습 신호로 쓴다. 특히 같은 문제에 여러 번 시도(롤아웃)하게 한 뒤 시도끼리 점수를 비교하는 '그룹 상대' 방식에서는 모든 시도가 같은 점수를 받으면 비교할 차이가 없어 학습 신호가 사라진다. 어려운 과제에서 모든 시도가 실패하면 모델은 아무것도 배우지 못한다는 뜻이다. 연구진은 점수는 같아도 각 시도의 과정에는 과제가 무엇을 요구하는지, 에이전트가 어디서 실패하는지에 대한 정보가 담겨 있다고 봤다.


연구진은 "사후에 깨달은 것으로, 행동하기 전에 미리 예상할 수 있었던 것을 가르칠 수 있는가"라는 질문을 던졌다. 그리고 이를 '전망 학습(prospective learning)'이라는 개념으로 정리했다. 과제를 끝낸 시도의 기록을 보면 미리 알았더라면 유용했을 지식과 피해야 했을 함정이 드러난다. SRD는 이렇게 사후에 얻은 깨달음을, 아직 시도 기록을 보지 못한 '행동 전 시점'의 같은 모델이 스스로 예측하도록 증류한다. 이 예측(foresight)은 학습 목표로만 쓰인다. 실제 사용(추론) 단계에서 따로 생성할 필요는 없다고 연구진은 설명했다.


성과는 보상 차이가 드문 상황에서 특히 두드러졌다. 초록에 따르면 모델 규모에 따라 전체 롤아웃 그룹의 37~98%가 모든 시도에서 같은 보상을 받았다. 그런데도 SRD는 샘플링된 시도 기록에서 학습 신호를 뽑아냈다. 2B 규모 설정에서는 그룹의 98%가 전부 실패였고, RLVR만으로 학습한 모델의 최종 성공률은 0.0%였다. 같은 롤아웃 예산에서 SRD를 더한 모델은 60.6%의 성공률을 기록했다. 연구진은 SRD가 RLVR과 기존 자기증류 방식을 대체하기보다 '보완'하는 방법이라고 설명했다.


이 결과는 에이전트가 쌓은 경험을 행동을 평가하거나 고치는 데만 쓰지 않고, 행동하기 전에 상황을 내다보는 내부 표현을 다듬는 데도 쓸 수 있다는 점을 보여준다고 연구진은 해석했다. 최근 AI 업계는 여러 단계에 걸쳐 도구를 쓰는 에이전트 개발에 집중하고 있다. 이런 과제는 성공 사례가 드물어 강화학습 신호를 얻기 어렵다는 문제가 꾸준히 지적돼 왔다. 그런 점에서 실패한 시도를 학습 자원으로 되살리는 접근이라는 의미가 있다.


논문은 연구자 커뮤니티 플랫폼 허깅페이스의 일일 논문 목록에서 추천 70회를 받았다. 다만 동료평가를 거치지 않은 사전공개 논문이다. 실험에 쓴 구체적인 과제 이름과 기반 모델, 계산 비용 등은 초록에 나오지 않아 확인되지 않았다. 원문은 arXiv(https://arxiv.org/abs/2610.08077)에 공개돼 있다.