애플 "성능 좋은 AI 에이전트에 복잡한 '하네스'가 얼마나 필요한가"…자율 ML 엔지니어링 논문 공개
애플이 머신러닝(ML) 엔지니어링을 스스로 수행하는 AI 에이전트에 갈수록 복잡해지는 보조 장치가 정말 필요한지 묻는 논문을 내놨다. 애플 머신러닝 연구(Apple Machine Learning Research) 사이트에 따르면 애플은 지난 1일 「How Much of a Harness Does a Strong Agent Need for Autonomous ML Engineering?」 논문을 올렸다. 제목은 '성능 좋은 에이전트가 자율 ML 엔지니어링을 하려면 하네스가 얼마나 필요한가'라는 뜻이다.
자율 머신러닝 엔지니어링(MLE) 에이전트는 사람이 하던 ML 개발 업무를 대형언어모델(LLM) 기반 AI가 직접 처리하도록 만든 시스템이다. 데이터 처리, 모델 학습, 실험 반복 같은 일이 여기에 해당한다. 논문 초록은 이런 에이전트들이 최근 공개 리더보드에서 큰 진전을 이뤘다고 짚었다.
연구진이 문제로 본 것은 이 성과를 내는 방식이다. 초록에 따르면 최신 MLE 에이전트는 점점 더 정교한 장치 위에서 돌아간다. 여러 에이전트를 조율하는 '멀티 에이전트 오케스트레이터', 정보 검색만 따로 맡는 '하위 에이전트' 등이 대표적이다. 이렇게 모델을 감싸 작업 흐름을 관리하는 외부 구조를 업계에서는 '하네스(harness)'라고 부른다. 원래 말에 채우는 마구(馬具)를 뜻하는 단어다.
초록은 하네스가 커진 배경으로 두 가지를 들었다. 하나는 긴 작업 주기를 거치는 동안 성과가 정체되는 문제다. 다른 하나는 LLM이 기본으로 제공하는 기능, 즉 '프리미티브'가 제한적이라는 점이다. 모델 혼자서는 오래 걸리는 복잡한 작업을 끝까지 해내기 어려우니 바깥에 구조를 덧붙여 보완해 왔다는 것이다.
연구진은 반대 방향에 주목했다. 더 원시적이지만 성능이 좋아진 코딩 에이전트다. 이런 에이전트에서는 LLM이 파일 읽기(read)·쓰기(write)와 배시(bash) 명령만으로 실행 환경에 직접 접근한다. 초록은 하네스가 계속 커지는 동안 이 단순한 방식은 학계와 업계에서 거의 주목받지 못했다고 지적했다. 논문 제목에 '성능 좋은 에이전트(strong agent)'라는 표현이 들어간 것도 같은 맥락으로 읽힌다. 모델 자체가 충분히 강해졌다면 정교한 외부 장치가 여전히 필요한지 다시 따져 보겠다는 것이다.
다만 이번에 정리한 초록 요지에는 실험 설계, 비교 대상 벤치마크, 수치 결과, 결론이 빠져 있다. 그래서 단순한 코딩 에이전트가 복잡한 하네스를 쓴 에이전트보다 실제로 성능이 좋았는지, 아니면 어느 정도까지 따라잡았는지는 확인되지 않았다. 이 논문이 동료평가(피어리뷰)를 거쳤는지, 학회에 채택됐는지도 공개된 자료로는 확인되지 않았다.
이 연구가 던지는 질문은 AI 에이전트를 만드는 쪽에 실질적인 의미가 있다. 하네스가 복잡할수록 시스템을 설계하고 유지보수하는 비용이 커지고, 문제가 생겼을 때 원인을 찾기도 어려워진다. 기본 도구만 갖춘 코딩 에이전트로 비슷한 성과를 낼 수 있다면 개발 방향이 '구조를 더 쌓는 쪽'에서 '모델에 환경을 직접 맡기는 쪽'으로 옮겨 갈 여지가 생긴다. 반대로 결과가 하네스 쪽에 유리하게 나왔다면 복잡한 구조가 왜 필요한지 근거가 보강된다. 어느 쪽인지는 논문 본문을 확인해야 알 수 있다.
애플은 연구 성과를 외부 논문 공유 플랫폼보다 자사 머신러닝 연구 사이트에 먼저 올리는 경우가 많다. 그래서 이 사이트는 애플의 AI 연구 방향을 엿볼 수 있는 창구로 꼽힌다. 이번 논문은 원문 전체가 애플 머신러닝 연구 사이트에 공개돼 있다.