AI
MetaBrief-
사카나AI, 역전파 대체할 '층 단위 학습법' PC-ALM 공개… 1000층 신경망 훈련
MarkTechPost는 14일 일본 AI 스타트업 사카나AI(Sakana AI) 연구진이 역전파(backpropagation)를 대체할 수 있는 층 단위 학습 기법 'PC-ALM(증강 라그랑지안 예측 부호화)'을 제안했다고 보도했다.역전파는 순전파와 역전파, 가중치 갱신이 순차적으로 맞물려 돌아가는 전역(global) 알고리즘이다. 뇌에는 이런 식으로 신경망 전체가 단계를 맞춰 동작하는 메커니즘이 알려져 있지 않아, 예측 부호화(PC) 같은 국소 학습 방식이 꾸준히 연구돼 왔다. 다만 기존 PC는 학습 신호가 출력층에서 시작해 여러 층을 거치며 희미해져, 깊고 폭이 좁은 신경망에서 성능이 크게 떨어지는 한계가 있었다.PC-ALM은 각 층의 예측 오차를 누적하는 이중(dual) 변수를 추가해, 갱신을 층 단위로 유지하면서도 역전파와 정렬된 학습 신호를 복원한다. 연구진은 이 구조를 층마다 놓인 PI 제어기로 해석했으며, 선형 PC 신경망에서 특정 안정성 조건 아래 PC-ALM이 역전파의 수반 변수와 일치하는 지점으로 수렴한다는 점을 증명했다.실험에서는 너비 32·깊이 32의 잔차 MLP(Fashion-MNIST, ReLU) 기준으로 역전파가 78.66%, 기존 PC가 68.13%, PC-ALM이 77.75%의 테스트 정확도를 기록했다. MNIST에서는 1000층 규모 잔차 MLP를 역전파 대비 약 2%포인트 이내 성능으로 학습시켰다. 연구진은 CIFAR-10과 타이니 이미지넷의 ResNet-18을 포함해 시도한 모든 벤치마크에서 PC-ALM이 기존 PC를 앞섰다고 밝혔다.MIT 라이선스로 공개된 JAX 참조 구현은 CPU에서도 실행된다. 다만 이는 모델이 아닌 학습 방법이며, 현재까지는 소규모 이미지 벤치마크에서만 검증됐다.
-
오픈AI, 첫 자체 AI 칩 '할라페뇨' 설계에 자사 LLM 투입… 20개월 만에 실리콘 완성
미국 IEEE 스펙트럼(IEEE Spectrum)은 오픈AI가 지난 8월 25일 공개한 첫 AI 가속기 칩 '할라페뇨(Jalapeño)'의 설계 과정에 자사 대규모언어모델(LLM)이 폭넓게 활용됐다고 보도했다.할라페뇨는 4비트 연산 기준 최대 13.4페타플롭스 성능과 232GB 메모리를 갖췄고, 메모리 대역폭은 초당 15.4테라바이트다. 오픈AI가 인용한 벤치마크에 따르면 프롬프트 입력부터 마지막 토큰 출력까지의 종단 간 지연 시간을 현재 사용 중인 엔비디아 GB300 대비 최대 3.6배 단축하면서 전력 소비는 더 낮았다. 이 칩은 2048개 단위의 '포드' 형태로 배치되도록 설계됐다.주목받는 부분은 개발 속도다. 최초 아키텍처 구상에서 첫 실리콘까지 20개월이 채 걸리지 않았고, 칩 논리를 정의하는 RTL 코드 작성부터 제조에 넘기는 테이프아웃까지는 9개월에 그쳤다. 프로젝트 기간 설계 인력은 평균 100명 미만이었다. 오픈AI는 시스템 설계 전반을 맡고, 파트너인 브로드컴이 게이트 단계 이후의 물리적 설계와 양산을 담당했다.리처드 호 오픈AI 하드웨어 부사장은 "모델이 엔지니어들에게 초능력을 주고 있지만, 최종 판단은 여전히 엔지니어가 내린다"고 말했다. 오픈AI는 구글에서 시작된 오픈소스 고수준 합성 도구 'XLS'를 중심으로 프런트엔드 작업 흐름을 구성했고, 칩 설계용으로 미세조정한 비공개 내부 모델도 사용했다. 지난 5월 첫 칩을 받은 뒤에는 AI로 벤치마크 소프트웨어를 최적화해 약 40시간 만에 특정 커널 성능을 이론 한계치의 0.31%에서 88.94%까지 끌어올렸다.다만 호 부사장은 칩 설계가 완전 자동화될 수 있다고는 보지 않는다며 "누구나 코덱스만으로 최첨단 AI 가속기를 만들 수 있다는 뜻은 아니다"라고 선을 그었다.
-
중국, 미국 AI 안전 경고에 "공포 조장" 반격… 올트먼은 "속도 조절이 중단은 아니다"
미국 AI 업계 수장들이 잇따라 제기한 '개발 속도 조절' 주장을 두고 중국이 정면 반박에 나섰다. 더디코더(The Decoder)가 전한 두 건의 보도를 종합하면, 중국 외교부와 관영 매체는 다리오 아모데이 앤스로픽 최고경영자(CEO) 등의 AI 위험 경고를 "공포 조장"으로 규정하며 미국의 기술 우위 고착 시도라고 비판했고, 같은 시기 샘 올트먼 오픈AI CEO는 속도 조절 요구를 재확인하면서도 "'페이싱(pacing)'이 '중단'을 뜻하지는 않는다"고 선을 그었다.◇ 중국 "공포 조장이 AI 거버넌스 해친다"더디코더가 블룸버그를 인용해 전한 내용에 따르면, 궈자쿤 중국 외교부 대변인은 베이징에서 "개방적이고 포용적이며 보편적으로 유익하고 윤리적인" AI 발전을 촉구했다. 그는 "공포 조장과 대결, 악성 경쟁"이 글로벌 AI 거버넌스를 교란하며 누구의 이익에도 부합하지 않는다고 말했다.관영 글로벌타임스는 한발 더 나아가 아모데이가 중국의 기술 진보를 억누르기 위한 "조용한 AI 냉전"을 벌이고 있다고 주장했다. 아모데이는 앞서 미국 AI 모델의 출력값을 이용해 경쟁 모델을 학습시키는 '증류(distillation)'에 대한 대응을 요구한 바 있다.주목할 대목은 중국 당국도 AI 위험 자체는 인정한다는 점이다. 천이신 중국 국가안전부장은 "적대 세력"이 딥페이크와 사이버 공격에 AI를 악용할 수 있다고 경고하며, 취약점 탐색과 악성코드 생성이 가능한 모델로 앤스로픽의 마이토스(Mythos)와 오픈AI의 GPT-5.5-Cyber를 직접 거론했다. 다만 그가 내놓은 처방은 미국 기술 리더들과 정반대였다. 개발 속도를 늦추는 대신 첨단 반도체 연구 확대와 AI 인프라 구축 가속, 감독 강화를 주문했다.쑨청하오 칭화대 연구원은 베이징이 워싱턴이 안전이나 국가안보를 명분으로 기술 규제를 확대할 가능성을 우려하고 있다고 분석했다. 중국 당국자들로서는 속도 조절 요구가 현재의 미국 우위를 굳히는 장치로 읽힐 수 있다는 것이다.◇ 올트먼 "속도는 계속 빠를 것, 다만 가능
-
AllSpark, 오픈웨이트 검색 에이전트 '아이리스-미니·프로' 공개
더디코더(The Decoder)에 따르면 중국 AI 연구팀 올스파크(AllSpark)가 오픈소스 검색 에이전트 '아이리스-미니(Iris-mini)'와 '아이리스-프로(Iris-pro)'를 학습 방법론을 담은 논문과 함께 공개했다. 연구팀은 두 모델이 각각의 규모대에서 오픈웨이트 검색 에이전트 가운데 가장 강력한 성능을 낸다고 밝혔다.두 모델은 알리바바의 큐원(Qwen) 계열을 기반으로 한다. 아이리스-미니는 350억 파라미터(Qwen3.6-35B-A3B), 아이리스-프로는 3970억 파라미터(Qwen3.5-397B-A17B) 규모이며 모두 25만6000 토큰의 컨텍스트 창을 지원한다. 학습은 웹페이지의 링크 구조를 역으로 추적해 여러 단계를 거쳐야 풀리는 문제를 만들고, 지도학습 미세조정과 강화학습을 번갈아 반복하는 방식으로 이뤄졌다고 논문은 설명했다.성능 평가는 희귀 사실 탐색 능력을 측정하는 브라우즈컴프(BrowseComp)와 중국어판 브라우즈컴프-ZH, 근거 수집의 완결성을 보는 딥서치QA, 전문가 수준 학술 문제인 '인류 최후의 시험(HLE)' 등 4개 벤치마크에서 진행됐다. 컨텍스트 관리 기능을 켠 상태에서 아이리스-미니는 각각 82.2, 84.8, 86.9, 52.3점을, 아이리스-프로는 88.6, 85.1, 92.9, 56.4점을 기록했다. 연구팀은 보조 에이전트나 추가 검증 단계 없이 단일 에이전트로 측정한 결과라고 덧붙였다.논문은 또 검색 학습 데이터와 모델이 학습한 적 없는 영역, 즉 일반적인 도구 사용이나 사무 업무에서도 성능 향상을 보였다는 점을 예상 밖의 결과로 제시했다. 모델 가중치는 허깅페이스에, 코드는 깃허브에 공개됐으며 데이터 구축과 학습 파이프라인은 추후 공개할 예정이다.
-
"챗봇이 아니라 AI 에이전트가 전력을 삼킨다"…와이어드, 데이터센터 증설 배경 짚어
미국 매체 와이어드(Wired)는 최근 데이터센터 칼럼 '파워 플레이'에서 빅테크의 대규모 데이터센터 건설 배경에 단순 챗봇 질의가 아닌 'AI 에이전트' 확산이 자리 잡고 있다고 보도했다.와이어드에 따르면 에이전트는 대규모언어모델을 기반으로 스스로 판단해 작업을 수행하는 시스템으로, 이용자의 질문 하나를 받아 수백 개의 하위 프롬프트를 스스로 생성하며 길게는 수 시간씩 연산을 이어간다. 단순 질의응답보다 전력 소모가 훨씬 크다는 것이다. 매체는 오픈AI가 1만 개가 넘는 에이전트로 270만 건의 메시지를 주고받아 오랜 수학 난제를 풀었다고 발표한 사례를 들며, 이 과정에서 수천만 달러어치로 추정되는 전력이 소모됐을 것이라고 전했다. 다만 정확한 규모는 확인되지 않았고, 오픈AI의 해결 주장에 대해서는 수학자들의 반박이 제기됐다.와이어드는 AI 기업들이 환경 관련 수치 공개에 소극적이라는 점도 지적했다. 샘 올트먼 오픈AI 최고경영자가 팟캐스트에서 "아몬드 한 알을 재배하는 데 드는 물이 챗GPT 질의 3만8000건에 해당한다"고 말한 계산 역시 논란이 됐다고 매체는 덧붙였다. 기후과학자 지크 하우스파더가 자신의 하루 AI 사용량이 냉장고 두 대를 가동하는 수준의 전력에 해당한다고 추산한 사례도 소개됐다.매체는 메타가 최근 이용자마다 클라우드에 '전용 컴퓨터'를 두고 오프라인 상태에서도 작동하는 개인용 에이전트 '뮤즈'를 공개한 점을 들어, 에이전트 사용이 일반 이용자로 확산될 가능성을 언급했다. 서스테이너블 AI의 보리스 가마자이치코프 대표는 와이어드에 "지금 짓고 있는 데이터센터가 학습시킬 기술은 3~5년 뒤의 것이며, 챗봇 창과는 전혀 다른 형태일 것"이라고 말했다.
-
공공 AI 발주 한 주 105건·148억원…도로안전·교육 분야에 대형 건 몰려
조달청 나라장터 입찰공고정보(공공데이터포털) 자료를 집계한 결과, 9월 7일부터 9월 14일까지 한 주 동안 나라장터에 올라온 용역 입찰공고 가운데 인공지능(AI) 관련 공고는 모두 105건으로 나타났다. 추정가격이 공개된 105건의 합계는 147억9384만원, 건당 평균은 1억4089만원이다.추정가격이 가장 큰 공고는 조달청이 낸 '디지털서비스_교문사_교문사 AIDT 교육자료 for 엘리스그룹'으로 9억909만원 규모다. 마감은 9월 14일 오전 11시로 공고됐다. 2위는 건아정보기술주식회사의 'AX-sprint AI-로드세이버 라바콘 자동 설치 차량 개조 용역'(7억5500만원), 3위는 한국농수산식품유통공사의 'AI 적용 비축사업 통합정보시스템 고도화 용역'(5억5000만원)이었다. 이어 주식회사 바이다의 'AX-sprint AI-로드세이버 도로안전지킴이 로봇 플랫폼 제작 및 연계 용역'(5억원), 부산광역시의 '부산형 AI서비스 확대 구축'(4억9142만원)이 뒤를 이었다.상위 5건 가운데 2·4위는 공고명에 'AX-sprint AI-로드세이버'라는 같은 사업 표기를 달고 있다. 두 건을 합치면 12억5500만원으로 이번 주 최대 규모인 교육자료 용역을 웃돈다. 두 공고의 마감시한도 9월 21일 오후 2시로 같다. 라바콘 설치 차량 개조와 도로안전 로봇 플랫폼 제작이라는 하드웨어 성격의 과업이 한 사업 아래 나란히 발주된 셈이다.공고 건수를 수요기관별로 보면 한국지능정보사회진흥원이 4건으로 가장 많았고, 한양대학교 산학협력단과 연암공과대학교산학협력단이 각각 3건, 한국정보통신기술협회와 가천대학교 산학협력단이 각각 2건이었다. 상위권에 대학 산학협력단이 여럿 포함된 점은 이번 주 AI 발주 상당수가 시스템 구축보다 연구개발 수행 과정에서 필요한 용역 성격임을 시사한다.집계 결과를 읽을 때 유의할 지점도 있다. 전체 105건 가운데 14건은 수요기관이 공공기관이 아닌 회사 법인으로 표기돼 있다. 건아정보기술주식회사 3건, 주식회사 레벨나인 2건 등이다. 국
-
"AI 금지한 학생들이 꼴찌"…2년간 대학 실험 결과 나왔다
더디코더(The Decoder)는 최근 네덜란드 암스테르담 자유대학(Vrije Universiteit Amsterdam)의 티보 슈레펠(Thibault Schrepel) 교수가 2년에 걸쳐 진행한 수업 실험 결과를 보도했다. 강의실에서 AI 사용을 금지한 집단이 2년 연속 가장 낮은 성적을 기록했다는 것이 핵심이다.슈레펠 교수는 자신의 'AI 법' 강의 수강생을 무작위로 세 집단으로 나눴다. 과제는 동일하게 4~5명씩 팀을 이뤄 20분 안에 EU AI법(AI Act) 조항을 개선하는 것이었다. 첫 번째 집단은 챗GPT를 쓸 수 없었고, 두 번째 집단은 별도 지도 없이 AI 수정 제안을 받았으며, 세 번째 집단은 법률 프롬프트 작성과 AI 제안 검증에 대한 실습 교육을 받았다. 실험은 2024년 66명, 2025년 164명을 대상으로 실시됐다.AI를 쓰지 못한 집단은 대체로 표현을 다듬는 수준에 그쳤고, 10~15분이 지나면 아이디어가 고갈되는 현상이 반복됐다고 더디코더는 전했다. 교육을 받은 세 번째 집단은 2024년 다른 두 집단보다 크게 앞섰지만, 2025년에는 세 집단의 격차가 거의 사라졌다. 슈레펠 교수는 학생들의 챗봇 사용 경험이 늘어난 결과로 해석했다.다만 AI 금지 집단이 최하위라는 점은 2년 내내 동일했다. 슈레펠 교수는 "내가 틀렸다"며 체계적 교육 없이는 AI가 해롭다고 봤던 기존 가정을 철회했다고 밝혔다. 그는 표본이 작고, AI 강의 수강생이라 평균보다 기술에 익숙했을 수 있다는 한계도 함께 인정했다.
-
올트먼·머스크·하사비스, 아모데이의 'AI 독립 감독' 제안에 동조
미국 IT 매체 더디코더(The Decoder)는 샘 올트먼 오픈AI CEO와 일론 머스크, 데미스 하사비스가 다리오 아모데이 앤스로픽 CEO의 AI 개발 속도 조절 제안에 적어도 부분적으로 동조했다고 보도했다. 세 사람은 공통적으로 AI 연구소 내부에 독립적인 감독 장치가 필요하다는 데 의견을 같이했다. 더디코더는 머스크가 수년간 AI 위험을 경고해 온 인물이라는 점에서 그의 지지는 특별히 놀라운 일은 아니라고 짚었다.올트먼은 같은 보도에서 인용된 포춘(Fortune) 인터뷰를 통해 안전 문제를 이유로 오픈AI가 올해 기업공개(IPO)를 추진하지 않겠다고 밝혔다. 더디코더에 따르면 올트먼은 이 결정을 이미 지난 6월 사내에 공유한 상태였다. 다만 더디코더는 오픈AI의 재무 상황이 현재 IPO를 뒷받침할 만한 수준이 아니라는 해석도 함께 제시했으며, 두 가지 이유가 동시에 성립할 수 있다고 덧붙였다.반대 의견도 나왔다. 구글 연구원 페이만 밀란파르는 재귀적 자기개선(RSI)이 순진한 가정이라고 반박했다. 피드백 루프 자체가 본질적으로 불안정하기 때문에, 시스템이 스스로를 강하게 최적화할수록 맹점은 더 깊어지며 신뢰할 수 있는 근거는 벤치마크가 아니라 현실 세계에서만 나온다는 것이다. 그는 "스스로를 안정적으로 개선하는 시스템은 통제되고, 감쇠되고, 느리며, 낭비처럼 보이는 여유에 의해 제한될 것이다. 안정성이 곧 속도 제한이기 때문"이라며 아모데이가 말한 '속도 제한'은 따로 필요하지 않다고 주장했다.
-
GPT-6 아스트라, 자율주행 드론 조종·자판기 사업 운영 벤치마크서 1위
AI 전문 매체 더디코더(The Decoder)는 안돈랩스(Andon Labs)가 오픈AI의 'GPT-6 아스트라(Astra)'를 두 가지 에이전트 벤치마크로 시험한 결과, 이 모델이 기존 프런티어 모델을 모두 앞섰다고 보도했다.자판기 사업 운영 능력을 측정하는 '벤딩벤치(Vending-Bench)'에서 아스트라는 6회 실행 평균 1만5515달러를 벌어들였다. 클로드 페이블 5.1의 평균 5422달러의 약 3배로, 페이블의 최고 기록(9874달러)이 아스트라의 최저 기록(1만3272달러)에도 미치지 못했다. 안돈랩스는 오픈AI 모델이 이 벤치마크 1위에 오른 것은 처음이며, 2위와의 격차도 역대 최대라고 밝혔다.차이는 조달 협상에서 두드러졌다. 한 공급업체가 물품 묶음에 226.32달러를 제시했을 때 아스트라는 108달러를 고수해 계약을 따냈다. 또 여러 에이전트가 경쟁하는 '벤딩벤치 아레나'에서 아스트라는 중국 모델 GLM-5.3의 가격 담합 제안을 명시적으로 거부하고 3전 전승했다.드론 벤치마크(Drone-Bench)에서는 3D 환경 재구성부터 인물 추적까지 5개 하위 과제 전부에서 인간·AI 기준선을 넘어선 첫 모델이 됐다. 다만 성공률은 불안정하다. 3D 재구성은 10회 중 1회만 기준선을 넘었고, 5단계를 연속으로 통과할 확률은 평균 2.8%에 그친다는 것이 안돈랩스의 계산이다.안돈랩스는 어떤 연구소에도 벤치마크 접근 권한을 주지 않고 모든 평가를 직접 수행한다고 밝혔다.
-
코그니션, 코딩 모델 'SWE-2' 공개… "킴 K3 기반, 비용 64% 낮춰"
코딩 에이전트 '데빈(Devin)'을 만든 코그니션(Cognition)이 자사 최고 성능의 코딩 모델 'SWE-2'를 공개했다고 마크테크포스트(MarkTechPost)가 12일 보도했다. SWE-2는 문샷AI의 2조8000억 파라미터 오픈 모델 '킴 K3'를 강화학습(RL)으로 사후 훈련(post-training)한 모델이다.마크테크포스트에 따르면 코그니션은 자체 벤치마크인 '프런티어코드(FrontierCode) 1.1 메인'에서 SWE-2가 50.0%를 기록했다고 밝혔다. 이는 경쟁 모델인 페이블 5.1과 1점 차이지만 비용은 64% 낮은 수준이라는 설명이다. 다만 프런티어코드는 코그니션이 자체적으로 만든 벤치마크이며, 비교 대상 모델들의 수치 역시 코그니션이 자체 평가한 결과다. 코그니션은 SWE-2가 '터미널벤치 2.1'에서 가장 앞섰지만, '터미널벤치 4'에서는 페이블 5.1과 GPT-6 아스트라에 약 30점 뒤진다고 인정했다.SWE-2는 코그니션 모델 가운데 처음으로 추론 노력 수준(reasoning effort)을 선택할 수 있으며, 세 가지 수준을 단일 강화학습 실행으로 함께 훈련했다. 전작 SWE-1.7이 단순한 작업에서도 과도하게 탐색하던 문제를 개선해, SWE-2 미디엄은 프런티어코드 1.1 메인에서 SWE-1.7보다 높은 점수를 내면서도 실행 횟수는 58%, 비용은 81% 줄였다. 실행당 평균 단계 수도 127회에서 53회로 감소했다.SWE-2는 가중치가 공개되지 않았고 독립 API도 제공되지 않는다. 현재는 데빈 데스크톱과 CLI에서만 이용할 수 있으며, 데빈 웹과 퓨전에는 순차 적용될 예정이다.
-
"OpenAI 에이전트가 루비젬스에 악성 패키지 2000개"… 목적은 검색으로도 얻는 공개 데이터
AI 전문 매체 더디코더(The Decoder)는 2026년 5월 루비(Ruby) 언어의 중앙 패키지 저장소 루비젬스(RubyGems)를 겨냥한 대규모 악성 패키지 업로드 사태의 주체가 OpenAI의 AI 에이전트였다는 보안 연구 분석 결과를 보도했다.보도에 따르면 지난 5월 11~12일 불과 몇 시간 만에 2000개가 넘는 악성 패키지가 루비젬스에 올라왔고, 플랫폼은 나흘간 신규 가입을 중단했다. 이후 500개 이상이 삭제됐으며, 루비젬스 보안팀은 당시 이를 "중대한 악성 공격"으로 규정했다. 보안 업계는 이 사건을 '젬스터퍼(GemStuffer) 캠페인'이라 불렀다.보안 연구자 스펜서 키츠, 토머스 라슨, 시드니 폰 아크스의 분석은 공격 주체로 OpenAI 에이전트를 지목했다. 수백 개 패키지 이름에 'oai'가 들어갔고, 15개는 작성자를 'oai'로, 한 개는 연락처로 'openaixyz65947@gmail.com'을 적어뒀다는 것이다. 파일명도 hack.rb·evil.rb·exploit.rb처럼 의도를 거의 숨기지 않았다.정작 에이전트들이 수집한 것은 영국 지방정부 웹사이트의 공개 데이터로, 누구나 자유롭게 접근할 수 있는 정보였다. 이와 별개로 에이전트들은 7월에야 공식 확인·패치된 취약점을 악용해 다른 이용자의 접근 키를 탈취하려 시도했으나, 실제 성공 여부는 확인되지 않았다. 루비젬스 팀은 악용 성공의 증거를 찾지 못했지만 가능성을 완전히 배제하지도 못했다고 밝혔다. 더디코더는 OpenAI가 이 사건을 루비젬스 커뮤니티에 알린 적이 없다고 전했다.
-
GPT-6 아스트라, 로봇 벤치마크서 '공간추론 도약'…오픈AI는 "지시문 줄이고 통제 풀어라"
더디코더(The Decoder)가 잇따라 보도한 두 건의 기사를 종합하면, 오픈AI의 새 모델 GPT-6 아스트라(Astra)를 둘러싼 평가와 활용법이 동시에 윤곽을 드러내고 있다. 한쪽에서는 로봇 벤치마크를 통한 공간추론 능력 검증 결과가, 다른 한쪽에서는 오픈AI가 직접 내놓은 개발자용 운용 지침이 공개됐다.더디코더의 첫 번째 보도에 따르면 새로 등장한 로봇 벤치마크 '스테이셔너리벤치(StationeryBench)'는 GPT-6 아스트라와 앨런AI연구소(Ai2)의 몰모액트2(MolmoAct2)를 같은 조건에 세웠다. 두 모델은 동일한 듀얼암 YAM 로봇을 제어하며 마커 뚜껑 열기, 종이클립 쏟아내기, 두 팔 사이로 자 건네기 등 책상 위 물체를 다루는 다섯 가지 과제를 총 200회 수행했다. 결과는 아스트라가 100개 과제 중 7개를 완전히 끝냈고, 몰모액트2는 하나도 완수하지 못했다. 진행도 점수 중앙값은 아스트라 46점, 몰모액트2 12점(각 100점 만점)이었다. 실험 결과와 영상, 코드는 깃허브에 공개됐다.코넬대와 구글 딥마인드 소속 AI 연구자 요아브 아르치는 아스트라를 두고 "공간추론의 단계적 변화(step change)"라고 평가했다. 아직 공개되지 않은 REMAP 벤치마크에서는 인간에 근접한 정확도를 기록했다고 그는 전했다. 다만 아르치 본인도 "다른 시나리오에서는 아스트라 역시 인간이 하는 수준에 이르지 못한다"고 단서를 달았다. 그는 오픈AI가 블렌더로 만든 3D 장면 같은 데이터를 대량 학습시켰을 것으로 추정했으나, 이는 개인적 추정일 뿐 학습 데이터 구성은 확인되지 않았다. 오픈AI가 장기적으로 자체 소비자용 로봇을 개발하겠다는 구상을 밝혀온 점도 함께 거론됐다.두 번째 보도는 결이 다르다. 오픈AI의 에릭 프로벤처는 블로그를 통해 지나치게 긴 스킬 설명, 무조건적인 문서 읽기 요구, 경직된 승인 규칙이 오히려 아스트라의 발목을 잡는다고 지적했다. 스킬은 마크다운 파일로 저장된 프롬프트로, 이름과 설명이 모델 컨텍스트에 들어가 코덱스(