기사 검색

이슈부터 IT·AI·연예·게임까지, 메타브리프의 기사를 찾아보세요.

AI

MetaBrief
  • 오픈AI, 'GPT-6.1 솔' 공개…"아스트라에 근접한 성능을 5분의 1 비용에"

    The Decoder는 오픈AI가 새 모델 'GPT-6.1 솔(Sol)'을 공개했다고 보도했다. 오픈AI는 솔이 에이전트 코딩, 컴퓨터 사용, 사무 업무에서 상위 모델 'GPT-6.1 아스트라(Astra)'에 근접한 성능을 내면서 비용은 5분의 1 수준이라고 설명했다. API 가격은 입력 100만 토큰당 2달러, 출력 10달러다. 캐시된 입력은 0.10달러로 책정됐다.솔은 이날부터 플러스·프로·비즈니스·엔터프라이즈·에듀 사용자가 ChatGPT 워크와 코덱스에서 쓸 수 있다. 일반 채팅에서는 아직 제공되지 않는다. 오픈AI는 코덱스에서 토큰을 최대 8배 빠르게 생성하는 '울트라패스트' 버전도 며칠 안에 내놓을 예정이다. 공개된 벤치마크 수치는 모두 오픈AI가 직접 낸 것으로, 회사 스스로도 예비 결과라고 밝혔다.이번 발표는 아스트라 출시가 미뤄진 가운데 나왔다. 월스트리트저널에 따르면 오픈AI는 내부 테스트에서 안전성 우려가 제기되자 10월로 계획했던 아스트라의 ChatGPT·코덱스 출시를 보류했다. 다만 오픈AI는 아스트라의 기반 모델을 추가 강화학습에 계속 활용할 계획이다.

    2026.10.01 09:00
  • 구글 딥마인드, 새 AI 모델 '제미나이 4 아르곤' 공개… 사이버 보안 방어 인력에 먼저 제공

    구글 딥마인드는 공식 블로그를 통해 새 프론티어 AI 모델 '제미나이 4 아르곤(Gemini 4 Argon)'을 공개했다. 아르곤은 먼저 '페어윈드 프로그램'을 통해 신뢰할 수 있는 사이버 보안 방어 인력에게 제공된다. 구글은 미국 정부의 출시 전 모델 접근 절차에 자발적으로 참여하며 접근 범위를 단계적으로 넓히겠다고 밝혔다. 이후 유료 API 고객과 구글 AI 울트라 구독자를 시작으로 개발자, 기업, 일반 소비자에게 공개할 계획이다.아르곤은 실무 소프트웨어 개발, 법률·금융 같은 기업 업무, 사이버 보안 방어에 초점을 맞춘 모델이다. 한 번에 생성할 수 있는 출력 토큰 한도는 기존 6만4000개에서 100만 개로 늘었다. 구글은 장기 소프트웨어 개발 과제를 평가하는 DeepSWE v1.1에서 77.9%로 최고 성능을 기록했다고 설명했다. 출시 할인 가격은 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 10달러다.신뢰할 수 있는 보안 방어 인력과 구글 내부 팀에는 사이버 보안 관련 안전장치를 해제한 버전을 제공한다. 구글에 따르면 보안 기업 위즈(Wiz)는 이 모델로 전 세계 병원이 쓰는 의료 소프트웨어에서 민감한 개인정보가 노출될 수 있는 치명적 취약점을 찾아냈다.

    2026.10.01 09:00
  • 메이퇀 연구진, 작은 AI 모델이 교사 모델에게 배울 때 '교정 지점'에 감독을 몰아주는 증류 기법 'SAKI' 공개

    중국 생활서비스 기업 메이퇀(Meituan) 연구진이 작은 언어모델(학생)이 큰 모델(교사)에게 배우는 과정에서 학습 신호를 어디에 어떻게 줄지 자동으로 정하는 증류 기법 'SAKI'를 내놓았다. 미테토 웨이(Miteto Wei) 등 연구자 10명은 arXiv에 「SAKI: Maximal-Coupling-Routed Teacher Supervision for On-Policy Distillation」(arXiv:2609.36601) 논문을 공개했다. 공개된 초록에 따르면 이 기법은 수학 추론 벤치마크 7종에서 매개변수 17억 개(1.7B)와 6억 개(0.6B) 규모의 학생 모델 모두에서 비교 기준 방법보다 좋은 성적을 냈다. 이 논문은 연구자 커뮤니티 플랫폼 허깅페이스의 일일 논문 목록에서 추천 36회를 받았다.배경에는 '온폴리시 증류(OPD)'라는 학습 방식이 있다. 지식 증류는 큰 모델의 능력을 작은 모델에 옮기는 기술이다. 교사가 만든 답안만 보고 배우면 학생은 실제로 쓰일 때 자기가 만든 문장 흐름에서 길을 잃기 쉽다. 학습할 때 본 상황과 실제로 쓰일 때 마주하는 상황이 다르기 때문이다. OPD는 학생이 직접 생성한 문장 흐름 위에서 교사의 평가를 받게 해 이 차이를 줄인다. 연구진은 이 방식에도 한계가 있다고 짚었다. 실력이 약한 학생은 교사라면 가지 않았을 방향으로 풀이를 끌고 가는 경우가 많은데, 그런 지점에서는 교사의 감독 신호가 제 역할을 하기 어렵다는 것이다.SAKI(Supervision Allocation with KL-constrained Interpolation)는 이 문제를 두 단계로 다룬다. 먼저 학생이 문장을 생성할 때 교사가 정해진 범위 안에서 개입하도록 한다. 이 범위는 KL 발산이라는 확률분포 간 거리로 제한한다. 이때 '최대 결합(maximal coupling)'이라는 확률 기법을 써서 토큰마다 학생의 선택을 그대로 받아들일지(수용), 교사 쪽으로 고칠지(교정)를 정한다. 다음으로 이렇게 생긴 수용·교정 기록을 그대로 활용

    2026.09.30 16:56
  • 저장대 연구진 'PanoVLN' 공개… 360도 파노라마로 로봇 길찾기 성공률 최고 기록 경신 주장

    중국 저장대학교(Zhejiang University) 연구진이 360도 파노라마 영상을 활용해 로봇이 자연어 지시를 따라 길을 찾도록 하는 인공지능 모델 'PanoVLN'을 내놓았다. 사전공개 논문 저장소 arXiv에 올라온 논문 「PanoVLN: Towards Effective Panoramic Vision-and-Language Navigation」(arXiv:2609.34759)에 따르면, 이 모델은 대표적인 평가 벤치마크 두 곳에서 기존 최고 성능(SOTA)보다 성공률을 각각 11.9%, 8.7% 높였다. 저자는 Zhen Wang 등 8명이다. 이 논문은 연구자 커뮤니티 플랫폼 허깅페이스의 일일 논문 목록에서 추천을 46회 받았다.연구 대상인 '시각-언어 내비게이션(VLN)'은 로봇이 카메라로 본 장면과 "복도 끝에서 왼쪽으로 돌아 부엌으로 가라" 같은 언어 지시를 함께 받아, 다음에 어떻게 움직일지 스스로 판단하는 기술이다. 최근 시각-언어 모델(VLM)이 발전하면서 이 분야도 빠르게 성장했다. 다만 기존 연구는 대부분 사람 눈처럼 앞쪽 일정 범위만 보는 일반 카메라(원근 카메라) 영상을 썼다. 연구진이 파노라마에 주목한 이유는 단순하다. 더 넓게 보면 더 나은 결정을 내릴 수 있다는 것이다. 예를 들어 일반 카메라 시야 밖에 있는 통로가 파노라마에서는 보이기 때문에, 로봇이 두리번거리며 추가로 탐색하지 않아도 가야 할 경로를 알아챌 수 있다.그런데 연구진이 실제로 해 보니, 입력 영상을 파노라마로 바꾸기만 해서는 성능이 조금밖에 오르지 않았다. 넓은 시야를 제대로 활용하려면 행동 예측, 학습 방식, 시각 표현을 모두 손봐야 한다는 것이 연구진의 진단이다.첫째는 행동 예측이다. 넓게 볼 수 있으면 더 먼 앞까지 계획할 수 있다. 그래서 모델이 한 장의 파노라마만 보고 크게 방향을 틀고 이어서 이동하는 긴 행동 순서를 한꺼번에 예측하게 했다. 여기에 '신뢰도 기반 실행(CGE)' 전략을 더했다. 모델이 예측한 행동 가운데 몇 개를 실제로 실행한 뒤 다시

    2026.09.30 16:56
  • 애플 "AI가 구조를 말로 풀면 얼마나 남나"…수식 '왕복 실험' 논문 공개

    애플이 언어모델이 구조화된 정보를 자연어로 풀어 쓸 때 원래 내용이 얼마나 온전히 전달되는지를 측정하는 연구를 공개했다. 애플 머신러닝 리서치(Apple Machine Learning Research) 사이트에 29일(현지시간) 올라온 논문 「The Communication Bottleneck: A Round-Trip Study of Tree-Structured Expression Serialization in Language Models」(소통의 병목: 언어모델의 트리 구조 표현 직렬화에 관한 왕복 연구)의 초록을 보면, 연구진은 트리 구조의 수식을 문장으로 바꿨다가 다시 수식으로 되돌리는 '왕복(round-trip)' 방식의 평가 절차를 제안했다.연구가 문제로 삼은 것은 언어모델이 추론하고 소통하는 방식 자체다. 언어모델은 사고사슬(chain-of-thought) 방식으로 단계를 밟아 추론하거나, 여러 모델이 자유 형식의 텍스트로 중간 결과를 주고받을 때 구조화된 정보를 자연어로 '직렬화'한다. 계층과 순서가 분명한 정보를 한 줄의 문장으로 펼쳐 놓는 셈이다. 초록은 이 과정을 일종의 병목으로 보고, 트리 구조를 가진 조합적 내용이 이 병목을 통과한 뒤에도 얼마나 살아남는지를 실험으로 확인하겠다고 밝혔다.실험 방법은 비교적 단순하다. 먼저 규칙에 따라 자동으로 산술식을 만든다. '생성기' 역할을 맡은 모델이 이 수식을 문장제(word problem), 즉 말로 풀어 쓴 문제로 바꾼다. 이어 별도의 '추출기' 모델이 원래 수식은 보지 못한 채 문장제만 읽고 수식을 복원한다. 마지막으로 복원된 수식이 원래 수식과 수학적으로 같은지를 기호적 동치성(symbolic equivalence)으로 판정한다. 연구진은 이 판정 방식이 정확한 '오라클'(정답 판정 기준) 역할을 한다고 설명했다. 사람이 평가하거나 다른 AI가 채점할 때 생기는 주관성과 오차를 피하고, 정보가 보존됐는지를 맞고 틀림으로 명확하게 가를 수 있다는 뜻이다.초록에 따르면 연구진은 16개 모델을 서

    2026.09.30 08:57
  • Viggle, 허깅페이스에 이미지 생성 모델 ‘Qwen-Image-2.1-viggle-turbo’ 공개… 일주일여 만에 17만 회 넘게 내려받아

    Viggle이 이미지 생성 모델 ‘Qwen-Image-2.1-viggle-turbo’를 AI 모델 공유 플랫폼 허깅페이스(Hugging Face)에 공개했다. 허깅페이스 모델 정보를 보면 이 모델은 2026년 9월 22일 올라왔다. 이후 내려받기는 17만 5,907회, 즐겨찾기(좋아요)는 394회를 기록했다. 모델은 허깅페이스의 Viggle 계정 저장소(huggingface.co/Viggle/Qwen-Image-2.1-viggle-turbo)에서 받을 수 있다.허깅페이스는 전 세계 개발자와 연구자가 AI 모델을 올리고 내려받는 사실상의 표준 저장소다. 새 모델에 대한 개발자들의 초기 반응은 흔히 내려받기와 즐겨찾기 수로 가늠한다. 공개일부터 이 글을 쓰는 시점까지 약 8일이 지났으니, 하루 평균 2만 회 넘게 내려받은 셈이다. 개별 기업이 공개한 파생 모델로서는 적지 않은 숫자다. 다만 내려받기 수에는 자동화된 배포 파이프라인이나 테스트 환경에서 반복해서 받은 횟수도 들어갈 수 있다. 그래서 실제 사용자 규모와 곧바로 같다고 보기는 어렵다. 관심의 척도로 쓰이는 즐겨찾기가 394회로 내려받기에 비해 훨씬 적다는 점도 함께 볼 필요가 있다.모델 이름에 들어간 ‘Qwen-Image’는 중국 알리바바의 Qwen 팀이 내놓은 이미지 생성 모델 계열의 이름이다. 이름만 보면 이 모델은 Qwen-Image 계열을 바탕으로 Viggle이 손본 파생 모델로 보인다. 그러나 어떤 기반 모델을 어떻게 추가 학습하거나 경량화했는지는 공개된 모델 정보에서 확인되지 않았다. 이름 끝의 ‘turbo’는 업계에서 보통 생성 단계를 줄여 속도를 높인 버전에 붙이는 이름이다. 그러나 이 모델의 실제 생성 속도나 품질 수치도 이번 자료로는 확인되지 않았다.최근 오픈 모델 생태계에서는 대형 기술 기업이 기반 모델을 공개하면, 다른 기업과 개발자가 이를 자기 서비스에 맞게 고쳐 다시 내놓는 흐름이 뚜렷하다. 기반 모델을 처음부터 만드는 데는 막대한 연산 자원이 든다. 반면 공개된 모델을 다듬으면

    2026.09.30 08:57
  • 오픈AI, 상시 작동 에이전트 '닷' 공개…저가 모델 'GPT-6.1 솔'도 출시

    오픈AI가 개발자 행사 '데브데이 2026'에서 사용자 요청이 없어도 스스로 업무를 챙기는 상시 작동형 에이전트 '닷(Dots)'과 저가 모델 'GPT-6.1 솔(Sol)'을 공개했다. 오픈AI는 공식 뉴스 채널에 데브데이 요약과 두 제품 소개 글을 올렸고, 독일 AI 전문 매체 더 디코더(The Decoder)는 이를 메타의 에이전트 '뮤즈(Muse)'의 경쟁 제품으로 보고 세부 기능과 요금, 출시 지역을 전했다.오픈AI는 이번 행사에서 GPT-6 아스트라, ChatGPT, 코덱스(Codex), API, 보안, 개발자 도구 등에 걸쳐 20건이 넘는 발표를 했다. 오픈AI는 GPT-6.1 솔이 코딩, 컴퓨터 사용, 전문 업무에서 아스트라에 가까운 성능을 낸다고 소개했다. API 입력·출력 토큰 가격은 아스트라 표준 가격의 5분의 1이다. 더 디코더는 최상위 모델인 GPT-6.1 아스트라가 안전 문제로 출시가 보류됐다고 전했다. 구체적으로 어떤 문제인지는 확인되지 않았다.오픈AI는 닷을 복잡한 프로젝트와 일상 업무를 계속 이어서 처리하는 선제적 비서로 소개했다. 일이 진행되는 동안에도 사용자가 통제권을 쥐고 있다는 점을 강조했다. 더 디코더 보도에 따르면 닷은 GPT-6 아스트라를 기반으로 한다. 닷마다 브라우저가 달린 전용 클라우드 컴퓨터가 배정돼 24시간 일할 수 있다. 이 컴퓨터에서 자료를 조사하고 데이터를 분석하며 문서를 쓰고, 코덱스로 소프트웨어를 만든다. 플러그인으로 4,000개가 넘는 앱에 연결되고, ChatGPT와 슬랙, 마이크로소프트 팀즈 어디서 대화해도 맥락이 이어진다. 오픈AI 내부 사례에서는 닷이 슬랙에 올라온 버그 제보를 받아 정상 작동하는 새 빌드까지 만들어냈다. 한 초기 테스터의 경우에는 잊고 있던 청구서를 찾아 작성한 뒤 승인을 받아 발송했다.안전장치도 여러 겹이다. 사용자가 따로 요청하지 않을 때 닷이 하는 '선제적 조사'에는 읽기 전용 도구만 쓴다. 사용자는 '커스텀 규칙'으로 행동마다 허용, 승인 필요, 금지를 정할 수 있다.

    2026.09.30 08:56
  • XiaomiMiMo, 텍스트 생성 모델 'MiMo-V2.6-Flash-RL' 허깅페이스에 공개… MIT 라이선스로 공개 일주일 만에 내려받기 2만8천 회 넘어

    AI 모델 공유 플랫폼 허깅페이스(Hugging Face)의 모델 정보에 따르면, XiaomiMiMo가 지난 22일 텍스트 생성 모델 'MiMo-V2.6-Flash-RL'을 공개했다. 이 모델은 29일 기준 내려받기 2만8,842회, 즐겨찾기 511회를 기록했다. 라이선스는 MIT다.허깅페이스는 전 세계 개발자와 연구자가 AI 모델을 올리고 내려받는 플랫폼이다. 내려받기 수는 실제로 모델 파일을 받아 간 횟수를 뜻하고, 즐겨찾기는 이용자가 관심 모델로 표시한 횟수다. 두 수치 모두 모델 성능을 직접 보여주지는 않지만, 새로 나온 모델에 개발자들이 얼마나 관심을 두는지 가늠하는 초기 지표로 쓰인다. 공개 후 약 일주일 만에 내려받기가 3만 회에 가까워졌으니 하루 평균 4천 회 안팎이 받아 간 셈이다.내려받기와 즐겨찾기의 비율도 눈여겨볼 만하다. 즐겨찾기 1회당 내려받기가 약 56회다. 관심 표시에 그치지 않고 모델을 직접 받아 시험해 본 이용자가 상대적으로 많다는 뜻으로 읽을 수 있다. 다만 내려받기 수에는 자동화된 배포 환경이나 반복 다운로드도 포함될 수 있어, 이 숫자가 곧 실사용자 수는 아니다.라이선스도 주목할 부분이다. MIT 라이선스는 오픈소스 라이선스 가운데 제약이 가장 적은 편에 속한다. 저작권 고지와 라이선스 문구만 유지하면 상업적 이용, 수정, 재배포가 대체로 자유롭다. 일부 공개 모델이 자체 라이선스로 상업 이용 규모나 용도를 제한하는 것과 달리, MIT 라이선스 모델은 기업이 자사 서비스에 넣거나 목적에 맞게 추가 학습해 쓰기가 비교적 쉽다. 국내 스타트업이나 개발자도 라이선스 부담 없이 이 모델을 시험하고 활용할 수 있다는 뜻이다.모델 이름에서도 몇 가지를 짐작할 수 있다. 'V2.6'은 기존 버전을 잇는 개정판으로 보이고, 'Flash'는 업계에서 흔히 가볍고 응답이 빠른 모델에 붙이는 이름이다. 'RL'은 보통 강화학습(Reinforcement Learning)을 뜻하는 약어로 쓰인다. 그러나 이번에 정리한 허깅페이스 모델 정보만으로는

    2026.09.29 09:10
  • 애플, 기기 속 '정답 없는 음성'으로 음성인식 학습하는 연합학습 방법론 논문 공개

    애플이 사용자 기기에 흩어진 라벨 없는 음성 데이터로 음성인식(ASR) 모델을 학습시키는 방법을 정리한 논문을 공개했다. 애플 머신러닝 연구 사이트(Apple Machine Learning Research)에 따르면, 애플은 지난 24일 「A Practical Recipe for Semi-Supervised Federated ASR: Online Pseudo-Labels with Server Update Stabilization」이라는 논문을 이 사이트에 올렸다. 제목을 우리말로 옮기면 '준지도 연합 음성인식을 위한 실용적 레시피: 온라인 의사 라벨과 서버 업데이트 안정화' 정도다.논문이 다루는 분야는 '준지도 연합학습(SSFL)'이다. 연합학습은 데이터를 서버로 모으지 않고 각 기기 안에서 모델을 학습시킨 뒤, 그 결과만 합쳐 전체 모델을 개선하는 방식이다. 개인정보가 기기 밖으로 나가지 않는다는 점에서 주목받아 왔다. 문제는 기기에 쌓이는 음성에는 '정답'이 없다는 것이다. 사용자가 자기 말을 일일이 받아 적어 두지 않기 때문에 기기 속 데이터는 대부분 라벨 없는 상태로 남는다.초록 설명에 따르면 SSFL은 이 문제를 '교사(teacher)' 모델로 푼다. 교사 모델이 기기 속 라벨 없는 데이터에 임시 정답인 의사 라벨(pseudo-label)을 붙이고, 서버는 사람이 라벨을 단 소규모 '씨앗(seed)' 데이터셋을 갖고 학습을 돕는다.연구진은 음성인식이 이런 구조에서 특히 취약하다고 짚었다. 음성인식은 결과를 단어나 글자의 연속으로 내놓는데, 의사 라벨에 섞인 오류가 이 출력 시퀀스를 따라 번지고 학습 라운드가 거듭될수록 쌓인다. 초록은 이렇게 쌓인 오류가 결국 학습을 발산(divergence)시키고, 모든 데이터에 정답이 있는 완전 지도 연합학습과의 성능 격차를 크게 벌린다고 설명한다.연구진은 이 격차를 줄이는 열쇠로 서로 맞물린 두 가지 설계 축을 제시했다. 하나는 어떤 모델이 의사 라벨을 만드느냐는 '교사', 다른 하나는 서버가 라벨 있는 데이터로

    2026.09.29 09:09
  • 앤트로픽 '클로드 소넷 5.5' 출시…작업당 비용 최대 30% 줄이고 성능은 오퍼스 5.5에 근접

    The Decoder는 앤트로픽이 클로드 5.5 제품군의 두 번째 모델인 '클로드 소넷 5.5'를 출시했다고 보도했다. 앤트로픽은 소넷 5.5가 이전 모델보다 결과물을 30% 이상 빠르게 만들어 내고, 작업당 비용은 최대 30% 낮으며, 여러 벤치마크에서 상위 모델인 오퍼스 5.5에 가까운 성능을 냈다고 밝혔다.성능이 가장 크게 오른 분야는 코딩이다. 커서(Cursor) 편집기의 실제 코딩 작업을 재현한 CursorBench 4.0에서 소넷 5.5는 55.5%를 기록했다. 오퍼스 5.5(57.8%)와는 약 2%포인트 차이다. 여러 직종의 실무 능력을 평가하는 GDPval-AA에서는 1,844점을 받아 오퍼스 5.5(1,846점)와 거의 같았다. 가격은 전작과 같이 100만 토큰당 입력 2달러, 출력 10달러다. 앤트로픽은 작업 하나에 쓰는 토큰이 줄어 실제 비용이 낮아진다고 설명했다. 다만 이 수치들은 앤트로픽이 자체 발표한 것이며, 독립적인 검증은 아직 이뤄지지 않았다.앤트로픽은 소넷 모델 가운데 처음으로 사이버보안 안전장치도 넣었다. 위험도가 높은 보안 관련 요청은 소넷 5로 넘겨 처리한다. 적은 비용으로 대량의 작업을 처리하는 데 맞춘 하이쿠 5.5도 몇 주 안에 공개할 예정이다.

    2026.09.29 09:09
  • 애플, 확산 언어모델 성능 높이는 '프로브 가이던스' 논문 공개… 추론 시 추가 연산 없이 무조건부 생성 최고 성능

    애플이 텍스트를 만드는 확산(diffusion) 방식 언어모델의 생성 품질을 높이는 새 기법을 내놨다. 애플은 지난 23일 자사 머신러닝 연구 사이트(Apple Machine Learning Research)에 논문 「How to Guide Your Language Flow」를 공개했다. 논문 초록에 따르면 연구진이 '프로브 가이던스(probe guidance)'라고 이름 붙인 이 기법은 연속 확산 언어모델의 무조건부 생성(unconditional generation)에서 새로운 최고 성능(state-of-the-art)을 기록했다.초록을 보면 프로브 가이던스는 '플로 매칭(flow matching)' 모델을 원하는 방향으로 이끄는 가이던스 기법이다. 핵심은 이미 학습된 확산 모델의 내부 상태를 고정(frozen)한 채 그대로 활용해 가이던스 신호를 만든다는 점이다. 연구진은 이 방식이 기존 '오토가이던스(autoguidance)'와 비슷한 원리로 작동한다고 설명했다. 오토가이던스는 성능이 낮은 '약한 모델'과 성능이 높은 '강한 모델'의 출력 차이를 이용해 생성 결과를 더 나은 쪽으로 끌어가는 방식이다.애플이 내세운 차별점은 두 가지다. 첫째, 추론 단계에서 모델을 한 번 더 돌리는 추가 순전파(forward pass)가 필요 없다. 오토가이던스처럼 약한 모델을 따로 두는 방식은 결과를 낼 때마다 연산이 늘어나는 부담이 있는데, 프로브 가이던스는 기존 모델의 내부 상태를 재활용해 이 과정을 없앴다는 것이다. 둘째, 약한 모델과 강한 모델이 비슷한 동역학(dynamics)을 공유하도록 보장하는 '신뢰할 수 있는 경로'를 제공한다고 연구진은 밝혔다. 두 모델의 성격이 지나치게 다르면 가이던스가 오히려 결과를 엉뚱한 방향으로 끌고 갈 수 있는데, 이 문제를 구조적으로 줄였다는 설명이다.이 연구가 주목받는 배경에는 언어모델 설계의 흐름 변화가 있다. 지금 널리 쓰이는 대형 언어모델 대부분은 단어(토큰)를 앞에서부터 하나씩 차례로 만들어 내는 '자기회귀' 방식이다.

    2026.09.28 09:00
  • XingChen-AGI, 텍스트 생성 모델 'Xing4.0-29B-A4B' 공개… 약 열흘 만에 내려받기 4만 3천여 회

    AI 개발사 XingChen-AGI가 텍스트 생성 모델 'Xing4.0-29B-A4B'를 AI 모델 공유 플랫폼 허깅페이스(Hugging Face)에 공개했다. 허깅페이스 모델 정보를 보면 이 모델은 2026년 9월 16일 등록됐다. 이후 내려받기 4만 3,947회, 즐겨찾기(좋아요) 1,724회를 기록했다. 라이선스는 아파치 2.0(apache-2.0)이다.허깅페이스는 전 세계 개발자와 연구자가 AI 모델과 데이터셋을 올리고 내려받는 오픈소스 AI 저장소다. 새로 올라온 모델이 얼마나 관심을 받는지는 내려받기와 즐겨찾기 수로 가늠한다. 내려받기는 개발자가 모델을 실제로 받아 시험하거나 서비스에 붙여 본 횟수를 보여준다. 즐겨찾기는 나중에 다시 보려고 표시해 둔 관심의 표현에 가깝다. 공개일부터 이달 27일까지 약 열흘 동안 4만 건이 넘게 내려받아졌으니, 공개 직후 개발자들의 초기 반응이 적지 않았던 셈이다. 다만 내려받기 수에는 자동화 도구의 반복 호출이나 같은 사용자의 중복 내려받기가 섞일 수 있다. 그래서 실제 사용자 수와 같다고 보기는 어렵다.모델 이름의 '29B-A4B'는 오픈소스 AI 업계에서 흔히 쓰는 표기 방식이다. 보통 전체 매개변수(파라미터)가 약 290억 개(29B)이고, 문장을 생성할 때 실제로 활성화되는 매개변수는 약 40억 개(A4B)라는 뜻이다. 이런 이름은 주로 '전문가 혼합(MoE)' 구조의 모델에 붙는다. 모델 전체는 크게 만들되 질문마다 일부 '전문가' 모듈만 골라 계산하는 설계다. 그만큼 연산 비용과 응답 속도를 줄일 수 있다는 점이 장점으로 꼽힌다. 다만 이번에 정리한 허깅페이스 모델 정보만으로는 Xing4.0의 실제 구조와 매개변수 규모, 학습 데이터, 지원 언어, 성능 평가 결과는 확인되지 않았다. 이름 앞의 '4.0'이 이전 세대 모델을 잇는 버전 번호인지도 확인되지 않았다.라이선스도 눈여겨볼 대목이다. 아파치 2.0은 대표적인 '허용형' 오픈소스 라이선스다. 저작권 고지 등 기본 조건만 지키면 누구나 모델을 내려받

    2026.09.27 09:47