AI
MetaBrief-
앤트로픽 '클로드 소넷 5.5' 출시…작업당 비용 최대 30% 줄이고 성능은 오퍼스 5.5에 근접
The Decoder는 앤트로픽이 클로드 5.5 제품군의 두 번째 모델인 '클로드 소넷 5.5'를 출시했다고 보도했다. 앤트로픽은 소넷 5.5가 이전 모델보다 결과물을 30% 이상 빠르게 만들어 내고, 작업당 비용은 최대 30% 낮으며, 여러 벤치마크에서 상위 모델인 오퍼스 5.5에 가까운 성능을 냈다고 밝혔다.성능이 가장 크게 오른 분야는 코딩이다. 커서(Cursor) 편집기의 실제 코딩 작업을 재현한 CursorBench 4.0에서 소넷 5.5는 55.5%를 기록했다. 오퍼스 5.5(57.8%)와는 약 2%포인트 차이다. 여러 직종의 실무 능력을 평가하는 GDPval-AA에서는 1,844점을 받아 오퍼스 5.5(1,846점)와 거의 같았다. 가격은 전작과 같이 100만 토큰당 입력 2달러, 출력 10달러다. 앤트로픽은 작업 하나에 쓰는 토큰이 줄어 실제 비용이 낮아진다고 설명했다. 다만 이 수치들은 앤트로픽이 자체 발표한 것이며, 독립적인 검증은 아직 이뤄지지 않았다.앤트로픽은 소넷 모델 가운데 처음으로 사이버보안 안전장치도 넣었다. 위험도가 높은 보안 관련 요청은 소넷 5로 넘겨 처리한다. 적은 비용으로 대량의 작업을 처리하는 데 맞춘 하이쿠 5.5도 몇 주 안에 공개할 예정이다.
-
애플, 확산 언어모델 성능 높이는 '프로브 가이던스' 논문 공개… 추론 시 추가 연산 없이 무조건부 생성 최고 성능
애플이 텍스트를 만드는 확산(diffusion) 방식 언어모델의 생성 품질을 높이는 새 기법을 내놨다. 애플은 지난 23일 자사 머신러닝 연구 사이트(Apple Machine Learning Research)에 논문 「How to Guide Your Language Flow」를 공개했다. 논문 초록에 따르면 연구진이 '프로브 가이던스(probe guidance)'라고 이름 붙인 이 기법은 연속 확산 언어모델의 무조건부 생성(unconditional generation)에서 새로운 최고 성능(state-of-the-art)을 기록했다.초록을 보면 프로브 가이던스는 '플로 매칭(flow matching)' 모델을 원하는 방향으로 이끄는 가이던스 기법이다. 핵심은 이미 학습된 확산 모델의 내부 상태를 고정(frozen)한 채 그대로 활용해 가이던스 신호를 만든다는 점이다. 연구진은 이 방식이 기존 '오토가이던스(autoguidance)'와 비슷한 원리로 작동한다고 설명했다. 오토가이던스는 성능이 낮은 '약한 모델'과 성능이 높은 '강한 모델'의 출력 차이를 이용해 생성 결과를 더 나은 쪽으로 끌어가는 방식이다.애플이 내세운 차별점은 두 가지다. 첫째, 추론 단계에서 모델을 한 번 더 돌리는 추가 순전파(forward pass)가 필요 없다. 오토가이던스처럼 약한 모델을 따로 두는 방식은 결과를 낼 때마다 연산이 늘어나는 부담이 있는데, 프로브 가이던스는 기존 모델의 내부 상태를 재활용해 이 과정을 없앴다는 것이다. 둘째, 약한 모델과 강한 모델이 비슷한 동역학(dynamics)을 공유하도록 보장하는 '신뢰할 수 있는 경로'를 제공한다고 연구진은 밝혔다. 두 모델의 성격이 지나치게 다르면 가이던스가 오히려 결과를 엉뚱한 방향으로 끌고 갈 수 있는데, 이 문제를 구조적으로 줄였다는 설명이다.이 연구가 주목받는 배경에는 언어모델 설계의 흐름 변화가 있다. 지금 널리 쓰이는 대형 언어모델 대부분은 단어(토큰)를 앞에서부터 하나씩 차례로 만들어 내는 '자기회귀' 방식이다.
-
XingChen-AGI, 텍스트 생성 모델 'Xing4.0-29B-A4B' 공개… 약 열흘 만에 내려받기 4만 3천여 회
AI 개발사 XingChen-AGI가 텍스트 생성 모델 'Xing4.0-29B-A4B'를 AI 모델 공유 플랫폼 허깅페이스(Hugging Face)에 공개했다. 허깅페이스 모델 정보를 보면 이 모델은 2026년 9월 16일 등록됐다. 이후 내려받기 4만 3,947회, 즐겨찾기(좋아요) 1,724회를 기록했다. 라이선스는 아파치 2.0(apache-2.0)이다.허깅페이스는 전 세계 개발자와 연구자가 AI 모델과 데이터셋을 올리고 내려받는 오픈소스 AI 저장소다. 새로 올라온 모델이 얼마나 관심을 받는지는 내려받기와 즐겨찾기 수로 가늠한다. 내려받기는 개발자가 모델을 실제로 받아 시험하거나 서비스에 붙여 본 횟수를 보여준다. 즐겨찾기는 나중에 다시 보려고 표시해 둔 관심의 표현에 가깝다. 공개일부터 이달 27일까지 약 열흘 동안 4만 건이 넘게 내려받아졌으니, 공개 직후 개발자들의 초기 반응이 적지 않았던 셈이다. 다만 내려받기 수에는 자동화 도구의 반복 호출이나 같은 사용자의 중복 내려받기가 섞일 수 있다. 그래서 실제 사용자 수와 같다고 보기는 어렵다.모델 이름의 '29B-A4B'는 오픈소스 AI 업계에서 흔히 쓰는 표기 방식이다. 보통 전체 매개변수(파라미터)가 약 290억 개(29B)이고, 문장을 생성할 때 실제로 활성화되는 매개변수는 약 40억 개(A4B)라는 뜻이다. 이런 이름은 주로 '전문가 혼합(MoE)' 구조의 모델에 붙는다. 모델 전체는 크게 만들되 질문마다 일부 '전문가' 모듈만 골라 계산하는 설계다. 그만큼 연산 비용과 응답 속도를 줄일 수 있다는 점이 장점으로 꼽힌다. 다만 이번에 정리한 허깅페이스 모델 정보만으로는 Xing4.0의 실제 구조와 매개변수 규모, 학습 데이터, 지원 언어, 성능 평가 결과는 확인되지 않았다. 이름 앞의 '4.0'이 이전 세대 모델을 잇는 버전 번호인지도 확인되지 않았다.라이선스도 눈여겨볼 대목이다. 아파치 2.0은 대표적인 '허용형' 오픈소스 라이선스다. 저작권 고지 등 기본 조건만 지키면 누구나 모델을 내려받
-
Comfy-Org, 허깅페이스에 ‘Qwen-Image-2.1’ 공개… 열흘 만에 내려받기 326만 회
ComfyUI 개발 조직인 Comfy-Org가 AI 모델 공유 플랫폼 허깅페이스(Hugging Face)에 이미지 생성 모델 ‘Qwen-Image-2.1’을 올렸다. 허깅페이스 모델 정보에 따르면 이 모델은 2026년 9월 16일 공개됐다. 이후 내려받기는 3,266,380회, 즐겨찾기(좋아요)는 732회를 기록했다. 공개된 지 열흘 남짓 만에 내려받기가 300만 회를 넘은 셈이다.허깅페이스는 전 세계 개발자와 연구자가 AI 모델과 데이터셋을 올리고 내려받는 플랫폼이다. 모델 페이지의 내려받기 수와 즐겨찾기 수는 공개 초기에 개발자들이 얼마나 관심을 보이는지 가늠하는 지표로 쓰인다. 모델은 https://huggingface.co/Comfy-Org/Qwen-Image-2.1 에서 받을 수 있다.‘Qwen-Image’는 중국 알리바바의 Qwen(통의천문) 팀이 내놓은 이미지 생성 모델 계열의 이름이다. 이 계열은 이미지 안에 글자를 정확하게 그려 넣는 능력과 이미지 편집 기능으로 오픈소스 이미지 생성 분야에서 주목받았다. Comfy-Org는 노드를 연결해 이미지 생성 과정을 짜는 도구 ComfyUI를 운영하는 조직이다. 그동안 주요 공개 모델을 ComfyUI에서 곧바로 불러 쓸 수 있는 형태로 정리해 허깅페이스에 배포해 왔다. 다만 이번 저장소가 원개발사 모델을 ComfyUI용으로 다시 묶은 것인지, 2.1 버전에서 무엇이 달라졌는지는 공개된 모델 정보만으로는 확인되지 않았다.수치를 보면 내려받기와 즐겨찾기의 차이가 크다. 내려받기는 326만 회를 넘었지만 즐겨찾기는 732회에 그쳐, 내려받기 약 4,460회당 즐겨찾기가 1회꼴이다. 즐겨찾기는 이용자가 직접 눌러야 하지만 내려받기는 워크플로나 자동화 도구가 모델 파일을 받아 갈 때마다 쌓인다. 그래서 ComfyUI처럼 사용자가 많은 도구와 연결된 저장소는 즐겨찾기보다 내려받기가 훨씬 빠르게 늘어나는 경향이 있다. 따라서 326만이라는 숫자를 실제 이용자 수로 볼 수는 없다. 그래도 이 모델이 짧은 기간에 이미지
-
Edge0, 음성 인식 모델 'Audio8-ASR-Infinite' 공개… 내려받기 2,853회·즐겨찾기 551회
허깅페이스(Hugging Face)의 모델 정보에 따르면 Edge0는 지난 22일 음성 인식(ASR) 모델 'Audio8-ASR-Infinite'를 허깅페이스에 공개했다. 공개 이후 집계된 내려받기는 2,853회, 즐겨찾기는 551회다. 라이선스는 아파치 2.0(apache-2.0)이며, 모델은 허깅페이스의 Edge0 저장소(huggingface.co/Edge0/Audio8-ASR-Infinite)에 올라와 있다.모델 이름의 'ASR'은 자동 음성 인식(Automatic Speech Recognition)을 뜻한다. 사람의 말소리를 텍스트로 바꾸는 기술로 회의록 작성, 영상 자막 생성, 콜센터 상담 기록, 음성 비서 등에 폭넓게 쓰인다. 다만 허깅페이스 모델 정보에서는 이 모델이 지원하는 언어, 매개변수 규모, 성능 평가 결과가 확인되지 않았다. 이름에 붙은 'Audio8'과 'Infinite'가 무엇을 뜻하는지도 공개된 정보만으로는 알 수 없다. 예를 들어 'Infinite'가 긴 음성 처리처럼 특정 기능을 가리키는지는 확인되지 않았다.허깅페이스는 전 세계 개발자와 연구자가 AI 모델과 데이터셋을 올리고 내려받는 공유 플랫폼이다. 여기서 보이는 내려받기와 즐겨찾기(좋아요) 수는 새로 나온 모델이 개발자 사이에서 얼마나 관심을 받는지 가늠하는 초기 지표로 쓰인다. 내려받기는 모델 파일을 실제로 받아 간 횟수를 가리키지만, 자동화된 파이프라인이나 반복 호출도 포함될 수 있어 실제 사용자 수와 같다고 보기는 어렵다. 즐겨찾기는 이용자가 직접 눌러야 쌓이기 때문에 관심의 강도를 보여주는 지표로 여겨진다.이번 수치를 보면 즐겨찾기가 내려받기의 약 19%에 해당한다. 내려받은 이용자 다섯 명 가운데 한 명꼴로 즐겨찾기를 누른 셈이다. 오늘(26일)은 공개일로부터 나흘이 지난 시점이지만, 수치가 정확히 언제 기준으로 집계됐는지는 확인되지 않았다. 따라서 하루 평균 증가 속도나 다른 음성 인식 모델과의 비교는 이 자료만으로 판단하기 어렵다.라이선스도 눈여겨볼 대목이다. 아
-
美 항소법원, 국방부의 앤트로픽 '공급망 위험' 지정 유지 판결
Wired는 미국 워싱턴DC 연방항소법원이 현지시간 금요일 AI 기업 앤트로픽의 청구를 받아들이지 않았다고 보도했다. 앤트로픽은 미 국방부가 내린 공급망 위험 지정 가운데 하나를 취소해 달라고 요구해 왔다. 재판부는 2대 1로 판결했다. 다수의견은 "국방부나 계약업체가 클로드를 국방부 정보시스템에 계속 통합하면 법이 규정한 국가안보 위험이 생긴다는 결론에는 충분한 근거가 있다"고 밝혔다. 재판부는 앤트로픽이 주장한 적법절차 위반과 표현의 자유 침해도 인정하지 않았다. 이번 분쟁은 통상적인 계약 협상 문제라는 판단이다.앤트로픽은 현재 AI 모델을 자율무기나 국내 감시에 쓰도록 허용하지 않겠다는 입장을 밝혔다. 국방부는 이를 이유로 올해 초 두 개의 공급망 관련 법에 근거해 앤트로픽을 제재했다. 이 가운데 하나는 지난 3월 샌프란시스코 연방법원이 무효로 판단했다. 나머지 하나는 이번 판결로 유지돼 국방부의 앤트로픽 배제는 계속될 수 있게 됐다.앤트로픽 대변인 대니엘 코언은 회사가 자신들의 입장에 여전히 자신이 있으며 모든 선택지를 검토하고 있다고 말했다.
-
31명 연구진이 영상 AI에 '대상 영속성' 가르치는 데이터 150만 건 공개
눈앞에서 사라진 물체도 여전히 존재한다는 사실을 영상 생성 AI가 이해하는지 확인하고, 이를 학습시키기 위한 대규모 데이터셋이 공개됐다. 논문 사전공개 사이트 arXiv에 올라온 저자 초록에 따르면, 하오톈 장(Haotian Zhang) 등 연구자 31명은 논문 「Training Object Permanence in World Models」(arXiv:2609.28654)에서 인지과학 과제를 바탕으로 만든 데이터 인프라 'WROP(World Reasoning with Object Permanence)'와 160억(16B) 파라미터 규모의 월드 모델 'PWM-WROP'를 발표했다. 이 논문은 연구자 커뮤니티 플랫폼 허깅페이스의 일일 논문 목록에서 추천 56회를 받았다.연구진이 다룬 '대상 영속성(object permanence)'과 '고체성(solidity)'은 발달심리학에서 인간 인지의 기본 전제로 꼽히는 개념이다. 대상 영속성은 가려지거나 시야에서 벗어난 물체도 계속 존재한다는 이해이고, 고체성은 단단한 물체끼리 서로를 통과하지 못한다는 이해다. 연구진은 초록에서 최근 연구들을 인용해 현재 월드 모델의 대표 유형인 영상 생성 모델이 추론 능력을 보이기 시작했으며, 그래서 사람과 비슷한 물리 지능을 만드는 데 알맞은 후보라고 설명했다. 그러면서 영상 모델에 대상 영속성이 이미 생겨났는지, 생겨나지 않았다면 핵심 인지(core cognition)에서 착안한 데이터셋으로 학습시킬 수 있는지를 연구 질문으로 내세웠다.WROP는 연구진이 직접 설계한 과제 150개로 이뤄져 있고, 이 과제들은 6개 인지 범주로 나뉜다. 연구진은 3D 그래픽 도구 블렌더(Blender)로 생성기를 만들어 과제마다 인지 구조는 그대로 두고 물체 속도, 조명, 카메라 각도 같은 부수 조건만 무작위로 바꿨다. 이렇게 과제 하나당 1만 개 넘는 샘플을 만들었다. 조건이 달라져도 핵심 원리는 같게 유지해, 모델이 겉모습의 패턴이 아니라 물리 원리 자체를 익히게 하려는 설계로 보인다. 공개한 자료
-
애플, 라벨 없는 음성 데이터로 연합학습 음성인식 모델 훈련하는 방법 논문 공개
애플이 9월 24일(현지시간) 자사 머신러닝 연구 사이트(Apple Machine Learning Research)에 사용자 기기의 라벨 없는 음성 데이터로 음성인식(ASR) 모델을 훈련하는 방법을 다룬 논문을 공개했다. 논문 제목은 「A Practical Recipe for Semi-Supervised Federated ASR: Online Pseudo-Labels with Server Update Stabilization」이다. 제목을 풀면 '준지도 연합학습 음성인식을 위한 실용적 방법: 온라인 의사 라벨과 서버 업데이트를 통한 안정화'다. 애플은 연구 성과를 외부 논문 공유 플랫폼보다 자사 사이트에 먼저 올리는 경우가 많아, 이 사이트는 애플의 AI 연구 방향을 엿볼 수 있는 창구로 꼽힌다.공개된 초록에 따르면 연구진이 다룬 주제는 '준지도 연합학습(SSFL)'이다. 연합학습은 데이터를 서버로 모으지 않고 각 사용자 기기(클라이언트)에서 모델을 학습시킨 뒤 그 결과만 합치는 방식이다. 이때 기기에 있는 데이터에는 대개 정답 라벨이 없다. 음성 데이터라면 녹음은 있어도 그 녹음을 받아 적은 텍스트가 없는 셈이다. 준지도 연합학습은 이 문제를 풀기 위해 '교사(teacher)' 모델이 라벨 없는 데이터에 임시 정답인 의사 라벨(pseudo-label)을 붙이고, 서버에는 정답이 달린 소규모 '시드(seed)' 데이터만 둔다.초록은 음성인식이 이런 구조에서 특히 취약하다고 짚었다. 음성인식은 단어나 글자를 순서대로 이어 출력하는 작업이라 의사 라벨의 오류 하나가 출력 문장 전체로 번진다. 게다가 연합학습은 여러 차례 학습 라운드를 반복하기 때문에 오류가 라운드마다 쌓이다가 결국 학습이 발산(divergence)해 버린다. 연구진은 이 때문에 준지도 연합학습 음성인식이 정답 라벨을 모두 갖춘 완전 지도 연합학습보다 성능이 크게 떨어져 왔다고 설명했다.연구진은 이 격차를 줄이는 열쇠로 서로 맞물린 두 가지 설계 축을 제시했다. 하나는 의사 라벨을 만드는 모델을 무
-
구글 딥마인드, 실시간 대화하는 AI 아바타 '제미나이 3.8 라이브 위드 라이브 아바타' 공개
구글 딥마인드는 공식 블로그를 통해 '제미나이 3.8 라이브 위드 라이브 아바타(Gemini 3.8 Live with Live Avatar)'를 공개했다. 실시간 대화형 AI에 가상 인물 영상을 결합한 서비스로, 기업용 서비스인 제미나이 엔터프라이즈에서 제공을 시작했다고 밝혔다. 지난주 출시된 제미나이 3.8 라이브에 거의 실시간으로 영상을 생성하는 기능을 더했다. 아바타는 입 모양과 표정을 음성에 맞춰 움직이며 대화한다.회사는 고객 응대나 대화형 안내 등에 이 서비스를 활용할 수 있다고 설명했다. 대화를 멈추지 않고 백그라운드에서 도구를 호출해 데이터를 가져오는 '비동기 도구 호출'을 지원한다. 대화 도중 97개 언어 사이를 오갈 수도 있다. 기본 제공 아바타 외에 참조 이미지로 맞춤형 아바타도 만들 수 있다. 다만 이 기능은 현재 허용 목록에 등록된 기업에만 제공된다. 아바타가 만든 음성과 영상에는 AI 생성물임을 알 수 있도록 눈에 보이지 않는 워터마크 '신스ID(SynthID)'가 들어간다.
-
애플, 확산 언어모델용 새 생성 유도 기법 '프로브 가이던스' 논문 공개
애플이 확산(diffusion) 방식 언어모델의 텍스트 생성 품질을 높이는 새 기법을 담은 논문을 내놨다. 애플 머신러닝 연구 사이트(Apple Machine Learning Research)에 23일(현지시간) 올라온 논문 「How to Guide Your Language Flow」의 초록에 따르면, 연구진은 이 기법에 '프로브 가이던스(probe guidance)'라는 이름을 붙였다. 조건 없이 문장을 생성하는 '무조건 생성' 과제에서 연속 확산 언어모델 기준 최고 성능(state-of-the-art)을 새로 기록했다고 밝혔다.초록을 보면 프로브 가이던스는 플로 매칭(flow matching) 모델의 생성 과정을 유도하는 방법이다. 이미 학습된 확산 모델의 내부 상태를 고정(frozen)한 채 그대로 가져와 유도 신호를 만든다. 연구진은 이 방식이 기존 '오토가이던스(autoguidance)'와 비슷한 원리로 작동한다고 설명했다. 오토가이던스는 상대적으로 약한 모델과 강한 모델의 출력 차이를 이용해 생성 방향을 잡는 기법이다. 연구진이 내세운 개선점은 두 가지다. 먼저 추론 단계에서 별도 모델을 한 번 더 계산하는 추가 순전파(forward pass)가 필요 없다. 또 약한 모델과 강한 모델이 비슷한 동역학(dynamics)을 갖도록 보장하는 안정적인 경로를 제공한다.이런 연구가 나온 배경에는 확산 모델을 텍스트 생성에 적용하려는 흐름이 있다. 확산·플로 매칭 계열 모델은 잡음에서 출발해 조금씩 결과물을 다듬어 가는 방식이다. 이미지 생성 분야에서는 이미 주류로 자리 잡았다. 이 과정에서 생성 결과를 원하는 방향으로 이끄는 '가이던스' 기법이 품질을 좌우하는 핵심 요소로 쓰여 왔다. 다만 오토가이던스처럼 보조 모델을 함께 돌리는 방식은 생성할 때마다 계산량이 늘어난다. 두 모델의 성질이 어긋나면 유도 신호가 불안정해질 수 있다는 점도 약점으로 꼽힌다. 애플 연구진은 기존 모델의 내부 상태를 재활용해 이 두 문제를 함께 줄이려 한 것으로 보인다.현재 대규모
-
OpenAI, 우크라이나 정부에 사이버보안 프로그램 '데이브레이크' 제공… 민간 기반시설 방어 지원
OpenAI는 자사 뉴스 페이지를 통해 사이버보안 프로그램 '데이브레이크(Daybreak)'를 우크라이나 정부도 이용할 수 있도록 확대한다고 밝혔다. 우크라이나의 민간 기반시설을 사이버 공격으로부터 방어하는 데 도움을 주기 위한 조치라고 회사는 설명했다.OpenAI의 발표에 따르면 이번 결정으로 우크라이나 정부는 데이브레이크 프로그램을 이용할 수 있게 된다. 회사는 지원 목적을 '민간 방어(civilian defense)'라고 밝혀 군사 목적이 아닌 민간 기반시설 보호에 쓰인다는 점을 분명히 했다.다만 공개된 발표문에는 데이브레이크 프로그램의 구체적인 기능과 제공 방식이 나와 있지 않다. 우크라이나 정부의 어느 기관이 프로그램을 쓰는지, 지원 기간과 규모가 어떻게 되는지도 담기지 않았다. 보호 대상인 민간 기반시설이 어디까지인지도 확인되지 않았다.우크라이나 정부가 언제부터 이 프로그램을 쓰기 시작하는지도 아직 알려지지 않았다.
-
구글 딥마인드, 'Private AI Compute'에 암호화된 서버 측 메모리 도입
구글 딥마인드는 공식 블로그에서 클라우드 기반 AI 처리 플랫폼 'Private AI Compute'에 서버 측 영구 메모리 기능을 도입한다고 밝혔다. 여러 기기에서 AI 비서가 맥락을 이어가면서도 온디바이스 처리 수준의 개인정보 보호를 유지하는 것이 목표다.새 구조에서는 사용자 데이터를 클라우드의 전용 암호화 저장소에 보관하고, 이를 풀 수 있는 암호 키는 사용자 기기에만 둔다. AI가 정보를 써야 할 때는 기기와 클라우드의 격리 환경인 '보안 엔클레이브'를 종단간 암호화 채널로 연결한다. 엔클레이브는 데이터를 잠시 복호화해 요청을 처리하고, 새 맥락을 저장한 뒤 곧바로 다시 암호화한다. 구글은 이 방식이면 구글도 데이터에 접근할 수 없다고 설명했다.구글에 따르면 기존 Private AI Compute를 비롯한 업계의 비슷한 기술은 작업이 끝나면 맥락을 모두 지우는 '무상태' 방식이었다. 구글은 개정된 기술 백서와 함께 변조할 수 없는 서버 소프트웨어 공개 기록을 내놓았고, 기기가 개인정보를 보내기 전에 소프트웨어가 정품인지 검증할 수 있게 했다. 외부 보안업체의 독립 감사 결과도 공개했다. 기능을 언제부터 쓸 수 있는지는 확인되지 않았다.