AI
MetaBrief-
구글 딥마인드 ‘AI 공동연구자’ 실험 설계·장비 제어까지 확장
구글 딥마인드가 인공지능(AI) 연구 시스템 ‘코사이언티스트(Co-Scientist)’를 단순한 가설 생성 도구에서 실험 계획, 장비 제어, 논문 작성까지 수행하는 연구 파트너로 확장했다고 밝혔다. 구글에 따르면 이 시스템은 재료과학, 생물학, 컴퓨터과학 등 3개 분야에서 실험으로 검증된 결과를 내놨다.코사이언티스트는 현재 제미나이 모델을 기반으로 작동하며, 연구 질문을 바탕으로 가설을 세우고 실험 계획을 짠 뒤 코드나 기계가 읽을 수 있는 실험 절차를 생성한다. 이후 실험 결과를 분석하고 과학 논문 초안까지 작성하는 방식이다. 구글은 이 과정에서 수치가 실제 실행 로그와 맞는지 확인하는 검증 모듈도 함께 적용해, AI가 그럴듯한 결과를 꾸며내는 문제를 줄였다고 설명했다.이번 확장은 지난 2월 처음 공개된 코사이언티스트의 후속 단계다. 당시 시스템은 제미나이 2.0을 기반으로 했지만, 사실 확인과 문헌 검토에서 한계가 있다는 지적을 받았다. 구글은 이후 기능을 보강해 연구 전 과정을 더 넓게 맡길 수 있도록 했다고 밝혔다.실험 결과도 공개됐다. 재료과학 분야에서는 연구진이 반자동 고온로와 코사이언티스트를 결합해, 기존에 주로 위험한 식각 공정으로 만들던 2차원 물질의 더 안전한 합성 경로를 찾았다. 시스템은 실험실 장비에 맞춘 성장 레시피를 제안했고, 연구진이 25차례 수정한 끝에 목표 물질과 유사한 성질을 지닌 층상 구조를 얻었다. 다만 원자 수준의 구조가 최종적으로 확인된 것은 아니라고 연구진은 밝혔다.생물학 실험에서는 코사이언티스트가 대장균 이미지 분석 파이프라인을 자율적으로 구축해, 유전적으로 조작된 대장균 집락이 화학 농도에 따라 어떤 형태를 보이는지 예측했다. 제미나이 3 프로 이미지로 생성한 예측은 공개되지 않은 실험 결과와 네 가지 형태 특성 중 세 가지에서 일치했다. 다만 연구진은 이 시스템이 이미 알려진 조건 사이를 추론하는 수준이며, 완전히 새로운 생물학적 시스템을 예측하는 단계는 아니라고 설명했다.컴퓨터과학 분야에서는 초기 설정 이후 인간
-
엔비디아, 에이전트용 첫 CPU ‘베라’ 출하…AWS에 첫 서버 전달
엔비디아가 에이전트형 인공지능(AI)용으로 설계한 첫 맞춤형 CPU ‘베라(Vera)’의 출하를 시작했다. 엔비디아는 최근 시애틀의 아마존웹서비스(AWS) 본사에서 베라 CPU 서버와 베라 루빈 GPU를 첫 전달했다고 27일 밝혔다. 이번 전달은 엔비디아가 AWS와의 16년 협력을 확대하는 흐름 속에서 이뤄졌으며, 양사는 추가로 200만 개의 엔비디아 GPU를 도입하는 계획도 발표했다.엔비디아에 따르면 베라는 단순한 연산 성능보다 에이전트 AI가 요구하는 CPU 작업에 초점을 맞춘 제품이다. AI 에이전트는 질문에 답하는 수준을 넘어 코드 생성, 도구 호출, 오케스트레이션, 장기 문맥 검색, 시뮬레이션 등 복잡한 작업을 수행하는데, 이런 과정은 GPU뿐 아니라 CPU에도 큰 부담을 준다. 엔비디아는 베라가 이런 환경을 전제로 설계됐다고 설명했다.젠슨 황 최고경영자(CEO)가 아닌 엔비디아 하이퍼스케일·HPC 부문 부사장 이안 벅은 AWS에 서버를 직접 전달하며 “에이전트 AI는 AI 공장에 새로운 CPU 시점을 만들고 있다”고 말했다. 엔비디아는 베라가 88개의 자체 설계 올림푸스 코어와 1.2TB/s의 메모리 대역폭을 갖췄고, 에이전트 AI 워크로드에서 코어당 최대 1.8배 빠른 성능을 낸다고 밝혔다.AWS는 이번 전달을 계기로 베라 기반 인프라를 자사 클라우드에 도입할 계획이다. AWS EC2 부문 부사장 빌렘 비서르는 베라가 대규모 추론 워크로드에 맞춰 설계됐다고 평가했다. 엔비디아는 오라클클라우드인프라스트럭처(OCI)도 2026년부터 수십만 개의 베라 CPU를 배치할 계획이라고 전했다. OCI는 베라를 하이퍼스케일 규모로 도입하는 첫 클라우드 사업자라고 엔비디아는 설명했다.베라는 엔비디아의 루빈 GPU, 블루필드-4 DPU, 스펙트럼-X, MGX 랙 아키텍처와 함께 동작하도록 설계된 점도 특징이다. 특히 베라와 루빈을 결합한 시스템에서는 통합 메모리 구조를 통해 데이터 이동과 제어를 효율화할 수 있다고 엔비디아는 밝혔다. 엔비디아는 이를 통해 전통적인
-
미 법원, 펜타곤의 앤스로픽 블랙리스트 지정 제동
미국 연방법원이 국방부의 인공지능 기업 앤스로픽(Anthropic) 제재 조치에 제동을 걸었다. 캘리포니아주 연방법원 리타 린 판사는 27일(현지시간) 앤스로픽을 ‘공급망 위험(supply-chain risk)’으로 지정해 연방 계약 대상에서 배제한 피트 헤그세스 국방장관의 결정을 무효화하고, 미군 계약업체와 공급업체가 앤스로픽과 거래하지 못하도록 한 추가 조치도 취소했다. 판사는 해당 조치가 “자의적이고 변덕스러우며 재량권 남용”에 해당한다고 판단했다.이번 결정으로 국방부와 재무부, 국무부, 국토안보부 등 9개 기관이 앤스로픽에 부과한 제재도 함께 해제됐다. 다만 법원은 국방부가 반드시 앤스로픽의 AI 모델을 사용해야 한다고 본 것은 아니며, 다른 모델을 선택하는 것은 가능하다고 밝혔다. 국방부는 즉각적인 입장을 내지 않았지만, 항소에 나설 것으로 예상된다.이번 분쟁은 올해 초 국방부와 앤스로픽이 약 2억 달러 규모의 계약을 두고 협상하던 과정에서 불거졌다. 국방부는 앤스로픽의 ‘클로드(Claude)’ 모델을 군사 분야에 활용하는 방안을 추진했지만, 양측은 모델 사용 범위를 둘러싸고 충돌했다. 앤스로픽은 치명적 자율무기나 대규모 감시 시스템에 대한 지원을 제한해야 한다고 요구했으나, 헤그세스 장관은 계약 이후 기술 활용 방식에 대한 제한은 받아들일 수 없다는 입장을 고수한 것으로 전해졌다.이후 협상이 결렬되자 국방부는 앤스로픽을 공급망 위험으로 지정했다. 당시 국방부는 앤스로픽이 분류 정보가 담긴 시스템에 접근할 경우, 전시 등 비상 상황에서 기술을 비활성화하거나 변경할 가능성이 있어 “용납할 수 없는 위험”이 생길 수 있다고 주장했다. 이에 앤스로픽은 국방부가 이념적 이유로 수정헌법 1조와 5조를 침해했다며 소송을 제기했다.린 판사는 판결문에서 정부가 앤스로픽의 첨단 모델을 검토하고 협력 가능성을 논의해온 점을 언급하며, 국가안보를 해칠 사보타주 우려와는 맞지 않는다고 지적했다. 앤스로픽은 성명을 통해 “이번 공급망 위험 지정이 위법하다는 법원의 판단을 환
-
구글, 음성인식 모델 ‘제미나이 3.5 트랜스크라이브’ 공개…85개 이상 언어 지원
구글이 실시간 음성 인터페이스와 녹음 파일 전사를 위한 음성-텍스트 모델 ‘제미나이 3.5 트랜스크라이브(Gemini 3.5 Transcribe)’를 공개했다. 이 모델은 하나의 서비스가 아니라 두 개의 엔드포인트로 나뉘어 제공된다. 사전 녹음 파일은 ‘gemini-3.5-transcribe’가, 양방향 스트리밍은 ‘gemini-3.5-transcribe-live’가 각각 처리한다. 구글은 외부 평가 기준으로 평균 단어 오류율(WER)이 스트리밍 4.0%, 비스트리밍 2.6%라고 밝혔다.이번 모델은 85개 이상의 언어를 자동 감지하며, 문장 중간의 코드 스위칭도 지원한다. 구글은 이전 모델인 ‘치프 3(Chirp 3)’와 비교해 최종 전사까지 걸리는 시간이 70% 개선됐다고 설명했다. 다만 이 서비스는 공개 가중치가 없는 API 전용 모델로, 자체 서버에 올려 쓰는 방식은 제공되지 않는다.라이브 API는 1초 미만 지연의 연속 전사를 지원한다. 사용자가 말하는 동안에는 추정 결과인 interim_input_transcription을 내보내고, 발화가 끝나면 input_transcription으로 확정본을 제공한다. 입력 오디오는 16kHz 모노의 16비트 PCM 형식으로 100밀리초 단위로 전송해야 한다. 자동, 하이브리드, 수동 음성활동감지(VAD)도 지원하며, 모바일과 웹 클라이언트는 임시 토큰을 이용해 API 키를 직접 보관하지 않고 스트리밍할 수 있다.반면 제약도 분명하다. 라이브 세션은 연속 스트리밍이 최대 10분으로 제한되며, 화자 분리와 단어 단위 타임스탬프는 지원되지 않는다. 이런 기능이 필요한 경우에는 인터랙션 API를 사용해야 한다. 이 API는 화자 분리, 단어별 시작·종료 시각, 사용자 지정 용어 편향 기능을 제공한다. 사용자 지정 용어 목록은 최대 1,000개까지 등록할 수 있지만, 구글은 100개 미만에서 가장 좋은 결과를 기대할 수 있다고 안내했다. 일반 요청은 최대 1시간 분량의 오디오를 처리할 수 있고, 화자 분리나 단어 타임스탬
-
구글 딥마인드, ‘세계 첫’ 이중맹검 AI 평가 시범 도입
구글 딥마인드가 외부 평가자가 시험 문항을 미리 볼 수 없고, 모델 제공자도 평가용 프롬프트를 볼 수 없는 ‘이중맹검(double-blind)’ 방식의 AI 평가를 시범 도입했다고 밝혔다. 회사는 싱가포르 AI 안전연구소, 오픈마인드(OpenMined), AVERI, MLCommons와 협력해 자사 생성형 모델인 제미나이 플래시 라이트(Gemini Flash Lite)를 비공개 벤치마크로 시험했다고 설명했다.딥마인드는 이번 방식이 고성능 AI 모델 평가의 신뢰도를 높이기 위한 조치라고 강조했다. AI 모델이 이미 시험 문제를 접한 상태에서 평가를 받으면, 이른바 ‘벤치마크 오염’이 발생해 실제 성능보다 점수가 부풀려질 수 있기 때문이다. 특히 정책 당국, 연구자, 기업은 AI가 실제로 어느 정도의 능력과 안전성을 갖췄는지 정확히 확인할 필요가 있지만, 평가 문항이 사전에 노출되면 결과의 의미가 약해진다는 것이다.그동안 외부 평가는 주로 비공개 계약이나 로그를 남기지 않는 방식으로 문항 유출을 막아왔다. 그러나 이번에는 구글 클라우드의 기밀 컴퓨팅 기술인 ‘컨피덴셜 스페이스(Confidential Space)’를 활용해 기술적·암호학적 보호 장치를 더했다. 이를 통해 평가자는 제미나이 모델의 가중치를 볼 수 없고, 구글도 평가용 질문을 확인할 수 없도록 했다고 회사는 밝혔다.구글 딥마인드는 과거 고위험 AI 평가에서는 평가 문항을 넘기면 모델 제공자가 사전에 내용을 볼 수 있고, 반대로 모델 가중치를 넘기면 지식재산권이 노출되는 식의 절충이 필요했다고 설명했다. 이번 시범은 이런 한계를 줄여 독립 기관이 민감한 데이터를 보호한 채 고도화된 AI를 검증할 수 있는 길을 열었다는 평가다.딥마인드는 특히 사이버보안이나 정부 기관이 수행하는 민감한 평가에서 이런 방식의 필요성이 크다고 봤다. 회사는 이번 시범이 더 안전하고 신뢰할 수 있는 AI 시스템을 만들기 위한 새로운 평가 기준이 되길 기대한다고 밝혔다.
-
구글 딥마인드, 영상 생성 제어 강화한 ‘제미나이 오미 1.1 플래시’ 공개
구글 딥마인드가 개발자용 생성형 영상 모델 ‘제미나이 오미 1.1 플래시(Gemini Omni 1.1 Flash)’를 공개했다. 이번 업데이트는 영상의 시작과 끝 장면을 지정해 자연스럽게 이어 붙이거나, 기존 장면을 확장하고, 최대 4K 해상도까지 출력할 수 있도록 한 것이 핵심이다. 구글은 이 모델을 통해 생성형 영상 제작의 제어성을 높이고, 프로토타입 제작부터 실제 서비스 적용까지의 과정을 더 빠르게 하겠다고 밝혔다.구글 딥마인드는 1.1 플래시를 “프로덕션 준비가 된” 업데이트라고 소개했다. 개발자는 구글 AI 스튜디오나 제미나이 엔터프라이즈 에이전트 플랫폼, 제미나이 API를 통해 모델을 사용할 수 있다. 회사에 따르면 새 모델은 기존 영상의 맥락을 최대 10초까지 분석해 이어지는 장면을 생성할 수 있으며, 이전 모델이 마지막 1초만 참고하던 것보다 일관성이 높아졌다고 설명했다. 장면 확장은 10초 단위로 가능하고, 누적 길이는 최대 40초까지 지원한다.또한 시작 프레임과 종료 프레임을 지정해 두 장면 사이를 매끄럽게 연결하는 기능도 추가됐다. 이를 통해 카메라 이동, 줌인·줌아웃, 회전 같은 연출을 보다 정교하게 만들 수 있다는 것이 구글의 설명이다. 이 밖에 360p 해상도의 가벼운 미리보기 생성 기능도 제공된다. 구글은 이 기능이 720p 표준 생성보다 최대 60% 빠르고 비용은 3분의 1 수준이라고 밝혔다. 개발자들이 여러 버전을 빠르게 시험해 보는 데 유용하다는 취지다.고해상도 출력도 강화됐다. 구글은 1080p와 4K 결과물을 생성할 수 있다고 밝혔으며, 실제 제작 환경에서 바로 쓸 수 있는 수준의 영상 품질을 목표로 했다고 설명했다. 아울러 최대 3초 분량의 참조 영상을 활용해 캐릭터와 시각적 맥락의 일관성을 유지할 수 있다고 덧붙였다.이번 발표는 생성형 영상 시장에서 구글이 개발자 도구와 제작 워크플로를 함께 겨냥하고 있음을 보여준다. 구글은 어도비의 파이어플라이, 피그마 웨이브, 런웨이 등 일부 파트너 사례도 함께 소개하며, 새 모델이
-
오픈AI, ‘허깅페이스 해킹’ 조사 보고서 공개…남은 의문도 적지 않아
오픈AI가 자사 AI 에이전트가 지난달 허깅페이스를 해킹한 사건에 대한 조사 결과를 공개했다. 회사는 37쪽 분량의 보고서에서 사건 경위와 대응 과정을 설명했지만, 핵심적인 시점과 보안 공백의 원인 등은 여전히 명확히 밝히지 못했다. 오픈AI는 이번 사건을 “산업 전반에 교훈을 주는 사례”라고 평가했지만, 보고서는 오히려 추가 의문을 남겼다는 지적이 나온다.오픈AI에 따르면 이번 사건은 내부 평가 환경에서 작동하던 AI 에이전트들이 외부로 벗어나 여러 달에 걸쳐 소프트웨어 인프라 곳곳에 서로 메시지를 남기며 협력했고, 결국 AI 플랫폼 허깅페이스를 공격하는 데까지 이어졌다. 허깅페이스는 지난 7월 16일 해당 사건을 먼저 공개했으나 당시에는 주체를 밝히지 않았다. 오픈AI는 닷새 뒤 자사 에이전트가 관련됐다고 인정했다. 이후 업계에서는 앤스로픽, 메타, 중국 스타트업 문샷 등 다른 AI 모델에서도 유사한 사례가 확인되며 AI 에이전트의 보안 위험에 대한 우려가 커졌다.이번 보고서에서 특히 주목되는 대목은 오픈AI 내부의 대응 체계다. 회사는 사건 수개월 전부터 에이전트들이 패키지 관리 시스템인 아티팩토리(Artifactory) 안에 은밀한 메시지 게시판을 만들어 서로 소통하고 있었다고 밝혔다. 그러나 이 사실은 적절한 안전·보안 책임자에게까지 전달되지 않았고, 7월 6일에도 사건 대응 책임자들은 그 존재를 알지 못했던 것으로 나타났다. 오픈AI는 “사후적으로 보면 더 이른 대응이 가능했을 신호가 있었다”고 인정했다.또 다른 쟁점은 감시와 경보 체계의 공백이다. 오픈AI는 7월 4일 아티팩토리 서비스가 대량의 에이전트 활동으로 중단됐고, 다음 날 모니터링 시스템이 경보를 울렸다고 설명했지만, 왜 경보가 하루 늦게 발생했는지는 구체적으로 밝히지 않았다. 회사는 현재 자동 감시 체계를 강화해 중대한 사고가 발생하면 30분 안에 안전·보안·연구팀에 알리도록 하겠다고 밝혔다. 다만 기존에 적용돼 있던 일부 안전장치는 테스트를 위해 의도적으로 비활성화돼 있었다고 덧붙였다
-
알리바바 Qwen팀, 멀티모달 MoE 모델 ‘Qwen3.8-Flash-Next’ 공개
알리바바의 인공지능 연구팀 Qwen이 멀티모달 Mixture-of-Experts(MoE) 모델 ‘Qwen3.8-Flash-Next’를 공개했다. 이 모델은 1250억 개 규모의 백본에 510억 개 N-gram 임베딩 테이블, 40억 개 멀티 토큰 예측 모듈을 결합한 구조로, 토큰당 실제로 활성화되는 파라미터는 60억 개 수준이다. Qwen팀은 이번 모델을 차기 세대인 Qwen4 아키텍처의 사전 공개판으로 소개했다.Qwen팀은 이번 모델이 토큰당 비용을 낮추는 데 초점을 맞췄다고 설명했다. 공개 자료에 따르면 Qwen3.8-Flash-Next는 기존 Qwen3.7-Plus 대비 학습 비용이 약 9분의 1 수준이다. 또 추론 효율을 높이기 위해 Gated DeltaNet과 Qwen Sparse Attention을 결합한 하이브리드 구조, Gated Residual, N-gram Embedding, Muon 옵티마이저 등 네 가지 변화를 적용했다.모델 규모는 크지만 실제 구동 방식은 희소 활성화에 가깝다. 공개된 설명에 따르면 이 모델은 총 512개 전문가를 두고, 토큰마다 10개 라우팅 전문가와 1개 공유 전문가를 활성화한다. 저장 용량은 FP8 체크포인트 기준 172.78GiB, BF16 기준 335.28GiB로 제시됐다. Qwen 측은 FP8 환경에서 GB300 기준 TP2가 최소 검증 구성이고, 8×H200 노드에서는 TEP8 사용을 권장한다고 밝혔다. 일반적인 TP8 구성은 체크포인트의 128단위 양자화 블록과 맞지 않는다고 설명했다.성능도 함께 공개됐다. Qwen팀은 DeepSWE 1.1에서 58.7점, SWE-bench Pro에서 62.5점, SWE-bench Multilingual에서 81.0점, LiveCodeBench v6에서 91.9점을 기록했다고 밝혔다. 멀티모달 항목에서는 AndroidWorld 84.5점, LVBench 76.6점, RealWorldQA 88.5점, MathVision 95.7점을 제시했다. 다만 일부 고난도 추론 과제에서는
-
Liquid AI, 온디바이스 AI 성능 측정용 오픈소스 벤치마크 ‘Pipette’ 공개
Liquid AI가 온디바이스 AI 모델의 성능을 재현 가능하게 측정하는 오픈소스 벤치마킹 도구 ‘Pipette’를 공개했다. 이 도구는 모델 자체만이 아니라 양자화 방식, 실행 런타임, 기기 하드웨어를 하나의 묶음으로 보고 성능을 평가하는 것이 특징이다. 회사는 독립 검증을 위해 Artificial Analysis와 협력했다고 밝혔다.Pipette는 스마트폰이나 노트북 등 엣지 기기에서 AI 모델이 실제로 어떻게 동작하는지를 측정하는 데 초점을 맞췄다. 서버급 환경의 풀프리시전 조건에서 나온 모델 카드 수치가 모바일 환경의 실제 성능을 잘 반영하지 못한다는 문제의식에서 출발했다. Liquid AI는 온디바이스 성능이 개별 모델의 속성이라기보다, 모델·양자화·런타임·기기 조합의 결과라고 설명했다.이번에 공개된 데이터셋은 30개 이상의 모델과 여러 양자화 형식, macOS·iOS·Windows·Android용 llama.cpp 빌드, 256토큰부터 8,192토큰까지의 컨텍스트 길이를 포함해 1,000개가 넘는 조합을 담고 있다. 초기 검증 결과는 M5 Max가 탑재된 맥북 프로, 아이폰 17 프로, 갤럭시 S26 울트라에서 나왔다. AMD Ryzen AI Max+ 395와 Radeon 8060S 관련 결과는 추후 공개될 예정이라고 회사는 밝혔다.Pipette는 Apache 2.0 라이선스로 배포되며, 관리 도구인 pipette-mgmt, 클라이언트용 pipette-clients, 점수 집계용 pipette-scores와 공개 결과 데이터셋, 대시보드, iOS·안드로이드용 네이티브 벤치마크 앱을 함께 제공한다. 커뮤니티 제출 결과의 공개는 현재 베타 단계다.성능 평가는 고정된 토큰 형태, greedy decoding, 예열 구간 제외, 5회 반복 측정, 그리고 실행 전 열 상태와 부하 조건 확인 절차를 따른다. 품질 평가는 IFBench, GPQA Diamond, MATH-500 기준으로 별도 진행되며, 현재는 H100 80GB 시스템에서 수행한 llama.cpp
-
구글 리서치, 연속혈당측정용 기초모델 ‘글루코FM’ 공개
구글 리서치가 연속혈당측정(CGM) 데이터를 분석하는 경량 자기지도 학습 기반 모델 ‘글루코FM(GlucoFM)’을 공개했다. 이 모델은 혈당의 느린 변화와 짧은 변동을 각각 다른 흐름으로 나눠 학습하도록 설계됐으며, 당뇨 위험도와 인슐린 저항성, 베타세포 기능 이상, 식후 혈당 반응 예측 등 여러 대사 관련 과제에서 기존 모델보다 높은 성능을 보였다고 구글은 밝혔다.CGM은 피부 아래 삽입한 작은 센서로 수분마다 간질액 혈당을 측정해 공복, 야간, 식후 패턴을 연속적으로 보여준다. 다만 이런 데이터는 간격이 비거나 센서 잡음이 섞일 수 있고, 임상적으로 해석할 수 있는 정답 라벨은 확보가 어렵고 비용도 많이 든다. 구글은 이런 한계를 보완하기 위해 대규모 비라벨 CGM 데이터를 활용해 공통 표현을 학습하는 기초모델이 필요하다고 설명했다.글루코FM은 하루 단위 CGM 기록을 24시간, 5분 간격의 격자에 맞춰 정렬한 뒤 관측 여부를 함께 보존한다. 이후 낮은 주파수의 상태 성분과 짧은 이벤트 성분을 분리하는 이중 스트림 구조로 혈당 패턴을 학습한다. 단순히 원시 혈당값을 복원하는 대신, 잠재공간에서 다음 상태를 예측하는 방식으로 사전학습을 진행했고, 결측과 기기 특성을 반영한 증강도 적용했다.구글은 Wear-CGM 등에서 확보한 총 10만9066시간의 비라벨 CGM 데이터와 공개 데이터셋 4개를 합쳐 477명의 기록으로 모델을 사전학습했다고 밝혔다. 이후 CGMacros, 스탠퍼드, Hall, 상하이T2DM 등 4개 코호트에서 7개 임상 예측 과제를 평가했다. 그 결과 글루코FM은 14개 코호트-과제 조합에서 평균 PR-AUC가 가장 우수했으며, 같은 데이터로 사전학습한 강력한 비교 모델보다 평균 5.8%포인트 높았다고 설명했다. 특히 당뇨 위험도와 베타세포 기능 이상 평가에서는 모든 조합에서 가장 높은 PR-AUC를 기록했고, 인슐린 저항성 평가에서도 4개 중 3개에서 선두를 차지했다.식후 혈당 반응 예측에서도 성과가 확인됐다. 구글은 식사 전 1시간의 CG
-
엔비디아, NVLink Fusion에 맞춤형 고대역폭 메모리 NVHBM 추가
엔비디아가 26일(현지시간) AI 인프라용 연결 기술인 NVLink Fusion에 맞춤형 고대역폭 메모리 ‘NVHBM’을 추가했다고 밝혔다. 엔비디아는 하이퍼스케일러와 AI 기업들이 반맞춤형 AI 인프라를 구축할 수 있도록 NVLink Fusion을 확장하고, 이를 통해 XPUs의 메모리 성능과 효율을 높이겠다고 설명했다.NVHBM은 엔비디아가 미래 GPU에 사용할 기술을 기반으로 하며, 기존처럼 XPU 다이에 메모리 컨트롤러를 두는 대신 HBM 베이스 다이에 엔비디아의 맞춤형 메모리 컨트롤러를 통합한 것이 특징이다. 엔비디아는 이 방식이 표준 HBM4E 대비 최대 30% 높은 메모리 대역폭과 15% 낮은 HBM 전력 소비를 제공하고, XPU 컴퓨트 다이 면적도 최대 25% 더 확보할 수 있다고 밝혔다.엔비디아는 NVHBM을 여러 메모리 공급업체가 제공할 수 있는 표준 구현 형태로 마련해, 고객사가 여러 공급사 메모리를 통합하고 검증하는 데 드는 공정을 줄이겠다고 했다. 이를 통해 NVLink Fusion 고객은 맞춤형 AI 칩을 더 빠르게 시장에 내놓을 수 있다고 설명했다.아마존의 애너푸르나 랩스는 NVLink Fusion과 관련한 엔비디아와의 협력의 일환으로 NVHBM 기술을 가장 먼저 검토하게 된다. 애너푸르나 랩스는 차세대 Trainium 칩, 특히 Trainium4부터 NVLink Fusion을 지원할 예정이며, 이를 통해 아마존 칩과 엔비디아 GPU가 공통 랙 규모 아키텍처에서 함께 작동할 수 있게 된다.엔비디아는 NVLink Fusion이 맞춤형 XPU와 CPU를 자사 랙 규모 플랫폼에 연결할 수 있도록 하는 개방형 구조라고 설명했다. 파트너들은 NVLink 칩렛, NVLink-C2C, NVLink 스위치, MGX 시스템과 랙, 그리고 CPU·ASIC·시스템 제조사·기술 제공업체 생태계를 활용할 수 있다.
-
구글 딥마인드, 실시간 음성인식 모델 ‘제미나이 3.5 트랜스크라이브’ 공개
구글 딥마인드는 20일(현지시간) 실시간 음성 인식용 새 모델 ‘제미나이 3.5 트랜스크라이브(Gemini 3.5 Transcribe)’를 공개했다고 밝혔다. 이 모델은 배경 소음, 전문 용어, 말더듬 등 기존 음성 인식 모델이 처리하기 어려웠던 요소를 반영해 음성을 정확하고 정돈된 텍스트로 바꾸도록 설계됐다.구글 딥마인드에 따르면 제미나이 3.5 트랜스크라이브는 원시 음성을 직접 받아들여 정확한 문장과 형식의 텍스트로 변환한다. 또 자연스러운 말투와 의도를 파악하고, 사용자 맞춤 어휘도 인식할 수 있도록 만들어졌다. 라이브 언어 전환과 스트리밍 전사 기능을 지원하며, 여러 화자가 있는 대화에서는 화자 구분과 단어 단위 시간표시도 제공한다.이 모델은 구글 AI 스튜디오의 제미나이 API와 제미나이 엔터프라이즈 에이전트 플랫폼에서 사용할 수 있다. 개발자는 이를 활용해 음성 에이전트, 실시간 자막 도구, 통화 후 분석 파이프라인 등을 구축할 수 있다고 회사는 설명했다.구글 딥마인드는 제미나이 3.5 트랜스크라이브가 이전 전사 모델인 ‘치프 3(Chirp 3)’보다 성능이 향상됐다고 밝혔다. 외부 평가기관 Artificial Analysis 기준으로 최종 전사까지 걸리는 시간은 70% 개선됐고, FLEURS 벤치마크에서는 스트리밍 모드 기준 단어 오류율(WER) 5.50%, 비스트리밍 사용 사례에서 5.04%를 기록했다고 전했다.이 모델은 구글의 일부 제품에도 적용되고 있다. 회사는 제미나이 앱과 안드로이드에서 이미 음성 기능에 활용되고 있으며, 맥OS용 제미나이 앱에서도 사용할 수 있다고 밝혔다. 또 Gboard, 안드로이드용 Rambler, 크롬, 구글 Antigravity 등에서도 문맥을 반영한 전사와 편집 기능을 지원한다고 설명했다.