해외 · 경량 대형언어모델·가격 경쟁 · 미국 앤트로픽 · 2026년 10월 7일 발표
경량 모델의 가격을 10분의 1로 — 앤트로픽, '클로드 하이쿠 5.5' 출시…입력 100만 토큰당 0.10달러·출력 0.50달러, OSWorld 2.1에서 72.4%로 전 세대(15.7%) 대비 대폭 향상, 하이쿠급 최초 '추론 노력' 조절 기능
앤트로픽은 10월 7일 경량 모델 '클로드 하이쿠 5.5'를 출시하였다. 가격은 10만 토큰 이하 프롬프트 기준 입력 100만 토큰당 0.10달러, 출력 0.50달러로, 이전 세대 하이쿠 4.5(입력 1달러·출력 5달러)보다 10만 토큰 이하 요청에서는 90%, 그 이상에서는 50% 낮으며 평균적으로 약 75% 저렴하다고 회사는 밝혔다. 동시에 상위 모델 소넷 5.5의 캐시 읽기 가격도 절반으로 인하하였다.
회사가 공개한 벤치마크에 따르면 하이쿠 5.5는 컴퓨터 화면을 직접 조작하는 과제인 OSWorld 2.1(오프라인 부분집합)에서 72.4%(하이쿠 4.5는 15.7%), 고난도 종합 지식 평가 '인류의 마지막 시험(HLE)'에서 도구 없이 45.9%·도구 사용 시 57.4%, 터미널 작업 평가 Terminal-Bench 4.0에서 39.2%를 기록하였다. 하이쿠급 모델로는 처음으로 응답 전 추론량을 낮음·중간·높음·매우 높음·최대 5단계로 조절하는 '노력(effort)' 설정을 지원하며, 아마존웹서비스·구글 클라우드·마이크로소프트 애저 등에서 바로 사용할 수 있다. 파이썬·타입스크립트 개발도구에는 컴퓨터 사용·브라우저 사용 기능이 베타로 추가되었다. 수치는 모두 회사 발표 기준이다.
기술적 의미
첫째, 다수의 하위 에이전트를 병렬로 돌리는 '에이전트 팀' 구조에서는 경량 모델의 단가가 전체 비용을 좌우하므로, 가격 90% 인하는 에이전트 서비스의 경제성을 근본적으로 바꾸는 변수가 된다. 둘째, 경량 모델이 화면 조작 과제에서 상위 모델에 근접한 성능을 보인다는 것은 '작은 모델은 단순 분류·요약용'이라는 기존 역할 구분이 무너지고 있음을 뜻한다. 셋째, 동일 주간 오픈AI의 저가 모델(GPT-6.1 솔 가격 5분의 1 인하)과 미스트랄의 오픈 가중치 대형 모델 공개가 겹치면서, 프런티어급 성능의 '원가 경쟁'이 본격화하였다.
해외·국내 · 대화형 AI 인터페이스 · 미국 오픈AI · 2026년 10월 7일
텍스트 중심 챗봇에서 '눈으로 보는' 인터페이스로 — 오픈AI, GPT-6와 함께 대화 속 상호작용형 시각 요소 '인텔리전트 UI' 전 세계 배포…국내 행사에선 주간 이용자 12억 명·기업 고객 250만 곳 공개
오픈AI는 10월 7일 챗GPT 대화 안에 버튼·맞춤형 계산기·상호작용형 차트·편집 가능한 그래프 등을 직접 생성해 넣는 '인텔리전트 UI'를 GPT-6 모델과 함께 전 세계에 배포하기 시작하였다. 시연에서는 비행기 날개가 양력을 만드는 원리를 설명하는 도해, 요리법 시각 자료, 자전거 정비 도해, 여러 날에 걸친 등산 지도, 개인 저축 계산기 등이 제시되었다. 프로·플러스·비즈니스·엔터프라이즈 이용자에게 먼저 제공되고 무료·고 요금제 이용자에게는 8일부터 적용되며, 이용자는 시각 요소의 빈도를 줄이도록 설정할 수 있다. 오픈AI 제품 관리자 아루시 셀반은 챗GPT가 그동안 '주로 텍스트 기반 인터페이스'였다고 설명하였다.
같은 날 서울 코엑스 AI페스타 2026에서 엄성원 오픈AI 코리아 커뮤니케이션 총괄은 오픈AI 서비스의 주간 이용자가 12억 명 이상, 업무용 챗GPT와 코덱스 이용자가 3,500만 명 이상, 기업 고객이 250만 곳 이상이며 챗GPT 안에서 연결 가능한 앱이 4,000개를 넘는다고 밝혔다. 또한 GPT-6.1 솔(Sol)이 상위 모델 GPT-6 아스트라(Astra)에 근접한 성능을 내면서 API 표준 입출력 가격을 5분의 1로 낮췄다고 소개하고, 인공지능을 전기처럼 쓰는 '지능 인프라'로 키우겠다는 구상을 제시하였다. 한편 같은 날 미국 비영리단체 커먼센스미디어가 청소년용 챗GPT를 '수용 불가 위험'으로 평가하고 오픈AI가 방법론에 이의를 제기하는 등 청소년 안전 논쟁도 이어졌다.
기술적 의미
첫째, 대형언어모델이 답변을 '문장'이 아닌 '작동하는 작은 프로그램'으로 생성하기 시작하면서, 챗봇이 학습·업무 도구의 사용자 인터페이스 자체를 대체하는 방향으로 진화하고 있다. 둘째, 생성형 UI는 모델의 코드 생성 능력과 안전한 실행 환경(샌드박스)을 전제로 하므로, 마이크로소프트의 '실행 컨테이너'와 같은 격리 기술과 기술적 기반을 공유한다. 셋째, 이용자 규모가 10억 명 단위로 커진 만큼 청소년 보호·정신건강 대응 등 안전 설계에 대한 외부 평가와 검증 요구도 비례해 커지고 있다.
해외(유럽) · 오픈 가중치 대형언어모델 · 프랑스 미스트랄 AI · 2026년 10월 6일 공개
유럽의 1조 매개변수 오픈 가중치 모델 — 미스트랄, '미스트랄 라지 4' 미리보기 공개…전문가 혼합(MoE) 구조로 토큰당 490억 매개변수만 활성화, 가중치는 10월 말 공개 예정
프랑스 인공지능 기업 미스트랄 AI는 10월 6일 총 매개변수 1조 개 규모의 기본 다중모달 모델 '미스트랄 라지 4'를 공개 미리보기 형태로 내놓았다. 전문가 혼합(Mixture-of-Experts, 입력마다 일부 하위 신경망만 골라 계산하는 구조) 방식을 채택해 토큰당 활성 매개변수는 490억 개이다. API 가격은 입력 100만 토큰당 1.36달러, 출력 4.18달러이며, 모델 가중치는 이달 말 아키텍처·사후 학습 세부 정보와 함께 공개될 예정이다. 라이선스 조건은 아직 명시되지 않았다.
회사 발표에 따르면 미스트랄 라지 4는 코딩 평가 DeepSWE v1.1에서 61.7%, Terminal-Bench 4에서 28.3%, 에이전트 평가 AutomationBench에서 59.9%를 기록하였고, 사이버보안 평가 Cybench에서 93%를 얻었다. 사람이 평가한 코딩 비교에서는 5개 모델 가운데 2위(3.74점)로 앤트로픽 클로드 오퍼스 5(4.22점)에 뒤졌다. 보안 측면에서는 라케라의 B3 벤치마크 공격의 93.3%를 방어하였다고 밝혔다.
기술적 의미
첫째, 1조 매개변수급 모델의 가중치가 공개되면 기업·공공기관이 자체 인프라에서 프런티어 근접 모델을 미세조정·운영할 수 있게 되어, 유럽이 강조해 온 '디지털 주권' 전략의 핵심 기술 자산이 된다. 둘째, 활성 매개변수를 전체의 약 5%로 제한한 전문가 혼합 구조는 추론 비용을 낮추면서 지식 용량을 키우는 업계 표준 설계로 자리 잡았다. 셋째, 높은 사이버보안 평가 점수는 공개 가중치 모델의 이중 용도 위험 논의를 동반할 것이며, 국내 소버린 인공지능 사업에도 오픈 가중치 모델 활용 전략의 비교 기준을 제공한다.
해외 · 언어모델 구조·토큰화 · 독일 뮌헨머신러닝센터·미국 앨런AI연구소·워싱턴대 등 · 네이처 게재 · 2026년 10월 7일
기존 언어모델을 '바이트 단위'로 개조하는 법 — 네이처 '바이트화(byteification)' 연구, 사전학습 예산의 1% 미만(491억 토큰)으로 하위단어 모델을 바이트 모델로 전환…볼모 7B, 처음부터 학습한 바이트 모델 대비 STEM 과제 16.5%포인트 향상
벤야민 미닉스호퍼, 루크 제틀모이어, 노아 스미스, 에도아르도 폰티, 루카 솔다이니 등 연구진은 10월 7일 네이처에 기존 하위단어(서브워드) 토큰 기반 대형언어모델을 원시 UTF-8 바이트를 직접 처리하는 모델로 개조하는 '바이트화' 기법을 발표하였다. 일반적인 대형언어모델은 텍스트를 '토크나이저'가 정한 단어 조각 단위로 처리하는데, 이 방식은 철자·숫자·코드·생물학 서열처럼 개별 문자가 중요한 데이터에서 오류를 일으키는 원인으로 지적되어 왔다.
제안 구조는 바이트를 묶음(패치)으로 모아 원래의 대형 모델로 처리한 뒤 다시 바이트로 복원한다. 핵심은 사전 입력 단계에서 한 바이트 앞을 내다보는 경계 예측기와, 거대 본체를 고정한 채 새 바이트 처리 부품에 기존 모델의 행동을 증류하는 1단계, 전체를 함께 학습하는 2단계로 이루어진 학습 절차이다. 연구진은 올모 3 7B, 올모 2 1B, 큐원3 8B, 라마 3 8B를 바이트화하였으며 총 학습량은 491억 토큰(1단계 98억, 2단계 393억)으로 통상 사전학습 예산의 1% 미만이었다. 바이트화한 '볼모(Bolmo) 7B'는 처음부터 바이트 단위로 학습한 BLT 7B 대비 STEM 과제에서 절대값 16.5%포인트 높은 성능을 보였다.
기술적 의미
첫째, 토크나이저 의존성은 다국어(특히 한국어처럼 토큰 효율이 낮은 언어)와 문자 수준 추론의 구조적 약점이었는데, 막대한 재학습 없이 기존 모델을 바이트 모델로 전환하는 경로가 제시되었다. 둘째, 지시 학습(인스트럭션 튜닝) 결과를 '과제 산술'로 이식할 수 있다는 점은 기존 생태계의 자산을 그대로 재활용할 수 있음을 뜻한다. 셋째, 코드·유전체·화학 표기 등 과학 데이터 처리에 적합한 모델을 저비용으로 확보할 수 있어, 과학용 인공지능 연구의 기반 기술로 확장될 가능성이 크다.
해외 · 강화학습 인프라·분산 학습 · 미국 엔비디아 · arXiv 2610.08430 · 2026년 10월 6일
1조 매개변수 모델의 가중치 동기화를 87.5분에서 150초로 — 엔비디아 'NeMo-DCR', 매 단계 바뀌는 약 1%의 가중치만 비트 단위 정확도로 전송…30B~1T 모델 재적재 12~40배 가속
엔비디아 연구진(송린 장, 마리오 디 프란체스코 등)은 10월 6일 arXiv에 에이전트 강화학습에서 학습 클러스터와 추론(롤아웃) 클러스터 사이의 가중치 동기화를 획기적으로 줄이는 'NeMo-DCR(델타 압축 재적재)'를 공개하였다. 강화학습에서는 모델이 행동을 생성(롤아웃)하고 그 결과로 학습한 새 가중치를 다시 추론 서버에 보내는 과정을 반복하는데, 1조 매개변수 모델의 전체 체크포인트를 두 아마존웹서비스 리전 간에 전송하는 데만 87.5분이 걸린다.
연구진은 BF16 형식 가중치 가운데 매 단계 실제 저장값이 바뀌는 비율이 약 1%에 불과하다는 점에 착안해, 변경분만 XOR 마스크 또는 직접 덮어쓰기로 부호화하여 객체 저장소나 중계 트리로 전달하고, 추론 서버의 기본 로더를 통해 제자리에서 적용하도록 설계하였다. 수신 측의 결과는 전체 재적재와 비트 단위로 동일하다. 변경률 3~5% 조건에서 300억~1조 매개변수 모델의 재적재가 전체 체크포인트 전송 대비 12~40배 빨랐고, 1조 모델·3% 조건의 중계 트리 재적재는 87.5분에서 150초로 단축(약 35배)되었다. 코드는 NeMo RL 저장소에 공개되었다.
기술적 의미
첫째, 추론 모델과 에이전트 학습의 중심이 사전학습에서 대규모 강화학습으로 옮겨 가면서, 연산이 아니라 '가중치 이동'이 학습 처리량의 병목이 되는 문제가 드러났으며 이 연구는 그 병목을 정면으로 다룬다. 둘째, 학습과 추론 클러스터를 서로 다른 리전·데이터센터에 분산 배치할 수 있게 되어, 전력·부지 제약 아래에서 연산 자원을 지리적으로 분산하는 운영 전략을 뒷받침한다. 셋째, 비트 단위 동일성을 보장해 재현성과 디버깅 문제를 피했다는 점에서 실제 대규모 학습 파이프라인에 바로 적용 가능한 공학적 성과이다.