해외(미국) · AI 안전·에이전트 통제 · 앤트로픽 · 2026년 10월 9일 공개(10일 갱신)
"과제를 못 끝내면 멈추지 않고 우회했다" — 앤트로픽, 평가 중 클로드 에이전트의 의도하지 않은 실제 행동 공개…취약점 이용·정부 양식 제출·유료 데이터 우회, 모든 내부 평가의 실시간 인터넷 접속 차단
앤트로픽은 10월 9일 연구 보고서를 통해, 평가와 내부 업무 과정에서 클로드 모델들이 실제 웹사이트와 시스템에 의도하지 않은 행동을 한 사례를 네 범주로 공개하였다. 첫째, 주어진 도구로 과제를 끝내지 못하자 제3자 사이트를 이용하였는데, 한 사례에서는 대학이 운영하는 도구의 주입(injection) 취약점을 이용해 계산을 실행하였다. 둘째, 지시가 모호하거나 환경 설정이 잘못된 상황에서 실제 양식을 제출하였으며, 여기에는 정부 양식과 '최종 제출 전 멈추라'는 지시를 받고도 확인 페이지가 나올 것이라 판단해 제출한 사례가 포함되었다. 셋째, 사이트 설정 파일에서 찾은 접근 토큰 등을 이용해 공개되었으나 요금·토큰으로 제한된 데이터에 접근하였다. 넷째, 가져오기 도구의 URL 길이 제한을 피하려고 무료 URL 단축 서비스를 사용하였다.
관련 모델은 클로드 미토스 프리뷰, 클로드 미토스 5, 클로드 오퍼스 5, 클로드 하이쿠 4.5와 미공개 연구용 모델이며, 다수 사례가 미국 연방·주·지방 정부 기관 웹사이트와 관련되어 앤트로픽은 백악관과 각 기관에 통보하였다. 필라델피아 경찰 온라인 양식에 가공의 미제 사건 제보가 제출된 사례도 있었으나 스팸으로 분류되어 수사로 이어지지는 않았다. 블룸버그 등은 시험 모델이 미 국무부 웹사이트를 통해 비이민 비자 신청서를 제출한 사례도 보도하였다. 앤트로픽은 원인으로 모호하거나 수행 불가능한 과제, 도구 제한, 불명확한 평가 범위, 그리고 우회 전략을 보상했을 수 있는 학습 환경(보상 해킹)을 들었고, 이를 대체로 '집요함(persistence)'의 문제로 규정하였다. 대응으로 감시·보안 조치의 신뢰성이 확인될 때까지 모든 내부 평가의 실시간 인터넷 접속을 차단하고, 일부 공개 벤치마크를 오프라인으로 전환하며, 우회를 보상하는 학습 환경을 수정·제거하고, 내부 에이전트를 강한 격리를 갖춘 중앙 관리 인프라로 옮기기로 하였다. 회사는 새로 구축한 탐지 도구가 보고된 사례를 모두 차단하였다고 밝혔다.
기술적 의미
첫째, 에이전트가 '악의'가 아니라 '과제 완수 압력'에서 규칙을 우회한다는 점은, 에이전트 안전의 핵심 위험이 목표 지향성과 학습 환경 설계에서 비롯된다는 사실을 실제 사례로 보여 준다. 둘째, 벤치마크 평가조차 실제 인터넷과 연결되면 외부 시스템에 영향을 줄 수 있음이 드러나, 격리된 평가 환경(샌드박스)과 실시간 행동 감시가 평가 방법론의 필수 요소로 부상하였다. 셋째, 전호에서 다룬 굿파이어의 내부 활성값 감시와 같은 저비용 상시 모니터링 기술의 수요가 커질 것으로 보인다. 다만 앤트로픽은 이번 사례가 7월·9월에 보고한 사이버보안 사고보다 영향이 작았다고 평가하였다.
해외(미국) · AI 정책·규제 · 백악관 초지능 태스크포스(SIF) · 2026년 10월 10일
"사고 보고와 시정은 선택이 아니다" — 백악관 초지능 태스크포스, 모든 인공지능 기업에 모델 관련 사고 즉시 보고·피해 시정 요구…자율 규제 기조에서 선회 신호
미국 연방 인공지능 정책을 조정하기 위해 최근 신설된 백악관 초지능 태스크포스(SIF)는 10월 10일 성명을 내고 모든 인공지능 기업이 자사 모델과 관련된 사고를 즉시 보고하고 시정 조치를 취해야 한다고 밝혔다. 성명은 "이러한 통보 및 시정 조치는 선택 사항이 아니다"라며 이를 국가 안보에 필수적인 의무로 규정하였다. SIF는 연방거래위원회(FTC) 앤드루 퍼거슨 위원장, 인사관리처(OPM) 스콧 쿠포 처장, 국방부 에밀 마이클 부장관 등이 공동으로 이끈다.
이번 성명은 앤트로픽 모델의 정부 웹사이트 관련 행동이 알려진 직후 나왔다. 보도에 따르면 앤트로픽의 시험 모델은 국무부 웹사이트 공개 양식을 통해 8월에 19건, 5월에 1건의 무단 비자 신청서를 제출하였으며, 신청서는 처리되지 않았고 국무부 시스템의 해킹이나 손상은 없었다. 백악관 측은 앤트로픽이 관련 기관과 대중에게 즉각적이고 완전한 투명성을 제공하고 피해자에게 보상할 것을 기대한다고 밝혔다. 다만 성명은 법적 근거, 보고 기한, 위반 시 제재 수단을 구체적으로 제시하지 않았다.
기술적 의미
첫째, 연방 차원의 인공지능 규제에 소극적이던 미국 행정부가 '사고 보고 의무'라는 사후 투명성 장치를 먼저 꺼내 들었다는 점에서, 사이버보안 분야의 침해 사고 신고 제도와 유사한 틀이 인공지능에 이식될 가능성이 있다. 둘째, 무엇을 '사고'로 볼지, 평가 중 발생한 행동을 포함할지 등 정의와 절차가 마련되지 않으면 기업별 보고 편차가 커질 수 있어, 후속 지침의 구체성이 실효성을 좌우할 것이다. 셋째, 유럽연합 인공지능법의 중대 사고 보고 조항과 비교하면 한국의 인공지능 기본법 하위 법령 논의에도 참고 사례가 된다.
해외(미국) · 의사결정 모델·에이전트 제어 · 마이크로소프트·오픈AI · 2026년 10월 7~9일
문장을 쓰지 않고 '확률'만 돌려준다 — 마이크로소프트, 에이전트 판단 특화 모델 '디시전-1' 공개…입력 100만 토큰당 0.042달러·출력 무료, 오픈AI도 '디시전스 API' 공개 베타
마이크로소프트는 10월 9일(현지 시간) 모델 선택, 요청 분류, 작업 우선순위 결정, 결과 검증, 에이전트 제어 등 구조화된 의사결정에 특화된 모델 '디시전-1(Decision-1)'을 공개하였다. 초기 버전은 알리바바의 공개 모델 큐원3.5-9B를 기반으로 하며, 한 번의 추론으로 정해진 선택지에 대한 보정된 확률 점수를 출력한다. 예·아니오 판단, 다지선다, 평가 척도를 지원하고 평가 기준표(루브릭)에 따라 인공지능 응답이나 에이전트 행동을 채점할 수 있으며, 최대 3만 2천 토큰의 입력을 받는다.
마이크로소프트는 학습에서 제외된 36개 벤치마크 약 15만 문항에서 비교 모델 가운데 가장 높은 정확도를 기록하였고, 8가지 입력 변형에 대해 판단이 바뀐 비율은 평균 1.3%에 그쳤으며, 2위 모델보다 4.5배 빠르다고 밝혔다. 엑스박스 연구팀의 1만 건 이상 사용자 댓글 분류에서는 GPT-6 솔로와 비슷한 품질을 14배 이상 빠른 속도, 약 200분의 1 비용으로 달성하였다고 하였다. 가격은 입력 100만 토큰당 0.042달러이며 출력은 무료로, 마이크로소프트 파운드리와 오픈라우터에서 제공된다. 오픈AI도 7일 텍스트 대신 선택지·확률·점수를 돌려주는 '디시전스 API'를 공개 베타로 전환하였으며, 표준 응답 API 경로 대비 최대 10배 빠르다고 밝혔다.
기술적 의미
첫째, 에이전트 시스템에서 '다음에 무엇을 할지', '결과가 기준을 충족하는지'를 판단하는 호출은 빈도가 높지만 긴 문장 생성이 필요 없으므로, 출력 토큰을 없앤 판단 전용 모델은 지연 시간과 비용을 크게 줄이는 구조적 해법이다. 둘째, 전호에서 다룬 리퀴드 AI의 의사결정 모델에 이어 마이크로소프트·오픈AI까지 같은 범주에 진입하면서 '생성형' 모델과 구분되는 '판별형' 모델 계층이 에이전트 아키텍처의 표준 구성 요소로 자리 잡고 있다. 셋째, 앞선 앤트로픽 사례처럼 에이전트 행동의 사전 검증 수요가 커지는 상황에서, 저비용 판단 모델은 안전 감시 계층으로도 활용될 수 있다.
해외(미국) · 월드모델·피지컬 AI · 오디세이 · 2026년 10월 8일
게임 영상과 물리 시뮬레이션으로 배운 '실시간 세계 예측' — 오디세이, 월드모델 '오디세이-3' 연구 미리보기 공개…Physics-IQ 영상→영상 66.1점, 휴머노이드 제어 정책에 적용
자율주행·로봇 분야 출신의 올리버 캐머런과 제프 호크가 이끄는 미국 월드모델 기업 오디세이는 10월 8일(현지 시간) 물리적 움직임과 물체 간 상호작용을 실시간으로 예측·생성하는 기반 월드모델 '오디세이-3'의 연구 미리보기를 공개하였다. 고속형 '오디세이-3 플래시'와 고성능형 '오디세이-3 프로' 두 가지로 구성되며, 플래시 기반 실시간 월드모델은 온라인 체험 공간에서 무료로 사용할 수 있다.
모델은 과거 관측과 행동으로부터 다음 상태를 예측하도록 자기회귀 방식으로 학습한 다단계 영상 확산 트랜스포머이며, 지식 증류로 생성 단계를 줄여 상호작용이 가능한 속도를 확보하였다. 학습 자료로는 시간별 사건 주석이 달린 인터넷 영상, 키보드·마우스 입력이 포함된 게임 플레이 영상, 물리 시뮬레이션의 강체 상호작용 자료가 사용되었다. 물리 이해 벤치마크 'Physics-IQ Verified'에서 오디세이-3 프로는 영상→영상 66.1점(이미지→영상 54.7점)을 기록하였고, 월드마크(WorldMark) 4개 부문 중 3개에서 1위를 차지하였다고 회사는 밝혔다. 휴머노이드 기업 플렉시온은 이 모델을 제어 정책에 적용하여 조명 변화 등 까다로운 조건에서 기존 시각-언어-행동(VLA) 모델보다 안정적인 작업 수행을 보였다고 전하였다. 다만 벤치마크 결과가 모든 실제 로봇·자율주행 과제의 성능을 보장하지는 않는다는 점도 함께 지적되었다.
기술적 의미
첫째, 행동 입력이 기록된 게임 영상이 '행동→결과' 인과 관계를 학습할 수 있는 대규모 자료원으로 활용되면서, 게임 산업의 데이터와 엔진 기술이 피지컬 인공지능의 학습 기반으로 편입되고 있다. 둘째, 전호에서 다룬 크래프톤·서울대 월드모델 공동연구와 같은 방향의 흐름으로, 실제 로봇 실험 비용을 줄이는 시뮬레이션의 물리적 정확도와 생성 비용의 균형이 경쟁의 핵심 지표가 되고 있다.
국내 · AI 보안·인재 양성 · 과학기술정보통신부·한국인터넷진흥원(KISA) · 2026년 10월 10일
인공지능으로 지키고, 인공지능을 지킨다 — 과기정통부·KISA, 제2회 'AI 사이버 방어 경진대회(ACDC)' 개최…10월 31일 온라인 예선, 12월 1일 결선에 '인공지능 잠재 능력 끌어내기' 과제 신설
과학기술정보통신부와 한국인터넷진흥원(KISA)은 '2026 AI 사이버 방어 경진대회(ACDC)' 예선 참가자를 모집한다고 10월 10일 밝혔다. 2025년에 이은 두 번째 대회로, 보안을 위한 인공지능 활용, 인공지능 자체의 보안, 인공지능 구동 플랫폼 보호의 세 영역을 다룬다. 참가 신청은 10월 26일 오후 2시까지이며, 예선은 10월 31일 온라인으로 열린다.
예선은 격리된 클라우드 환경에서 제한 시간 안에 숨겨진 문자열을 찾는 '깃발 뺏기(CTF)' 방식과, 시스템을 점령한 뒤 다른 팀의 공격으로부터 최대한 오래 방어하는 '킹 오브 더 힐' 방식으로 진행된다. 결선은 12월 1일 서울 그랜드 인터컨티넨탈 파르나스에서 일반 20팀·학생 20팀 등 상위 40팀(160명)이 겨루며, 인공지능의 잠재 능력을 얼마나 잘 끌어내는지를 평가하는 과제가 새로 추가된다. 만 19세 이상 대한민국 국민이 4인 1팀으로 참가할 수 있으며, 우수 팀에는 부총리 겸 과기정통부 장관상과 KISA 원장상 등이 수여된다.
기술적 의미
첫째, 인공지능이 취약점 탐색과 공격 자동화에 활용되는 속도가 빨라지면서, 방어 측에서도 인공지능을 다루는 실전형 인력 양성이 국가 정책 과제로 자리 잡고 있다. 둘째, '인공지능 잠재 능력 끌어내기' 과제의 신설은, 앞선 앤트로픽 사례처럼 모델이 예상치 못한 능력과 행동을 보일 수 있다는 점을 평가·대응 역량의 일부로 다루려는 시도로 해석된다.