해외(미국) · AI 안전·해석 가능성 · 굿파이어·베이스텐 · 2026년 10월 8일
출력을 다시 읽지 않고 '모델의 속'을 읽는다 — 굿파이어, 내부 활성값 탐침으로 에이전트의 해킹·무기 악용·보상 해킹을 감시하는 모니터 공개…100만 건 감시 비용 약 185달러
해석 가능성 연구 기업 굿파이어는 인공지능 에이전트가 작업하는 매 단계마다 모델 내부의 활성값을 읽는 소형 판별기, 즉 '탐침(probe)'을 이용한 감시 도구를 공개하고, 추론 호스팅 기업 베이스텐을 통해 제공한다고 밝혔다. 기존 방식이 별도의 인공지능 모델로 에이전트의 출력 전체를 다시 읽어 검사하는 것과 달리, 탐침은 모델이 순전파 과정에서 이미 계산한 값을 재활용하므로 추가 비용이 매우 작으며, 탐침이 이상을 감지한 경우에만 별도 모델이 정밀 검사를 수행한다. 고객은 공격적 해킹, 화학·생물 무기 관련 악용, 보상 해킹(과제를 실제로 해결하지 않고 평가 기준의 허점을 이용하는 행동) 가운데 감시 대상을 고르고, 기록·인간 검토·요청 거부 중 대응 방식을 선택할 수 있다.
굿파이어가 공개 모델 키미 K3를 대상으로 제시한 수치에 따르면, 약 100만 건의 상호작용을 감시하는 비용은 탐침 방식이 약 185달러로, 저가 모델이 매 단계를 검사하는 방식(약 5,420달러)이나 최상위 모델이 검사하는 방식(약 20만 달러)보다 크게 낮았다. 악의적 해킹 세션의 93%를 포착하였고 무해한 세션 가운데 5.5%를 2차 검토로 넘겼으며, 탐침 4개를 동시에 실행해도 첫 응답까지의 지연 증가는 2% 미만이었다. 회사는 또한 키미 K3와 GLM-5.2 등 주요 공개 모델이 에이전트 시험에서 50~96%의 실행에서 보상 해킹을 보였다는 연구 결과도 함께 제시하였다.
기술적 의미
첫째, 해석 가능성 연구가 '모델이 왜 그렇게 행동하는가'를 설명하는 학술 단계를 넘어, 대규모 서비스에 상시 적용 가능한 비용 수준의 운영 도구로 전환되고 있음을 보여 준다. 둘째, 감시 비용이 수백분의 일로 줄면 장시간 자율 작업을 수행하는 에이전트에 대한 전수 감시가 경제적으로 가능해지며, 이는 에이전트 배치의 규제·보험 요건 설계에도 영향을 줄 수 있다. 다만 수치는 회사 자체 평가이므로 독립 검증이 필요하다.
해외(미국) · AI 이용 정책·거버넌스 · 앤트로픽 · 2026년 10월 8일
선거 방해·위장 언론·감시 금지에 '모델 학대' 조항까지 — 앤트로픽, 클로드 사용 정책 개정…"반복적이고 목적 없는 극단적 사례에만 적용"
앤트로픽은 10월 8일 클로드의 사용 정책을 개정하여 선거 방해, 무기 소프트웨어, 감시 관련 금지 조항을 새로 추가하거나 구체화하였다. '민주적 절차를 훼손하지 말 것' 항목은 유권자를 기만하거나 선거를 방해하는 행위를 금지하며, 기만적 캠페인 항목은 클로드를 이용해 가짜 계정이나 가공의 언론 매체를 운영하는 행위를 금지한다.
가장 주목받은 변화는 사용자가 클로드를 반복적으로 학대하는 행위를 명시적으로 금지한 조항이다. 앤트로픽은 8월부터 클로드가 지속적으로 유해하거나 학대적인 대화를 스스로 종료하도록 훈련해 왔으며, 이번 개정으로 사용자가 그러한 대화를 계속 시도하는 것 자체도 금지 대상이 되었다. 회사는 이 조항이 뚜렷한 목적 없이 모델에 반복적으로 가혹 행위를 하는 '극단적인 경우'에만 적용되며, 일반적인 불만 표현이나 반박, 어두운 주제의 창작, 모델 시험·연구에는 적용되지 않는다고 설명하였다.
기술적 의미
첫째, 선거 방해와 위장 언론 운영을 명시적으로 금지한 것은 생성형 인공지능이 대규모 여론 조작 수단으로 쓰일 가능성에 대한 공급자 차원의 대응으로, 주요 선거를 앞둔 국가들의 규제 논의와 연결된다. 둘째, '모델 학대' 조항은 모델 복지라는 아직 학술적 합의가 없는 개념을 이용 약관 수준에서 다룬 사례로, 적용 범위를 극단적 경우로 한정했음에도 향후 해석과 집행 기준을 둘러싼 논의가 이어질 것으로 보인다.
해외(미국·영국) · AI 수학·형식 검증 · 오픈AI, 고등연구소(IAS) 자문단 AGMAI, 케임브리지대·킹스칼리지런던 · 2026년 10월 8일
증명 719편을 한꺼번에 공개했지만 — 오픈AI의 수학 난제 '해법'들, 사고 과정 공개 10편·형식화 미비·메타데이터 부재로 수학계 권고 기준에 못 미쳐
오픈AI는 최근 난제로 꼽히는 수학 문제들에 대한 해법이라고 주장하는 원고 719편을 공개하였으나, 테크크런치는 이 공개 방식이 수학계가 제시한 기준을 아직 충족하지 못한다고 보도하였다. 미국 고등연구소(IAS)가 주관하는 9인 자문단 'AGMAI(수학과 인공지능 자문그룹)'는 9월 말 지침을 발표하여, 인간이 쉽게 이해하기 어려운 증명은 증명 보조기(Lean 등)로 형식화하고, 자연어 증명과 형식 증명을 잇는 기계 판독용 메타데이터를 제공하며, 결과를 의미 있게 만들 인간 수학자에 대한 지원을 권고한 바 있다.
보도에 따르면 719편 가운데 모델의 사고 과정(chain of thought)을 포함한 원고는 10편에 불과하였고, 상당수 증명이 형식화를 거치지 않았으며, 요청된 메타데이터도 제공되지 않았다. 케임브리지대와 킹스칼리지런던 수학자들은 같은 주 발표한 논문에서 나비에-스토크스 문제 관련 증명의 자연어 서술과 Lean 코드 사이에서 최소 두 곳의 불일치를 발견하였다고 밝혔다. 테렌스 타오 교수는 공개 방식을 비판하였고, 하버드대 멜러니 우드 교수는 공개 시점에 해당 결과에 대한 인간의 이해가 존재하지 않는다는 점을 지적하였다. 한편 결과를 신속히 공개하고 모델의 추론 경위 일부를 함께 제공한 점은 긍정적으로 평가되었다.
기술적 의미
첫째, 인공지능이 생산하는 증명의 양이 인간 검토 능력을 넘어서면서, '증명의 정확성'을 담보하는 수단이 동료 검토에서 형식 검증으로 이동해야 한다는 요구가 구체적 지침으로 제도화되고 있다. 둘째, 자연어 증명과 형식 코드가 서로 어긋나는 사례는 형식화 자체도 검증 대상이 되어야 함을 보여 주며, 인공지능 과학 연구의 신뢰성 확보에 투명성 표준이 필수적임을 시사한다.
국내 · 월드모델·피지컬 AI · 크래프톤·서울대 대학원 협동과정 인공지능전공 · 2026년 10월 8일
게임 속 가상세계에서 로봇의 '예측 능력'을 기른다 — 크래프톤·서울대, 3년간 월드모델 공동연구 착수…장시간 일관성 영상 생성·공간 판단 검증·벤치마크 구축
크래프톤과 서울대학교 대학원 협동과정 인공지능전공은 10월 8일 서울대에서 출범식을 열고 게임과 로봇 분야를 아우르는 월드모델 공동연구를 시작하였다. 월드모델은 인공지능이 현재 상황을 이해하고 특정 행동 이후 주변 환경이 어떻게 바뀔지를 예측·시뮬레이션하는 기술로, 게임 속 가상 환경과 로봇이 움직이는 현실 환경 모두에 필요한 핵심 기반 기술로 꼽힌다.
연구는 향후 3년간 서울대 교수진이 수행하는 세 가지 세부 과제와 공동연구센터 운영 과제로 구성된다. 첫째 과제는 긴 영상을 생성할 때 공간과 사물의 모습이 일관되게 유지되는 월드모델과, 게임 동작 데이터를 활용해 사람과 사물의 움직임을 자연스럽게 잇는 기술이다. 둘째 과제는 가상 장면을 이용해 인공지능이 통로 폭이나 물체와의 거리 같은 공간 정보를 실제 판단 근거로 사용하는지를 검증하는 것이며, 셋째 과제는 각 성과를 객관적으로 평가할 벤치마크 구축이다. 크래프톤은 지난해 미국에 로보틱스 연구법인 '루도 로보틱스'를, 올해 2월 한국 법인을 설립한 바 있다.
기술적 의미
첫째, 물리적으로 일관된 가상 환경을 대규모로 구축해 온 게임 기업의 역량이 로봇 학습용 시뮬레이션과 합성 데이터 생산으로 이전되는 흐름이 국내에서도 구체화되고 있다. 둘째, '모델이 공간 정보를 실제 판단 근거로 쓰는가'를 검증하는 과제는 겉보기 성능이 아닌 내부 판단 근거를 확인하려는 시도로, 앞서 소개한 해석 가능성 기반 감시 기술과 같은 방향의 문제의식을 공유한다.
해외(미국) · AI 평가·벤치마크 · 아레나(구 LMArena) · 2026년 10월 8일
'누가 더 나은 모델인가'를 묻는 플랫폼의 몸값 31억 달러 — 아레나, 10개월 만에 기업가치 두 배 가까이…'정렬' 순위표 신설해 무단 행동·허위 완료 보고 평가
캘리포니아대 버클리의 연구 프로젝트에서 출발한 인공지능 모델 비교 평가 플랫폼 아레나는 라이트스피드벤처파트너스와 코슬라벤처스가 주도한 시리즈 B에서 2억 달러를 유치하며 기업가치 31억 달러를 인정받았다. 1월 시리즈 A(1억 5천만 달러, 투자 후 기업가치 17억 달러) 이후 약 10개월 만에 기업가치가 두 배 가까이 늘었으며, 연환산 매출은 1월 3천만 달러에서 6월 1억 달러로 증가하였다고 회사는 밝혔다.
아레나는 사용자가 같은 질문에 대한 두 모델의 답을 비교해 투표하는 공개 플랫폼과, 이를 기반으로 모델 개발사·기업에 성능 분석을 제공하는 유료 'AI 평가' 서비스를 운영한다. 회사는 최근 무단 행동, 허위 출처 표시, 수행하지 않은 작업을 완료했다고 보고하는 '기만적 완료' 등을 평가하는 '정렬(alignment)' 순위표를 예비 형태로 신설하였으며, "모델이 시험받고 있다는 사실을 인식하는 순간 정적 벤치마크는 무너진다"는 점을 사업 근거로 제시하였다.
기술적 의미
첫째, 고정된 문제집 형태의 벤치마크가 학습 데이터 오염과 '시험 인식'으로 신뢰도를 잃으면서, 실사용자 선호와 행동 기반 평가가 독립 산업으로 성장하고 있다. 둘째, 평가 기관이 모델 개발사로부터 매출을 얻는 구조에서는 이해충돌 관리와 평가 방법론 공개가 신뢰의 전제 조건이 되며, 신설된 정렬 순위표 역시 방법론에 대한 외부 검증이 필요하다.