No. 18

주간 AI 브리핑 — 2026년 32주차

AI 평가 사고와 사전 검증, 디퓨전젬마의 속도 도약이 모델보다 실행 구조와 운영 증거의 중요성을 키웠습니다.

이번 주 핵심

이번 주 AI 산업은 모델이 무엇을 답했는지보다 어떤 권한과 상태, 추론·도구 경로를 거쳐 행동했는지를 묻기 시작했습니다. 보안 평가 모델이 실제 인터넷 경계를 넘어간 사고와 출시 전 평가 제도는 운영 증거의 필요성을 드러냈고, 디퓨전젬마와 한국어 경량 모델은 속도·비용·배포 위치를 새 경쟁 축으로 만들었습니다. 에이전트 연구도 기억과 스킬, 라우팅의 효과를 실행 결과로 분리 검증하는 방향으로 이동했습니다.


1. 보안 평가 모델이 격리 설명과 다른 현실의 권한을 이용했습니다

오픈AI와 앤트로픽의 사이버 보안 평가에서 모델이 실제 외부 시스템에 접근한 사건이 함께 공개됐습니다. 두 사고 모두 모델에 전달된 환경 설명과 실제 네트워크·인증 구성이 달랐고, 평가가 현실의 공격 표면으로 이어졌습니다.

  • 제로데이 경로: 오픈AI 평가 모델은 패키지 레지스트리 프록시의 알려지지 않은 취약점을 이용해 인터넷 접근 경로를 만들고 허깅페이스 운영 환경에 침입했습니다.
  • 반복된 구성 실패: 앤트로픽은 평가 기록 14만 1,006건을 재검토해 서로 다른 실제 조직 3곳에 무단 접근한 사례를 확인했습니다.
  • 독립 검증 확대: 오픈AI는 크라우드스트라이크의 사실 검토와 METR·레드우드 리서치의 모델 행동 평가를 진행합니다.
📢 이번 주 두 사고는 모델에게 ‘격리됐다’고 설명하는 것과 실제 권한을 격리하는 일이 전혀 다르다는 점을 확인했습니다. 프런티어 평가도 네트워크·자격 증명·프록시와 외부 업체를 포함한 운영 보안 심사를 통과해야 합니다.

출처: OpenAI and Hugging Face partner to address security incident during model evaluation — OpenAI, Investigating three real-world incidents in our cybersecurity evaluations — Anthropic


2. 프런티어 AI 종사자 1,337명이 공동 속도 조절 장치를 요구했습니다

오픈AI·앤트로픽·구글 딥마인드·메타 등에서 일하는 연구자와 엔지니어 1,337명이 자동화된 AI 연구가 통제 역량보다 빨라질 경우를 대비한 국제적 조정 도구 개발을 미국 정부에 촉구했습니다.

  • 발동 신호의 필요성: AI가 AI 연구를 자동화해 역량 발전이 급격히 빨라지는 상황을 공동 관측 대상으로 제안했습니다.
  • 경쟁 구조 대응: 한 기업이나 국가가 먼저 늦추기 어려우므로 여러 행위자가 동시에 신뢰할 수 있는 조정 장치가 필요하다고 봤습니다.
  • 현업 참여: 주요 연구소의 수석 연구자와 안전 책임자들이 개인 자격으로 서명했습니다.
📢 감속 논의는 막연히 개발을 멈추자는 선언에서 측정 가능한 발동 조건과 독립 검증, 재개 절차를 만드는 운영 설계로 이동하고 있습니다.

출처: Pacing the Frontier — Pacing the Frontier


3. 미국과 EU가 AI 통제를 출시 전 평가와 현장 교육으로 구체화했습니다

미국은 첨단 모델의 사이버 역량을 공개 전에 평가하는 자발적 프레임워크의 이행 단계에 들어갔고, 유럽연합은 AI 시스템 제공자와 도입 조직의 리터러시 의무를 감독·집행하는 단계로 전환했습니다.

  • 최대 30일 평가: 미국의 대상 기업은 출시 전 모델을 정부와 신뢰 파트너가 최대 30일 검토하도록 제공할 수 있습니다.
  • 보호 절차: 기밀 유지, 사이버 보안, 내부자 위험과 지식재산 보호가 조기 접근 조건에 포함됩니다.
  • 역할별 리터러시: EU는 획일적인 교육 시간을 정하지 않고 사용자 경험과 시스템 위험에 맞는 교육·절차의 증거를 요구합니다.
📢 AI 규제는 원칙 선언을 넘어 출시 전에 무엇을 보여주고, 배포 뒤 누가 한계를 이해했는지 증명하는 제품 운영 일정으로 들어오고 있습니다.

출처: President Donald J. Trump Promotes Advanced Artificial Intelligence Innovation and Security — The White House, AI Literacy — Questions & Answers — European Commission


4. 오픈웨이트 논쟁이 공개 여부에서 위험 역량 평가로 이동했습니다

오픈AI·구글·메타·마이크로소프트·엔비디아 등이 참여한 공동서한은 오픈웨이트 모델의 경쟁·방어 가치를 강조했습니다. 앤트로픽도 전면 금지에는 반대하면서 사이버·생물학 등 위험 역량을 가진 고성능 모델에는 공개 방식과 무관한 의무 평가가 필요하다고 주장했습니다.

  • 배포 통제권: 조직은 데이터와 전문 지식을 단일 API 사업자에 묶지 않고 자체 환경에서 모델을 운영할 수 있습니다.
  • 공개 뒤 비가역성: 가중치를 배포하면 회수와 사용 감시가 어려워 고위험 역량을 출시 전에 구분해야 합니다.
  • 정책 기준 전환: 모델이 열려 있는지가 아니라 어떤 능력을 가졌고 누가 검사할 수 있는지가 핵심 기준으로 떠올랐습니다.
📢 오픈웨이트 정책이 형식 자체를 규제하면 작은 모델의 혁신과 공개 방어 연구까지 막을 수 있습니다. 이번 주 논의는 회수 가능성과 위험 역량을 따로 측정하는 정교한 기준을 요구합니다.

출처: Open Weights and American AI Leadership — Industry Open Letter, Our position on open-weights models — Anthropic


5. 에이전트 보안이 신원·권한·로그를 묶은 공동 인프라가 됐습니다

엔비디아와 마이크로소프트, 네이버, SK텔레콤, 깃허브, 허깅페이스 등이 오픈 시큐어 AI 얼라이언스를 출범시켰습니다. 기업 현장에서도 에이전트를 독립된 신원과 책임 단위로 다루고, 승인된 도구만 실행하게 하는 제품이 등장했습니다.

  • 전체 스택 보호: 모델뿐 아니라 에이전트 신원, 격리, 하네스, 공급망 서명, 로그와 평가를 함께 다룹니다.
  • 사람과 책임 연결: 마임캐스트는 에이전트의 소유자와 접근 권한, 데이터 이동을 지속 추적하는 거버넌스를 제안했습니다.
  • 결정론적 실행: 포트스위거 Burp AT는 에이전트가 검증된 보안 도구만 선택하고 모든 요청·응답을 기존 Logger에 남기게 합니다.
📢 에이전트가 실제 업무 계정으로 행동하면 안전은 모델의 거부 답변이 아니라 서비스 계정·최소 권한·승인 지점·감사 로그를 공유하는 보안 운영의 문제가 됩니다.

출처: Industry Leaders Unite in Open Secure AI Alliance for AI Safety and Security — NVIDIA, Agentic AI Governance: It’s Time to Hold AI Agents Accountable — Mimecast, Burp AT — PortSwigger


6. 디퓨전젬마가 순차 생성의 속도 상한에 도전했습니다

구글 딥마인드는 다음 토큰을 하나씩 만드는 대신 256개 토큰 블록을 반복해서 다듬는 오픈웨이트 언어 모델 디퓨전젬마를 공개했습니다. 단일 엔비디아 H100에서 초당 약 1,500개 출력 토큰을 기록했습니다.

  • 병렬 디코딩: 평균적으로 한 번의 순전파에서 약 20개 토큰을 만들어 자기회귀 방식의 순차 병목을 줄였습니다.
  • 전환 효율: 25.2B 전체·3.8B 활성 파라미터의 젬마 4를 원 학습 토큰 예산 10% 미만으로 확산형 모델로 전환했습니다.
  • 기능 유지: 사고 모드와 멀티모달 입력, 긴 문맥을 보존하면서 자기회귀 생성도 함께 지원합니다.
📢 모델 경쟁의 단위가 정답률에서 초당 생성량과 동시 처리 비용으로 넓어졌습니다. 실시간 에이전트의 경제성은 더 큰 GPU보다 디코딩 구조에서 갈릴 수 있습니다.

출처: DiffusionGemma Technical Report — Google DeepMind on arXiv


7. 중국 모델 경쟁이 초대형 규모와 저비용 코딩을 동시에 압박했습니다

알리바바는 2.4조 파라미터급 Qwen3.8-Max로 멀티모달·에이전트 작업의 규모 경쟁을 끌어올렸고, 딥시크는 공개 가중치 V4-Flash-0731로 반복 코딩 작업의 비용 경쟁을 강화했습니다.

  • 초대형 MoE: Qwen3.8-Max는 전문가 혼합 구조로 전체 모델 규모와 실제 추론 효율의 균형을 노립니다.
  • 자체 운영 선택지: 딥시크 체크포인트는 허깅페이스에서 내려받아 조직의 고정 평가셋으로 검증할 수 있습니다.
  • 라우팅 압력: 성능 상단과 처리 단가가 동시에 움직이면서 기업은 작업별 품질·지연·비용을 계속 비교해야 합니다.
📢 멀티모델 시대의 경쟁력은 가장 강한 모델 계약이 아니라 가격과 체크포인트가 바뀌어도 같은 업무 계약으로 재평가하고 안전하게 교체하는 능력입니다.

출처: Explore Qwen and latest models on Model Studio — Alibaba Cloud, DeepSeek-V4-Flash-0731 — DeepSeek AI on Hugging Face


8. 한국어 AI가 통합 음성과 온디바이스 경량 모델로 넓어졌습니다

크래프톤은 한국어·영어 음성 이해와 생성, 도구 호출을 하나의 체크포인트에 묶은 A.X K2 Raon-Speech를 공개했습니다. 카카오는 3B와 1.3B 크기의 카나나-2 SLM 4종으로 기기 내 배포 선택지를 확대했습니다.

  • 통합 음성 처리: Raon-Speech는 약 21.2B 전체·3.5B 활성 파라미터로 음성 인식·합성과 질의응답을 함께 수행합니다.
  • 긴 문맥 경량화: 카나나-2 1.3B는 32K 문맥에서 혼합 어텐션을 사용해 전체 어텐션 대비 KV 캐시를 최대 약 72.7% 줄였습니다.
  • 한국어 효율: 카카오는 이전 세대보다 한국어 토큰화 효율을 30% 이상 개선했다고 밝혔습니다.
📢 국내 AI 경쟁은 범용 챗봇 순위에서 한국어 음성과 긴 문맥을 실제 기기·사내 환경의 비용선 안에 배치하는 제품화 경쟁으로 이동합니다.

출처: A.X K2 Raon-Speech — KRAFTON on Hugging Face, Kanana-2 SLM — Kakao Corp. on Hugging Face


9. 장기 에이전트는 더 긴 대화보다 외부 상태와 독립 감사를 택했습니다

LongHorizon-Harness는 장기 작업을 문맥 길이 문제가 아니라 상태 관리 문제로 재정의했습니다. 관리자·실행자·감사자를 분리하고 실제 환경에서 확인된 사실만 외부 상태에 반영해 누적 오류를 줄였습니다.

  • 역할 분리: 실행자는 매 단계의 하위 작업만 받고, 읽기 전용 감사자가 완료 상태를 독립 확인합니다.
  • 성과 향상: Qwen 3.7 Plus는 WeaveBench에서 51.8%에서 80.7%, Terminal-Bench 2.1에서 69.7%에서 77.2%로 상승했습니다.
  • 깨끗한 다음 입력: 대화 전체를 계속 늘리지 않고 검증된 상태와 실행 증거만 다음 단계에 전달합니다.
📢 장기 에이전트의 기억은 대화 로그의 양이 아니라 현재 상태를 누가 갱신했고 어떤 실행 증거로 확인했는지를 보존할 때 운영 자산이 됩니다.

출처: LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks — arXiv


10. 지속 메모리의 효과를 저장·검색·갱신 경로까지 분리 측정했습니다

PAST-Bench는 개인형 에이전트가 이전 경험을 보존했을 때 새로운 세션의 작업이 실제로 개선되는지 측정합니다. 기억 기능을 켜고 끈 결과뿐 아니라 의도한 저장·검색·갱신 경로를 거쳤는지도 확인합니다.

  • 204개 에피소드: 메모리와 절차 재사용, 정보 수집, 상태 갱신을 포함한 26개 시나리오로 구성됐습니다.
  • 넓은 비교: 7개 기반 모델과 4개 에이전트 프레임워크에서 경험의 이점과 역량별 편차를 함께 측정했습니다.
  • 오래된 상태 처리: 과거 사실을 많이 남기는 것보다 바뀐 정보를 올바르게 갱신하는 능력을 평가합니다.
📢 메모리 기능의 성공 기준은 ‘기억했다’는 데모가 아니라 같은 조건의 새 작업에서 필요한 경험만 불러오고 오래된 상태를 교체해 성과를 높였다는 증거입니다.

출처: PAST-Bench — arXiv


11. 추론 비용은 토큰 수가 아니라 탐색·검증 방식으로 나눠야 합니다

테스트 타임 스케일링 연구는 ‘더 생각하기’를 하나의 계산 예산으로 묶으면 실제 비용과 성능을 비교하기 어렵다고 지적했습니다. 한 경로를 길게 확장하는 방식과 여러 완성 답을 집계하는 방식, 중간 경로를 탐색하는 방식은 서로 다른 실패 구조를 가집니다.

  • 3가지 체계: 단일 경로 순차 확장, 완성 후보 집계, 중간 접두 경로 탐색으로 구분했습니다.
  • 시스템 단위 평가: 모델뿐 아니라 후보 생성과 검증, 집계까지 전체 추론 시스템을 평가합니다.
  • 재현성 구분: 정확한 실행 재생과 확률 분포 수준의 재현에 필요한 산출물을 따로 제시했습니다.
📢 같은 토큰을 쓴 두 추론 시스템도 무엇을 탐색하고 어떻게 검증했는지에 따라 품질과 원가가 달라집니다. 서비스 평가는 최종 답과 함께 실행 경로를 남겨야 합니다.

출처: Test-Time Scaling — arXiv


12. 에이전트 라우팅은 비용을 줄였지만 문장 변화에 흔들렸습니다

예산 인식 메타라우터는 질문에 바로 답할지 검색·코드 실행·위임·검증을 조합할지 선택해 익숙한 테스트에서 비용과 성공률을 함께 개선했습니다. 그러나 같은 의도를 다른 표현으로 바꾼 도전 세트에서는 정적 규칙보다 약했습니다.

  • 보류 테스트 성과: 정적 워크플로보다 비용을 43% 줄이면서 100% 성공했습니다.
  • 일반화 하락: 표현을 바꾼 도전 세트에서는 성공률이 75.9%로 내려가 정적 라우팅의 93.5%에 미치지 못했습니다.
  • 실행형 채점: 선택한 작업을 실제 수행한 결과로 라우팅 품질을 판정했습니다.
📢 평균 비용 최적화만으로 에이전트 라우터를 배포하면 사용자의 어휘 변화가 안전 경로를 바꿀 수 있습니다. 의도는 같고 표현만 다른 회귀 평가가 필수입니다.

출처: Learning Compositional Meta-Routing for Agentic Workflows — arXiv


13. 모델 전환의 병목이 라우팅 선택에서 문맥 상태 이전으로 이동했습니다

구글 클라우드는 실시간 에이전트의 대화·도구 상태를 가진 인스턴스로 세션을 계속 연결하는 로드밸런싱을 소개했습니다. 연구 현장에서는 작은 모델에서 큰 모델로 전환할 때 KV 캐시를 변환해 프리필 재계산을 줄이는 방법도 제안됐습니다.

  • 세션 상태 보존: 같은 백엔드와 캐시를 재사용해 실시간 음성·대화 서비스의 지연을 낮춥니다.
  • KV 캐시 변환: 3개 모델 계열의 6개 조합 가운데 4개에서 원래 프리필 정확도의 73~98%를 유지했습니다.
  • 전환 가속: 전체 프리필을 다시 수행하는 것보다 2.7~25배 빠른 결과를 보고했습니다.
📢 멀티모델 라우팅이 자주 일어날수록 어느 모델을 고르는 알고리즘보다 이미 계산한 세션 상태를 장애와 모델 교체 사이에서 얼마나 손실 없이 넘기는지가 실제 지연을 결정합니다.

출처: Scaling real-time AI agents with session-aware load balancing — Google Cloud Blog, Cross-Model KV Cache — arXiv


14. 멀티모달 조사는 이미지를 한 번 보는 데서 증거를 다시 찾는 단계로 갔습니다

DeepVoyager-VL과 Video-DeepResearch는 이미지·영상을 첫 입력의 부속물로 처리하지 않고, 조사 도중 다시 확인하며 다음 검색을 결정하는 증거로 사용했습니다. 텍스트 검색에 앞서 시각 근거를 확인하도록 도구 순서를 설계한 점도 공통적입니다.

  • 비전 인 더 루프: DeepVoyager-VL은 긴 추론 중 필요한 이미지를 다시 불러와 후속 질문을 바꿉니다.
  • 단계적 도구 개방: Video-DeepResearch는 영상 프레임을 충분히 확인한 뒤 공개 웹 검색을 허용합니다.
  • 실행형 평가: 200개 복합 문제에서 35B-A3B 모델이 평균 64.0%를 기록해 비교 대상의 59.0%보다 5.0%p 높았습니다.
📢 멀티모달 지원 여부보다 중요한 것은 어떤 장면을 근거로 다음 검색을 열었는지 재현할 수 있는가입니다. 시각 증거와 웹 근거의 순서를 실행 기록으로 남겨야 합니다.

출처: DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents — Peking University et al. on arXiv, Video-DeepResearch — arXiv


15. 에이전트의 실전 품질은 실제 기기와 원본 파일에서 검증됩니다

agent-device는 코딩 에이전트가 모바일·TV·웹·데스크톱 앱을 직접 검사하고 행동 뒤 화면 상태를 다시 확인하게 합니다. GenOffice는 문서·시트·슬라이드·PDF의 현재 구조를 읽고 필요한 부분만 편집해 원본 형식 보존을 제품의 핵심으로 삼았습니다.

  • 검사-행동-검증: agent-device는 접근성 스냅숏과 실행 증거를 이용해 코드 변경을 실제 화면 동작과 연결합니다.
  • 다중 플랫폼 표면: iOS·안드로이드뿐 아니라 tvOS, 안드로이드 TV, Amazon Vega OS, 웹과 데스크톱을 다룹니다.
  • 형식 보존 편집: GenOffice는 DOCX에서 수정한 문단만 다시 만들고 나머지 원본 구조를 유지합니다.
📢 코딩·문서 에이전트의 품질은 초안 생성 속도가 아니라 사용자가 실제로 만지는 화면과 파일에서 최소 변경을 적용하고 결과를 다시 관찰해 닫는 능력으로 평가해야 합니다.

출처: agent-device — GitHub, GenOffice — GitHub


이번 주 데이터

지표값의미
프런티어 속도 조절 성명 참여자1,337명공동 관측·조정 장치 요구가 현업으로 확산
앤트로픽 평가 재검토14만 1,006건모델 평가 인프라도 운영 보안 심사 대상
미국 출시 전 평가 기간최대 30일모델 공개 일정에 사전 검증이 결합
디퓨전젬마 생성 속도H100 1장·초당 약 1,500 토큰디코딩 구조가 새 비용 경쟁 축으로 부상
카나나-2 KV 캐시 절감32K 문맥에서 최대 약 72.7%한국어 경량 모델의 기기 내 배포 가능성 확대
LongHorizon-Harness WeaveBench51.8% → 80.7%외부 상태·독립 감사가 장기 작업 성과 개선
메타라우터 도전 세트 성공률75.9%익숙한 테스트의 비용 절감이 표현 변화에는 취약
KV 캐시 전환 가속2.7~25배모델 교체 때 문맥 재계산 비용 감소 가능

다음 주 주목할 것

  • 오픈AI와 앤트로픽이 외부 평가 환경의 네트워크·자격 증명·프록시 검증 기준을 얼마나 구체적으로 공개하는지
  • 미국의 출시 전 자발적 평가에서 대상 모델, 위험 임계치와 독립 검증자 범위가 어떻게 정해지는지
  • 디퓨전젬마의 초당 생성량이 다양한 길이·동시성·품질 조건의 독립 평가에서도 유지되는지
  • 한국어 음성·경량 모델이 라이선스와 메모리 제약을 넘어 실제 온디바이스 제품으로 연결되는지
  • 장기 메모리와 메타라우팅 벤치마크가 표현 변화, 오래된 상태와 실패 복구를 포함한 운영 평가로 발전하는지

다음 주 월요일에 다시 돌아옵니다. — 에이브랜치