주간 AI 브리핑 — 2026년 34주차
엔비디아 AVO와 스트라이프의 OpenRouter 인수가 모델 점수보다 하네스·라우팅·검증 계약을 경쟁의 중심으로 옮겼습니다.
이번 주 핵심
이번 주 AI 산업은 같은 모델의 점수보다, 그 모델이 들어가는 경로·하네스·기억·검증 계약에 무게를 실었습니다. 엔비디아 AVO는 동일한 Claude Opus 5로 공개셋 100점을 냈고, 스트라이프는 하루 10조 개 토큰을 나누는 OpenRouter를 결제 인프라 옆에 붙이기로 했습니다. 오픈AI는 Astra의 사이버 임계치 앞에서 대규모 강화학습을 멈추고, 답을 바로 주지 않는 학습 경로와 원문을 남기지 않는 안전을 제품 기본값으로 올렸습니다. 동시에 설정만 바뀌어도 하네스가 열리고, 기억과 자기 개선은 쌓을수록 추론을 가둘 수 있다는 현장 증거가 이어졌습니다.
1. 엔비디아 AVO는 같은 모델로 ARC-AGI-3 공개셋 100점을 냈습니다
엔비디아는 장기 자율 작업을 위한 에이전트 아키텍처 AVO를 공개했습니다. 프론티어 언어 모델은 구성 요소일 뿐이고, 문맥·도구·상태·피드백·실패 복구를 맡는 하네스가 긴 작업을 끝까지 밀어 간다고 설명했습니다.
- 같은 Opus 5, 다른 성적: AVO는 Claude Opus 5로 공개셋 25개 환경의 183개 레벨을 환경 행동 6,624회로 모두 끝냈고, RHAE 100.00점을 기록했습니다. ARC Prize가 같은 모델 계열의 고추론 설정에서 약 30 %를 보고한 것과는 평가 체계가 다릅니다.
- 감독과 기억이 루프를 유지: 메인 에이전트가 검사·변경·시험·평가를 맡고, 감독자가 정체와 반복을 보다가 방향을 바꿉니다. 영속 기억은 구현, 평가, 컴파일러·프로파일러 출력과 추론을 다음 스텝으로 넘깁니다.
- 커널 최적화에서 일반 추론으로: 어텐션 커널 실험에서는 7일 동안 500개 넘는 방향을 탐색해 커널 40개를 커밋했고, 같은 아키텍처를 규칙 없는 상호작용 벤치로 옮긴 것이 ARC-AGI-3입니다.
출처: NVIDIA AVO Reaches 100% on ARC-AGI-3 — NVIDIA
2. 스트라이프는 OpenRouter로 토큰 라우팅을 결제 인프라 옆에 붙였습니다
스트라이프는 요청마다 난이도, 가격, 속도, 신뢰도를 보고 400개 넘는 모델과 80곳 넘는 공급자 가운데 경로를 고르는 OpenRouter를 인수하기로 합의했습니다. 엔비디아, Zoom, Lovable이 이미 이 층을 쓰고 있습니다.
- 중립 게이트웨이를 유지: OpenRouter는 하루 10조 개 이상의 토큰과 1,000만 명 넘는 개발자·기업 트래픽을 처리하며, 인수 뒤에도 이름, 제품, 로드맵과 통합 방식은 그대로 둔다고 밝혔습니다.
- 수익과 토큰 비용을 한쪽에: 스트라이프는 결제 수단·승인률·사기를 최적화해 온 것처럼, 토큰을 희소한 연산 자원의 통화로 보고 매출과 추론 지출을 함께 관리하겠다고 설명했습니다.
- 멀티모델이 기본 가정: 어떤 모델도 모든 과제에서 최적이 아니므로, 특정 랩에 기울지 않는 조율 층이 필요하다고 OpenRouter 쪽은 말했습니다.
출처: Stripe agrees to acquire OpenRouter — Stripe, OpenRouter is Joining Stripe — OpenRouter
3. 오픈AI는 Astra의 사이버 임계치 앞에서 대규모 RL을 멈춰 두었습니다
오픈AI는 다가오는 모델 아스트라가 준비 체계의 Critical 사이버 능력 임계치를 충족할 수 있다는 예비 증거가 나왔다고 밝혔습니다. 내부 연구 진전과 맞물려 모니터링, 정렬, 격리 기준을 학습 전 단계로 끌어올리기 위해 확장 속도를 일시적으로 낮췄습니다.
- 배포용 모델의 RL을 2주 중단: 최신 배포 예정 모델의 강화학습을 멈추고 연구 환경을 재점검했으며, 가장 큰 프론티어 RL 실행은 아직 보류입니다.
- 도구와 격리를 학습 앞에 둠: 코드 실행이나 인터넷에 닿는 도구를 쓰는 프론티어 추론을 사고 직후 중단했고, 아스트라와 사이버 작업에는 가장 강한 격리를 요구합니다.
- 짧은 방어 창: 그레그 브록먼은 오픈 웨이트 사이버 모델이 몇 달 뒤처진 채 공개될 수 있다고 보고, 공격자가 기술 부채를 자동으로 엮기 전에 결함을 찾고 고치는 속도를 올려야 한다고 썼습니다.
출처: Pacing model development — OpenAI, The Defender’s Window — OpenAI
4. 청소년·학생 제품은 답을 푸는 대신 학습 경로를 기본값으로 두었습니다
오픈AI는 시스템이 18세 미만으로 추정하거나 사용자가 나이를 13~17세로 밝히면 자동으로 들어가는 ChatGPT for Teens를 공개했습니다. 같은 주 구글은 자격 있는 대학생에게 Google AI 요금제를 1년 동안 무료로 제공하고, 학기용 학습 도구를 묶었습니다.
- 학습을 기본 경로로 설계: Study Mode, 책임 있는 숙제 알림, 퀴즈와 학습 시각화, 정해진 시간에 Study Mode가 켜지는 Study Hours를 묶었습니다. 연결된 부모 계정은 Quiet Hours와 안전 알림을 쓸 수 있습니다.
- 사람과의 관계를 우선: 로맨틱 역할극뿐 아니라 감정 의존을 유도하거나 의식이 있는 것처럼 말하는 표현도 막도록 18세 미만 모델 사양을 강화했습니다.
- 한도를 푼 뒤의 입구: 구글은 학생 허브에서 학습 노트북, 플래시카드, 연습 퀴즈를 시작하게 했고, 강의 노트를 올리면 진단 퀴즈와 짧은 수업, 진행 대시보드를 만들도록 했습니다.
출처: Introducing ChatGPT for Teens — OpenAI, Partnering with CodeAI — OpenAI, Start the semester with one year of Gemini, on us — Google
5. 오픈AI는 프론티어 모델에도 ZDR을 유지하는 안전 처리를 열었습니다
오픈AI는 자격 있는 API 고객에게 Zero Data Retention을 제공한다고 재확인했습니다. 요청이 처리된 뒤 프롬프트와 응답을 보관하지 않으면서도, 여러 상호작용을 묶어 봐야만 보이는 위험을 잡기 위해 Private Safety Processing을 프리뷰했습니다.
- 내용은 고객 쪽에: ZDR 배포에서는 고객이 통제하는 인프라에 내용이 남고, 오픈AI 쪽 저장을 쓰는 옵션도 고객이 쥔 키로 암호화해 직원은 원문을 볼 수 없습니다.
- 신호만 돌려줌: 자동 시스템이 관련 요청의 패턴을 보고, 오픈AI에는 활동 유형을 가리키는 좁은 안전 신호만 전달됩니다. 강제 조치가 있어도 원문은 열리지 않습니다.
- 9월 롤아웃을 예고: 초기 고객과 시험 중이며, 9월에 Private Safety Processing과 기술 백서를 공개할 계획입니다.
출처: Offering Zero Data Retention for frontier models — OpenAI
6. 오픈AI AI Futures는 권력 집중을 장기 위험으로 올렸습니다
오픈AI는 Strategic Futures 팀의 블로그 AI Futures를 열었습니다. 팀이 묻는 질문은 변혁적 AI가 등장해도 개인의 권리와 행위 능력을 지키려면 자유 사회를 어떻게 다시 짜야 하는가입니다.
- 노동 없는 권력: 자율 시스템이 힘을 투사하고, 데이터센터가 세수를 만들며, 관료제 자체가 자동화되면 사회 전체의 거래 없이도 권력이 유지될 수 있다고 봅니다.
- 양피지 장벽만으로는 부족: 투표 형식이 남아도 사람은 무력해질 수 있고, 문서가 자유를 선언해도 행위 능력은 빼앗길 수 있습니다. 목표는 한 행위자나 소수 과점이 경제와 사회 구조를 독점하지 못하게 균형을 맞추는 일입니다.
- 익명과 책임을 함께: 고위험 행위는 책임 있는 사람이나 조직에 묶되, 그 메커니즘은 프라이버시를 중심에 두고 많은 장면에서는 AI를 익명으로 쓸 수 있어야 한다고 적었습니다.
출처: Introducing AI Futures — OpenAI
7. Cursor Origin은 에이전트가 코드를 다루는 저장소를 직접 호스팅합니다
커서는 유료 플랜에 Origin 코드 호스팅을 얼리 베타로 열었습니다. 저장소, 풀 리퀘스트, 코드 탐색, GitHub 동기화부터 시작하고 에이전트 전용 기능은 이어질 예정입니다.
- 커서 호스팅과 GitHub 미러를 한 화면에서 관리: 직접 만든 저장소는 cursor.com/codebase/ 아래 조직 이름을 쓰고, GitHub에서 가져온 저장소는 GitHub가 진실의 원본으로 남습니다.
- PR과 리뷰가 양방향으로 동기화: 커서에서 남긴 댓글이 GitHub에 올라가고, GitHub의 반응은 수초 안에 커서로 돌아옵니다.
- 코드를 보는 자리에서 에이전트가 수정: 탐색 중인 코드에 질문하고 변경, PR 갱신, 브랜치 푸시까지 이을 수 있으며 Vercel·Depot·Buildkite 연동이 먼저 붙었습니다.
출처: Origin Code Hosting — Cursor
8. 에이전트 학습은 정적 환경과 실제 하네스 위에서 다시 짜이기 시작했습니다
구글 연구진의 EnvHarness는 손으로 만든 정적 환경을 뜯지 않고 플러그인 층으로 약점을 겨냥합니다. ClawGym II와 마이크로소프트 Agent Lightning v1.0은 배포 때 쓰는 하네스를 열지 않은 채 궤적을 모아 정책을 갱신합니다.
- 환경을 다시 짜는 신호: EnvHarness는 4개 도메인, 5개 벤치마크에서 미공개 인스턴스 점수를 최대 9.0점 올리면서 실행 스텝은 9.8 % 줄였습니다.
- 불투명한 하네스 위 학습: ClawGym II는 OpenClaw와 Claude Code로 Qwen3-30A3B를 공동 최적화해 ClawGym-Bench Pass@1을 각각 9.98점, 14.81점 올렸습니다.
- 현장 하네스가 환경을 소유: Agent Lightning은 6,000개 학습 예제만으로 Qwen3.5-9B의 SWE-bench Verified를 41.8 %에서 56.4 %로 14.6점 올렸습니다.
출처: EnvHarness: Awakening Static Worlds for Agent Learning — arXiv, ClawGym II — arXiv, Agent Lightning v1.0 — arXiv, microsoft/agent-lightning — GitHub
9. 하네스 공격은 런타임보다 설정 단계에서 먼저 열렸습니다
HarnessRisk는 도구, 확장, 영속 상태, 권한, 외부 행동을 맡는 에이전트 하네스 안전을 구성부터 사고 복구까지 여섯 단계로 나눕니다. 128개 샌드박스 사례는 무해한 사용자 목표와, 신뢰할 수 없는 워크플로 산출물에 심은 적대 지시를 짝지었습니다.
- 효용은 높은데 공격은 널뜀: 3개 하네스, 6개 모델, 14개 구성에서 공격 성공률은 12.6 %에서 80.9 %까지 갈렸고, 효용은 75.0~97.6 %에 머물렀습니다.
- 구성 단계가 가장 약함: 세 하네스 모두에서 Harness Configuration이 가장 취약했고, 허가된 워크플로 안의 보안 민감 매개변수만 바꿔도 공격이 성공했습니다.
- 위험을 알아도 막지 않음: 어떤 구성은 위험 인식을 90 % 넘게 하면서도 공격 성공을 크게 남겼습니다.
출처: HarnessRisk — arXiv
10. 기억과 자기 개선은 쌓을수록 추론을 가둘 수 있습니다
MemTrapBench는 기억을 잘 넣고 잘 꺼내는지가 아니라, 꺼낸 기억이 지금 과제의 추론을 어떻게 찌그러뜨리는지를 잽니다. 세일즈포스 연구진은 텍스트 기억 은행을 쌓으며 스스로 나아간다고 알려진 방법도 과제 순서와 분산만으로 무너질 수 있음을 보였습니다.
- 기억 있는 쪽이 더 낮음: 두 모델 계열, 다섯 가지 대표 기억 프레임워크 모두 기억 없는 설정보다 못했고, 가장 강한 방법도 10 %가 넘는 하락을 보였습니다.
- 기본 순서가 숨은 커리큘럼: 자기 개선의 향상이 과제 순서에 강하게 의존하며, 평가 소음이 루프에서 증폭됐습니다.
- 추론 시점에 막는 쪽이 유효: AdaptiveMem은 기억 함정을 피하라는 추론 시점 지시만으로 MemTrapBench의 함정은 줄이면서 일반 기억 벤치 성능은 유지하거나 올렸습니다.
출처: MemTrapBench — arXiv, On the Fragility of Self-Improving Agents — arXiv
11. ChatGPT는 애플 메시지 플러그인으로 개인 통신망에 들어갔습니다
오픈AI는 ChatGPT에 애플 메시지 플러그인을 붙여, 받은 문자를 정리·검색하고 답장을 초안하거나 보낼 수 있게 했습니다. Codex와 ChatGPT Work에서도 동작해 개인 대화와 업무 대화를 같은 플러그인으로 다룹니다.
- 요청할 때만 읽음: 오픈AI는 메시지 전체 색인을 만들지 않고, 플러그인은 기기에서 돌며, 특정 요청이 있어야 문자를 읽는다고 설명했습니다. 설정에는 전체 디스크 접근이 필요합니다.
- 보내기 전 확인을 권고: 지속 승인을 켜면 ChatGPT가 사용자 이름으로 보내기 전 마지막 검토 기회가 사라진다고 문서에 적었습니다.
- 삭제와 발송까지: 메시지 삭제, 대신 보내기, 오래된 대화에서 정보 찾기가 포함됩니다.
출처: ChatGPT can now send texts for you — TechCrunch, Plugins — ChatGPT Learn
12. 계산 용량은 오하이오 전력과 궤도 발사 창으로 갈렸습니다
오픈AI는 오하이오주 파이크 카운티의 PORTS-Pike 테크놀로지 캠퍼스에서 SB Energy, 엔비디아, 미 에너지부와 함께 약 8 GW-IT를 확보하는 계약에 들어갔습니다. 같은 주 Starcloud는 궤도 데이터센터에 2.5억 달러 연장 투자를 더해 기업 가치를 23억 달러로 올렸습니다.
- 지역 요금에 인프라 비용을 넘기지 않음: SB Energy가 그리드 증설과 송전선 비용을 전부 부담한다고 밝혔고, 냉각탑 대신 폐쇄 루프 공랭을 목표로 했습니다. 커뮤니티 기금 4,000만 달러와 오하이오 대학생 코덱스 크레딧 8,400만 달러를 별도로 제시했습니다.
- 발사 슬롯이 병목: Starcloud 최고경영자 필립 존스턴은 팰컨 9 프로그램이 2028년 종료를 앞둔 탓에 발사 예약 자체가 큰 비용이 됐다고 말했습니다. FCC에는 위성 8.8만 기 운용을 신청한 상태입니다.
- 2027년 궤도 추론을 겨냥: 우선 라이드셰어로 8 kW급 Starcloud-2 두 기를 올려 미국 정부 고객의 궤도 추론을 맡기려 하며, 궤도에서 엔비디아 H100을 이미 운용 중이라고 했습니다.
출처: OpenAI joins PORTS-Pike project — OpenAI, Starcloud raises $250 million for orbital data centers — TechCrunch
13. 에이전트가 쓴 정책은 테스트가 아니라 증명으로 막히기 시작했습니다
구글은 커먼 익스프레션 랭귀지(CEL) 형식 검증 프레임워크를 공개했습니다. TopoIntent는 사업 요구, 규제와 위험 가정을 네트워크 구역, 경계 장비, 경로와 접근 제어 정책으로 변환한 뒤 실행 가능한 검사로 닫습니다.
- 무한 입력에서 질문을 닫음: 승인되지 않은 요청이 통과하는 입력이 있는지, 리팩터한 규칙이 원래와 같은지, 오류를 강제할 수 있는지를 Z3 정리 증명기로 묻습니다.
- 연산자 우선순위를 즉시 적발: is_prod && port == 80 || port == 443처럼 AND가 OR보다 먼저 묶이면, 비프로덕션에서도 포트 443이 열리는 반례를 바로 보여 줍니다.
- 실행 가능한 정책 테스트: TopoIntent는 보류 시나리오에서 토폴로지 수준 CIS 충족률을 0.78에서 1.00으로, 한 번의 피드백 뒤 ACL 정책 통과율을 0.78에서 0.88로 높였습니다.
출처: Formal verification for CEL — Google Open Source Blog, TopoIntent — arXiv
14. 시장이 검증한 업무와 과학 코드는 아직 절반을 넘지 못했습니다
StartupBench는 연구자가 고른 과제가 아니라, 실제 도입이 있는 AI 스타트업 제품의 업무 흐름을 끝까지 완성해야 하는 벤치마크로 옮겼습니다. SWE-bench Science는 20개 분야, 98개 GitHub 저장소의 과학 소프트웨어 수리 119개 과제를 모았습니다.
- 완료율 약 30 %: StartupBench에서 가장 강한 모델도 약 30 %만 성공적으로 끝냈고, 중간 진전은 있어도 납품물 기준의 끝까지는 가지 못했습니다.
- 과학 코드는 50 % 아래: Claude Code와 Opus-5(max) 조합의 pass@1도 50 %를 넘지 못했습니다. 과학 지식·추상화 부족, 표면적 수리, 시스템 통합 미완이 반복됐습니다.
- 지식 노동의 버전 계약: StagedWorkspace는 파싱·원본을 함께 쓰는 설정이 OfficeQA Pass@1을 8.3~12.1점 올렸고, 같은 모델의 공개 점수와 현장 점수 격차를 드러냈습니다.
출처: StartupBench — arXiv, SWE-bench Science — arXiv, StagedWorkspace — arXiv
15. Gemma 내려받기 10억 건이 오픈 가중치의 현장 증명이 되었습니다
구글은 Gemma 계열 내려받기가 10억 건을 넘었고, 개발자가 만든 변형이 10만 개를 넘었다고 밝혔습니다. 숫자가 아니라 Gemmaverse에서 무엇이 돌아가는지가 핵심이라고 강조했습니다.
- 궤도까지 내려감: NASA, Satlyt, Starcloud가 위성에서 Gemma를 돌려 영상 분석, 다운링크 절약, 위성 간 통신 경로를 맡깁니다.
- 현장 규모로 붙음: 인도 국가보건당국은 Gemma 4와 Medical Data Toolkit을 1억 건 넘게 내려받은 Aarogya Setu 2.0에 넣어 복잡한 의료 기록을 표준 형식으로 바꿉니다.
- 세포와 돌고래까지: 예일·구글의 C2S-Scale은 살아 있는 세포에서 검증된 암 치료 경로를 찾았고, DolphinGemma는 돌고래 발성을 예측합니다.
출처: Inside the Gemmaverse: Celebrating one billion Gemma downloads — Google
이번 주 데이터
| 신호 | 이번 주 수치 | 의미 |
|---|---|---|
| AVO RHAE / 같은 계열 고추론 보고 | 100.00점 / 약 30 % | 모델 카드와 하네스 점수는 다른 능력 |
| OpenRouter 일일 토큰 / 모델 수 | 10조 개 이상 / 400개 이상 | 라우팅 층이 모델 선택의 기본 가정 |
| HarnessRisk 공격 성공률 | 12.6~80.9 % | 설정 단계가 런타임보다 먼저 열림 |
| Agent Lightning SWE-bench Verified | 41.8 % → 56.4 % | 현장 하네스 위 소량 학습의 효과 |
| StartupBench / SWE-bench Science | 약 30 % / 50 % 미만 | 실제 업무·과학 코드의 완료 벽 |
| PORTS-Pike 확보 용량 | 약 8 GW-IT | 계산 용량이 지역 전력 계약이 됨 |
다음 주 주목할 것
- AVO처럼 같은 모델을 다른 하네스로 감싼 점수가 공개 리더보드와 제품 평가를 어떻게 다시 나누는지
- 스트라이프 인수 뒤 OpenRouter의 모델 중립성과 라우팅 감사 가능성이 유지되는지
- 오픈AI가 Astra 관련 대규모 RL을 언제 재개하고, 사이버 임계치 대응 환경을 어떻게 공개하는지
- 9월 Private Safety Processing이 원문 없는 다중 요청 안전을 실제로 구현하는지
- ChatGPT Ads의 유럽 31개국 확장이 답과 광고의 분리 계약을 규제 환경에서 지키는지
다음 주 월요일에 다시 돌아옵니다. — 에이브랜치