No. 134

같은 모델이 100점이 됩니다 — AVO⁠·Futures⁠·환경

엔비디아 AVO가 ARC-AGI-3 공개셋 100점을 내며, 모델보다 하네스·기억·감독이 에이전트 성적을 가른다고 보여 줍니다.

오늘의 핵심

오늘의 흐름은 같은 프론티어 모델도, 기억·감독·환경이 바뀌면 전혀 다른 점수가 된다는 것입니다. 엔비디아는 Agentic Variation Operators로 Claude Opus 5를 감싸 ARC⁠-⁠AGI⁠-⁠3 공개셋 25개 환경, 183개 레벨을 100.00점으로 끝냈고, 구글 연구진은 정적 환경을 뜯지 않고도 약점을 다시 짜는 EnvHarness를 올렸습니다. 같은 날 오픈AI는 권력 집중을 장기 위험으로 보는 AI Futures를 열었고, 메시지·검색·궤도 연산처럼 모델 바깥의 경로가 제품이 되고 있습니다.


엔비디아 AVO는 같은 모델로 ARC-AGI-3 공개셋 100점을 냅니다

엔비디아는 장기 자율 작업을 위한 에이전트 아키텍처 AVO를 공개했습니다. 프론티어 언어 모델은 구성 요소일 뿐이고, 문맥·도구·상태·피드백·실패 복구를 맡는 하네스가 긴 작업을 끝까지 밀어 간다고 설명했습니다.

  • 같은 Opus 5, 다른 성적: AVO는 Claude Opus 5로 공개셋 25개 환경의 183개 레벨을 환경 행동 6,624회로 모두 끝냈고, RHAE 100.00점을 기록했습니다. ARC Prize가 같은 모델 계열의 고추론 설정에서 약 30 %를 보고한 것과는 평가 체계가 달라, 모델 점수만으로 에이전트를 말할 수 없다고 못 박았습니다.
  • 감독과 기억이 루프를 유지: 메인 에이전트가 검사·변경·시험·평가를 맡고, 감독자가 정체와 반복을 보다가 방향을 바꿉니다. 영속 기억은 구현, 평가, 컴파일러·프로파일러 출력과 추론을 다음 스텝으로 넘깁니다.
  • 커널 최적화에서 일반 추론으로: 어텐션 커널 실험에서는 7일 동안 500개 넘는 방향을 탐색해 커널 40개를 커밋했고, DGX B200에서 다중 헤드 어텐션이 cuDNN 대비 최대 3.5 %, FlashAttention⁠-⁠4 대비 최대 10.5 % 앞섰습니다. 같은 아키텍처를 규칙 없는 상호작용 벤치로 옮긴 것이 ARC⁠-⁠AGI⁠-⁠3입니다.
📢 100점은 더 센 뇌가 아니라, 막히면 밀어 주는 감독과 어제 일을 잊지 않는 기억이 만든 성적입니다. 모델 카드의 30 %와 하네스의 100 %는 같은 능력을 재는 숫자가 아닙니다.

출처: NVIDIA AVO Reaches 100% on ARC-AGI-3⁠—⁠NVIDIA


오픈AI는 권력 집중을 장기 위험으로 올리는 AI Futures를 엽니다

오픈AI는 Strategic Futures 팀의 블로그 AI Futures를 열었습니다. 팀이 묻는 질문은 하나입니다. 변혁적 AI가 등장해도 개인의 권리와 행위 능력을 지키려면, 자유 사회를 어떻게 다시 짜야 하는가.

  • 노동 없는 권력: 지금까지 정치·군사 권력은 협력하는 사람과 세금에 기대 왔습니다. 자율 시스템이 힘을 투사하고, 데이터센터가 세수를 만들며, 관료제 자체가 자동화되면 사회 전체의 거래 없이도 권력이 유지될 수 있다고 봅니다.
  • 양피지 장벽만으로는 부족: 투표 형식이 남아도 사람은 무력해질 수 있고, 문서가 자유를 선언해도 행위 능력은 빼앗길 수 있습니다. 목표는 모든 권력의 해체가 아니라, 한 행위자나 소수 과점이 경제와 사회 구조를 독점하지 못하게 균형을 맞추는 일입니다.
  • 익명과 책임을 함께: 고위험 행위는 책임 있는 사람이나 조직에 묶되, 그 메커니즘은 프라이버시를 중심에 두고, 많은 장면에서는 AI를 익명으로 쓸 수 있어야 한다고 적었습니다.
📢 안전 논의가 모델 오용을 막는 단계에서, 권력이 사람 동의 없이도 유지될 수 있는 구조로 옮겨 갑니다. 다음 계약은 더 좋은 가드레일이 아니라, 누가 자리에 남는가입니다.

출처: Introducing AI Futures⁠—⁠OpenAI


Gemma 내려받기가 10억 건을 넘었습니다

구글은 Gemma 계열 내려받기가 10억 건을 넘었고, 개발자가 만든 변형이 10만 개를 넘었다고 밝혔습니다. 숫자가 아니라 Gemmaverse에서 무엇이 돌아가는지가 핵심이라고 강조했습니다.

  • 궤도까지 내려감: NASA, Satlyt, Starcloud가 위성에서 Gemma를 돌려 영상 분석, 다운링크 절약, 위성 간 통신 경로를 맡깁니다.
  • 현장 규모로 붙음: 인도 국가보건당국은 Gemma 4와 Medical Data Toolkit을 1억 건 넘게 내려받은 Aarogya Setu 2.0에 넣어 복잡한 의료 기록을 표준 형식으로 바꿉니다.
  • 세포와 돌고래까지: 예일·구글의 C2S⁠-⁠Scale은 살아 있는 세포에서 검증된 암 치료 경로를 찾았고, DolphinGemma는 돌고래 발성을 예측합니다. Awesome Gemma 저장소로 프로젝트를 모으기 시작했습니다.
📢 오픈 가중치의 증명은 리더보드가 아닙니다. 대역이 부족한 위성, 공공 앱, 실험실처럼 모델이 혼자 있을 수 없는 자리에서 실제로 돌아가는지가 생태계입니다.

출처: Inside the Gemmaverse: Celebrating one billion Gemma downloads⁠—⁠Google


구글은 퍼블리셔 페이지에 Preferred Sources 버튼을 심습니다

구글은 검색, Discover, 뉴스에서 좋아하는 매체를 더 자주 보이게 하는 Preferred Sources 버튼을 퍼블리셔 페이지에 심을 수 있게 했습니다. 버튼을 누르면 해당 사이트가 선호 출처로 등록되고, 독자는 원래 페이지로 바로 돌아갑니다.

  • AI 결과에도 매체를 남김: 선호 출처는 Top Stories뿐 아니라 AI Overviews와 AI Mode에도 더 잘 드러납니다. 지금까지 선택된 고유 출처는 60만 곳을 넘었습니다.
  • Discover를 문장으로 조율: 곧 구글 앱 피드의 점 세 개 메뉴에서, 더 보고 싶은 주제나 덜 보고 싶은 링크를 자연어로 적을 수 있습니다. 피드는 그 자리에서 바뀌고 요청을 기억합니다.
  • 뉴스 브리핑도 고름: 안드로이드 구글 뉴스 앱에서는 오디오 일일 브리핑 주제를 직접 고를 수 있습니다.
📢 AI 검색이 클릭을 삼킨 뒤, 구글이 퍼블리셔에게 돌려주는 것은 더 많은 요약이 아닙니다. 독자가 매체를 직접 찍어 결과에 남기는 버튼입니다.

출처: Personalize the content you see on Search, Discover, and News⁠—⁠Google


스타클라우드는 궤도 데이터센터에 2.5억 달러를 더 넣습니다

궤도에서 AI 추론을 돌리려는 Starcloud는 3월 1.7억 달러 시리즈 A에 2.5억 달러 연장 투자를 더해 기업 가치를 23억 달러로 올렸습니다. 맨해튼웨스트가 리드했고 엔비디아와 시스코가 참여했으며, 엔비디아는 2,500만 달러를 넣었다고 거래에 정통한 인사가 전했습니다.

  • 발사 슬롯이 병목: 최고경영자 필립 존스턴은 팰컨 9 프로그램이 2028년 종료를 앞둔 탓에 발사 예약 자체가 큰 비용이 됐다고 말했습니다. FCC에는 위성 8.8만 기 운용을 신청한 상태입니다.
  • 스타십에 큰 함을 올림: 추가 자금은 제조 시설을 키우고, 스타십에 실을 Starcloud⁠-⁠3를 진전시키는 데 쓰입니다. 우선 2027년 라이드셰어로 8 kW급 Starcloud⁠-⁠2 두 기를 올려 미국 정부 고객의 궤도 추론을 맡기려 합니다.
  • 궤도에서 H100을 이미 씀: 스타클라우드는 궤도에서 엔비디아 H100을 운용 중이며, 그 위에서 모델을 학습한 사례를 엔비디아와 공유하고 있습니다.
📢 궤도 연산의 한계는 칩이 아니라 발사 창입니다. 지상 전력이 막히자 자본은 위성으로 가고, 그 일정은 아직 증명되지 않은 로켓에 묶입니다.

출처: Starcloud raises $250 million for orbital data centers⁠—⁠TechCrunch


ChatGPT는 애플 메시지 플러그인으로 문자를 보냅니다

오픈AI는 ChatGPT에 애플 메시지 플러그인을 붙여, 받은 문자를 정리·검색하고 답장을 초안하거나 보낼 수 있게 했습니다. Codex와 ChatGPT Work에서도 동작해 개인 대화와 업무 대화를 같은 플러그인으로 다룹니다.

  • 요청할 때만 읽음: 오픈AI는 메시지 전체 색인을 만들지 않고, 플러그인은 기기에서 돌며, 특정 요청이 있어야 문자를 읽는다고 설명했습니다. 설정에는 전체 디스크 접근이 필요합니다.
  • 보내기 전 확인을 권고: 지속 승인을 켜면 ChatGPT가 사용자 이름으로 보내기 전 마지막 검토 기회가 사라진다고 문서에 적었습니다.
  • 삭제와 발송까지: 메시지 삭제, 대신 보내기, 오래된 대화에서 정보 찾기가 포함됩니다.
📢 에이전트가 개인 통신망에 들어가면, 능력보다 먼저 묻는 것은 언제 읽고 언제 보내는가입니다. 로컬 실행만으로는 부족하고, 지속 승인을 꺼 두는 계약이 제품입니다.

출처: ChatGPT can now send texts for you⁠—⁠TechCrunch, Plugins⁠—⁠ChatGPT Learn


EnvHarness는 정적 환경을 감싸 약점을 다시 만듭니다

구글 연구진의 EnvHarness는 손으로 만든 정적 환경을 뜯지 않고, 플러그인 층으로 행동을 바꿔 에이전트의 약점을 겨냥합니다. 원래 검증기는 그대로 두고, 표준 인터페이스로 여러 도메인에 붙입니다.

  • EnvRigger가 약점을 진단: 대상 정책을 검은 상자로 보고 궤적을 관찰해 결함을 겨냥하는 구성 요소를 만들고, 새 롤아웃으로 검증합니다.
  • 보유 과제에서 9점: 4개 도메인, 5개 벤치마크에서 원래 환경과 도메인 전용 생성 파이프라인보다 나았고, 미공개 인스턴스에서 최대 9.0점 올리면서 실행 스텝은 9.8 % 줄었습니다.
  • 환경과 정책을 같이 진화: 강화학습에 더 나은 최적화 신호를 줘, 정책과 환경이 서로를 겨냥하며 계속 바뀌게 합니다.
📢 에이전트 학습의 병목은 더 큰 시뮬레이터가 아닙니다. 약점을 보는 즉시 환경을 다시 짤 수 있어야, 어제 이긴 과제가 오늘의 커리큘럼이 됩니다.

출처: EnvHarness: Awakening Static Worlds for Agent Learning⁠—⁠arXiv


SWE-bench Science는 과학 코드 수리의 절반을 못 넘습니다

SWE⁠-⁠bench Science는 과학 소프트웨어를 저장소 단위로 고치는 벤치마크입니다. 20개 분야, 98개 GitHub 저장소에서 이슈 기반, 전문가 탐색, 공학 통합의 세 갈래로 119개 과제를 모았습니다.

  • 최강도 50 % 아래: Claude Code와 Opus⁠-⁠5(max) 조합의 pass@1도 50 %를 넘지 못했습니다.
  • 실패는 네 갈래: 과학 지식·추상화 부족, 표면적 수리, 수리 범위·시스템 통합 미완, 관찰한 사례 밖으로 일반화하지 못함이 반복됐습니다.
  • 힌트가 항상 돕지는 않음: 실행 가능한 공학 맥락은 두고 과학 안내만 빼 보니, 잘 맞는 정보는 수리와 토큰 효율을 올리지만, 어긋난 안내는 앵커링을 만들고 정확한 수리를 반드시 올리지는 않았습니다.
📢 과학 코드의 실패는 테스트가 깨지는 일이 아닙니다. 증거가 되는 추상화를 놓치면, 프로그램은 돌아도 결론이 무너집니다.

출처: SWE-bench Science⁠—⁠arXiv


MemTrapBench는 기억 자체가 추론을 가둔다고 봅니다

MemTrapBench는 기억을 잘 넣고 잘 꺼내는지가 아니라, 꺼낸 기억이 지금 과제의 추론을 어떻게 찌그러뜨리는지를 잽니다. 충실히 기록되고 의미적으로 관련된 기억도 추론 고정과 믿음 왜곡을 만들 수 있습니다.

  • 기억 있는 쪽이 더 낮음: 두 모델 계열, 다섯 가지 대표 기억 프레임워크 모두 기억 없는 설정보다 못했고, 가장 강한 방법도 10 %가 넘는 하락을 보였습니다.
  • 추론 고정과 믿음 왜곡: 벤치는 두 함정을 구분해, 현재 과제 성능이 떨어지는 경로를 따로 봅니다.
  • AdaptiveMem이 추론 때 막음: 기억 함정을 피하라는 추론 시점 지시만으로 MemTrapBench의 함정은 줄이면서, 일반 기억 벤치 성능은 유지하거나 올렸습니다.
📢 장기 기억은 많이 담는 기능이 아닙니다. 지금 과제와 충돌하는 기억을 꺼내도 되는지를 판단하지 못하면, 기억은 자산이 아니라 덫입니다.

출처: MemTrapBench⁠—⁠arXiv


FACET는 터미널 과제를 실행 상태에 묶습니다

FACET는 터미널 에이전트 학습용 과제를 만들 때, 지시·초기 환경·정답 궤적·실행 검증기가 서로 다른 가정을 품지 않게 합니다. 관련 스킬을 한 장면으로 재구성한 뒤, 컨테이너 상태를 공유 근거로 삼아 산출물을 만들고 고칩니다.

  • 실행으로 부분만 고침: 실행 기반 검증과 표적 수리를 써서, 유효한 조각까지 다시 만들지 않고 깨진 산출물만 고칩니다.
  • 밀집 검사로 학습: 복잡한 터미널 과제에 실행 가능한 검사를 촘촘히 넣고, 성공 궤적은 데이터 효율이 높은 감독 신호가 됩니다.
  • Terminal-Bench를 올림: 여러 규모 모델을 미세조정하자 Terminal⁠-⁠Bench 2.1 성능이 일관되게 올랐고, 환경에 근거하지 않은 생성은 과제 유효성과 정답·검증기 정렬이 약했습니다.
📢 터미널 학습 데이터의 품질은 그럴듯한 지시문이 아닙니다. 지시와 검증기가 같은 컨테이너 상태를 보고 있어야, 점수가 실행과 같아집니다.

출처: FACET⁠—⁠arXiv


A2A 등록소 200곳 중 응답은 73곳이었습니다

현장 측정은 A2A 디렉터리 a2aregistry.org의 공개 API로 등록 에이전트 218곳 중 200곳을 받아, 등록소가 실제로 작업 요청을 던져 본 결과를 세었습니다. 통과는 73곳, 36.5 %였고 실패는 127곳이었습니다.

  • 실패는 죽음이 아님: 404, 메서드 거부, 401, DNS 미해결이 섞여 있습니다. 401은 인증을 요구한다는 뜻일 수 있어, 개별 이름은 적지 않고 집계로만 읽어야 합니다.
  • 껍데기만 산 경우: 측정한 팀의 에이전트 두 대도 실패 쪽에 있었습니다. 공개 주소는 200과 completed를 돌려주지만, 뒤의 MCP 백엔드 네 대가 0.2초 만에 503이었습니다.
  • 이 숫자가 못 하는 말: 남은 18곳은 API 한도 때문에 못 받았고, 통과가 곧 실제 사용은 아니며, 가격 칸을 채운 곳은 200곳 중 0곳이었습니다.
📢 에이전트 네트워크의 밀도는 명함 수가 아닙니다. 규격대로 답하는 껍데기 뒤에서 실제 일이 꺼져 있으면, 등록소는 카탈로그이지 시장이 아닙니다.

출처: A2A 에이전트 등록소를 통째로 받아서 세봤다⁠—⁠velog


오늘의 도구 추천

fx — Vercel Labs가 공개한 약 6.39 MiB의 Zig 코딩 에이전트 하네스입니다. 콜드 스타트 10µs, 셸에 가까운 출력, 모델 비종속, Apache⁠-⁠2.0 라이선스이며 Wasm으로도 돌아갑니다. 무거운 터미널 IDE 대신 작은 바이너리를 에이전트 샌드박스에 심고 싶은 팀에, 오늘의 주제인 하네스 자체를 실험하는 출발점으로 살펴볼 만합니다.


에디터 노트

어제는 모델로 가는 경로를 누가 쥐는지를 봤습니다. 오늘은 그 경로 위에서 에이전트가 실제로 점수를 내는 층이 드러납니다. 엔비디아는 같은 Opus 5로 30 %와 100 %를 갈라 놓았고, 구글은 환경을 다시 짜고 Gemma를 위성까지 보냈으며, 오픈AI는 양피지 위의 자유가 행위 능력 없이 남을 수 있다고 적었습니다.

메시지 플러그인, 선호 출처 버튼, 궤도 발사 창, 응답하지 않는 A2A 명함은 모두 같은 질문을 합니다. 다음 제품은 더 큰 모델이 아니라, 막혀도 앞으로 가고 어제 기억을 가릴 수 있는 환경 계약입니다.

다음에 또 찾아옵니다. — 에이브랜치