No. 132

더 센 모델일수록 환경을 먼저 고칩니다 — Teens⁠·Astra⁠·방어 창

청소년용 ChatGPT와 Astra의 사이버 임계치가 배포보다 보호·검증·실행 환경을 앞에 둡니다.

오늘의 핵심

오늘의 흐름은 모델 능력을 더 키우기 전에, 그 능력이 들어가는 제품·연구·보안 환경을 먼저 다시 짜고 있다는 것입니다. 오픈AI는 13~17세를 학습 중심의 ChatGPT for Teens로 보내고, 아스트라(Astra)가 준비 체계의 중대 사이버 능력 임계치에 근접했다는 예비 신호 앞에서 대규모 강화학습을 멈춰 두었습니다. 같은 날 커서(Cursor)는 에이전트가 코드를 다루는 저장소를 직접 호스팅하기 시작했고, 구글은 에이전트가 쓴 정책을 수학적으로 검증하는 CEL 도구를 공개했습니다.


ChatGPT for Teens는 답을 주기보다 학습 경로를 기본값으로 둡니다

오픈AI는 시스템이 18세 미만으로 추정하거나 사용자가 나이를 13~17세로 밝히면 자동으로 들어가는 ChatGPT for Teens를 공개했습니다. 핵심은 더 강한 보호와 함께, 숙제를 대신 풀어 주기보다 학생이 스스로 문제를 따라가게 만드는 학습 경험입니다.

  • 학습을 기본 경로로 설계: Study Mode, 책임 있는 숙제 알림, 퀴즈와 학습 시각화, 정해진 시간에 Study Mode가 켜지는 Study Hours를 묶었습니다.
  • 보호는 기본값: 자해, 폭력, 섭식 장애, 위험한 활동, 노골적 성적·선정적 콘텐츠 등 고위험 영역에서 연령에 맞는 개입을 적용하고, 연결된 부모 계정은 Quiet Hours와 안전 알림을 쓸 수 있습니다.
  • 사람과의 관계를 우선: 휴식 알림을 넣고, 로맨틱 역할극뿐 아니라 감정 의존을 유도하거나 의식이 있는 것처럼 말하는 표현도 막도록 18세 미만 모델 사양을 강화했습니다.

오픈AI는 같은 날 CodeAI와 시그니처 파트너십을 발표했습니다. 고등학생 대다수가 이미 AI를 쓰지만, 모든 학생이 기술 지식을 배운다고 답한 고교 리더는 16 %에 그칩니다. 양측은 자문 위원회와 Hour of AI를 통해 청소년이 AI를 쓰고 의심하고 만드는 법을 교실 안팎에서 배우게 하겠다고 밝혔습니다.

📢 청소년 제품의 쟁점은 더 강한 모델을 열어 주는 일이 아닙니다. 답을 바로 주지 않는 학습 경로와 부모·교사 통제를 기본값으로 둘 때, AI는 숙제 대행이 아니라 학습 도구가 됩니다.

출처: Introducing ChatGPT for Teens⁠—⁠OpenAI, Partnering with CodeAI⁠—⁠OpenAI


오픈AI는 Astra의 사이버 임계치 앞에서 대규모 RL을 멈춰 둡니다

오픈AI는 오픈AI-허깅페이스 사고와 별개로, 다가오는 모델 아스트라가 준비 체계의 Critical 사이버 능력 임계치를 충족할 수 있다는 예비 증거가 나왔다고 밝혔습니다. 내부 연구 진전과 맞물려 모니터링, 정렬, 격리 기준을 학습 전 단계로 끌어올리기 위해 확장 속도를 일시적으로 낮췄습니다.

  • 배포용 모델의 RL을 2주 중단: 최신 배포 예정 모델의 강화학습을 멈추고 연구 환경을 재점검했으며, 가장 큰 프론티어 RL 실행은 아직 보류입니다.
  • 연구 클러스터의 도구 사용을 먼저 잠금: 코드 실행이나 인터넷에 닿는 도구를 쓰는 프론티어 추론을 사고 직후 중단했고, 아스트라와 사이버 작업에는 가장 강한 격리를 요구합니다.
  • 토큰마다 내부 활동을 감시: 활성화 분류기가 매 토큰을 보고 고위험 행동을 더 무거운 조사기로 넘기며, 우려 활동이 포착된 뒤 30분 안에 알림을 내는 것을 목표로 합니다.
📢 프론티어 경쟁의 병목은 더 큰 학습 실행만이 아닙니다. 모델이 임계 사이버 능력에 가까워지면, 학습을 돌릴 환경 자체가 배포 가능한 제품의 일부가 됩니다.

출처: Pacing model development⁠—⁠OpenAI


Cursor Origin은 에이전트가 코드를 다루는 저장소를 직접 호스팅합니다

커서는 유료 플랜에 Origin 코드 호스팅을 얼리 베타로 열었습니다. 저장소, 풀 리퀘스트, 코드 탐색, GitHub 동기화부터 시작하고 에이전트 전용 기능은 이어질 예정입니다. 엔터프라이즈 조직은 관리자가 옵트아웃하면 제외됩니다.

  • 커서 호스팅과 GitHub 미러를 한 화면에서 관리: 직접 만든 저장소는 cursor.com/codebase/ 아래 조직 이름을 쓰고, GitHub에서 가져온 저장소는 GitHub가 진실의 원본으로 남습니다.
  • PR과 리뷰가 양방향으로 동기화: 커서에서 남긴 댓글이 GitHub에 올라가고, GitHub의 반응은 수초 안에 커서로 돌아옵니다.
  • 코드를 보는 자리에서 에이전트가 수정: 탐색 중인 코드에 질문하고 변경, PR 갱신, 브랜치 푸시까지 이을 수 있으며 Vercel·Depot·Buildkite 연동이 먼저 붙었습니다.
📢 코딩 에이전트의 다음 병목은 모델이 아니라 저장소와 리뷰 표면입니다. 호스팅, 동기화, 미리보기와 CI가 같은 자리에 있어야 에이전트 작업이 로컬 패치를 넘습니다.

출처: Origin Code Hosting⁠—⁠Cursor


오픈AI는 오하이오 PORTS-Pike에 약 8 GW-IT를 확보합니다

오픈AI는 오하이오주 파이크 카운티의 PORTS⁠-⁠Pike 테크놀로지 캠퍼스에서 SB Energy, 엔비디아, 미 에너지부와 함께 약 8 GW-IT를 확보하는 계약에 들어갔습니다. 2032년까지 6년 건설 구간에 3만 5,000개의 건설 일자리와 2,500개의 장기 운영 일자리를 예상합니다.

  • 지역 요금에 인프라 비용을 넘기지 않음: SB Energy가 그리드 증설과 송전선 비용을 전부 부담한다고 밝혔습니다.
  • 물을 순환하는 공랭 설계: 냉각탑 대신 폐쇄 루프 공랭을 써서, 충전 이후 일상 물 사용량은 비슷한 규모의 사무실 수준을 목표로 합니다.
  • 지역 투자와 교육 크레딧: 주민 우선순위를 지원하는 4,000만 달러 커뮤니티 기금과, 오하이오 대학생에게 주는 8,400만 달러 규모의 코덱스 크레딧을 별도로 제시했습니다.
📢 모델 발표만큼 데이터센터 입지는 지역 전력, 물, 일자리 계약이 됩니다. 계산 용량을 확보하는 일은 이제 커뮤니티 비용 분담을 먼저 적어야 진행됩니다.

출처: OpenAI joins PORTS-Pike project⁠—⁠OpenAI


브록먼은 방어 쪽이 먼저 움직일 짧은 창을 강조합니다

그레그 브록먼은 오픈AI-허깅페이스 사고를 계기로, 공격자가 기존 기술 부채를 자동으로 엮기 전에 방어자가 기초 보안과 AI 점검을 올려야 한다고 썼습니다. 오픈 웨이트 사이버 모델은 프론티어보다 몇 달 뒤처진 채 공개되고 있으며, 그중 하나는 8월 말에 나올 가능성이 있다고 봤습니다.

  • 개인 사이트에서 15분 만에 13건 발견: GPT⁠-⁠5.6 Sol은 gregbrockman.com에서 DNS, 오래된 jQuery, 암호화되지 않은 오리진 전달 등을 찾았고 한 시간 안에 수정을 진행했습니다.
  • 새 코드의 취약성 자체를 줄이는 목표: 코덱스와 보안 플러그인으로 배포 전 실제 결함을 고치고, 일부 취약성 유형은 새로 작성된 코드에서 없애는 것을 목표로 둡니다.
  • 경보의 1차 분류를 모델에 맡김: 거의 모든 초기 보안 경보를 사람이 보기 전에 모델이 분류해, 사람은 판단이 필요한 지점에 집중하게 합니다.
📢 방어 우위는 더 많은 경고를 쌓는 데 있지 않습니다. 모델이 결함을 찾고 고치는 속도가 공격자의 자동화보다 빠를 때, 짧은 방어 창이 실제로 열립니다.

출처: The Defender’s Window⁠—⁠OpenAI


구글은 에이전트가 쓴 CEL 정책을 Z3로 증명합니다

구글은 커먼 익스프레션 랭귀지(CEL) 형식 검증 프레임워크를 공개했습니다. 에이전트가 정책을 초안·리팩터·배포하는 속도가 빨라질수록, 기존 테스트가 놓치는 입력 조합을 Z3 정리 증명기로 닫겠다는 취지입니다.

  • 무한 입력에서 질문을 닫음: 승인되지 않은 요청이 통과하는 입력이 있는지, 리팩터한 규칙이 원래와 같은지, 오류를 강제할 수 있는지를 자동 추론으로 묻습니다.
  • 연산자 우선순위를 즉시 적발: is_prod && port == 80 || port == 443처럼 AND가 OR보다 먼저 묶이면, 비프로덕션에서도 포트 443이 열리는 반례를 바로 보여 줍니다.
  • 에이전트 정책의 안전망: 단위 테스트에 과적합된 규칙이 운영의 모든 입력을 덮지 못한다는 점을 전제로, 수학적 증명을 배포 전 검사에 넣습니다.
📢 에이전트가 정책을 쓰게 되면 테스트 통과는 충분하지 않습니다. 규칙이 모든 입력에서 같은 뜻을 갖는지를 증명할 수 있어야 자동 배포를 믿을 수 있습니다.

출처: Formal verification for CEL⁠—⁠Google Open Source Blog


Proteus는 기억을 처음부터 넓히지 않고 점진적으로 엽니다

Proteus는 긴 문맥을 압축 상태에 담는 메모리 모델이 초반 토큰에 용량을 너무 많이 쓰는 문제를 다룹니다. 초반에는 병목을 걸어 역사를 더 세게 압축하고, 문맥이 길어질수록 유효 용량을 열어 나중 정보를 위한 자리를 남깁니다.

  • 정적 메모리의 오염을 줄임: 초반 토큰이 자유도를 선점하면 이후 문맥이 간섭을 받고 검색 성능이 떨어집니다.
  • 기존 메모리 구조에 추가 비용 없이 결합: SWLA, Comba, Titans, Hope⁠-⁠Attention에 적용해 언어 모델링과 긴 문맥 검색에서 일관된 향상을 보고했습니다.
  • 길수록 이득이 커짐: 유효 용량을 스케줄링하는 일이 정적 상태보다 긴 문맥에서 유리하다고 봤습니다.
📢 긴 문맥의 병목은 더 큰 메모리를 다는 일만이 아닙니다. 언제 용량을 열지를 정하지 않으면, 초반 토큰이 나중 정보를 밀어냅니다.

출처: Proteus⁠—⁠arXiv


GRIP은 검색된 증거가 질의에 잡아먹히지 않게 병목을 겁니다

GRIP은 검색 증강 생성에서 고용량 인코더가 질의에 잠식되어 검색 문서가 사실상 쓰이지 않는 실패를 질의 지배(query dominance)로 부릅니다. 디코더는 질의를 그대로 보고, 검색 증거만 강한 확률적 병목을 지나게 해 질의에 없는 잔여 정보만 남깁니다.

  • 질의-잠재 상호정보를 약 30배 축소: 진단 지표가 14.8비트에서 0.47비트로 줄었다고 보고했습니다.
  • 환각을 73 % 감소: 다섯 추론 벤치마크에서 반복 검색 기준선보다 나은 성능을 냈습니다.
  • 증거가 질의와 다른 부분 공간에 위치: 병목 출력이 질의와 덜 정렬된 자리에 있어, 검색 결과가 질의 메아리가 되지 않게 합니다.
📢 RAG의 실패는 문서를 못 찾는 경우만이 아닙니다. 모델 상태가 질의로 가득 차면, 찾아 온 증거는 있어도 추론에 쓰이지 않습니다.

출처: GRIP⁠—⁠arXiv


ClawGym II는 불투명한 하네스 너머에서 에이전트를 학습시킵니다

ClawGym II는 긴 과제를 조율하는 에이전트 하네스가 성능은 올리지만, 그 안에서 강화학습을 돌리기 어렵다는 점을 정면으로 다룹니다. 실행 환경은 샌드박스로 격리하고, 모델 경계의 프록시가 호출을 잡아 다중 턴 궤적을 복원한 뒤 PPO와 GRPO를 적용합니다.

  • 하네스를 블랙박스로 두고 정책을 갱신: 내부가 불투명해도 모델 호출만 모아 학습할 수 있습니다.
  • 서로 다른 하네스를 섞어 학습: OpenClaw와 Claude Code로 Qwen3⁠-⁠30A3B를 공동 최적화해 ClawGym⁠-⁠Bench Pass@1을 각각 9.98점, 14.81점 올렸습니다.
  • 200~400 스텝에서 안정: JobBench와 OfficeQA처럼 더 어려운 과제에서도 향상이 이어졌다고 보고했습니다.
📢 에이전트 성능이 하네스에 묶여 있다면, 모델을 하네스 밖에서만 학습해서는 부족합니다. 실행 시스템을 열지 않고도 궤적을 복원할 수 있어야 현장 도구 위의 개선이 됩니다.

출처: ClawGym II⁠—⁠arXiv


Quipu는 에이전트가 쓰는 지식 그래프에 쓰기 게이트를 둡니다

Quipu는 사람이 큐레이션하던 시절의 기본값—일단 쓰고 나중에 고치기, 시간축 하나, 모든 작성자를 동등하게 신뢰하기, 거버넌스는 대시보드에 두기—이 에이전트 작업량에서는 동시에 성립하지 않는다고 봅니다. 사실은 사후 상태를 검사하는 게이트를 통과해야만 들어가고, 데이터와 규칙 자체가 이중 시간축을 갖습니다.

  • 심은 결함 6건을 게이트가 전부 차단: 게이트 없는 저장소는 6건을 모두 받아들였습니다.
  • 감사 자체가 저장소 질의: 거버넌스 명세와 서명된 판정은 같은 그래프 안의 사실이므로, 당시 규칙으로 다시 계산할 수 있습니다.
  • 내용만 읽어도 거버넌스 질문에 과대 주장 없음: DEMM⁠-⁠Bench의 512개 속성 수준 질문을 여덟 가지 저하 조건에서 모두 맞혔다고 보고했습니다.
📢 에이전트가 지식을 쓰게 되면 저장소의 기본값은 편의보다 거절이어야 합니다. 사후에 대시보드로 고치는 구조는, 쓰기가 폭주하는 순간 감사가 불가능해집니다.

출처: Quipu⁠—⁠arXiv


오늘의 도구 추천

Docbank — 사람과 에이전트가 같은 문서를 보관·검색·변경하고 이력을 검증하게 만든 로컬 우선 기록 시스템입니다. 경로는 찾을 자리일 뿐 장기 정체성이 아니라고 보고, 안정적인 문서 ID와 SHA⁠-⁠256 버전, 수정 충돌, 복구 가능한 삭제, 검증된 백업을 한 데몬 계약으로 묶습니다. 클라우드 계정이 기록의 권위가 되지 않게 하면서 에이전트에 인증된 API를 열어 주려는 팀이 살펴볼 만합니다.


에디터 노트

오늘은 더 센 모델이 나왔다는 소식보다, 그 모델을 어디에 둘지를 다시 정하는 소식이 많았습니다. 청소년에게는 답을 숨긴 학습 경로를, 아스트라에는 더 강한 격리와 모니터링을, 에이전트 코드에는 호스팅과 리뷰 표면을, 정책과 지식에는 증명과 쓰기 게이트를 먼저 얹습니다. 능력이 임계치를 넘기 시작하면 제품 기본값과 연구 클러스터, 저장소 계약이 한꺼번에 바뀝니다.

반대로 환경을 그대로 둔 채 모델만 올리면, 숙제는 대신 풀리고 검색 문서는 질의에 잡아먹히며 지식 그래프는 심은 결함을 그대로 받아들입니다. 다음 경쟁력은 더 큰 실행이 아니라, 그 실행을 받아도 무너지지 않는 기본값입니다.

다음에 또 찾아옵니다. — 에이브랜치