No. 130

모델보다 실행 구조가 능력을 만듭니다 — Qwen 3.8과 기억⁠·평가⁠·해석의 재설계

Qwen 3.8-27B부터 장기 기억, 월드 모델, AI 과학자와 안전 평가까지 실행 구조의 변화를 살핍니다.

오늘의 핵심

오늘의 흐름은 모델 크기보다 모델이 보고, 기억하고, 서로 전달하며, 평가받는 구조가 실제 성능을 결정한다는 것입니다. Qwen3.8⁠-⁠27B는 27B 밀집 모델 안에 장기 에이전트 실행과 네이티브 멀티모달을 묶었고, 최신 연구들은 외부 월드 상태, 연상 기억, 잠재 표현 통신과 사람 선호 기반 평가로 실행 경로를 다시 설계합니다. 더 강한 모델 하나보다 올바른 상태와 증거를 끝까지 보존하는 시스템이 중요해지고 있습니다.


Qwen3.8-27B가 27B 밀집 모델에 장기 에이전트 실행을 담았습니다

알리바바 Qwen 팀이 Qwen3.8⁠-⁠27B 가중치를 공개했습니다. 이미지와 비디오를 이해하는 네이티브 비전·언어 모델이며, 사고 모드를 요청마다 끄거나 reasoning_effort로 깊이를 조절할 수 있습니다.

  • 262,144 토큰의 기본 문맥: 공식 카드 기준으로 최대 1M 토큰까지 확장할 수 있으며 이전 메시지의 추론 문맥도 보존할 수 있습니다.
  • 코딩과 업무 실행을 함께 겨냥: 자체 평가에서 Terminal Bench 2.1은 73.0점, SWE⁠-⁠bench Pro는 61.7점, CoWorkBench는 70.7점을 기록했습니다.
  • 배포 가능한 27B 밀집 구조: Transformers 가중치를 공개하고 vLLM, SGLang과 TokenSpeed 같은 주요 서빙 엔진 호환을 안내했습니다.
📢 오픈 모델 경쟁의 초점이 단일 응답 품질에서 긴 문맥, 환경 피드백과 도구 실행을 끝까지 이어 가는 배포 가능한 에이전트 성능으로 옮겨가고 있습니다.

출처: Qwen3.8⁠-⁠27B⁠—⁠Hugging Face


영상 생성의 잠재 공간은 복원 점수보다 의미를 보존해야 합니다

V⁠-⁠RAE는 픽셀 복원에 최적화된 기존 비디오 오토인코더 대신, 동결된 비전 파운데이션 모델의 표현 위에 생성용 잠재 공간을 구축합니다. 가벼운 시간 풀링으로 중복을 줄이면서 의미 구조를 유지합니다.

  • 복원과 생성의 목표를 분리: K600에서 2.13 rFVD를 기록하면서 기존 비디오 토크나이저보다 더 많은 의미 정보를 잠재 공간에 남겼습니다.
  • 학습 수렴 최대 6배 향상: 같은 생성 설정에서 UCF101과 K600의 gFVD를 각각 117.86과 19.16으로 보고했습니다.
  • 시간 일관성을 별도로 측정: 픽셀 복원 점수보다 후속 생성 품질과 더 잘 맞는 tFVD 진단 지표를 제안했습니다.
📢 생성 모델의 압축기는 원본 프레임을 잘 복사하는 장치가 아니라, 이후 모델이 움직임과 의미를 더 쉽게 학습하도록 정보를 재배치하는 인터페이스가 됩니다.

출처: V⁠-⁠RAE⁠—⁠arXiv


휴머노이드 평가는 관절 오차보다 사람이 보는 미끄러짐을 측정합니다

HumanTracker는 휴머노이드 모션 트래킹의 수치 오차와 사람이 영상에서 느끼는 자연스러움 사이의 간극을 다룹니다. 기존 평균 관절 오차가 놓치기 쉬운 발 미끄러짐, 불안정한 지지와 잘못된 접촉 시점을 평가 대상으로 끌어왔습니다.

  • 약 153시간의 동작 궤적: 전문 퍼포머의 광학 모션을 4개 동작군과 세부 텍스트 레이블로 구성했습니다.
  • 사람 선호를 학습한 HumanScore: 12,000개 동작 쌍, 총 24,000개 동작으로 선호 정렬 지표를 훈련했습니다.
  • 물리적 실패를 더 잘 발견: 대표 최신 트래커 비교에서 기존 운동학 지표보다 사람 선호를 잘 예측하고 접촉·안정성 오류를 드러냈습니다.
📢 로봇 평가가 사람의 체감과 어긋나면 벤치마크를 통과한 동작도 실제 배치에서 불안하게 보입니다. 사람 선호는 미관이 아니라 물리적 신뢰성의 관측 장치가 됩니다.

출처: HumanTracker⁠—⁠arXiv


월드 모델은 모든 과거 프레임 대신 필요한 세계 상태만 불러옵니다

Alaya⁠-⁠EVOKE는 대화형 월드 모델의 과거를 디노이저 문맥이나 KV 캐시에 계속 쌓지 않습니다. 카메라 위치에 연결된 외부 월드 상태 은행을 두고 현재 시점에 필요한 기하 정보만 검색합니다.

  • 세션이 길어져도 문맥 크기를 제한: 장면 기하를 외부 상태로 분리해 기억과 계산량이 실행 길이에 그대로 묶이지 않도록 했습니다.
  • 30초 교사에서 3단계 학생으로 전이: 장기 드리프트를 드러내는 자기 강제 롤아웃으로 빠른 학생 모델을 학습했습니다.
  • 반응성과 지속성의 절충을 정량화: 단일 H200, 384×640 해상도에서 1.5초 분량을 2.11초에 생성했다고 보고했습니다.
📢 긴 세계를 만드는 핵심은 모든 장면을 기억하는 것이 아니라, 다시 보게 될 구조와 바뀐 상태를 외부화하고 현재 시야에 맞게 회수하는 데 있습니다.

출처: Alaya⁠-⁠EVOKE⁠—⁠arXiv


희소 오토인코더의 특징을 모델이 직접 문장으로 설명합니다

SAEVerbalizer는 희소 오토인코더의 디코더 방향을 언어 모델 내부 표현에 주입하고, 뒤쪽 계층이 그 의미를 자연어로 설명하도록 훈련합니다. 관찰 예시를 대량으로 모아 외부 모델이 이름을 붙이던 기존 방식과 다릅니다.

  • 방향 자체에서 설명 생성: 활성 예시가 아니라 SAE 디코더 벡터를 입력 신호로 사용합니다.
  • 보지 못한 특징으로 일반화: 새로운 특징과 별도로 훈련된 SAE 사전에도 설명 능력이 전이됐습니다.
  • 개입과 설명의 의미가 연결: 여러 방향을 함께 주입하면 의미가 결합됐고, 방향을 뒤집으면 설명도 대응해 바뀌었습니다.
📢 해석 가능성 도구가 상관관계를 보고 이름을 붙이는 단계에서, 내부 특징을 직접 조작하고 설명의 의미 변화까지 검증하는 단계로 이동하고 있습니다.

출처: SAEVerbalizer⁠—⁠arXiv


장기 기억은 한 번의 검색보다 연상으로 빠진 증거를 복원합니다

RippleMem은 에이전트 대화를 단일 문서 조각으로 검색하지 않고, 단서가 풍부한 에피소드와 사건 중심 그래프로 저장합니다. 첫 검색 결과를 다음 연상의 단서로 사용해 흩어진 근거를 단계적으로 모읍니다.

  • 앵커 뒤에 연상 확장: 질의와 가까운 기억을 먼저 찾고 의미·구조 연결을 따라 빠진 뒷받침 증거를 회수합니다.
  • 두 장기 기억 벤치마크 개선: LLM 심사 정확도를 LoCoMo에서 3.95 %p, LongMemEval⁠-⁠S에서 최대 11.87 %p 높였습니다.
  • 그래프 구축 비용 약 30배 감소: 풍부한 사건 문맥을 유지하면서도 기존 그래프형 기억보다 구축 부담을 낮췄습니다.
📢 에이전트 기억의 병목은 저장 용량이 아니라 첫 검색에서 놓친 관계를 다시 찾는 능력입니다. 회수 결과가 다음 회수의 단서가 되어야 긴 작업의 맥락이 이어집니다.

출처: RippleMem⁠—⁠arXiv


AI 과학자는 새 발견 전에 기존 논문을 재현하는 법부터 배웁니다

Training AI Scientists to Replicate Research는 논문 재현을 장기 과학 에이전트의 훈련 과제로 바꾼 Replica를 제안합니다. 불완전한 방법 설명을 해석하고 실험으로 빈틈을 메우는 과정 자체에 보상을 줍니다.

  • 확장 가능한 재현 과제와 심사기: 자동 생성된 루브릭 심사기가 사람의 재현 품질 평가와 낮은 잡음으로 일치하도록 설계됐습니다.
  • 27B Faraday를 후속 훈련: 코딩 에이전트를 도구로 쓰는 과학 에이전트가 보류된 재현 과제에서 Claude Opus 4.8과 GPT⁠-⁠5.5를 넘어섰다고 보고했습니다.
  • 결과보다 과학적 과정이 달라짐: 개별 실행 분석에서 가설을 세우고 확인하는 더 원칙적인 접근이 나타났습니다.
📢 자율 과학의 현실적인 첫 기준은 참신한 문장을 만드는 능력이 아니라, 다른 연구자의 결과를 독립적으로 다시 만들고 불명확한 조건을 증거로 해소하는 능력입니다.

출처: Replica⁠—⁠arXiv


평가를 감지하는 내부 방향은 모델보다 질문 문구에 더 흔들립니다

A Probe Direction Is a Property of Its Prompt는 모델이 평가 상황을 감지하는지 읽어내는 활성값 프로브를 다시 검증했습니다. 같은 과제에서 평가를 알리는 문구만 바꿔도 점수와 모델 크기에 따른 추세 방향까지 달라졌습니다.

  • 프로브에 숨은 자유도: 무엇을 ‘평가를 알리는 프롬프트’로 정했는지가 측정값에 명시되지 않았습니다.
  • 상반된 기존 결과를 모두 재현: 하나의 설계에서 프롬프트 선택만 바꿔도 규모가 커질수록 증가하거나 감소하는 두 결론이 나왔습니다.
  • 문항 수 추가로는 해결되지 않음: 모델보다 모델과 프롬프트의 상호작용이 분산의 큰 부분을 차지해 여러 프롬프트를 측정 설계에 포함해야 했습니다.
📢 내부 표현을 읽는 프로브도 측정 기기입니다. 단일 문구로 만든 방향을 모델의 고유 속성처럼 비교하면 프롬프트의 편향을 모델 차이로 오인할 수 있습니다.

출처: Prompt Direction Audit⁠—⁠arXiv


멀티에이전트는 문장 대신 잠재 상태를 훈련 없이 전달합니다

StateBridge는 송신 모델의 마지막 계층 은닉 상태를 수신 모델의 입력 공간에 닫힌형 직교 변환으로 맞춥니다. 별도 프로젝터 훈련 없이 정규화 보정과 어휘 앵커링을 거쳐 연속 프리픽스로 전달합니다.

  • 텍스트 병목을 우회: 은닉 상태를 토큰으로 바꾸며 사라지는 정보를 연속 표현으로 보존합니다.
  • 레이어별 주입이나 학습된 변환기 불필요: 사전학습 입력 분포에 맞추는 가벼운 보정으로 모델 간 이식성을 높였습니다.
  • 26개 조합 중 22개에서 최고 또는 공동 최고: 두 모델 계열의 수학, 코드 생성과 질의응답 과제에서 가장 강한 기준선을 일관되게 앞섰습니다.
📢 에이전트 협업의 다음 인터페이스는 사람이 읽는 메시지만이 아닐 수 있습니다. 다만 잠재 상태 통신은 성능 이득과 함께 감사 가능성을 어떻게 보존할지가 핵심 과제가 됩니다.

출처: StateBridge⁠—⁠arXiv


안전 학습은 포장 형식이 아니라 같은 의도를 묶어 가르칩니다

Refusing Intent, Not Form 연구는 유해 요청을 코드 블록이나 역할극으로 감싸면 거부가 약해지고, 같은 형식의 무해한 요청은 과도하게 거부되는 문제를 다룹니다. WIFA는 구조가 같은 유해·무해 예시를 의도 그룹으로 묶어 자동 증강합니다.

  • 외부 교사와 수동 레이블 없이 구성: 같은 의도를 여러 래퍼 형식으로 만들고 반대 의도의 구조적 대응 예시를 함께 제공합니다.
  • 안전성과 과잉 거부를 나눠 최적화: WIFA⁠-⁠Boost는 변형된 유해 요청 거부를 강화하고, A⁠-⁠GCRT는 그룹 간 거부·준수 점수를 일관되게 맞춥니다.
  • 과잉 거부 25.7 %에서 17.4 %로 감소: Qwen 설정의 OR⁠-⁠Bench에서 기본 모델보다 무해 요청 거부를 낮췄습니다.
📢 안전 모델이 문구의 겉모양을 외우면 공격자는 포장만 바꾸고 정상 사용자는 표현 방식 때문에 막힙니다. 감독 단위는 문자열이 아니라 보존돼야 할 의도여야 합니다.

출처: Refusing Intent, Not Form⁠—⁠arXiv


오늘의 도구 추천

Hubble.md — 사람과 에이전트가 같은 Markdown·HTML 폴더를 함께 편집하는 오픈소스 데스크톱 노트 앱입니다. / 명령, 프론트매터와 실시간 파일 변경 반영을 지원하고, 에이전트가 노트 폴더를 표·책장·지도 같은 HTML 보기로 바꿀 수 있습니다. macOS, Windows와 Linux용 데스크톱 앱을 제공해 에이전트 메모리를 폐쇄형 데이터베이스보다 사람이 직접 읽고 고칠 수 있는 파일로 운용하려는 팀이 살펴볼 만합니다.


에디터 노트

오늘 소식의 공통점은 모델 바깥의 구조가 모델 안의 파라미터만큼 중요해졌다는 것입니다. Qwen3.8⁠-⁠27B는 비교적 작은 밀집 모델에 긴 문맥과 에이전트 실행을 담았지만, 그 능력이 실제 작업으로 이어지려면 세계 상태를 외부화하고, 흩어진 기억을 연상으로 복원하며, 다른 에이전트에게 정보를 덜 잃고 전달해야 합니다.

평가도 같은 방향으로 바뀝니다. 사람 눈에 보이는 로봇의 미끄러짐을 재고, 논문 재현 과정을 훈련하며, 안전 행동이 포장 문구가 아니라 의도를 따르는지 확인해야 합니다. 성능은 더 이상 모델 파일 하나의 속성이 아닙니다. 상태·인터페이스·감사 가능한 증거를 어떻게 연결했는지가 곧 시스템의 능력입니다.

다음에 또 찾아옵니다. — 에이브랜치