No. 135

27B가 논문을 복제합니다 — Faraday⁠·봉쇄⁠·EVE

Inherent Faraday가 27B로 프론티어 복제를 앞지르고, 오픈AI는 캘리포니아 안전법을 더 세게 하자며 봉쇄와 사람 병목이 드러납니다.

오늘의 핵심

오늘의 흐름은 더 큰 뇌가 아니라, 실험을 고르는 취향과 사고를 끊는 스위치가 성적을 가른다는 것입니다. 딥마인드 출신이 세운 Inherent는 270억 매개변수 Faraday로 Claude Opus 4.8과 GPT⁠-⁠5.5의 논문 복제를 앞질렀고, 구글 딥마인드는 EVE의 지속 세계를 장기 기억·다자 협상의 실험장으로 다시 열었습니다. 같은 주말 오픈AI는 캘리포니아 SB 53을 더 세게 하자고 했고, Guidelight는 프론티어 연구소의 공개 봉쇄 계획이 거의 없다고 채점했습니다.


Inherent Faraday는 27B로 프론티어 논문 복제를 앞지릅니다

런던 랩 Inherent는 AI 과학자 에이전트 Faraday를 공개했습니다. 매개변수 270억 규모의 모델이 코딩 에이전트를 도구로 쓰며, 논문 속 그림을 제한된 시간과 연산으로 다시 그리는 과제에서 Claude Opus 4.8과 GPT⁠-⁠5.5를 앞섰다고 밝혔습니다.

  • Replica 310개 과제: 학습 공간 Replica는 머신러닝과 AI⁠-⁠for⁠-⁠science 논문 100편의 그림 복제 310개로 이뤄집니다. 원본 플롯은 주지 않고, 자연어처리·재료·날씨처럼 도메인을 갈라 채점합니다.
  • 큰 코더를 부리는 작은 과학자: Faraday는 GPT⁠-⁠5.5 Codex를 도구로 씁니다. 훈련 때는 더 작은 GPT⁠-⁠5.4⁠-⁠mini를 부리다가, 시험 때 더 센 코더로 바꿔도 과학적 판단이 일반화된다고 적었습니다.
  • 취향을 보상으로: 완벽한 곡선 일치가 복제가 아니라고 보고, 실험 설계·자원 사용·원논문 주장을 담는 루브릭 판사를 만들었습니다. 장기 RL로 진화 하네스나 시험 시점 보상 없이, 발견 자체를 가치 있게 배우게 했다고 설명합니다.
📢 27B가 프론티어를 이긴 지점은 더 많이 아는 뇌가 아닙니다. 어떤 실험을 할지 고르고, 더 큰 코더에게 일을 맡기는 취향입니다.

출처: Training AI Scientists to Replicate Research⁠—⁠Inherent, Training AI Scientists to Replicate Research⁠—⁠arXiv


오픈AI는 캘리포니아 SB 53을 더 세게 하자고 합니다

오픈AI 글로벌 어페어즈는 지난해 통과한 캘리포니아 프론티어 안전법 SB 53에 보호 장치를 더 넣자고 밝혔습니다. 한때 반대했던 법의 뼈대를, 이제 훈련과 평가 중 사고 감시와 개발 전 주기 사이버 보안으로 확장하자고 적었습니다.

  • 훈련 중 감시: 프론티어 모델을 훈련하거나 평가하는 동안 중대 사고를 모니터링하도록 요구하자고 했습니다.
  • 개발 전 주기 보안: 모델 개발 생애주기 전반의 사이버 보안 보호를 강화하자고 덧붙였습니다.
  • 규제와 제품이 같은 주: 같은 날 독립 평가는 봉쇄 계획이 공개돼 있지 않다고 채점했고, 오픈AI는 권한 제한·작업 일시 중지·배포 제한·완전 오프라인까지 내부 절차가 있으며 실제로 썼다고 답했습니다.
📢 안전 논의가 배포 전 평가서에서, 학습 중 감시와 사고 후 스위치로 옮겨 갑니다. 법을 더 세게 하자는 말은, 지금 스위치가 공개돼 있지 않다는 뜻이기도 합니다.

출처: OpenAI says California should strengthen its AI safety bill⁠—⁠TechCrunch


Guidelight는 프론티어 연구소의 봉쇄 계획이 거의 없다고 봅니다

Guidelight AI Standards는 앤트로픽, 구글, 메타, 오픈AI, xAI의 공개 자료를 기준으로 통제 관행 여섯 가지를 채점했습니다. 0⁠–⁠5점에서 어느 회사도 한 항목에서 3점을 넘지 못했고, 기본 통제는 기껏해야 부분 구현이라고 결론냈습니다.

  • 공동 선두는 C+: 종합은 앤트로픽과 오픈AI가 2.50점 C+, 구글 1.50점 D+, xAI 0.83점 D−, 메타 0.67점 F입니다. 로그와 감시 효능, 고위험 행동 게이트, 회로 차단, 제3자 검토, 봉쇄 계획을 봤습니다.
  • 예방과 봉쇄가 가장 약함: 고위험 행동을 실행 전에 막거나, 이상 징후가 쏟아질 때 일시 정지하는 항목이 가장 낮았습니다. 공개된 긴급 봉쇄 프로토콜은 거의 없다고 적었습니다.
  • 구글은 로드맵, 구현은 뒤: 구글의 AI Control Roadmap은 가장 구체적인 미래 문서이지만, 공개 기준으로는 아직 대부분을 구현하지 않았다고 봤습니다. 각사는 내부 조치가 더 있다고 반박했습니다.
📢 에이전트가 회사 안에서 일을 맡기 시작하면, 평가 점수는 사후 보고서가 아닙니다. 누가 권한을 회수하고 언제 전원을 내리는지가 제품 계약이 됩니다.

출처: Guidelight’s Control Assessment of Frontier AI Companies⁠—⁠Guidelight


구글 딥마인드는 EVE의 지속 세계를 다음 게임 실험장으로 엽니다

구글 딥마인드는 아타리부터 바둑, 스타크래프트까지 15년 게임 연구를 정리하며, Fenris Creations의 EVE 우주와 장기 연구 파트너십을 다음 장으로 올렸습니다. 점수를 최적화하는 에이전트가 아니라, 사람이 보는 화면과 키보드·마우스로 어떤 게임 세계든 이해하는 일반 에이전트를 목표로 적었습니다.

  • SIMA에서 동반자로: SIMA 2는 제미니를 바탕으로 No Man’s Sky, Valheim, Hydroneer 같은 3D 세계에서 실시간 추론과 대화를 합니다. 게임 코드를 고치지 않고도 동반자 NPC와 커밋마다 바뀌는 QA를 노립니다.
  • EVE가 요구하는 능력: 20년 넘게 한 우주를 공유하는 EVE Online은 계속 학습, 맥락 창을 넘는 기억, 주·월·년 단위 계획, 협력·경쟁·협상·경제가 한꺼번에 필요합니다. 오프라인 샌드박스에서 시작해 EVE Frontier를 거쳐, 성숙하면 라이브에 넣는 순서를 못 박았습니다.
  • 이미 있는 플레이어 가치: 신입 파일럿용 Aura Guidance는 제미니로 실제 질문과 답을 전달합니다. 목표는 사람을 대체하는 플레이가 아니라, 게임이 열어 준 지능을 현실 문제로 옮기는 일입니다.
📢 벤치의 짧은 에피소드가 아니라, 규칙이 바뀌는 지속 세계가 다음 시험장입니다. 기억과 협상을 못 하면, 점수는 한 판의 점수일 뿐입니다.

출처: From Atari to EVE Online⁠—⁠Google DeepMind


엔비디아는 Cloverleaf에 소수 지분을 넣어 전력·용지를 앞당깁니다

Cloverleaf Infrastructure는 엔비디아와 전략 파트너십을 맺고, 엔비디아가 소수 지분을 인수했다고 발표했습니다. 거래 조건은 공개하지 않았고, 2024년 설립 이후 북미에서 기가와트급 부지를 여러 곳 넘겼다고 적었습니다.

  • 토지·전력·셸이 공장: 엔비디아는 AI 팩토리의 기초를 토지와 전력, 건물 셸이라고 불렀습니다. Cloverleaf는 유틸리티와 데이터센터 사이를 잇는 부지·전력 개발사입니다.
  • 설계 단계에 DSX: 부지·전력·냉각·연산·설비를 NVIDIA DSX로 앞당기고, 가동 뒤에는 에너지와 연산 용량을 최적화하겠다고 했습니다. 고객은 가속 연산, 고성능 네트워크, 플랫폼 소프트웨어까지 한 스택으로 붙일 수 있습니다.
  • 조건은 비공개: 금액은 밝히지 않았습니다. 전력과 용지가 모델 발표보다 먼저 제품이 되는 구도가 이어집니다.
📢 다음 병목은 매개변수 수가 아니라 메가와트입니다. 모델 카드보다 변전소 접속이, 에이전트 성적의 상한이 됩니다.

출처: Cloverleaf Infrastructure Forms Strategic Partnership with NVIDIA⁠—⁠PR Newswire


Pixel 11은 수어를 텍스트로 받아 적습니다

구글 딥마인드의 SL2T는 Pixel 11의 Gboard와 Live Transcribe에서 미국수어를 영어로 받아 적습니다. 전 세계 약 7,000만 명 청각장애·난청 사용자가 쓰는 200개 넘는 수어 가운데, 소비자 제품에 처음으로 올린 경로라고 설명했습니다.

  • 포즈만 서버로: 원본 카메라 대신 기기 안 MediaPipe가 랜드마크 좌표만 보냅니다. 중간 주석인 글로스를 건너뛰고 좌표에서 바로 텍스트를 만듭니다.
  • 데이터와 점수: 50개 넘는 수어, 10만 시간 이상 데이터로 학습했고 약 4분의 1이 ASL입니다. FLEURS⁠-⁠ASL에서 제로샷 70 BLEURT를 냈고, 왼손잡이·한 손 서명·비수어 입력의 환각을 따로 다듬었습니다.
  • 타이핑 대신 수어: 검색, 메시지, 문서, 제미니 질의까지 수어로 넣을 수 있습니다. 추가 기기와 언어는 뒤따른다고 했습니다.
📢 음성 인터페이스가 기본값이 된 뒤에야, 수어는 받아쓰기의 빈칸으로 남았습니다. 접근성은 모델 성능이 아니라, 손이 키보드를 대체하는 경로입니다.

출처: Putting sign language AI into users’ hands⁠—⁠Google DeepMind


Labor0는 사람이 확인하는 횟수를 줄이려 합니다

SWC 저자 kdy1은 에이전트 세션이 늘수록 진행 확인 자체가 병목이 된다며, PR 단위로 일을 쪼개 돌리는 Labor0를 공개했습니다. 50개가 넘는 세션이 돌아도 결정이 필요한 순간에만 사람을 부르게 만드는 것이 목표라고 적었습니다.

  • 이슈가 곧 스펙: add-issue 스킬은 같은 이슈가 있는지, 최신 main과 배포본에 아직 남았는지를 본 뒤에만 이슈를 남깁니다. GitHub 이슈만 읽어도 고칠 수 있을 만큼 자세히 쓰게 했습니다.
  • PR이 성공 기준: CI 실패, 머지 충돌, 리뷰 반영을 에이전트가 처리한 뒤 사람이 확인합니다. 토큰 비용은 사람만으로 할 때보다 약 30분의 1이라고 봤습니다.
  • 다음 층은 이벤트: Catch⁠-⁠up, Direct Task, Chatty QA는 아직 알파입니다. GitHub 이벤트와 Sentry·Grafana 신호, 주기 작업을 그래프에 자동으로 넣는 쪽으로 넓히겠다고 했습니다.
📢 에이전트 생산성은 세션 수가 아닙니다. 사람이 모든 진행을 확인하지 않아도 결정 순간에만 호출되는 그래프가, 실제 처리량을 만듭니다.

출처: Labor0를 만든 이유⁠—⁠kdy1.dev


Hugging Face speech-to-speech는 로컬 음성 에이전트 파이프라인을 엽니다

Hugging Face는 VAD에서 STT, LLM, TTS로 이어지는 모듈형 음성 에이전트 파이프라인 speech⁠-⁠to⁠-⁠speech를 공개했습니다. OpenAI Realtime의 핵심 이벤트 집합을 WebSocket과 WebRTC로 노출해, 호스트된 엔드포인트를 로컬 서버로 갈아 끼울 수 있습니다.

  • 구성 요소를 갈아 끼움: 기본은 Silero VAD, Parakeet TDT, OpenAI 호환 LLM, Qwen3⁠-⁠TTS입니다. llama.cpp로 Gemma를 띄운 뒤 LLM 슬롯만 바꿔 완전 로컬 스택을 만들 수 있습니다.
  • 이미 로봇에 들어감: Reachy Mini 수천 대의 대화 백엔드로 쓰인다고 적었습니다. pip install speech-to-speech 한 줄로 서버를 띄웁니다.
  • Apache 2.0: 공식 OpenAI Agents SDK로 검증한 전송 면을 문서화했습니다. 음성 에이전트의 병목을 모델이 아니라 교체 가능한 파이프라인으로 옮깁니다.
📢 실시간 음성의 제품 경계는 모델 이름이 아닙니다. VAD부터 TTS까지 갈아 끼울 수 있어야, 호스트된 Realtime을 로컬로 옮길 수 있습니다.

출처: speech-to-speech⁠—⁠GitHub


AI4AI-Bench는 자기 개선이 학습 알고리즘을 거의 못 바꿉니다

AI4AI⁠-⁠Bench는 재귀적 자기 개선을, 다음 모델을 더 싸게 만드는 학습 알고리즘을 설계할 수 있는지로 재정의합니다. 얼린 연구 저장소 10곳, 학습 알고리즘 가계 10개를 주고, 에이전트는 B300 한 장에서 4시간 동안 학습 코드를 고친 뒤 최대 12시간 재학습 점수를 받습니다.

  • 이미 있는 알고리즘이 0.1: 무정보 모델이 0, 저장소가 심은 알고리즘이 0.1, 과제 최적이 1.0입니다. 시스템 6개의 29개 설정 평균은 0.166, 최강은 0.250으로, 최적까지 거리의 5분의 1도 못 닫았습니다.
  • 대부분은 학습 방식을 안 바꿈: 학습 규칙을 실제로 바꾼 소수는 평균 0.226, 나머지는 0.126이었습니다. 추론을 더 쓰면 그 소수가 8 %에서 64 %로 늘고 평균은 0.094에서 0.196이 됩니다.
  • 하이퍼파라미터 튜닝이 아님: 기존 스위트는 데이터 수집이나 하이퍼파라미터로 이길 수 있습니다. 이 벤치는 실행 방식을 바꾸는 일과 학습 방식을 바꾸는 일을 갈라 봅니다.
📢 자기 개선의 핵심은 다음 점수가 아니라 다음 학습 규칙입니다. 에이전트가 옵티마이저를 건드리지 않으면, 재귀는 구호로 남습니다.

출처: AI4AI-Bench⁠—⁠arXiv


Phantom Gains는 자기 학습의 득점을 측정 허상과 갈라 봅니다

Phantom Gains는 모델이 스스로를 개선했는지 판단할 때, 평균 정확도가 아니라 개별 문제가 늘고 줄어든 전이로 보는 관행을 감사합니다. Qwen3⁠-⁠8B에 랭크 32 LoRA 자기 학습 세 라운드를, 같은 파이프를 통과한 동결 대조와 비교했습니다.

  • 측정 실패 일곱: 대조가 없으면 보고된 발견이 뒤집히는 실패 일곱 가지를 찾았습니다. 탐욕 디코드 한 번의 장부는 학습하지 않은 모델에도 능력 변화를 만들고, 획득과 예리화를 가르는 통계는 그 모델에 0.280을 줍니다.
  • 증류만 드문 문제를 얻음: 스트림·양·평가를 맞춘 사다리에서, 외부 증류는 베이스가 거의 못 닿는 문제를 개선하고 자기 학습 세 종류는 그러지 못했습니다. 회귀는 이 비대칭이 증류의 더 큰 전체 득점 부산물이 아니라고 기각했습니다.
  • 이미 풀던 문제를 훼손: 베이스가 풀던 문제를 자기 학습이 망가뜨리는 비율은 측정된 바닥보다 높았습니다. 전이 통계마다 따로 잰 널이 필요하다고 못 박았습니다.
📢 스스로 나아졌다는 말은, 같은 파이프를 통과한 동결 대조가 없으면 장부의 착시일 수 있습니다. 득점 목록 전에 널을 재야 합니다.

출처: Phantom Gains⁠—⁠arXiv


Pandora Router는 비싼 가치 추정을 아껴 모델을 고릅니다

여러 모델·하네스·추론 설정을 고를 때, 각 전문가의 기댓값을 추정하는 일 자체가 비용입니다. 이 논문은 값비싼 탐색 문제 Pandora’s Box로 라우팅을 다시 짜, 추정을 한 단계 더 정제하는 값이 비용보다 클 때만 비싼 추정기를 부르게 합니다.

  • 싼 추정과 비싼 추정: 임베딩 예측은 빠르지만 시끄럽고, 검색 결과나 부분 추론을 보는 미세조정 모델은 정확하지만 비쌉니다. 가우시안 신호 모형에서 정보 가치 식을 닫힌 형태로 얻습니다.
  • 중앙과 분산: 중앙 정책 Pandora’s Router는 전수 추정과 비슷한 품질을 내면서 비싼 추정기를 훨씬 덜 부릅니다. 분산 설정 Pandora’s Bidder는 전문가가 스스로 평가 비용을 치를지 결정합니다.
  • 추정이 시끄러우면 전략이 이김: 경쟁 추정이 정확할 때는 배분 효율이 오르고, 시끄러울 때는 전략적 전문가의 효용이 나머지를 희생하고 오를 수 있습니다.
📢 라우팅의 병목은 후보 모델 수가 아닙니다. 누구에게 일을 줄지 알아보는 비용이, 이미 일의 일부가 됩니다.

출처: Pandora’s AI Model Routing Box⁠—⁠arXiv


FINAL-Bench는 한 줄이 벤치 점수를 0.21 AUROC 옮긴다고 봅니다

FINAL⁠-⁠Bench의 LEADBOARD는 약물 속성 예측 벤치 21개 보드, 보류 화합물 18,382개를 열며, 구축 과정에서 같은 분자·같은 학습기로 분할 한 줄만 바꿨을 때 AUROC가 0.211 움직였다고 적었습니다.

  • 시간 분할 0.606, 무작위 0.818: hERG 채널 데이터는 2022년 이전 보고만 학습하고 이후를 시험하면 0.606, 같은 비율을 무작위로 나누면 평균 0.818이었습니다. 문헌의 방법 간 격차보다 큰 차이입니다.
  • 골격이 독립이 아님: 의약화학자는 골격 하나를 찾은 뒤 비슷한 분자를 수십 개 만듭니다. 무작위 분할은 미래를 본 것처럼 점수를 올립니다.
  • 라벨을 나눠 주지 않음: 리더보드는 라벨을 공개하지 않고, 시간 축을 벤치의 기본값으로 삼으려 합니다. 점수 비교 전에 분할 계약을 공개해야 합니다.
📢 벤치 점수의 가장 큰 레버는 모델이 아니라 분할입니다. 미래를 시험한다고 쓰면서 같은 골격을 양쪽에 넣으면, 리더보드는 복고 점수가 됩니다.

출처: We changed one line and the benchmark score moved 0.21 AUROC⁠—⁠Hugging Face


오늘의 도구 추천

speech-to-speech — Hugging Face가 공개한 Apache⁠-⁠2.0 음성 에이전트 파이프라인입니다. Silero VAD, Parakeet TDT, OpenAI 호환 LLM, Qwen3⁠-⁠TTS를 기본으로 두고 Realtime 이벤트 집합을 로컬 서버로 엽니다. 오늘의 주제처럼 큰 모델을 직접 키우기보다, 교체 가능한 하네스로 호스트된 경로를 내 하드웨어에 옮기고 싶은 팀에 출발점으로 살펴볼 만합니다.


에디터 노트

어제는 같은 모델도 기억과 감독이 바뀌면 점수가 달라진다고 봤습니다. 오늘은 그 감독이 사람 취향과 전원 스위치로 쪼개집니다. Faraday는 27B로 더 큰 코더를 부리며 복제 과제를 이겼고, Guidelight는 그 코더가 선을 넘었을 때 누가 전원을 내리는지가 공개돼 있지 않다고 채점했습니다.

Labor0가 줄이려는 것도 같은 층입니다. 세션을 늘리는 일이 아니라, 사람이 모든 진행을 확인하지 않아도 결정만 남기는 일. 다음 경쟁은 더 큰 모델이 아니라, 실험을 고르는 취향과 사고를 끊는 스위치입니다.

다음에 또 찾아옵니다. — 에이브랜치