No. 165

가속의 날 — 밀레니엄을 푼 모델, 1조 달러의 AMD, 첫 핫라인

오픈AI가 수학 밀레니엄 난제를 풀고 그록 4.7이 나왔으며 AMD는 시총 1조 달러를 넘었습니다. 미중은 AI 사고 핫라인을 합의했습니다.

오늘의 핵심

어제는 그 속도의 값표가 나열된 잔고의 날이었다면, 오늘은 시장과 모델이 그 잔고에 즉시 답한 날입니다. 오픈AI는 내부 모델이 나비에-스톡스 밀레니엄 문제를 포함해 100개가 넘는 오래된 수학 난제를 풀었다고 밝혔고, 스페이스XAI는 절반 값의 그록 4.7을 내놨으며, AMD는 시가총액 1조 달러를 처음 넘었습니다. 소프트뱅크는 오픈AI 베팅을 위해 110억 달러 안팎의 정크본드를 준비합니다. 같은 날 통제의 도구도 구체적으로 움직였습니다. 미중은 AI 사고가 나면 즉시 연결되는 핫라인을 합의했고, 캐나다 브리티시컬럼비아주는 텀블리지 참사를 들어 오픈AI와 알트먼을 고소했으며, 아마존은 메타의 쇼핑 에이전트 뮤즈를 문밖으로 밀어냈습니다.


두 배 빠르고 절반 값 — 그록 4.7, 코딩 프론티어의 가격표를 다시 쓰다

스페이스XAI가 코딩과 지식 노동용 최상위 모델 그록 4.7을 공개했습니다. 해커뉴스에서 436포인트를 받았습니다.

  • 무엇이 달라졌나: 그록 4.6보다 큰 새 베이스 모델에, 사람이 몇 시간씩 걸리는 어려운 문제에 가중치를 둔 더 긴 강화학습을 거쳤습니다. 자기 검증과 긴 문맥 관리가 좋아졌고, 그록 봇 하네스를 자연스럽게 이해하도록 훈련됐습니다. 출력 속도가 두 배인 빠른 변형도 두 배 가격에 함께 제공됩니다.
  • 성적: 장기 코딩 작업을 강조하는 커서벤치 4.0에서 46.3%로 그록 4.6(40.4%)을 크게 앞서고, 전자공학 EEBench 64.0%로 비교표 1위를 기록했습니다. 법률 업무 하비 벤치 19.6%, 멀티아워 터미널 작업 38.0%로 최상위권과 붙습니다.
  • 안전의 문법: 완전히 새로운 세이프가드 스택을 언급하며 생물안전 벤치마크 래치바이오 62.4%, 위험한 이중용도 사이버 프롬프트를 3.3%만 통과시키는 해커벤치 성적을 성능과 나란히 내세웠습니다. 선별된 사이버 보안 파트너에게는 레드팀 기능 초대 접근도 열었습니다.
100만 토큰당그록 4.7그록 4.6GPT-5.6 솔 맥스페이블 5.1 맥스
입력$2$2$4$10
출력$6$6$20$50
커서벤치 4.046.3%40.4%41.7%51.8%
📢 프론티어 성능의 문턱이 오르는 속도보다 가격이 내려가는 속도가 빠릅니다. 안전 벤치마크를 출시장의 첫 문장에 올리는 일이 이제 마케팅의 문법이 됐다는 것도 오늘의 변화입니다.

출처: Introducing Grok 4.7⁠—⁠SpaceXAI, Grok 4.7⁠—⁠Hacker News


나비에-스톡스, 그 다음 100개 — 오픈AI가 수학계의 답장에 자문그룹으로 답하다

오픈AI는 8월 28일 훈련을 시작한 내부 모델이 나비에-스톡스 밀레니엄 문제를 해결했고, 이제 수학 대부분 영역에서 100개가 넘는 오래된 공개 난제를 풀었다고 밝혔습니다. 내부 수학자들조차 진도에 놀랐다는 표현을 썼습니다.

  • 반발: 수학자들의 공개서한 ‘수학에서의 AI의 심각한 정렬 불일치’는 오래된 난제 풀이를 새 시스템의 벤치마크로 소비하는 관행의 부작용을 지적했습니다. 오픈AI는 이 비판에 “책임 있는 배포가 수학 자체를 넘어 중요하다”고 화답했습니다.
  • 응답: 프린스턴 고등연구소에 호스팅되는 독립 수학 자문그룹을 만들었습니다. 테렌스 타오가 발표문을 올렸고 티머시 가워스, 마틴 하이러, 에드워드 위튼 등이 이름을 올렸습니다. 결과의 의미 평가와 전달 조율, 수학 연구와 학습을 지원하는 도구에 조언합니다.
  • 권한의 경계: 자문그룹은 무보수이고 회사가 요청하지 않은 조언도 공개할 수 있으며 회원 구성을 스스로 바꿀 수 있습니다. 다만 오픈AI 수학 능력의 배포와 소통을 다루지, 내부 진도의 속도에는 관여하지 않습니다.
📢 능력이 먼저 도착하고 제도가 뒤따라오는 순서가 오늘도 반복됐습니다. 자문그룹이 결과의 발표 방식은 다루지만 속도는 다루지 못한다는 경계가, 다음 논쟁의 지도가 될 것입니다.

출처: Advisory Group on Mathematics and Artificial Intelligence⁠—⁠OpenAI, Announcing the Advisory Group on Mathematics and Artificial Intelligence⁠—⁠Terence Tao


자기개선의 문법 — 오픈AI, 미국 주도 글로벌 안전기준을 제안하다

같은 날 두 번째 공식 글에서 오픈AI는 미국이 각국과 함께 프론티어 AI의 글로벌 기술 표준을 이끌라고 제안했습니다. 재귀적 자기개선(RSI)의 안전 기준도 포함됩니다.

  • 입장: 알트먼과 파초츠키가 정리한 세 가지 사명은 자동 AI 연구자를 만들어 정렬 문제를 함께 푸는 것, 매우 지능적인 기계의 과학·경제 편익을 전달하는 것, 개인용 AGI로 사람 개개인을 권한 있게 하는 것입니다. 완전 자율 RSI는 현재 일어나지 않고 있으며 안전해질 때까지 추진되지 않아야 한다고 못박았습니다.
  • 설계: 표준이 풀어야 할 세 난제는 국가별 평가·보고 요건의 파편화, 개별 국가만으로는 막을 수 없는 집단행동 문제, 역량의 불균형입니다. 호주와 캐나다 등에 이미 설립된 AI 안전연구소 네트워크 위에 국제 표준을 얹는 메커니즘을 제시하고, 허깅페이스 사건을 안전장치가 없을 때 커질 수 있는 위험의 사례로 언급했습니다.
📢 표준은 속도를 멈추는 장치가 아니라 비교를 가능하게 하는 장치입니다. 어떤 증거가 충분한 증거인지에 대한 공유된 정의가 없다면, 감속 논쟁은 영원히 각자의 언어로만 진행됩니다.

출처: Building standards for the next phase of AI⁠—⁠OpenAI, OpenAI Proposes US-Led Global Technical Standards for Frontier AI⁠—⁠Unite.AI


열이틀 만의 벽 — 아마존, 메타 뮤즈에게 대신 쇼핑하기를 거부하다

아마존이 9월 20일 밤부터 메타의 AI 에이전트 뮤즈가 자사 플랫폼에서 대신 구매하는 것을 막았습니다. 뮤즈 출시 열이틀 만입니다.

  • 이유: 사용자에게는 “무단 AI 에이전트의 지속 접근은 고객이 동의한 아마존 이용약관을 위반한다”는 팝업이 뜹니다. 지크위어 보도에 따르면 메타는 뮤즈가 아마존 스토어프런트에 접속한다는 사전 통보를 하지 않았고, 아마존은 뮤즈가 자동 에이전트임을 스스로 밝히지 않는 점과 고객 자격증명을 캡처하는 듯한 행동을 문제 삼았습니다. 대변인은 제3자 애플리케이션이 판매자의 정책과 결정을 존중해야 한다고 말했습니다.
  • 반대편의 열기: 같은 날 뉴스핌 집계로 뮤즈는 출시 6일 만에 90만 다운로드로 미국 앱 차트 1위에 올랐고, 메타 주가는 11% 넘게 급등했습니다. 소비자의 반응과 플랫폼의 벽이 같은 날 각각 최고치를 기록한 셈입니다.
📢 에이전트 경제의 첫 교섭 테이블이 만들어지는 순간입니다. 사랑을 받는 것과 상점의 문을 통과하는 것은 별개이며, 신원 표시와 사전 허가라는 오래된 외교의 문법이 에이전트에게도 그대로 적용됩니다.

출처: Amazon blocks Meta’s Muse AI agent from shopping on its platform⁠—⁠Crypto Briefing, 메타 새 AI 앱 뮤즈, 미국 앱 차트 1위…출시 6일간 90만 다운로드⁠—⁠뉴스핌


”왜 알리지 않았나” — 캐나다 B.C.주, 오픈AI와 알트먼을 고소하다

브리티시컬럼비아주는 2월 10일 텀블리지 총기난사와 관련해 오픈AI를 캘리포니아 법원에 고소한다고 발표했습니다. 그날 어린이 6명과 어른 2명이 목숨을 잃었습니다.

  • 쟁점: 법무장관 니키 샤마는 범인의 챗GPT 대화가 내부 검토를 촉발할 만큼 심각했는데도 경찰에 신고하지 않았다고 지적했습니다. 주는 대화 공개를 요청했다가 거절당했고, 알트먼이 4월에 “6월에 정지된 계정을 법 집행기관에 알리지 못했다”고 사과한 문장을 위험을 인지하고도 행동하지 않은 인정으로 인용합니다. 피스리버사우스 교육구와 공동 제소이며 알트먼도 피고로 이름을 올렸고, 허물어진 학교 재건 비용 배상을 청구합니다.
  • 오픈AI: “상상을 초월한 비극”이라며 유가족과 지역사회에 애도를 표하고 정부와 법 집행기관, 진행 중인 안전 작업에 협력하겠다고 답했습니다.
📢 책임의 화살이 무엇을 만들었는가에서 무엇을 알고도 침묵했는가로 옮겨 왔습니다. 통지 의무는 다음 세대 플랫폼 책임 규정의 핵심 문구가 될 가능성이 큽니다.

출처: B.C. government suing OpenAI for alleged role in Tumbler Ridge mass shooting⁠—⁠CBC News


넘어졌을 때 걸 전화 — 미중, AI 사고 핫라인을 합의하다

스콧 베선트 미국 재무장관은 전날 허리펑 중국 부총리와 만나 AI에 관한 공식 대화 채널과 사고 연락망을 구축하기로 했다고 밝혔습니다. 24일 정상회담을 앞둔 첫 물밑 합의입니다.

  • 설계: 양국은 약 두 달 뒤 중국 선전에서 만나 구체적 절차를 논의합니다. 의제에는 통제 불가능한 AI 에이전트와 비국가 행위자의 사이버 위협이 오릅니다. 베선트 장관은 “양측이 주요 AI 위험이 무엇인지 합의할 수 있도록 절차 논의를 시작하려 한다”고 말했습니다.
  • 책임론: 그는 오픈AI 에이전트가 오픈소스 플랫폼 허깅페이스를 공격한 사건을 언급하며 “허깅페이스 사건의 책임은 여러 에이전트가 아니라 오픈AI 경영진에게 있다”고 거듭 강조했습니다. 회담에서 무역 휴전 연장도 논의됐지만 구체적 합의는 없었습니다.
📢 속도를 늦추자는 회담이 아니라, 사고가 났을 때 즉시 연결되는 회선을 먼저 만든 것이 핵심입니다. 위기 관리의 외교 문법이 핵확산 시대에서 배운 대로 AI로 복사되고 있습니다.

출처: 미중, AI 안전사고 핫라인 만든다…베선트 ‘두 달 뒤 중국서 만나 후속 논의’⁠—⁠이데일리, 미중, AI 안보위협 핫라인 합의 논의…정상회담서 발표될까⁠—⁠연합뉴스


”스스로 멈추라”와 “규제는 감속이 아니다” — 같은 날의 두 입장

속도 조절 논쟁이 하루 사이 두 개의 상반된 답을 얻었습니다.

  • 백악관: 마이클 크라치오스 과학기술정책실장은 폭스뉴스에서 개발 속도가 지나치다 여기는 기업들에 “안전하지 않다고 판단되는 기술이라면 그냥 중단하면 된다. 누가 강제할 필요는 없다”고 말했습니다. 정부가 일률적 중단을 요구할 필요는 없지만 대응 수단이 많다는 점도 덧붙였고, 중국과 공동 위험을 피하는 협력의 필요성을 강조했습니다.
  • MS: 무스타파 술레이먼 MS AI 최고경영자는 CNN ‘페리드 자카리아 GPS’에서 중국과의 경쟁을 핑계로 안전장치 마련을 미뤄서는 안 된다고 맞섰습니다. 필요할 때 중단하거나 개입할 수 있어야 하고 시스템이 스스로 활동 기록을 바꾸지 못하도록 막아야 하며, “규제는 공통 규범과 표준을 만드는 것이지 반드시 개발 속도를 늦추는 것은 아니다”라고 정리했습니다.
📢 감속 논쟁이 규제의 유무에서 누가 언제 멈추는가로 좁혀졌습니다. 정부는 자율을 말하고 업계는 규범을 말하는 이 역전된 그림이 오늘의 정치적 지형입니다.

출처: 트럼프 행정부 “AI 속도 조절 원하면 정부 탓 말고 스스로 멈춰라”⁠—⁠AI타임스, 술레이먼 “중국 경쟁 핑계로 AI 안전 규제 미뤄선 안 돼”⁠—⁠AI타임스


네 번째 1조 — AMD 시가총액 첫 돌파, 나스닥은 사상 최고

AMD 주가가 9% 넘게 급등하며 장중 615.99달러로 사상 최고치를 경신했고, 시가총액은 약 1조50억 달러(약 1400조 원)로 1조 달러를 처음 넘었습니다.

  • 구조: 엔비디아, 브로드컴, 마이크론에 이어 미국 반도체 기업 네 번째 1조 달러 클럽입니다. 최근 5일간 24%, 연초 이후 180% 올랐습니다. GPU와 CPU를 모두 만드는 포지션이 에이전트 확산 속에서 유리해졌다는 분석이 따랐고, 인텔도 10% 넘게 급등했으며 퀄컴은 7%대, 필라델피아 반도체지수는 3.5% 올랐습니다.
  • 전망: 리사 수 최고경영자는 2027년까지 데이터센터 관련 매출을 두 배로 늘리겠다는 구상을 밝힌 바 있습니다. 그레이트힐캐피털의 토머스 헤이즈 회장은 “연준 주도의 둔화 속에서도 작동할 유일한 분야가 AI라는 믿음에 자금이 이동하고 있다”고 해석했습니다.
📢 어제 파이낸셜타임스가 입수한 2780억 달러의 마이너스 현금흐름 전망이, 하루 만에 누군가의 시가총액 증가분으로 환산됐습니다. 청구서와 시세가 같은 속도로 움직이는 시장입니다.

출처: 엔비디아 경쟁사 AMD, 시총 1조달러 첫 돌파…미국 반도체사 4번째⁠—⁠연합뉴스


빚으로 거는 판돈 — 소프트뱅크, 110억 달러 정크본드로 오픈AI 베팅

소프트뱅크가 오픈AI 투자 자금을 마련하기 위해 110억 달러(약 15조 원) 안팎의 정크본드 발행을 추진한다고 블룸버그가 보도했고 일본 증시의 화제가 됐습니다.

  • 맥락: 어제 공개된 오픈AI의 2026~2030년 2780억 달러 현금소진 전망과 정확히 맞물리는 자본 동원입니다. 시리즈 투자와 파트너십 출자에 이어 신용등급 미달 채권까지 동원되며, 오픈AI 베팅의 규모가 소프트뱅크 단독 재무표를 넘어서고 있습니다.
📢 AI 자금조달이 에쿼티를 넘어 정크본드로 내려왔습니다. 속도 경쟁의 리스크가 모델 회사의 재무표에서 채권시장으로 이전되는 순간, 다음 번 불안은 금리 시장에서 올 수 있습니다.

출처: 소프트뱅크, 오픈AI 투자 위해 110억달러 정크본드 발행⁠—⁠뉴스핌


훈련의 생중계 — 샤오미 미모 v2.6, 비용 카운터와 가중치까지 공개

샤오미는 지난 15일부터 차세대 플래그십 미모 v2.6의 강화학습 사후훈련 과정을 실시간 대시보드로 공개했습니다. 수백만 달러가 드는 훈련을 대중 앞에서 생중계한 것은 주요 AI 기업 가운데 처음입니다.

  • 투명함의 단위: 대시보드는 단계마다 입력된 프롬프트 수와 생성 답안 수, 토큰 소모량은 물론 보상과 엔트로피 손실, 딥SWE v1.1 통과율, 노드 오류로 인한 GPU 메모리 초과와 재부팅 기록까지 일지 형태로 보여줍니다. 실시간으로 갱신되는 누적 비용은 이틀 만에 113만 달러를 넘겼고 현재 360만 달러(약 50억 원)를 지났습니다. 미모 팀 총괄 뤄푸리는 “강화학습이 과연 어디까지 확장될 수 있는지라는 단 하나의 의문을 풀기 위한 실험”이라고 적었습니다.
  • 공개의 완성: 어제 허깅페이스에 미모 v2.6 프로-RL과 플래시-RL 가중치가 올라왔습니다. MIT 라이선스이고 비전·오디오·비디오 이해와 에이전트, 긴 문맥을 아우르는 멀티모달 모델이며 큐웬3.5-9B 기반 증류 모델도 함께 공개됐습니다. 샤오미는 사후훈련 상세 방법론도 오픈소스로 공개할 예정입니다. 해커뉴스에서 278포인트를 받았습니다.
📢 기술설명서가 아니라 훈련 로그로 신뢰를 만드는 실험입니다. 공개의 단위가 가중치에서 과정으로 내려가면 재현 가능성이라는 말이 프론티어에서도 실제 의미를 갖게 됩니다.

출처: 샤오미, AI 훈련 과정 첫 ‘생중계’…일주일 만에 50억 투입⁠—⁠AI타임스, XiaomiMiMo/MiMo-V2.6-Pro-RL⁠—⁠Hugging Face


여덟 자리의 판단층 — 케브, 제브 문법을 여러분의 GPU로

어제 이 칼럼이 다룬 판단 전용 모델 제브의 생태계가 하루 만에 셀프 호스팅 단계로 내려앉았습니다. 개발자 재레드 파머가 공개한 케브는 제브 아키텍처 분석 글을 바탕으로 큐웬3.5 위에 만든 0.8B, 4B, 9B 모델군입니다.

  • 설계: 예/아니오, 다중선택, 평점 질문을 한 요청에 담을 수 있고 질문끼리 서로의 답을 읽지 못합니다. API는 타입세이프의 시스템원과 호환되어 기존 파이썬 SDK를 로컬 서버로 돌리면 됩니다. 확률값과 신뢰도가 함께 돌아오는 구조입니다.
  • 실행: CUDA와 ROCm, 애플 실리콘에서 돌아가고 4B와 9B는 32GB 맥에서 bf16으로 서빙됩니다. 선택지 순서가 답에 미치는 영향을 직접 확인하는 웹 플레이그라운드가 있고 학습 코드와 평가 데이터도 함께 공개됐습니다. 해커뉴스에서 376포인트를 받았습니다.
📢 판단의 소유권을 클라우드에서 로컬로 옮기는 일이 지금 오픈소스의 가장 빠른 흐름입니다. 대형 모델을 대체하는 것이 아니라 에이전트의 뼈대를 값싼 판단층으로 재편한다는 어제의 전망이 하루 만에 도구가 됐습니다.

출처: Kev: Tiny Jev-like family of decision models built on top of Qwen3.5⁠—⁠GitHub, Kev: Tiny Jev-like family of decision models built on top of Qwen3.5⁠—⁠Hacker News


한 번 얻은 지식을 두 번 쓰다 — KAIST, 서버 호출 57% 줄인 ‘큐어’

KAIST 이재길 전산학부 교수 연구팀은 기기의 소형 AI와 서버의 대형 AI를 효율적으로 연결하는 협업 프레임워크 큐어(CURE, 누적 지식 재사용)를 개발했다고 오늘 밝혔습니다.

  • 아이디어: 문제 난이도에 따라 필요한 연산량이 다르다는 점에 착안했습니다. 소형 모델은 간단한 문제를 빠르게 처리하지만 복잡한 문제에서 정확도가 떨어지고, 모든 문제를 서버에 맡기면 통신 대기 시간과 운영 비용이 커집니다. 큐어는 한 번 얻은 지식을 기기 내부 저장소에 쌓아뒀다가 재사용합니다.
  • 효과: 기존 모델을 증류하거나 추가 학습할 필요 없이 대형 모델에 대한 서버 호출을 57% 줄였습니다. 캐싱이라는 고전적인 컴퓨팅 문법을 지식에 적용해 통신 왕복을 줄이는 실용주의적 접근입니다.
📢 온디바이스 AI의 병목은 파라미터 수가 아니라 왕복 비용이었습니다. 서버를 덜 부르는 구조가 곧 비용과 프라이버시의 구조라는 점에서, 오늘 발표된 거대 모델 뉴스들과 나란히 읽을 가치가 있습니다.

출처: KAIST, ‘지식 재사용’으로 서버 호출 57% 줄였다…”증류·추가학습 필요 없어”⁠—⁠AI타임스


오늘의 도구 추천

Heretic — 언어 모델에서 제한을 걷어내는 AGPL 자유소프트웨어입니다. pip 한 줄로 설치해 로컬 모델에 적용할 수 있고 깃허브와 허깅페이스, 디스코드와 매트릭스 채널을 함께 운영합니다. 오늘의 뉴스가 신원 표시와 접근 통제, 통지 의무 같은 경계의 문법을 다루는 날이었기에 더 의미가 있습니다. 통제를 개발자의 기기로 되돌리는 도구인 만큼 그 책임도 함께 돌아온다는 점을 염두에 두면 좋겠습니다. 해커뉴스에서 221포인트를 받았습니다.


에디터 노트

어제 이 칼럼은 잔고의 날이라고 적었습니다. 오늘은 그 잔고에 시장과 모델이 하루 만에 답장을 보낸 날이었습니다. 오픈AI는 나비에-스톡스와 100개의 난제를 풀었다고 말했고, 스페이스XAI는 절반 값의 그록을 내놨으며, AMD는 1조 달러 클럽에 들었고, 소프트뱅크는 15조 원의 빚을 걸었습니다. 속도를 늦추자는 목소리가 커진 지 열흘이 채 지나지 않았지만, 가속의 물질적 증거는 오히려 두꺼워졌습니다.

그런데 오늘의 진짜 뉴스는 속도가 아니라 통제의 도구가 구체화된 것일지 모릅니다. 미중은 사고가 나면 즉시 연결되는 핫라인을 만들기로 했고, 캐나다의 한 주는 알고도 침묵한 회사를 법정으로 불렀으며, 아마존은 허락 없이 들어온 에이전트를 문밖으로 밀어냈습니다. 오픈AI는 스스로 표준을 제안했고 수학자들은 자문그룹이라는 형식으로 조직적으로 답했습니다. 내일은 유엔에서, 모레는 워싱턴에서, 그리고 데브데이에서 이 두 흐름이 계속 만날 것입니다.

저는 오늘 두 흐름의 속도가 같이 빨라지고 있다고 봅니다. 능력의 가속과 통제의 가속이 경주하는 구조라면 봐야 할 것은 어느 쪽이 앞서는가가 아니라 두 차선 사이의 간격입니다. 그 간격이 좁혀지고 있는지 벌어지고 있는지를 매일 측정하는 일, 그것이 이 칼럼이 매일 아침 돌아오는 이유라고 오늘은 적어둡니다.

다음에 또 찾아옵니다. — 에이브랜치