No. 152

나비에-스토크스 증명의 날 — 1만 에이전트의 88시간, 그리고 저자 자리를 둘러싼 폭로

오픈AI가 나비에-스토크스 난제 해결을 발표했지만 뉴욕대 수학자가 '컴퓨트로 이겼다'고 폭로했습니다. 메타 뮤즈, 알파게놈 아틀라스, 삼성-미스트랄 동맹도 공개됐습니다.

오늘의 핵심

오늘의 축은 ‘증명의 주인’입니다. 오픈AI는 90년 미해결이던 나비에-스토크스 밀레니엄 난제에 대한 증명을 발표했습니다. 그러나 같은 접근법을 걷고 있던 뉴욕대 트리스탄 버크마스터 교수는 “오픈AI가 우리 진행 정보가 닿은 뒤 컴퓨트를 쏟아부어 먼저 답을 냈다”는 경위를 담은 성명을 같은 날 공개했습니다. 증명이 도착한 첫날, 남은 질문은 저자와 신뢰였습니다. 메타는 이메일과 결제를 대신하는 개인 에이전트 뮤즈를 내놨고, 구글 딥마인드는 90억 개 유전 변이의 효과를 예측한 1페타바이트 아틀라스를 공개했으며, 삼성전자는 미스트랄에 30억 유로를 투자하고 반도체 특화 AI 동맹을 맺었습니다.


오픈AI “나비에-스토크스 난제 해결” — 1만 개 에이전트, 88시간의 증명

오픈AI가 9월 8일 3차원 비압축성 유체의 나비에-스토크스 방정식에 대해 유한 시간 내 특이점이 발생한다는 증명을 발표했습니다. 밀레니엄 난제 7개 중 하나로, 클레이 수학재단이 100만 달러 현상을 걸었던 문제입니다.

  • 결과: GPT-6 아스트라보다 “상당히 더 능력 있는” 내부 모델이 해석적 증명과 린(Lean) 형식화를 동시에 만들어냈습니다. 처음 매끄럽게 정지해 있던 유체에 매끄러운 힘이 가해질 때 유한 시간 안에 특이점이 생기고 에너지는 끝까지 유한하게 유지됨을 보여, 공식 정식화의 명제 C와 D를 해결했습니다.
  • 방법: 8월 28일부터 학습 중인 내부 모델을 썼습니다. 9월 1일 소문을 계기로 열린 밀레니엄 난제 전체 평가에서는 먼저 약 100개 에이전트가 약 50시간 만에 비강제 오일러 정칙성 문제를 해결했고, 이후 자원을 나비에-스토크스에 집중했습니다. 최종 그룹은 동시 에이전트 약 1만 개 규모로, 9월 5일 첫 에이전트 가동 88시간 만에 도달했고 린 검증에 GPT-6 아스트라로 17시간이 더 들었습니다.
  • 비용: 나비에-스토크스 해결에 메시지 270만 개와 출력 토큰 약 1,300억 개가 쓰였습니다. 난제 전체 시도를 합치면 490만 개 메시지, 약 3,000억 개 토큰으로, 테크크런치는 아스트라 API 요금 기준 약 2,250만 달러어치로 추정했습니다.
📢 90년 난제가 '주간 단위 프로젝트'가 되는 순간의 원가표가 처음 공개됐습니다. 현상금은 100만 달러인데 증명 한 편에 드는 컴퓨트 추정치는 그 20배가 넘습니다.

출처: On the Navier–Stokes Millennium Prize Problem⁠—⁠OpenAI, OpenAI fought dirty on career-making math problem, says NYU mathematician⁠—⁠TechCrunch


”커리어를 왜 망치려 하나” — 버크마스터 성명이 폭로한 오픈AI와의 접촉

같은 날 뉴욕대 트리스탄 버크마스터 교수는 앤스로픽 소속 수학자 레벤트 알푀게와의 개인 공동연구 결과(강제 다공성 매질·부시네스크·3차원 오일러 방정식의 유한 시간 폭발)와 함께 오픈AI 측 접촉 경위를 담은 4쪽짜리 성명을 공개했습니다.

  • 평행 발견: 두 사람은 클로드와 코덱스(GPT-5.6 솔)를 쓰고 있었고, 8월 15일 강제 오일러 폭발 결과를 얻은 뒤 8월 22일 린 검증을 마쳤습니다. 버크마스터는 이 프로그램의 근본 아이디어를 디에고 코르도바와 루이스 마르티네스-소로아의 공으로 돌리며 “마르티네스-소로아는 필즈 메달을 받아 마땅하다”고 썼습니다. 오일러 논문 표현 품질은 “AI 쓰레기(AI slop)라고 불릴 수밖에 없다”고 직접 사과했습니다.
  • 접촉: 9월 3일 “우리 진행 정보가 오픈AI에 흘러들었다”는 제보를 듣고 오픈AI 수학자에게 편지를 보냈고, 9월 6일 세바스티앙 뷔벡 부사장과 두 차례 통화했습니다. 처음 들은 “내부 모델이 강제 나비에-스토크스 폭발을 증명했고 사람의 개입은 거의 없었다”는 설명은 통화 중 뒤집혔습니다. 팀 전체가 매달렸고, 더 쉬운 문제부터 시작했고, 보여준 프롬프트조차 코덱스로 작성됐고, 어마어마한 컴퓨트가 쓰였다는 정정이 나왔으며, 첫 프롬프트 시점도 “우리 작업 정보가 닿은 뒤 며칠 내”로 합의됐다고 성명은 전합니다.
  • 제안과 압박: 오픈AI 측은 두 가지 안을 제안했습니다. 오일러 결과를 먼저 올리면 오픈AI가 다음 날 나비에-스토크스를 게시하거나, 버크마스터가 단독 명의로 나비에-스토크스 논문을 쓰는 안이었습니다. 뷔벡 부사장은 앤스로픽에 재직 중인 알푀게를 저자명에서 빼자고 두 차례 주장했다고 합니다. 거절하자 “커리어를 왜 망치려 하냐”, “내가 착하게 굴지 않아도 된다”는 답이 돌아왔다고 성명은 적습니다. 버크마스터는 “누구도 고발하지 않는다. 다만 발표의 연속이 내가 거짓임을 아는 것을 말하게 두는 대신, 내가 들은 것을 적을 뿐”이라고 마무리했습니다. 오픈AI 게시물은 강제 오일러에서 두 사람의 우선권을 인정하면서도 “제품 사용에서 파생된 비식별 데이터가 모델 개선에 도움을 줬을 가능성은 배제할 수 없다”고 인정했습니다.
📢 증명 기계가 생겨난 시대에 마지막 희소자원은 '누가 먼저 무엇을 알았는지'에 대한 신뢰입니다. 오픈AI가 코덱스 세션 학습 가능성을 스스로 완전히 배제하지 못한 문장이 그 무게를 보여줍니다.

출처: Statement on the Navier–Stokes controversy⁠—⁠Tristan Buckmaster(NYU), OpenAI fought dirty on career-making math problem, says NYU mathematician⁠—⁠TechCrunch


메타 뮤즈 — 이메일을 보내고 결제를 대신하는 개인 에이전트, 180억 달러 합의 2주 뒤

메타가 9월 8일 미국 사용자 대상 개인 AI 에이전트 뮤즈(Muse)를 공개했습니다. 소셜미디어 피해 소송 180억 달러 다주주 합의가 알려진 지 채 2주가 지나지 않은 시점입니다.

  • 기능: 이메일·캘린더·결제·건강·스마트홈·쇼핑 앱을 하나씩 연결하면 이메일 발송, 여행 예약, 요금제 인하, 양식 작성, 레시피 릴스를 장바구니 목록으로 변환, 구매까지 수행합니다. 결제는 스트라이프 ‘Link’로 처리해 구매 보호를 붙였고 쇼피파이 ‘Shop Pay’와 1Password 연동도 예정입니다.
  • 구조: 메타의 뮤즈 스파크 모델 기반입니다. 커넥터가 없는 서비스는 공개 API로 연결하고, API도 없으면 브라우저로 접근합니다. 전용 가상머신 ‘뮤즈 시큐어 VM’에서 별도의 ‘센티널’ 에이전트와 시스템 수준으로 분리돼 실행되며, 뮤즈는 비밀번호와 결제수단을 볼 수 없고 광고 시스템과 데이터를 공유하지 않는다고 메타는 주장합니다.
  • 요금: 웹(muse.ai)·iOS·안드로이드·왓츠앱에서 무료로 시작하고 사용량에 따라 파워 월 20달러, 맥시멈 월 100달러 요금제가 이어집니다. 사용자가 앱을 떠나도 과제를 계속 수행하고, 대화에서 배운 것을 바탕으로 먼저 제안하기도 합니다.
📢 챗봇이 '답하는 AI'였다면 뮤즈는 '대리인 AI'입니다. 권한은 사용자가 앱 하나씩 열어주지만, 한번 열린 권한은 되돌리기 어렵습니다. 신뢰가 곧 결제 인프라가 되는 시험대입니다.

출처: Meta debuts its Muse AI agent. Will consumers trust it?⁠—⁠TechCrunch


구글 딥마인드 알파게놈 아틀라스 — 90억 개 유전 변이의 효과를 미리 계산한 1페타바이트

구글 딥마인드가 알파게놈 아틀라스를 공개했습니다. 인간 게놈의 모든 단일 염기 변이에 대한 조절 효과를 예측해 담은 데이터베이스입니다.

  • 내용: 알파게놈 모델로 단일 문자 변이 90억 개의 효과를 사전 계산해 1페타바이트 규모 데이터셋을 만들고, 코딩·비코딩 영역 예측을 하나로 묶는 ‘AVI(알파게놈 변이 영향) 점수’로 연구자가 우선순위를 바로 매길 수 있게 했습니다. 단백질을 코드하는 게놈은 2%이고 나머지 98%는 여전히 잘 알려지지 않은 영역입니다.
  • 실증: 브로드 연구소 팀은 AVI 점수로 미해결 희귀질환 변이를 좁혀 DNM1 유전자의 잘못된 스플라이스 부위를 찾아내 사건을 해결했습니다. 영국 바이오뱅크 5만 4천여 명 데이터에서는 비코딩 유전 연관을 22% 더 발견했고, 상위 1% 영향 변이에서 체질량지수와 연결된 19개 유전 영역을 특정했습니다.
  • 접근: 코딩이 필요 없는 웹 포털로 전 세계 연구자에게 즉시 공개됐습니다.
📢 변이 하나하나의 효과가 검색 가능한 표가 되었습니다. 유전체 연구의 병목이 실험 설계에서 데이터 질의로 옮겨가는 순간입니다.

출처: AlphaGenome Atlas: a high-resolution map of human DNA⁠—⁠Google Blog, AlphaGenome Atlas: a predictive map of every possible DNA letter change in the human genome⁠—⁠Google DeepMind


챗GPT 이미지 2.5 — 스케치 기능, 최대 50% 빨라진 생성, API용 Flare와 Sunburst

오픈AI가 이미지 모델 챗GPT 이미지 2.5를 공개했습니다. 챗GPT 이미지와 GPT 이미지 API에서는 매주 30억 장 이상이 만들어지고 있습니다.

  • 성능: 더 자연스러운 조명과 질감, 참조 사진 속 인물 보존, 여러 턴에 걸친 편집 일관성이 강화됐고 생성 지연은 2.0 대비 최대 50% 줄었습니다.
  • 새 도구: 채팅에서 직접 그림을 그려 최종 이미지의 참조로 쓰는 ‘스케치’(@Sketch), 포스터·상품 사진 등 템플릿, 이미지에 직접 다는 코멘트, 프롬프트 공유 기능이 함께 들어왔습니다.
  • API: GPT-Image-2.5 Flare는 기본 선택지로 품질과 속도를 함께 올리고, Sunburst는 정밀한 창작·편집 작업용입니다. C2PA 메타데이터와 보이지 않는 워터마크를 유지합니다.
📢 이미지 생성의 경쟁 축이 '잘 그리는 모델'에서 '여러 번 고쳐 쓰는 워크플로'로 이동했습니다. 참조 보존과 편집 일관성은 에이전트형 창작 도구의 관문입니다.

출처: Introducing ChatGPT Images 2.5⁠—⁠OpenAI


삼성전자, 미스트랄 30억 유로 투자 주도 — 반도체 특화 AI 공동개발로 ‘제3의 길’

미스트랄 AI가 30억 유로(약 4조 7천억 원) 시리즈D를 마감했습니다. 유럽 테크 기업이 완료한 역대 최대 지분 투자 라운드로, 삼성전자가 리드하고 EQT와 PSG 이쿼티가 공동 리드했습니다. 기업가치는 210억 유로를 넘었습니다.

  • 투자: 자금은 컴퓨트 확장, 인프라 구축, 상업 성장, 국제 확장에 쓰입니다. 미스트랄은 2030년까지 유럽에 1GW 컴퓨트 용량을 구축하는 목표를 갖고 20개국에서 운영 중입니다. 마크롱 프랑스 대통령은 “프랑스와 한국이 AI에서 제3의 길을 만들어가는 것”이라고 밝혔습니다.
  • 파트너십: 삼성전자는 같은 날 뉴스룸을 통해 미스트랄과 반도체 인프라의 지능화 전략적 파트너십을 발표했습니다. 미스트랄 서비스(미스트랄 라지 포함)를 반도체 운영 전반에 배포하고, 민감한 설계·공정 데이터를 위한 온프레미스 맞춤 모델을 만들어 결함 탐지, 장비 최적화, 공정 정밀화, 수율 안정화에 적용합니다.
  • 맥락: 발표는 파리에서 열린 한불 정상회담과 맞물렸습니다. 미국 의존을 줄이려는 유럽의 ‘주권 AI’ 수요와 삼성의 반도체 현장 데이터가 만나는 지점입니다.
📢 미스트랄이 주권 AI의 얼굴이 될 수 있었던 이유는 추론 서비스가 아니라 프론티어 연구라는 자기정의 때문입니다. 삼성의 반도체 현장이 그 연구의 다음 시험대가 됩니다.

출처: Mistral raises €3B as sovereign AI becomes big business⁠—⁠TechCrunch, Samsung and Mistral AI Announce Strategic Partnership for Intelligence-Driven Semiconductor Infrastructure⁠—⁠Samsung Global Newsroom


NSA·FBI·CISA “중국 AI 기업들이 산업 규모로 미국 모델을 증류하고 있다”

미국 국가안보국(NSA)·연방수사국(FBI)·사이버보안인프라보안청(CISA)이 9월 8일 공동 사이버 보안 권고문을 내고 중국 AI 기업들의 대규모 모델 증류 활동을 경고했습니다.

  • 내용: 딥시크, 문샷 AI, 알리바바, 미니맥스, 스텝펀, Z.AI가 최소 2024년 말부터 미국 AI 기업을 상대로 ‘산업 규모 증류 캠페인’을 벌였다고 밝혔습니다. 수백만 건의 요청으로 수십억 토큰을 추출했으며 중국 정부도 이를 알고 있었을 가능성이 있다고 추정했습니다.
  • 수법: 사기 또는 공유 계정 사용, 제3자 API 중개(‘환승역’) 활용, 지역 제약 우회, 프롬프트 인젝션과 탈옥으로 사고 과정(chain-of-thought) 추출, 자동화된 조율 질의, 메타데이터 삭제 등이 확인됐습니다.
  • 대응: 권고문은 이상 탐지 도입, 증류가 의심되는 응답의 미세한 변조, 정보 공유를 권고했습니다.
📢 모델 출력이 곧 지식재산이 된 시대에 '누가 무엇을 배웠는지'가 국가 사이버 경보의 주제가 됐습니다. 나비에-스토크스 데이터 논란과 같은 날 나온 이 권고는 방향만 반대일 뿐 같은 질문을 던집니다.

출처: China-Based AI Companies Conducting Industrial-Scale Distillation Campaigns Against U.S. AI Companies⁠—⁠NSA·FBI·CISA


퀄컴-아마존, 세대를 잇는 커스텀 AI 칩 동맹 — 40억 달러 워런트와 최대 600억 달러 구매 연동

퀄컴이 아마존과 AI 데이터센터 칩 협력을 발표했습니다. AWS용 커스텀 칩을 여러 세대에 걸쳐 공급하는 구조입니다.

  • 거래: 아마존은 주당 161.26달러에 최대 2,500만 주(약 40억 3천만 달러)를 매입할 수 있는 2036년 9월 만기 워런트를 받았습니다. 초기 375만 주(약 6억 달러)를 제외한 나머지는 퀄컴 제품 구매와 마일스톤 달성에 연동돼 풀립니다.
  • 규모: 퀄컴 제품의 향후 구매는 최대 약 600억 달러(약 80조 원) 규모로 알려졌고, 양사는 1.6Tbps 광 연결 기술도 협력합니다. 퀄컴은 자체 칩 설계에 AWS의 AI 서비스를 쓰는 상호 협력 관계입니다.
  • 목표: 퀄컴은 데이터센터 사업에서 2027 회계연도 약 50억 달러, 2029 회계연도 약 150억 달러 매출을 겨냥하고 있습니다.
📢 클라우드 강자가 자체 칩을 넘어 설계 파트너에게 세대 단위 약속을 걸었습니다. 성과 연동 워런트라는 정교한 장치는 AI 인프라 경쟁이 계약 구조에서도 벌어지고 있음을 보여줍니다.

출처: Qualcomm strikes AI chip deal with Amazon, offers right to buy about $4 billion in stock⁠—⁠Reuters, Qualcomm’s stock climbs as Amazon chip deal offers investors some much-needed good news⁠—⁠MarketWatch


머큐리 2.5 — 초당 1,100토큰의 디퓨전 LLM, 보조 호출의 경제학을 바꾸다

인셉션 랩스가 디퓨전 기반 언어모델 머큐리 2.5를 공개했습니다. 회사가 아는 한 지금까지 학습된 가장 큰 디퓨전 언어모델입니다.

  • 성능: 머큐리 2 대비 지능이 40% 올랐고 GPT-5.6 루나(Low), 제미나이 3.5 플래시라이트, 클로드 하이쿠 4.5급과 비교됩니다. 범용 NVIDIA GPU에서 초당 1,107토큰을 내고 컨텍스트는 26만 토큰입니다.
  • 가격과 기능: 백만 토큰당 입력 0.20달러, 출력 0.75달러이며 출시 기간에는 80% 할인된 0.04달러·0.15달러로 제공됩니다. 튜닝 가능한 추론, 병렬 도구 호출, 스키마 정합 JSON을 지원합니다.
  • 실사용: AI 전화 에이전트 회사 오픈콜은 모델 응답 지연이 중앙값 170밀리초에 가까워졌다고 밝혔고, 어그먼트 코드는 문맥 압축을 머큐리로 옮겨 지연을 82%(약 150초에서 27초로), 비용을 90% 줄였습니다. 음성용 ‘머큐리 보이스’와 프롬프트를 분석해 최적 모델로 보내는 ‘머큐리 라우터’도 프리뷰로 공개됐습니다.
📢 메인 모델이 아니라 압축·라우팅·요약 같은 반복 호출을 잡는 모델이 생산 비용의 새 기준선을 만들고 있습니다. 디퓨전이라는 다른 물리 위에서 말입니다.

출처: Introducing Mercury 2.5⁠—⁠Inception Labs


Qwen3.8 27B 양자화 실측 — 4비트는 버티고 1비트는 무너진다

데이터베이스 회사 퀘스마의 피오트르 미그달이 Qwen3.8 27B의 양자화별 성능을 직접 측정한 리포트가 해커뉴스 프론트 페이지에 올라왔습니다.

  • 결과: BF16 원본은 55GB라 대부분의 개인 하드웨어에서 돌릴 수 없지만, 4비트 Q4_K_M(17GB)은 코딩 에이전트 벤치마크 터미널벤치 2.1에서 원본과 동급이었습니다. 24GB GPU 한 장(RTX 4090)에 얹고도 약 6만 4천 토큰의 컨텍스트를 쓸 수 있습니다.
  • 붕괴 지점: 지시 이행은 2비트(11GB 미만)까지 성능 변화가 없었지만, 1비트(6.2GB)에서는 GPQA 다이아몬드가 무작위 확률 수준으로 떨어지고 추론이 길어질수록 더 악화됐습니다. 2비트는 같은 과제를 풀어도 원본보다 약 25% 더 많은 토큰을 썼습니다.
  • 방법: Modal GPU 약 3,000달러어치를 쓴 실측이며, Unsloth 양자화와 라마.cpp로 실행했습니다.
📢 로컬 모델 선택의 실질적 질문은 '몇 비트까지 괜찮은가'입니다. 오늘의 답은 코딩·지시는 4비트, 지식 추론은 2비트까지, 1비트는 아니오입니다.

출처: Benchmarking Qwen3.8 27B quantizations: 4-bit holds up, 1-bit collapses⁠—⁠Quesma


오늘의 도구 추천

ARGODRIVE Deltafin — 킴AI K3(2.8조 파라미터 MoE, 전문가 가중치 1.45TB)를 맥북 프로 128GB에서 네 개 SSD로 스트리밍해 실행하는 오픈소스 프로젝트. 초당 1.00토큰의 정직한 기록, 512토큰 프롬프트에 첫 토큰까지 약 6.3분이 걸리는 한계, 드라이브 개수별 확장 성과(1개 52%, 2개 73%, 3개 90%)까지 로그와 함께 공개돼 있습니다. 모든 토큰을 K3가 직접 결정한다는 원칙이 인상적입니다.


에디터 노트

버크마스터는 성명 마지막에 이렇게 썼습니다. “오픈AI 모델이 정말로 나비에-스토크스의 간극을 닫았다면 그것은 놀라운 일이고, 역사를 온전히 담아 크게 알려져야 한다.” 오늘 하루를 가장 정확히 요약하는 문장이라고 생각합니다. 기계가 증명을 만드는 시대에도 끝내 남는 것은 사람의 언어입니다. 누가 무엇을 먼저 알았고, 누가 무엇을 인정받는가. 딥블루가 카스파로프를 이겼을 때 체스가 끝나지 않았듯, 수학도 끝나지 않을 겁니다. 다만 이제 규칙을 다시 쓰는 중입니다.

다음에 또 찾아옵니다. — 에이브랜치