No. 138

추론의 전쟁이 칩으로 내려갑니다 — Jalapeño⁠·M6⁠·통합 메모리

오픈AI Jalapeño는 와트당 성능을, 애플은 2 nm M6와 512 GB Mac Studio로, Claude는 챗·Cowork 메모리를 하나로 묶습니다.

오늘의 핵심

오늘의 흐름은 토큰값을 정하던 싸움이 실리콘 층으로 내려갔다는 것입니다. 오픈AI는 첫 자체 추론 칩 Jalapeño의 측정 결과를 공개하며 와트당 처리량과 지연에서 비교 대상을 앞섰다고 밝혔고, 애플은 2 nm M6와 512 GB 통합 메모리의 맥 스튜디오로 책상 위 프론티어 추론을 겨냥했습니다. 사이드에서는 Claude가 챗과 Cowork의 메모리를 하나로 묶었고, 사진 진위 증명을 맡은 C2PA는 안드로이드에서 근본적으로 깨졌다는 분석이 나왔습니다.


Jalapeño 첫 성적: 와트당 1.5~1.9배, 지연은 최대 3.6분의 1입니다

오픈AI가 6월 브로드컴과 함께 공개한 첫 자체 추론 칩 Jalapeño의 첫 측정 결과를 공개했습니다. 세미애널리시스의 공개 벤치마크 InferenceX에서 GPT-OSS 120B, DeepSeek R1 670B, Kimi K2.5 1T 세 오픈 모델을 돌린 결과, 와트당 처리량과 지연을 함께 잡았다는 것입니다.

  • 숫자로 본 우위: 최대 처리량 구간에서 와트당 AI 작업량이 비교 시스템보다 1.51.9배 많았고, 종단 지연은 1.73.6분의 1이었습니다. 대화형 저지연 구간에서는 2.1~4.1배 성능이었습니다. 정격 700 W인데 실측 지속 전력은 550 W 이하로 유지됐습니다.
📢 초대형 모델 인수·하네스 최적화에 이어, 이번엔 칩 자체가 비용 무기로 나섰습니다. 추론 단가 싸움이 마케팅이 아니라 웨이퍼에서 결정되는 시대가 열렸습니다.

출처: Jalapeño’s first results show industry-leading speed and efficiency in AI inference⁠—⁠OpenAI


애플 M6·M5 Ultra: 책상 위에서 프론티어 모델을 돌립니다

애플은 첫 2 nm 칩 M6와 쿼드다이 M5 Ultra를 공개했습니다. 맥 스튜디오는 M5 Ultra 구성에서 최대 512 GB 통합 메모리를 제공해, 거대 언어 모델을 기기 안에서 통째로 돌릴 수 있게 됐습니다.

  • M6의 핵심: 12코어 CPU(슈퍼 2+성능 4+효율 6)와 코어마다 뉴럴 가속기를 얹은 12코어 GPU, 듀얼 16코어 뉴럴 엔진으로 전 세대 대비 최대 2배 피크 연산을 냅니다. AI 목적 GPU 피크 연산은 M5 대비 약 30 %, M1 대비 8배 이상입니다.
  • M5 Ultra와 맥 스튜디오: 차세대 울트라퓨전으로 네 다이를 묶어 최대 36코어 CPU·80코어 GPU와 1.2 TB/s 대역폭(M3 Ultra보다 50 % 많음)을 냅니다. 맥 스튜디오 전체로는 AI 성능 최대 4.3배, 썬더볼트 5로 여러 대를 묶으면 분산 추론 3배까지 잡았습니다. 9월 22일 출시입니다.
📢 서버는 와트당, 책상은 통합 메모리 용량이 무기입니다. 로컬에서 프론티어급 모델이 현실적 선택지가 되는 순간, 데이터가 나가지 않는 추론의 시장이 같이 커집니다.

출처: Apple introduces M6 and M5 Ultra for a big leap in performance and AI compute⁠—⁠Apple Newsroom, Apple introduces new Mac Studio with M5 Max and M5 Ultra⁠—⁠Apple Newsroom


세미애널리시스 평가: “테스트한 엔비디아·AMD·구글 칩을 이깁니다”

오픈AI의 발표와 함께 벤치마크를 직접 돌린 세미애널리시스는 ‘Jalapeño가 블랙웰보다 낫다’는 제목의 심층 리뷰를 냈습니다. 1세대 칩이 보통 경쟁력이 없다는 통념을 깨고, 테스트한 엔비디아·AMD·구글 칩을 여러 오픈 모델에서 이겼다는 결론입니다.

  • 16개월 만의 테이프아웃: 2024년 중반 설계 시작부터 제조 테이프아웃까지 약 16개월이 걸렸습니다. HBM4를 쓰는 등 스펙 자체가 플래그십 GPU 급이며, AI가 칩 설계·프로그래밍을 가속했다고 적습니다.
  • 특화가 아니라 일반화: 오픈AI 모델 전용이라는 해석과 달리, 오픈 모델 범용 추론에서 고르게 강하다는 것이 관찰입니다. 어느 한 구간에 몰기보다 모든 시나리오에서 파레토 프론티어에 올랐습니다.
📢 1세대 칩의 성적은 기술 우위보다 개발 속도가 본문입니다. 칩 설계 주기가 모델 출시 주기와 맞물리기 시작하면, 세대 차가 곧 가격표가 됩니다.

출처: OpenAI Jalapeño: Better Than Nvidia Blackwell⁠—⁠SemiAnalysis


오픈AI 컴퓨트 전략: “넓게는 빌리고, 레버리지는 직접”

오픈AI는 같은 날 컴퓨트 전략 글을 추가로 공개했습니다. 데이터센터·칩·모델·제품을 한 시스템으로 함께 개선한다는 ‘풀스택’ 논리로, 파트너 폭을 유지하면서 핵심 층은 직접 소유하겠다는 설명입니다.

  • 포트폴리오의 폭: 마이크로소프트와 엔비디아를 기반으로 AWS·AMD·브로드컴·세레브라스·코어위브·오라클·SB에너지·소프트뱅크까지 폭을 넓혔습니다. 일감마다 최강 조합을 맞추겠다는 것입니다.
  • 직접 소유의 지렛대: Jalapeño로 이어지는 자체 실리콘은 가격 협상력과 통합 최적화의 지렛대이고, 데이터센터 프로젝트는 또 다른 소유 지점입니다. “능력이 필요한 곳엔 프리미엄을, 규모와 비용이 중요한 곳엔 효율을” 쓰는 이원 전략입니다.
📢 풀스택은 부의 과시가 아니라 협상 지렛대 모으기입니다. 모델 업체가 어느 층까지 직접 소유해야 살아남는지를 보여주는 청사진입니다.

출처: The full stack behind abundant intelligence⁠—⁠OpenAI


Claude 챗·Cowork 메모리 통합: 브리핑을 두 번 하지 않습니다

앤트로픽은 화요일 Claude 챗과 Cowork의 메모리 시스템을 통합한다고 발표했습니다. 챗에서 쌓은 맥락을 Cowork가 그대로 기억하고, 사용자가 저장된 기억을 주제별로 읽고 고치고 지울 수 있습니다.

  • 대화 중 즉시 저장: 대화가 끝날 때 요약하는 방식에서 벗어나 챗이 진행되는 동안 주제를 메모리에 추가합니다. 연구와 실행을 오가며 재설명해야 했던 불편이 사라지는 구조입니다.
  • 민감 정보는 기본 제외: 건강·인종·정치 성향 등은 기본적으로 저장하지 않고, 사용자가 토글로 직접 허용해야 합니다. 신분증·사회보장번호 등은 어떤 경우에도 저장하지 않습니다. 무료·Pro·Max 전 구간에 기본 적용됩니다.
📢 에이전트 제품의 경계는 기능 목록이 아니라 무엇을 기억하는지로 정해집니다. 편의와 사생활의 설정 위치를 사용자가 직접 볼 수 있게 했다는 것이 이번 발표의 핵심입니다.

출처: Claude Cowork finally remembers what you told the app in chat⁠—⁠TechCrunch


오픈AI Admin 플러그인: 관리자 콘솔을 대화로 옮깁니다

오픈AI는 ChatGPT Work와 Codex에 Admin 플러그인을 추가했습니다. 사용량 분석, 구성원·그룹 관리, 권한 진단, 사용 한도와 지출 요청 승인을 하나의 대화에서 처리할 수 있습니다.

  • 권한은 그대로: 플러그인은 사용자의 기존 역할과 권한 안에서만 동작하고, 범위를 넓혀주지 않습니다. 각 요청을 지원되는 읽기·쓰기 작업으로 매핑해 구조화된 결과를 돌려주고, 파급이 큰 변경은 적용 전에 다시 확인시킵니다.
  • 반복 업무 자동화: 승인 대기 요청을 Slack·Teams로 라우팅하거나, 미리 정한 기준을 만족하면 접근 권한을 자동 부여하고 예외만 검토로 보내는 워크플로우를 코드 없이 만들 수 있습니다.
📢 '관리'가 에이전트의 다음 일자리로 떠오르고 있습니다. 콘솔 UI를 익히는 비용이 사라지면, 도입의 병목은 권한 설계와 감사 증적 남기기로 옮겨갑니다.

출처: Introducing the Admin plugin for ChatGPT Work and Codex⁠—⁠OpenAI


스테이빌리티 AI, 음반·게임 거물을 주주로 받았습니다

스테이빌리티 AI가 7,600만 달러 시리즈 B를 마쳤습니다. 유니버설뮤직·소니뮤직·워너뮤직과 게임사 EA가 참여했고, AMD 벤처스와 퍼시픽 얼라이언스도 들었습니다. 누적 조달액은 2억 3,200만 달러입니다.

  • 거래처가 주주로: 지난해 유니버설뮤직·EA·워너뮤직과 맺은 공동 개발 협력이 이번 투자로 이어졌습니다. 라이선스를 파는 관계가 아니라 도구를 같이 만드는 관계로 묶은 셈입니다.
  • 법정 변수: 영국 게티 이미지 소송에서는 대체로 스테이빌리티가 이겼지만, 미국 소송은 계류 중입니다. 생성 이미지의 저작권 구도가 회사 가치에 그대로 걸려 있습니다.
📢 창작 산업은 생성 AI를 막는 대신 지분으로 묶는 쪽으로 기울고 있습니다. 콘텐츠 원천이 플랫폼의 주주 명단에 들어가는 구조 실험입니다.

출처: Stability AI, maker of image generator Stable Diffusion, raises $76 million in fresh funding⁠—⁠TechCrunch, Stability AI’s Latest Funding Backed by Entertainment Industry’s Biggest Names⁠—⁠Stability AI


감마, 라이카를 인수하며 디자인 연구소를 만듭니다

프레젠테이션 스타트업 감마가 액셀 지원을 받은 디자인 스타트업 라이카를 인수했습니다. 라이카 공동창업자 두 사람이 이끄는 연구 조직이 감마에 생기고, 발표 너머의 시각 커뮤니케이션 연구가 목표입니다.

  • 분배와 연구의 결합: 라이카는 브랜드 가이드라인을 지키는 전자상거래 마케팅 영상에 집중해 왔고, 감마는 1억 명이 넘는 사용자를 보유한 배급 채널입니다. 연구 몫과 도달 몫을 맞바꾼 인수입니다.
  • 다음 싸움은 형식: 감마는 프레젠테이션이라는 형식을 넘어 상호작용하는 멀티모달 커뮤니케이션을 탐색합니다. 청중별로 스타일을 조정하는 모델 커스터마이징이 연구 과제입니다.
📢 생성 도구의 차별점이 템플릿에서 연구 조직으로 옮겨가고 있습니다. 배급 규모가 있는 회사가 연구를 사들이는 인수가 반복되면, 독립 디자인 도구의 자리가 좁아집니다.

출처: Gamma acquires Accel-backed design startup Lica⁠—⁠TechCrunch


앤트로픽, AI 웰빙 영향 평가에 500만 달러를 걸습니다

앤트로픽은 AI가 사용자 웰빙에 미치는 영향을 측정하는 독립 연구에 500만 달러 규모의 그랜트 프로그램을 만들었습니다. 선정팀은 자금과 모델 접근, 기술 지원을 받고 결과를 오픈소스로 공개합니다.

  • 단답 평가의 한계: 웰빙은 한 번의 답변으로 판정하기 어렵습니다. 자해 암시가 대화 중반에 나타나거나, 같은 조언도 맥락에 따라 해로워지는 경우가 있어 긴 대화 맥락을 보는 평가가 필요합니다.
  • 독립성이 조건: 연구진은 앤트로픽과 완전히 독립적으로 작업하고, 임상 전문가·심리학자·방법론 전문가의 참여를 권했습니다. 세이프가드 팀의 평가 설계 가이드라인도 함께 공개했습니다.
📢 정확도 벤치마크는 잘 정립됐지만, '계속 대화하는 제품'의 안전성 지표는 아직 없습니다. 평가 시장을 돈으로 먼저 키우는 움직임입니다.

출처: Funding better evaluations of AI’s impact on wellbeing⁠—⁠Anthropic


C2PA 카메라 서명, 안드로이드에서 깨졌습니다

보안 연구자 데이비드 버캐넌은 C2PA 콘텐츠 증명이 안드로이드에서 “현실적으로 패치할 수 없는 방식으로 붕괴했다”는 분석을 공개했습니다. 카메라 앱의 암호 서명을 뒷받침하는 안드로이드 키 어테스테이션과 플레이 무결성 모두 루트 권한 익스플로잇에 무너진다는 것입니다.

  • 완전 패치된 픽셔도 뚫립니다: 저비용 하드웨어 폴트 인젝션으로 기기를 루팅할 수 있고, CVE-2026-43499를 이용한 원클릭 루트 익스플로잇이 이미 완전 패치된 픽셀에서 동작합니다. 누구나 C2PA 위조를 만들 수 있는 상태입니다.
  • LLM이 공격도 가속: 루트 권한 상승 취약점이 구글이 패치를 배포하는 속도보다 빠르게 쏟아진다고 적습니다. 최고 등급(Assurance Level 2)을 받은 픽셀 카메라 앱이 오히려 그 표본입니다.
📢 AI 위조에 대한 답으로 '카메라가 서명한 사진'이 자주 거론되지만, 그 신뢰의 바닥은 운영체제 익스플로잇 시장이었습니다. 진위 증명은 모델 워터마크와 함께 여러 층으로 쌓아야 합니다.

출처: C2PA Cameras Do Not Survive Contact With Reality⁠—⁠David Buchanan


옥사 알파 지문: GLM-5.x 어휘 11개 전부 일치, 검열은 스위치형입니다

오픈라우터에 익명으로 올라온 옥사 알파의 정체를 행동 지문으로 추적한 연구가 나왔습니다. CTGT는 토크나이저가 GLM-5.x 어휘와 11개 항목 전부 일치한다는 독립 검증과 함께, 민감 주제 검열 패턴을 해부했습니다.

  • 검열은 기울기가 아니라 스위치: 전체 평균 상승분 +7.42 중 +7.39가 7개 주제(국내 사건, 시진핑 개인 등)에서 나왔습니다. 신장·대만 질문에는 미국 모델과 같은 수준으로 답합니다. 딥시크처럼 전반적으로 기우는 게 아니라, 특정 주제만 차단하는 블랙리스트 구조입니다.
  • 일상 감사로는 안 보입니다: 티베트·대만 같은 국제 관심 주제 중심 감사에서는 ‘검열 없음’으로 측정됩니다. 국내 정치 리스크 영역에 검열이 집중된 사례로, 익명 모델의 출처 추정에 행동 지문이 유효한 도구임을 보여줍니다.
📢 익명 라우팅 모델의 정체는 벤치마크 점수가 아니라 어휘와 검열 행동에서 드러납니다. 모델 출처 투명성 요구가 규제가 되기 전에, 측정 기술이 먼저 성숙해지고 있습니다.

출처: Behaviorally Fingerprinting Ox Alpha’s Provenance and Censorship⁠—⁠CTGT


키미 K3 실전 리포트: 코드는 훌륭, 한국어 오타가 발목입니다

개발자·강사 오준석(생존코딩)님이 Kimi K3 xhigh와 Kimi Code를 약 일주일 쓴 실전 리포트를 공개했습니다. 게임 개발, 보안 점검, 100만 다운로드 안드로이드 앱 레거시 분석, 플러터 신규 개발 시나리오를 다뤘습니다.

  • 잘한 것: 구체적 요구가 있을 때 유지보수 가능한 아키텍처를 만들고, 단위·위젯·UI 테스트를 일관되게 포함했습니다. 장시간 작업에서도 컨텍스트를 효율적으로 썼고, 가격이 저렴한 것도 강점입니다.
  • 아쉬운 것: 한국어 문서에서 반복 오타가 나와 수정에 토큰을 소모했고, Kimi Code는 코드 변경 과정이 눈에 잘 보이지 않았습니다. 보안 분석은 유용한 issue를 찾았지만 결론은 전문가 검증이 필요했습니다. 총평은 “개발 성능은 매우 뛰어나지만 한국어 맞춤법 이슈가 해결되면 완벽”입니다.
📢 국내 개발자의 채택 조건은 벤치마크 점수와 한국어 품질이 같이 갑니다. 비영어권 시장에서는 오타 하나가 토큰 비용과 신뢰를 같이 깎습니다.

출처: Kimi K3 실전 테스트: 웹·Flutter·Android 개발에서 확인한 강점과 한계⁠—⁠생존코딩 오준석


오늘의 도구 추천

Prime Agent — 코딩과 장기 자율 작업을 위한 자기 개선형 에이전트입니다. RLM(Recursive Language Model)과 Continual Harness라는 두 가지 추상화로 컨텍스트를 변수처럼 다루고 긴 작업을 이어갑니다. 에이전트 세션이 길어질수록 맥락 관리가 병목인 지금, 점검해볼 만한 오픈소스입니다.


에디터 노트

어제는 일을 어디로 보낼지가 제품이라고 적었습니다. 오늘은 한 층 더 아래입니다. 같은 일을 시키는 비용이 이제 칩 설계도에서 갈립니다. 오픈AI는 범용 추론 칩 1세대로 비교 대상을 앞서 나갔고, 애플은 512 GB 책상 위 기기로 데이터가 나가지 않는 추론을 밀고 있습니다. 모델을 고르는 일이 어느새 실리콘 로드맵을 고르는 일과 겹쳐졌습니다.

그 위에서 제품의 접착제는 메모리입니다. Claude가 챗과 Cowork를 하나의 기억으로 묶은 순간, 사용자가 옮겨야 하는 비용은 다시 커졌습니다. 반대로 신뢰의 접착제는 갈라지는 중입니다. 사진 서명의 최고 등급이 원클릭 익스플로잇 앞에서 무너진다는 오늘의 분석은, 진위 증명이 단일 기술이 아니라 여러 층의 겹침이어야 한다는 점을 보여줍니다.

칩이 싸지고, 기억이 묶이고, 증명은 깨지는 오늘의 조합은 다음 질문을 미리 놓고 있습니다. 아껴진 비용으로 무엇을 더 맡길지, 그리고 그 맡김을 무엇으로 확인할지입니다.

다음에 또 찾아옵니다. — 에이브랜치