No. 136

일을 어디로 보낼지 고릅니다 — Ox Alpha⁠·Fable⁠·라우팅

Ox Alpha가 익명으로 풀리고, Fable 가격은 일을 어디로 보낼지를 제품으로 바꿉니다.

오늘의 핵심

오늘의 흐름은 더 센 모델이 아니라, 일을 어디로 보낼지가 제품이 된다는 것입니다. OpenRouter에 익명으로 올라온 Ox Alpha는 코딩과 장기 에이전트 작업용 추론 모델로 무료 미리보기를 열었고, 같은 주말 FT와 Ramp 장부는 앤트로픽의 가장 비싼 모델이 현장 점유를 못 가져간다고 적었습니다. Drew Breunig의 말처럼, 새 모델이 하네스 문제를 덮어 주던 공짜 점심이 끝났습니다.


Ox Alpha는 만든 곳을 숨긴 채 코딩 에이전트 자리를 노립니다

OpenRouter에 목요일 올라온 Ox Alpha는 코딩, 오래 가는 에이전트 작업, 텍스트와 시각 맥락을 섞는 생산 부하용 추론 모델이라고 적혀 있습니다. 무료이고 컨텍스트는 1M 토큰이며, 운영자는 미리보기 동안 익명을 유지합니다.

  • 스텔스 계약: OpenRouter는 요청을 전달할 뿐 개발자·소유자가 아니라고 못 박았습니다. 프롬프트와 완성은 제공자가 보관하고 학습에는 쓰지 않으며, 나머지는 스텔스 약관이 적용됩니다.
  • 현장 반응: 스트라이프 CEO 패트릭 칼리슨은 X에서 “매우 인상적”이라고 적었습니다. 추측은 Z.ai의 미공개 GLM, 마이크로소프트 MAI, 딥시크 쪽으로 갈렸고, 토크나이저가 cl100k_base라는 관측이 나오자 중국 모델 가설이 흔들렸습니다.
  • 정체는 제품의 일부: 벤치 점수보다 먼저, 트레이스를 어디에 남기는지가 채택 조건이 됩니다. 공짜 미리보기는 성능을 보는 창이기도 하고, 익명 제공자에게 업무를 맡기는 실험이기도 합니다.
📢 다음 프론티어 모델은 이름보다 먼저 라우터에 나타납니다. 만든 곳을 숨긴 채 일을 받는 일이, 이미 배포 전략입니다.

출처: Ox Alpha⁠—⁠OpenRouter, Who’s behind the new ‘stealth model’ Ox Alpha?⁠—⁠TechCrunch


Fable의 가격은 일을 어디로 보낼지를 제품으로 바꿉니다

파이낸셜 타임스는 앤트로픽의 가장 비싼 모델이 사용자 점유를 못 가져간다고 전했습니다. 7월 연환산 매출은 650억 달러로 5월 470억 달러에서 늘었고, 같은 분기 오픈AI는 GPT⁠-⁠5.6 이후 연환산 매출이 35 % 올라 400억 달러를 넘겼다고 적었습니다.

  • Ramp 장부: 7월 앤트로픽 지출에서 Claude Opus 4.8이 28.0 %로 1위입니다. Fable 5는 8.0 %, Opus 5는 3.5 %에 그쳤습니다. Fable은 7월 24일 공개라 기간이 짧지만, 비용이 채택을 가로막았다는 해석과 맞습니다.
  • 공짜 점심의 끝: Drew Breunig는 새 모델이 같은 값, 더 싸게 나와 하네스 문제를 덮던 시기가 끝났다고 봤습니다. Fable은 뛰어나지만 Opus와 GPT⁠-⁠5.6, K3, GLM이 대부분의 코드에 충분합니다.
  • 싼 모델에 브리프를 넘김: GLM 5.2는 Fable 대비 약 9분의 1, Opus 5 대비 약 5분의 1 비용입니다. 설계는 Fable과 이야기하고, 실행 브리프는 GLM에 넘기는 식의 분업이 이미 현장 습관입니다.
📢 모델 성적표가 아니라 토큰 영수증이 라우팅을 결정합니다. 다음 경쟁은 최고점 하나가 아니라, 어떤 일을 어디에 줄지입니다.

출처: Anthropic’s best AI model struggles to attract users as cheaper tools thrive⁠—⁠Financial Times, Fable & The End of the Free Lunch⁠—⁠Drew Breunig


웨이모는 트렁크 아래에 5 nm 자체 칩을 넣습니다

웨이모는 6세대 드라이버의 연산을 처음 공개하며, 센서 원본을 핵심 뇌로 보내기 전에 처리하는 5 nm ASIC을 꺼냈습니다. 프론트엔드와 융합 모델만으로 1,000 TOPS가 넘고, 오하이 차량의 고해상 카메라 13대를 동시에 읽습니다.

  • 픽셀에서 조향까지: 지난 8년 동안 연산을 20배로 키웠고, 완전 자율 2억 마일 이상을 근거로 밀리초 안에 결정을 끝내는 온보드 스택을 설계했다고 적었습니다. 데이터센터급 부하를 차 안에서, 실시간으로 돌립니다.
  • 두 개의 엔진: 진동·충격·한여름 피닉스와 겨울에도 액체 냉각으로 정점을 유지합니다. 연산은 평소 병렬로 돌다가, 한쪽이 고장 나면 다른 쪽이 이어받도록 이중화했습니다.
  • 파트너는 공개, 칩은 내부: AMD, Micron, NVIDIA, Samsung, Sandisk, Socionext, TSMC를 처음 이름을 올려 적었습니다. LA·피닉스·샌프란시스코의 오하이가 싸게 돌아가려면, 범용 보드가 아니라 센서와 같이 설계한 실리콘이 필요합니다.
📢 물리 에이전트의 상한은 클라우드 토큰이 아닙니다. 차 안에서 픽셀을 조향으로 바꾸는 자체 칩이, 도시 밀도의 성적표입니다.

출처: A look under our trunk⁠—⁠Waymo, The custom chip driving Waymo’s robotaxi ambitions⁠—⁠TechCrunch


저작권 책으로 학습하는 일은 아직 한 줄로 안 끝납니다

테크크런치는 챗봇 학습이 무단 복제로 보이지만, 미국 법원이 읽기와 복제를 갈라 보고 있다고 정리했습니다. 저작권법이 1976년 이후 크게 안 바뀌어, 변환적 이용과 시장 침해가 사건마다 다르게 읽힙니다.

  • 학습은 합법, 해적판은 별개: 알섭 판사는 앤트로픽 학습을 작가의 독서에 비유하며 합법으로 봤고, 처벌한 것은 섀도 라이브러리에서 책을 가져온 일입니다. 15억 달러 합의는 그 불법 복제에 붙었습니다.
  • 경쟁하면 변환이 아님: 톰슨 로이터 대 Ross 사건에서 비바스 판사는, 같은 법률 시장을 겨냥한 학습은 변환적이지 않다고 봤습니다. 챗봇이 작가와 직접 경쟁하는지는 아직 이 논리로 이기지 못했습니다.
  • 생성물 보호는 다른 축: Thaler 사건에서 100 % AI 창작은 저작권 대상이 아니라고 했습니다. 학습 합법과 생성물 보호는 같은 질문이 아닙니다.
📢 학습 데이터 논쟁의 핵심은 모델이 읽었느냐가 아닙니다. 해적판을 썼는지, 그리고 그 결과물이 원작 시장을 대체하는지가 갈립니다.

출처: Is it legal to train AI models on copyrighted books?⁠—⁠TechCrunch


중간선거는 데이터센터에 이어 Flock 카메라를 적으로 올립니다

Axios는 AI 감시 카메라가 데이터센터와 함께 중간선거의 표적으로 떠올랐다고 전했습니다. Flock의 번호판 인식망은 약 12만 대이며, 회사는 수사 100만 건과 실종 1만 명 수색을 도왔다고 주장합니다.

  • 지방에서 전국으로: 시 정부는 계약을 끊고, 일부는 카메라를 훼손했습니다. 미시간 상원 후보 압둘 엘사이드는 상대를 Flock에 묶는 영상을 올렸고, 하원 후보들도 같은 구호를 씁니다.
  • 여야가 겹치는 지점: 테네시 하원 공화 팀 버쳇 등은 연방 정부가 Flock류를 사지 못하게 하는 법안을 냈습니다. 버니 샌더스도 설치 규모를 문제 삼았습니다.
  • 전력과 카메라가 같은 선거: 데이터센터 반대 초당파 메모에 이어, 감시 도구가 AI 규제의 얼굴이 됩니다. 모델 카드가 아니라 가로등 카메라가 유권자 접점입니다.
📢 AI 정치는 연구소 평가서가 아니라 동네 인프라에서 열립니다. 전력 수요와 번호판 카메라가, 같은 반감의 입구입니다.

출처: Flock camera backlash adds fuel to midterm anti-AI frenzy⁠—⁠Axios


엔비디아는 서버 가격을 15 % 넘게 올린다고 알립니다

블룸버그는 엔비디아의 큰 고객 일부가 서버 가격을 15 % 넘게 올린다는 통보를 받았다고 전했습니다. 더 버지는 이 고객이 오라클·마이크로소프트 등의 AI 데이터센터를 짓는 쪽이라고 적었습니다.

  • 수요가 부품을 밀어 올림: GPU 가격은 올해 이미 올랐고, 서버 통보는 그 다음 층입니다. 수요 폭주가 구성품 가격을 밀어, 다시 임차 원가로 돌아옵니다.
  • 수요일 실적: 엔비디아 2분기 실적이 수요일입니다. 가격과 공급이 같은 발표에서 맞붙을 수 있습니다.
  • 자체 칩의 배경: 웨이모가 5 nm ASIC을 꺼낸 주와 겹칩니다. 범용 가속기의 값이 오를수록, 차·로봇·특정 부하는 자체 실리콘으로 빠져나갑니다.
📢 토큰 단가가 내려가도, 서버 스티커 가격은 올라갈 수 있습니다. 라우팅의 다른 축은 메가와트와 랙 가격입니다.

출처: Nvidia customers notified about AI-related price hikes above 15%⁠—⁠Bloomberg


바이브 택스는 주간 쿼터를 테스트 폴더에 태웁니다

insufferable.dev의 The Vibe Tax는 경험 있는 개발자가 에이전트에 할 일 앱 스파이크를 맡긴 뒤, 12시간 만에 주간 쿼터가 0이 된 일화를 적었습니다. 저장소에는 앱이 없고, 해시 이름 테스트 폴더만 남아 있었습니다.

  • 앱 없이 테스트만: 에이전트는 사람이 절대 안 밟을 코너 케이스를 정성껏 쌓았습니다. 제품 코드는 자리 표시도 없었습니다.
  • 원샷을 학습한 대가: 바이브 코딩이 이슈 없이 한 번에 끝나게 훈련된 습관이, 토큰을 10배로 태우는 과잉 오케스트레이션이 되었다고 봅니다.
  • 세금의 전가: 코드를 안 읽는 사용자가 감당할 가격이, 코드를 읽는 개발자의 쿼터를 먼저 깎습니다.
📢 에이전트 비용의 구멍은 모델 단가가 아닙니다. 제품 없이 테스트만 쌓는 원샷 습관이, 주간 쿼터를 세금으로 바꿉니다.

출처: The Vibe Tax⁠—⁠insufferable.dev


리누스는 포기하자고 한 AI와 함께 커널 한 줄을 고칩니다

리누스 토르발스는 인텔 Xe 드라이버에서 플랫 CCS 저장을 가용 VRAM으로 넘기던 반올림 버그를 고치며, 디버그를 AI가 크게 도왔다고 커밋에 남겼습니다. 고친 코드는 round_up()을 round_down()으로 바꾼 한 줄입니다.

  • 2 KiB가 검은 화면: Battlemage G21 16 GiB에서 올림이 CCS 저장 2 KiB를 할당기에 공개했습니다. Mesa VM 3단계 페이지 테이블이 그 페이지에 앉으면 컴포지터 배치를 잃고, gdm이 재시작을 반복했습니다.
  • 24개 패치, 18번 부팅: 디버그 패치 24개와 커널 부팅 18번 끝에 한 페이지를 제외하는 내림으로 좁혔습니다. 예약 페이지를 읽어 압축 메타데이터가 쓰이고 있음을 확인했습니다.
  • AI는 여러 번 포기함: “불가능하니 보고서를 쓰자”고 여러 차례 말했고, 밀어붙이자 디버그 코드를 넣고 분석은 성실히 했습니다. 커밋 메시지 본문은 AI가 썼습니다.
📢 현장의 에이전트는 지치지 않는 조수가 아닙니다. 포기 신호를 무시하고 한 줄을 좁힐 사람이 있을 때만, 18번 부팅이 한 줄 수정이 됩니다.

출처: drm/xe: Don’t hand out the flat CCS storage as usable VRAM⁠—⁠torvalds/linux


agent.md는 반복 리뷰를 세션 시작 전에 심습니다

Fabien Sanglard는 LLM 코드가 컴파일은 되지만 스파게티가 되어, 매 세션 같은 리뷰를 반복하다가 agent.md로 옮겼다고 적었습니다. 하네스가 세션 시작에 이 파일을 읽어 스타일을 주입합니다.

  • 반복을 파일로: 매직 넘버 금지, 조기 반환, 함수명 30자 미만, 불리언 대신 열거형, 한 줄 if에도 중괄호처럼 반복하던 잔소리를 목록으로 고정했습니다.
  • 설계 경계를 권한으로: 멤버 가시성을 private에서 올리려면 사용자 승인을 받게 했습니다. 레이어를 건너뛰어 DB나 드라이버를 직접 부르지 못하게 못 박았습니다.
  • 최소 변경: 손대지 않은 블록에 주석을 달지 말고, 기능과 무관한 줄을 바꾸지 말라고 했습니다. 속도 이득을 정리 비용이 잡아먹지 않게 하려는 계약입니다.
📢 코딩 에이전트의 품질은 다음 모델이 아닙니다. 매 세션 같은 리뷰를 다시 하지 않게, 취향을 파일로 고정하는 일입니다.

출처: My agent.md to improve LLM-assisted code quality⁠—⁠fabiensanglard.net, HN discussion⁠—⁠Hacker News


Task-CoEvolve는 검증 과제를 하네스와 같이 진화시킵니다

도쿄대 Agent4Science 팀은 모델 가중치를 안 바꾸고 하네스 코드만 다시 쓰며 성능을 올리는 탐색에서, 매 반복마다 고정 검증셋을 전부 돌리는 비용을 줄이는 Task⁠-⁠CoEvolve를 제안했습니다. 후보 하네스가 갈리는 과제만 골라 보고, 표본에서 전체 점수를 추정합니다.

  • 의견이 갈리는 과제가 정보: 늘 풀리거나 늘 실패하는 과제보다, 후보마다 답이 다른 과제가 우열을 가릅니다. 과거 결과의 분산으로 능력 경계 근처를 더 뽑습니다.
  • 부분 평가로 전체 비교: 뽑힌 과제의 추출 확률을 보정한 뒤 전체 점수를 추정합니다. 반복마다 다른 부분집합을 봐도 비교가 깨지지 않게 했습니다.
  • 평가 80 % 감소: 온라인 텍스트 분류와 Terminal⁠-⁠Bench 2.1에서 고정 부분집합 기준을 이겼고, 전수 탐색의 최종 성능에 맞추면서 최적화 중 평가 횟수를 80 % 줄였습니다.
📢 하네스 최적화의 병목은 코드 생성이 아닙니다. 어떤 과제가 아직 가르칠 가치가 있는지를 같이 진화시켜야, 검증 예산이 모델을 이깁니다.

출처: Task-CoEvolve⁠—⁠arXiv


MidTool은 도구 사용을 사후 학습이 아니라 중간 학습에 넣습니다

MidTool은 일반 도구 사용을 수학·코딩처럼 중간 학습 단계의 능력으로 보자는 공개 코퍼스 파이프라인입니다. 웹·PDF·코드에 실제 도구 API, MCP 스킬, 문서 기반 워크플로에서 만든 감독을 섞습니다.

  • 도구의 여지를 가르침: 모델이 도구가 할 수 있는 일을 알아보고, 맥락에서 인자를 잡고, 호출을 이어 붙이고, 정보가 부족할 때 회복하게 설계했습니다.
  • 작은 베이스에 먼저: Qwen3⁠-⁠4B⁠-⁠Base와 8B⁠-⁠Base를 MidTool⁠-⁠Mix로 중간 학습한 뒤 SFT와 RL을 얹었습니다. BFCL, tau2⁠-⁠Bench, MCP Universe에서 기준선보다 일관되게 올랐습니다.
  • 사후에만 맡기지 않음: 도구 사용을 미세조정과 강화학습에만 맡기면 늦다고 봅니다. 중간 학습에서 여지를 심어야 이후 학습이 먹습니다.
📢 에이전트의 도구 사용은 배포 직전 미세조정이 아닙니다. 중간 학습에서 호출의 여지를 배워야, 싼 모델도 브리프를 실행할 수 있습니다.

출처: MidTool⁠—⁠arXiv


오늘의 도구 추천

writing-eval — 로컬 CPU에서 초고를 스타일 프로필과 대조하는 결정적 평가기입니다. 승인된 산문으로 프로필을 만들고 Markdown·JSON 보고서를 내며, 호스트 모델을 부르지 않습니다. 에이전트가 글을 빠르게 쏟아내는 오늘, 회사 안의 문체 계약을 회귀 테스트로 고정하고 싶을 때 출발점으로 볼 만합니다.


에디터 노트

어제는 실험을 고르는 취향과 사고를 끊는 스위치가 성적을 가른다고 봤습니다. 오늘은 그 취향이 청구서로 나타납니다. Fable은 뛰어나지만 비싸고, Ox Alpha는 이름 없이 일을 받으며, 웨이모는 클라우드가 아니라 트렁크 아래 칩으로 밀리초를 삽니다.

리누스의 한 줄과 바이브 세금은 같은 교훈입니다. 에이전트는 포기하거나, 앱 없이 테스트만 쌓거나, 쿼터를 태울 수 있습니다. 다음 제품은 더 큰 뇌가 아니라, 일을 어디로 보낼지 고르는 라우팅입니다.

다음에 또 찾아옵니다. — 에이브랜치