No. 166

AI를 돌리는 비용 — Opus 5.5와 지식⁠·학습⁠·로컬 실행의 변화

Opus 5.5의 가격 인하, Firecrawl의 7,500만 달러 투자, 소형 전문 모델과 로컬 실행 도구로 살펴본 AI 운영의 변화.

오늘의 핵심

앤트로픽이 Opus 5.5를 발표하며 성능과 작업당 비용을 함께 내세웠습니다. 지난 하루 공개되거나 새롭게 주목받은 도구에서도 같은 흐름이 보입니다. 데이터를 찾고, 모델을 학습시키고, 실제 기기에서 실행하는 비용이 AI 경쟁의 중심으로 들어오고 있습니다.


클로드 Opus 5.5 — 성능 향상과 가격 인하를 함께

앤트로픽이 9월 22일 클로드 Opus 5.5를 공개했습니다. 회사는 대부분의 작업에서 Fable 5.1 수준의 성능을 내면서, 기본 설정의 일반적인 작업 비용은 Opus 5보다 40 % 낮아졌다고 설명합니다.

  • 가격 구조: 100만 토큰당 입력 4 달러, 출력 20 달러입니다. 캐시 읽기는 0.20 달러로 내려갑니다. 작업당 40 % 절감은 토큰 단가 인하와 사용량 감소를 합친 자체 측정치입니다.
  • 속도와 검증: 출력 생성은 30 % 이상 빨라졌다는 설명입니다. 외부 평가와 행동 감사를 거쳤지만, 회사도 벤치마크의 작은 차이가 실제 업무 차이를 정확히 설명하지는 못한다고 밝혔습니다.
  • 이용 범위: 유료 구독의 5시간 사용 한도를 늘리고, 사용자가 나중에 쓸 수 있는 한도 초기화도 제공합니다. Sonnet 5.5와 Haiku 5.5는 추후 출시 예정입니다.
📢 모델 교체의 판단 기준은 최고 점수에 더해, 같은 일을 끝내는 비용과 검토 시간이 되어야 합니다.

출처: Introducing Claude Opus 5.5 — Anthropic


Firecrawl, 7,500만 달러 투자와 Alexandria 공개

Firecrawl이 Smash Capital 주도의 7,500만 달러 시리즈 B 투자와 지식 연결 서비스 Alexandria를 발표했습니다. 웹, 공식 데이터 공급자, 자체 검색 인덱스를 하나의 접근 방식으로 묶습니다.

  • 사업 모델: 에이전트가 지식을 사용할 때 공급자에게 대가를 지급하는 구조입니다. Wikimedia Enterprise와는 이미 계약을 맺었으며, 더 많은 개인·기관이 참여하는 셀프서비스 체계는 준비 중입니다.
  • 개발자 효과: 데이터마다 다른 API와 형식을 연결하는 부담을 줄이는 것이 목표입니다. 회사는 같은 모델과 프롬프트를 쓴 845개 과제에서 기본 웹 도구 대비 답변 품질이 21 % 높았다고 보고했습니다. 평가는 AI 심사 방식이므로 독립적인 인간 평가와 구분해야 합니다.
📢 에이전트의 지식 접근권을 공급자 보상과 연결하는 시도가 검색 인프라의 다음 사업 모델을 보여줍니다.

출처: Introducing Alexandria and our $75M Series B — Firecrawl


Midcentury — 로봇을 위한 행동 데이터와 시뮬레이션

Midcentury가 전면에 내세운 제품은 로봇 자체보다 로봇을 훈련하고 평가할 데이터 기반입니다. 사람 시점의 영상과 시뮬레이션을 함께 제공하는 접근입니다.

  • 데이터 규모: 공식 사이트는 50개 이상 환경에서 수집한 200만 시간 이상의 1인칭 데이터를 소개합니다. 영상뿐 아니라 3차원 손 자세, 깊이, 동작 관련 주석을 포함합니다.
  • 평가 환경: Matrix 시뮬레이션 제품을 통해 로봇 정책을 시험하는 환경도 제공합니다. 데이터 규모와 데모가 실제 현장의 성공률을 보장하는 것은 아니므로 적용 환경별 검증이 필요합니다.
📢 물리 AI의 확장에는 더 큰 모델만큼이나 반복해서 실패를 측정할 데이터와 시험 환경이 중요합니다.

출처: Data and Simulation Infra for Physical AI — Midcentury


Limite 1B — 수학에 집중한 작은 전문 모델

Paradigma가 첫 모델 Limite 1B Violetto를 공개했습니다. 10억 개 파라미터의 밀집형 모델로, 범용 대화보다 어려운 수학 문제를 높은 처리량으로 푸는 데 초점을 맞췄습니다.

  • 학습과 공개 범위: 3,000억 토큰 미만의 선별 데이터로 처음부터 학습했으며, 약 13만 토큰 길이를 처리합니다. 모델과 평가, 학습에 사용한 가치 모델, vLLM 추론 플러그인을 함께 제공합니다.
  • 성능의 경계: 자체 보고한 AIME 2026 점수는 94.01 %입니다. 개발팀은 일반 질문을 수학 문제로 잘못 해석하는 예시도 공개했고, 범용 비서처럼 지시를 따를 것으로 기대하지 말라고 명시했습니다.
📢 작은 전문 모델을 쓰려면 높은 분야별 점수와 함께, 맡기지 않아야 할 작업도 분명히 정해야 합니다.

출처: Limite 1B Violetto — Paradigma


Halo — Hugging Face 모델 그대로 분산 학습

White Circle이 내부 모델 학습에 쓰던 Halo를 오픈소스로 공개했습니다. 모델을 다른 프레임워크의 형식으로 다시 구현하는 작업을 줄이는 것이 핵심입니다.

  • 기존 형식 유지: Hugging Face 모델에 분산 학습 기능을 더하며, 별도 체크포인트 변환을 요구하지 않는다고 설명합니다. 전문가·컨텍스트·텐서 병렬화와 비동기 강화학습을 지원합니다.
  • 성능 수치 해석: 개발팀은 같은 하드웨어에서 기본 TRL 대비 2.3~2.8배 처리량과 낮은 최대 메모리 사용량을 보고했습니다. 모든 모델·설정에 그대로 적용되는 보장 수치는 아닙니다.
📢 학습 비용에는 GPU 요금뿐 아니라 모델을 옮기고 유지하는 엔지니어링 시간도 포함됩니다.

출처: Halo: Frontier-Lab Training for Everyone — White Circle


Altar — 사내에서 실행하는 보안 모델의 압축 실험

Aikido가 9월 21일 공개하고 22일 갱신한 Altar 기술 설명은 보안 모델을 내부 인프라에서 운영하는 비용을 다룹니다. GLM-5.3을 양자화하고 일부 전문가를 제거해 저장 용량을 줄였습니다.

  • 비교 기준: 원본 16비트 모델 약 1.51 TB에서 328 GB로 줄었으며, 이미 양자화된 488 GB 모델과 비교하면 약 32.8 % 감소입니다. 두 기준을 섞어 해석하면 안 됩니다.
  • 평가의 한계: 32개 알려진 취약점 평가에서 실행당 평균 재현율은 60.4 %였습니다. 세 번 중 한 번이라도 찾은 취약점 수와 매번 안정적으로 찾는 비율은 다릅니다. 회사도 이 실험이 전체 코드에서 새로운 취약점을 발견하는 능력을 측정하지는 않는다고 설명합니다.
📢 내부 운영 가능성을 판단하려면 모델 크기뿐 아니라 압축 후 놓치는 사례와 평가 범위를 함께 봐야 합니다.

출처: Aikido Altar: open-weight AI for sovereign security — Aikido


Cua-S1 — 화면 조작을 작은 의사결정 문제로

Cua의 Cua-S1 연구 프로젝트는 화면의 후보 요소와 행동 중 하나를 고르는 전문 모델을 다룹니다. 범용 컴퓨터 에이전트 전체를 대체한다고 주장하지 않습니다.

  • 모델 구성: Nano는 약 85만 5,000개 파라미터로 후보 행동을 평가합니다. 4B 계열은 Qwen3.5-4B를 바탕으로 화면 요소와 행동을 선택하도록 조정한 모델입니다.
  • 운영 경계: 공식 저장소는 계획과 실행을 분리하고, 선택적 실행 기능은 기본적으로 모의 실행을 사용한다고 설명합니다. 평가에서도 정답률뿐 아니라 잘못된 대상, 잘못된 행동, 행동을 삼가야 하는 상황을 구분합니다.
📢 화면 자동화의 품질은 행동을 얼마나 잘 고르는지와 멈춰야 할 때 얼마나 잘 멈추는지를 함께 측정해야 드러납니다.

출처: Cua-S1 연구 문서 — Cua


Unsloth, Qwen 이미지 모델의 로컬 실행 안내

Unsloth가 Qwen-Image-2.1의 양자화 파일과 로컬 실행 방법을 안내했습니다. 기존 모델 발표에 이어, 실제 개인 장비에서 어떤 설정으로 돌릴지를 구체화한 소식입니다.

  • 메모리 기준: 문서는 12~16 GB VRAM에서 GGUF Q4 계열과 1,024픽셀 해상도를 시작점으로 제시합니다. 이 수치는 검증된 최소 사양이 아닌 추정치이며, 해상도와 메모리 분산 설정에 따라 달라집니다.
  • 기능 구분: 원본 모델은 이미지 편집도 지원하지만, 현재 Unsloth의 해당 출시에서는 텍스트로 이미지 생성만 제공한다고 명시합니다. 모델 자체 기능과 앱에서 지금 쓸 수 있는 기능을 구분해야 합니다.
📢 로컬 AI 도입에서는 모델 이름보다 실제 실행 도구가 지원하는 기능과 메모리 조건이 더 직접적인 기준입니다.

출처: Qwen-Image-2.1: How to Run Locally — Unsloth


Superset, 아이폰에서 코딩 에이전트 관리

Superset이 아이폰용 앱을 소개했습니다. 휴대전화에서 에이전트를 시작하고 진행 상황을 보며 코드 변경을 검토하는 흐름을 제공합니다.

  • 작업 방식: 코드는 사용자의 컴퓨터에 유지됩니다. 모바일 화면은 작업 진행과 변경 내역을 확인하는 접점입니다.
  • 이용 조건: iOS 26 이상과 Superset Pro가 필요합니다. 안드로이드는 현재 대기 명단을 받고 있어 아이폰과 제공 상태가 다릅니다.
📢 에이전트가 오래 일할수록 사용자는 코드를 직접 입력하는 화면보다 진행 상황과 변경을 검토하는 화면을 더 자주 찾게 됩니다.

출처: Superset for iPhone — Superset


Runway, AI 창작 인재 채용 플랫폼 DIFFUSE 출시

Runway가 브랜드·에이전시·스튜디오와 AI 도구를 활용하는 창작자를 연결하는 DIFFUSE를 출시했습니다. 생성 도구 공급에 더해, 그 도구를 잘 쓰는 인재를 찾는 시장으로 확장합니다.

  • 창작자 기능: 개인과 제작사가 프로필과 포트폴리오를 만들고 작업물을 공개할 수 있습니다. 기업은 필요한 인재를 찾아 직접 연결합니다.
  • 채용 신호: Runway가 약 400개 회사의 창작 직군 공고 1,000개 이상을 살핀 결과, 17 %가 AI 역량이나 생성 도구를 언급했습니다. 회사가 선택한 표본의 결과이므로 전체 노동시장의 비율로 일반화할 수는 없습니다.
📢 생성 도구의 확산은 창작 결과뿐 아니라 작업 과정과 역량을 증명하는 포트폴리오의 가치도 바꾸고 있습니다.

출처: Introducing DIFFUSE — Runway


오늘의 도구 추천

Unsloth의 Qwen-Image-2.1 실행 가이드 — 로컬 이미지 생성을 검토한다면 하드웨어별 시작 설정과 현재 제공 기능부터 확인할 수 있는 자료입니다. 메모리 표를 확정 사양으로 받아들이기보다, 작은 해상도와 이미지 한 장으로 자신의 장비에서 먼저 확인하는 데 유용합니다.


에디터 노트

오늘 눈에 들어온 것은 서로 다른 종류의 비용입니다. Opus 5.5는 작업당 추론 비용, Halo는 학습과 이전 비용, Alexandria는 데이터 연결 비용, 로컬 모델 도구는 외부 서비스 의존 비용을 다룹니다.

숫자 하나로 도구를 고르기는 더 어려워졌습니다. 저렴한 토큰이 재시도까지 줄여 주는지, 작은 모델이 필요한 기능을 남겨 두었는지, 새로운 데이터 연결이 근거 확인 시간을 줄이는지를 실제 작업으로 살펴봐야 합니다. 이번 소식들이 주는 공통 질문은 같습니다. 우리 팀이 끝내려는 일을 기준으로 무엇이 얼마나 나아졌을까요.

다음에 또 찾아옵니다. — 에이브랜치