No. 104

AI 에이전트의 경쟁력이 실행에서 운영으로 이동합니다 — Codex Security⁠·Claude⁠·Inkling

보안 스캔, 조직 도입 단계, 코딩·영상 평가와 대규모 API가 AI 에이전트의 운영 기준을 구체화합니다.

오늘의 핵심

오늘의 흐름은 AI 에이전트를 실제 운영 시스템으로 만드는 조건에 모입니다. 오픈AI는 코드 보안 스캔을 Codex 플러그인으로 연결했고, 앤트로픽은 조직의 AI 도입을 5단계로 나눴습니다. 코딩 에이전트와 영상 에이전트는 품질뿐 아니라 비용과 작업 단위로 평가되기 시작했으며, 언리얼 엔진·분산 파인튜닝·대량 영상 API처럼 에이전트가 직접 다룰 수 있는 실행 표면도 빠르게 넓어지고 있습니다.


오픈AI, Codex Security를 플러그인과 CLI 흐름으로 개방

오픈AI가 Codex Security를 데스크톱 플러그인과 CLI에서 시작할 수 있는 공개 흐름을 제공했습니다. 저장소를 선택해 스캔하면 취약점 탐지에서 수정 작업까지 같은 Codex 환경 안에서 이어갈 수 있습니다.

  • 데스크톱 경로: 플러그인을 추가한 뒤 준비된 보안 스캔 프롬프트로 프로젝트 폴더를 검사합니다.
  • CLI 경로: 코드 폴더에서 한 번의 명령으로 스캔을 시작할 수 있어 자동화 파이프라인에 붙이기 쉽습니다.
  • 수정까지 연결: 보고서만 만드는 도구가 아니라 발견한 문제를 코드 변경 작업으로 넘기는 데 초점을 둡니다.
📢 보안 에이전트의 가치는 경고 수보다 발견, 근거 확인, 패치, 재검증을 한 작업 흐름으로 닫는 능력에서 결정됩니다.

출처: Get started with the Codex Security plugin — OpenAI


앤트로픽, AI 엔지니어링 도입을 5단계로 구분

앤트로픽이 조직의 AI 엔지니어링 도입을 제한적 사용부터 AI 네이티브 운영까지 5단계로 정리했습니다. 단순한 도구 보급률이 아니라 에이전트의 병렬 실행, 감독 방식과 신뢰 장치를 함께 성숙시켜야 한다는 관점입니다.

  • Gated·Assisted: 허용된 작업에서 사람이 주도하고 AI가 보조합니다.
  • Parallel·Supervised Autonomy: 여러 작업을 에이전트가 병렬 처리하고 사람이 결과와 예외를 감독합니다.
  • AI-native: 조직의 프로세스 자체가 에이전트 실행을 전제로 설계됩니다.
📢 AI 도입의 병목은 모델 접근권보다 권한 범위, 검토 책임, 실패 복구를 조직 단계에 맞게 설계하지 못하는 데서 생깁니다.

출처: Steps of AI Adoption — Anthropic


Kimi K3, 코딩 에이전트 지수 57점과 작업당 3.18달러 기록

Artificial Analysis가 Kimi Code CLI에서 Kimi K3를 평가해 코딩 에이전트 지수 57점, 작업당 평균 비용 3.18달러를 기록했다고 공개했습니다. 오픈웨이트 구성 가운데 가장 높은 성능권에 진입하면서 성능과 비용을 함께 비교할 수 있는 선택지가 늘었습니다.

  • 복합 평가: DeepSWE, Terminal-Bench v2, SWE-Atlas-QnA의 평균으로 구현·터미널·저장소 이해를 함께 측정합니다.
  • 비용 단위 변화: 토큰 가격만이 아니라 실제 작업 1건을 완료하는 데 든 비용을 비교합니다.
  • 하네스 영향: 같은 모델도 CLI와 에이전트 설정에 따라 실행 성능이 달라질 수 있습니다.
📢 코딩 모델의 구매 기준은 벤치마크 점수 하나에서 성공한 작업당 비용과 실행 하네스의 안정성으로 이동하고 있습니다.

출처: AI Coding Agent Benchmarks & Leaderboard — Artificial Analysis


프런티어 AI 경쟁, 6개 연구소로 넓어지고 비용은 2~3배 하락

Artificial Analysis는 8일 동안 4개의 새 프런티어 모델이 등장하면서 지능 지수 50점을 넘긴 연구소가 2곳에서 6곳으로 늘었다고 분석했습니다. 최상위권 격차가 줄어드는 동시에 준프런티어 성능의 작업 비용은 2~3배 낮아졌습니다.

  • 선두권 확대: 단일 양강 구도보다 여러 연구소가 근접한 성능권을 형성합니다.
  • 가격 압력: 모델 성능의 평준화가 API 가격과 추론 효율 경쟁을 가속합니다.
  • 선택 기준 다변화: 지능 외에도 지연 시간, 처리량, 컨텍스트, 개방성이 실제 도입을 좌우합니다.
📢 모델 격차가 좁아질수록 기업의 차별점은 최고 점수 확보보다 라우팅, 비용 통제, 장애 전환 같은 운영 설계에서 커집니다.

출처: Comparison of AI Models across Intelligence, Performance, and Price — Artificial Analysis


Hermes Agent, 언리얼 엔진을 다루는 공식 MCP 스킬 공개

Nous Research의 Hermes Agent가 에픽게임즈의 언리얼 엔진 MCP 서버를 안전하게 다루는 선택형 스킬을 공개했습니다. 자연어 요청을 장면 구성, 액터 조작, 블루프린트, 카메라, 렌더링과 플레이 테스트로 연결합니다.

  • 실행 표면 확장: 코드 편집을 넘어 실제 3D 에디터 상태를 읽고 변경합니다.
  • 검증 루프: 도구 호출 뒤 속성을 다시 읽고 뷰포트 스크린샷으로 시각 결과를 확인하도록 안내합니다.
  • 직렬 실행 원칙: 언리얼의 게임 스레드 특성에 맞춰 MCP 호출을 겹치지 않게 운용합니다.
📢 에이전트 스킬의 품질은 도구 목록보다 대상 애플리케이션의 실행 제약과 검증 방법을 얼마나 정확히 인코딩했느냐에 달려 있습니다.

출처: Unreal MCP — Nous Research


Sakana AI, 생물학적 제약을 지키는 오류 확산 학습 제안

Sakana AI 연구진이 각 뉴런을 흥분성 또는 억제성으로 고정하는 데일의 원리를 지키면서 학습하는 이중 스트림 신경망을 제안했습니다. 전방 가중치의 전치 행렬을 전달하지 않고 전역 오류 신호를 각 층에 라우팅합니다.

  • 이미지 분류: MNIST 96.7 %, CIFAR-10 61.7 %를 기록했습니다.
  • 강화학습 확장: 오류 확산을 PPO에 결합해 Brax와 Craftax에서 역전파 없는 기준선과 경쟁했습니다.
  • 작업별 병목: 어떤 학습 장치가 중요한지는 데이터셋 난도에 따라 달라졌습니다.
📢 역전파를 그대로 모사하지 않는 학습 규칙은 뇌과학적 타당성뿐 아니라 새로운 저전력 학습 하드웨어의 설계 공간도 넓힐 수 있습니다.

출처: Diffusing Blame: Task-Dependent Credit Assignment in Biologically Plausible Dual-Stream Networks — arXiv


NVIDIA NeMo AutoModel, Diffusers 분산 파인튜닝 지원

NVIDIA가 NeMo AutoModel에 Hugging Face Diffusers 지원을 추가했습니다. FLUX.1-dev와 Wan 2.1 같은 이미지·영상 모델을 체크포인트 변환 없이 여러 GPU에서 전체 파인튜닝하거나 LoRA로 조정할 수 있습니다.

  • 준비된 레시피: 모델별 전체 학습과 LoRA 구성을 바로 실행할 수 있습니다.
  • 분산 확장: 샤딩과 병렬화 설정을 Diffusers 모델에 그대로 적용합니다.
  • 변환 제거: 라이브러리 사이 체크포인트 변환 단계를 줄여 실험과 배포 사이 마찰을 낮춥니다.
📢 생성 모델 운영의 경쟁력은 새 모델 발표보다 기존 생태계의 체크포인트와 분산 학습을 얼마나 적은 변환으로 연결하느냐에서 나옵니다.

출처: Fine-tune video and image models at scale with NVIDIA NeMo AutoModel and Diffusers — NVIDIA·Hugging Face


Physion-Arc 1.0, 영상 에이전트를 완성된 이야기로 평가

Physion Labs가 여러 장면으로 구성된 1분 길이 영상을 평가하는 Physion-Arc 1.0을 공개했습니다. 개별 클립의 화질을 넘어 서사 일관성, 영화적 언어, 제작 품질을 16개 지표와 전문가 블라인드 비교로 측정합니다.

  • 작업 단위 전환: 한 장면이 아니라 여러 장면이 이어진 완성 영상 전체를 봅니다.
  • 에이전트 비교: 6개 상용 영상 에이전트를 동일한 시나리오 조건에서 평가했습니다.
  • Runway 선두: Runway Agent 2.0이 세 핵심 영역 모두에서 가장 높은 결과를 기록했습니다.
📢 영상 생성의 기준이 예쁜 한 컷에서 장면 선택, 연결, 속도와 감정선을 통제하는 감독 능력으로 이동하고 있습니다.

출처: Inside Our Approach to Building Runway Agent — Runway


fal, 깊이 지도로 영상 스타일을 바꾸는 워크플로우 공개

fal이 원본 영상의 깊이 지도를 추출한 뒤 Seedance 2.0으로 스타일을 바꾸는 워크플로우 템플릿을 공개했습니다. 카메라 움직임과 구도를 유지하면서 외형만 일관되게 변환하도록 설계됐습니다.

  • 구조 보존: Video Depth Anything이 프레임마다 깊이 정보를 제공합니다.
  • 스타일 변환: 깊이 정보를 조건으로 사용해 피사체와 배경의 공간 관계를 유지합니다.
  • 재사용 가능한 흐름: 템플릿과 API로 같은 제작 단계를 반복 실행할 수 있습니다.
📢 생성 영상의 실무 가치는 무작위 결과보다 원본의 움직임과 공간 구조를 유지하며 반복 가능한 변환 파이프라인을 제공하는 데 있습니다.

출처: depth-to-seedance Template — fal


HeyGen, 영상 작업 100건을 묶는 Batch API 출시

HeyGen이 영상 생성, 번역, 립싱크와 자산 업로드를 한 요청에 최대 100건까지 제출하는 Batch API를 공개했습니다. 요청 직후 배치 ID를 반환하고 모든 작업이 종료 상태에 도달하면 웹훅으로 알립니다.

  • 비동기 처리: 각 영상 요청을 순서대로 기다리지 않고 대량 작업을 제출할 수 있습니다.
  • 통합 상태 관리: 여러 작업의 완료 여부를 하나의 배치 ID로 추적합니다.
  • 자동화 친화적: 웹훅을 후속 검수, 저장, 배포 파이프라인의 시작 신호로 사용할 수 있습니다.
📢 생성형 영상이 캠페인과 다국어 운영에 들어가면 모델 품질만큼 대량 제출, 상태 추적, 실패 재처리 같은 배치 제어가 중요해집니다.

출처: Batch videos — HeyGen


Together AI, 975B 멀티모달 모델 Inkling을 서버리스로 제공

Together AI가 Thinking Machines Lab의 멀티모달 추론 모델 Inkling을 서버리스 추론으로 제공하기 시작했습니다. 975B 전체 파라미터 중 41B를 활성화하는 MoE 구조와 1M 토큰 컨텍스트를 갖추고 텍스트, 이미지, 오디오를 기본 입력으로 지원합니다.

  • 조절 가능한 추론: 작업 난도와 비용에 맞춰 추론 노력을 제어할 수 있습니다.
  • 멀티모달 입력: 긴 문서와 시각·음성 자료를 하나의 컨텍스트에서 다룹니다.
  • 서버리스 접근: 별도 대규모 인프라를 운영하지 않고 API에서 모델을 시험할 수 있습니다.
📢 초대형 MoE 모델의 확산 속도는 모델 공개보다 개발자가 즉시 호출하고 비용을 측정할 수 있는 추론 유통망에 좌우됩니다.

출처: Inkling API — Together AI


오늘의 도구 추천

Codex Security plugin — 저장소의 보안 문제를 찾는 데서 끝내지 않고 Codex의 수정·검증 흐름으로 이어주는 도구입니다. 기존 개발 에이전트 작업에 보안 검토를 가장 짧게 붙여볼 수 있는 선택지입니다.


에디터 노트

이번 주말의 새 소식은 거대한 모델 발표보다 운영의 빈칸을 채우는 업데이트가 많았습니다. 보안 스캔은 플러그인이 됐고, 조직 도입은 단계표가 됐으며, 영상 생성은 배치 API와 완성작 평가로 이동했습니다. AI 에이전트가 특별한 데모에서 일상적인 시스템으로 넘어가려면 더 강한 모델보다 권한, 비용, 상태, 검증을 다루는 지루하지만 구체적인 층이 필요합니다. 오늘 공개된 도구들은 바로 그 층이 제품 경쟁의 중심으로 올라오고 있음을 보여줍니다.

다음에 또 찾아옵니다. — 에이브랜치