No. 99

AI 에이전트, 이제는 통제와 증명의 시간

에이전트 함대의 검증, 파괴 명령 차단, 토큰 비용 관측과 결과 책임이 AI 운영의 새 기준으로 떠올랐습니다.

오늘의 핵심

오늘의 AI 현장은 더 많은 에이전트를 동시에 실행하는 단계에서 그 결과를 어떻게 증명하고, 비용을 어떻게 관측하며, 위험한 행동을 어디서 멈출지를 설계하는 단계로 넘어가고 있습니다. 생성 능력 자체보다 검증 가능한 증거와 운영 경계가 희소한 자원이 되고 있습니다.


에이전트가 실행 루프를 맡아도 최종 판단은 사람이 소유해야 합니다

애디 오스마니는 에이전트가 조사·구현·검증의 내부 루프를 수행하더라도, 배포 여부와 결과에 대한 책임을 결정하는 외부 루프는 엔지니어가 소유해야 한다고 설명했습니다.

  • 세 가지 운영 기준: 품질 신호를 모으고, 그 증거로 배포 판단을 내리며, 나중에 결정 이유를 설명할 수 있어야 합니다.
  • 사람의 위치 변화: 모든 작업을 직접 수행하는 대신 제약, 표본 검토, 감사 기록과 프로덕션 경계를 관리합니다.
📢 에이전트의 자율성이 커질수록 사람의 역할은 실행자가 아니라 증거를 보고 최종 책임을 지는 운영자로 선명해집니다.

출처: Own the Outer Loop — Addy Osmani


AI 에이전트 180개로 13만 줄 앱을 감사했습니다

21개 언어를 지원하는 약 13만 줄 규모의 iOS 앱을 대상으로 하루 동안 180개 에이전트를 투입해 버그를 찾고 검증한 현장 보고가 공개됐습니다. 단순히 같은 요청을 반복하지 않고 도메인, 고장 유형, 유사 결함과 미확인 영역으로 관점을 나눴습니다.

  • 직교하는 탐색 렌즈: 기능 영역과 결함 유형처럼 서로 다른 축으로 같은 코드를 반복해 사각지대를 줄였습니다.
  • 발견보다 검증: 파일, 줄, 설명과 증거를 고정 JSON 형식으로 요구하고 확신이 없으면 빈 배열을 허용했습니다.
📢 멀티에이전트의 가치는 숫자보다 중복되지 않는 역할 설계와 근거 없는 발견을 버리는 검증 구조에서 나옵니다.

출처: 에이전트 함대의 해부 — AI 180개로 하루에 버그 55개를 잡은 검증 파이프라인 — Velog


AgentsView, 여러 코딩 에이전트의 작업을 한곳에서 추적합니다

AgentsView는 클로드 코드, Codex를 포함한 여러 코딩 에이전트의 세션을 로컬에서 수집해 검색하고 사용량과 비용을 분석하는 오픈소스 도구입니다.

  • 로컬 우선: 계정 없이 하나의 바이너리와 로컬 SQLite를 사용해 세션 데이터를 관리합니다.
  • 운영 가시성: 세션 검색뿐 아니라 일별 사용량, 비용과 활동 흐름을 함께 확인할 수 있습니다.
📢 에이전트가 여러 개가 되면 대화 내용보다 누가 언제 무엇을 했고 얼마를 썼는지 찾는 운영 인덱스가 먼저 필요해집니다.

출처: kenn-io/agentsview — GitHub


PowerShell 변수 하나가 사용자 홈 삭제로 이어질 뻔했습니다

한 사용자가 GPT-5.6 Sol 기반 코딩 에이전트가 임시 폴더를 지우려다 PowerShell의 자동 변수 $HOME과 로컬 변수 $home을 혼동한 안전 사고를 공개했습니다. PowerShell은 변수 이름의 대소문자를 구분하지 않습니다.

  • 작은 이름 충돌, 큰 영향: 의도한 임시 경로 대신 사용자 프로필 루트를 재귀 삭제 대상으로 해석할 수 있었습니다.
  • 모델 밖의 방어 필요: 경로를 삭제 전에 출력하고, 허용된 루트인지 검사하며, 파괴 명령을 별도 승인하는 장치가 필요합니다.
📢 강한 모델도 셸의 언어 규칙과 실행 환경을 잘못 해석할 수 있으므로 위험 명령의 마지막 방어선은 결정론적이어야 합니다.

출처: Dangerous Behavior in AI Agent: PowerShell $HOME Conflict — GitHub Gist


destructive_command_guard, 파괴 명령을 실행 전에 차단합니다

Destructive Command Guard는 코딩 에이전트가 셸 명령을 실행하기 전 훅으로 동작해 위험한 Git과 파일 삭제 명령을 탐지하는 오픈소스 도구입니다.

  • 4단계 검사: 입력을 파싱하고 명령을 정규화한 뒤 빠른 키워드 필터와 안전·위험 패턴 매칭을 차례로 수행합니다.
  • 여러 에이전트 지원: Codex, 클로드, 제미나이, 코파일럿과 커서의 훅 환경을 지원합니다.
📢 프롬프트에 주의를 요구하는 것보다 실행 직전의 결정론적 차단 규칙이 파괴적 실수를 막는 데 더 직접적입니다.

출처: Dicklesworthstone/destructive_command_guard — GitHub


코딩 에이전트는 사용자 요청 전에 수만 토큰을 쓸 수 있습니다

Systima가 같은 모델과 머신에서 클로드 코드와 OpenCode의 API 요청을 측정한 결과, 한 줄 답변을 요청하기 전 고정 프롬프트와 도구 스키마에 각각 약 3만 3,000개와 7,000개의 토큰이 사용됐습니다.

  • 설정도 문맥 비용: 큰 지침 파일과 여러 MCP 서버는 실제 작업에 쓸 수 있는 컨텍스트를 줄입니다.
  • 서브에이전트의 기저 비용: 각 에이전트가 시스템 프롬프트와 도구를 다시 읽으므로 병렬화가 기본 비용을 복제할 수 있습니다.
📢 에이전트 비용을 줄이려면 답변 길이만 볼 것이 아니라 요청 전에 반복 전송되는 지침, 도구와 캐시 쓰기를 측정해야 합니다.

출처: Claude Code Sends 4.7x More Tokens Than OpenCode Before Reading Your Prompt — Systima


토큰 하나는 게이트웨이부터 GPU와 네트워크까지 15개 단계를 지납니다

Data Gravity는 한 번의 프롬프트가 게이트웨이, 스케줄러, KV 캐시, GPU와 네트워크를 거쳐 토큰으로 반환되는 과정을 15개 단계로 추적했습니다.

  • 추론이 중심 비용: 모델 학습 뒤 실제 요청을 처리하는 전력, 냉각, 메모리와 네트워크가 AI 서비스의 지속 비용을 만듭니다.
  • 지연시간의 합: 사용자가 느끼는 응답 속도는 GPU 연산 하나가 아니라 라우팅, 대기, 캐시와 통신의 합입니다.
📢 토큰 가격과 응답 속도는 모델 선택만의 문제가 아니라 요청이 지나가는 전체 데이터센터 경로의 운영 문제입니다.

출처: How an AI Token Travels Through a Data Center — Data Gravity


AI 시대의 SaaS 가치는 화면 아래의 희소 자산으로 이동합니다

The VC Corner는 AI로 기능과 인터페이스를 빠르게 복제할 수 있게 되면서 소프트웨어 표면 자체보다 독점 데이터 루프, 행동 권한, 신뢰와 시스템 오브 레코드가 방어력을 만든다고 분석했습니다.

  • 좌석에서 결과로: 결과 기반 과금은 에이전트가 실패했을 때 공급자가 비용을 떠안는 위험 인수 모델에 가깝습니다.
  • 에이전트가 고객: 사람이 화면을 찾아 쓰는 대신 에이전트가 신뢰도, 비용과 호출 가능성을 보고 도구를 고릅니다.
📢 AI SaaS의 경쟁력은 무엇을 보여주는지보다 어떤 데이터와 권한을 갖고 결과를 책임질 수 있는지로 이동합니다.

출처: This Is the New SaaS Playbook — The VC Corner


LDBD, AI의 예측을 수정할 수 없는 공개 기록으로 검증합니다

LDBD는 주식, ETF와 암호화폐의 상승·하락 예측을 타임스탬프와 함께 공개하고 기간이 끝나면 자동으로 결과를 확정하는 서비스입니다. AI 에이전트도 Bot API나 MCP로 같은 순위표에 참여할 수 있습니다.

  • 사후 편집 차단: 예측을 삭제하거나 결과를 본 뒤 수정할 수 없어 선택 편향을 줄입니다.
  • 단순 기준선 제공: 계속 상승만 예측하는 봇을 포함한 기준선과 비교해 복잡한 모델이 실제로 더 나은지 확인합니다.
📢 AI 평가의 신뢰는 멋진 사례보다 실패까지 남는 사전 등록 기록과 단순 기준선을 이기는지에서 시작합니다.

출처: LDBD — You called it? Prove it. — LDBD


Vibe-Trading, 자율 금융 에이전트에 권한 경계를 넣었습니다

Vibe-Trading은 자연어 시장 조사, 전략 생성, 백테스트와 멀티에이전트 분석을 연결하는 오픈소스 연구 환경입니다. 사용자가 직접 허가한 브로커를 통한 거래 기능에는 명시적 한도와 즉시 중단 장치를 둡니다.

  • 연구와 실행의 분리: 데이터 분석과 백테스트는 넓게 제공하되 실제 주문은 사용자가 정한 종목, 규모와 노출 범위 안에서만 허용합니다.
  • 검증 가능한 산출물: 성과 지표, 벤치마크 비교, 몬테카를로와 워크포워드 검증 결과를 보고서로 남깁니다.
📢 금융 에이전트의 핵심은 더 자유롭게 거래하게 하는 것이 아니라 권한, 감사 기록과 중단 경계를 코드로 고정하는 데 있습니다.

출처: HKUDS/Vibe-Trading — GitHub


오늘의 도구 추천

destructive_command_guard — 코딩 에이전트가 실행하려는 위험한 Git·셸 명령을 PreToolUse 훅에서 차단합니다. 모델의 주의력에만 기대지 않고 파괴 행동 앞에 결정론적 경계를 두고 싶을 때 유용합니다.


에디터 노트

에이전트가 많아질수록 결과가 좋아질 것이라는 기대는 절반만 맞습니다. 180개 에이전트의 버그 감사가 의미 있었던 이유는 180이라는 숫자가 아니라 탐색 관점을 겹치지 않게 나누고, 증거 형식을 고정하고, 틀린 후보를 버리는 단계를 따로 만들었기 때문입니다.

오늘의 사례들은 같은 결론을 가리킵니다. 좋은 AI 운영은 자율성을 최대화하는 일이 아니라 필요한 만큼의 자율성을 주고, 비용과 행동을 관측하며, 위험한 경계에서 멈추고, 마지막 판단을 설명할 수 있게 만드는 일입니다.

다음에 또 찾아옵니다. — 에이브랜치