No. 125

장기 AI 에이전트는 기억보다 운영 구조가 중요합니다 — 상태⁠⁠·⁠증거⁠⁠·⁠교정의 전환

장기 AI 에이전트의 신뢰성을 지속 상태, 실행 증거, 실시간 교정, 메모리와 스킬 품질로 높이는 방법을 살핍니다.

오늘의 핵심

오늘의 흐름은 장기 AI 에이전트를 더 똑똑한 한 번의 추론이 아니라, 상태를 남기고 실행을 관찰하며 필요한 순간에 교정하는 시스템으로 바꾸는 움직임입니다. 실패 원인을 매번 대화 기록에서 다시 찾는 대신 이슈 상태를 유지하고, 최종 화면만 채점하는 대신 실제 전환을 증명하며, 검색된 메모리와 스킬을 고정 지침이 아니라 현재 환경에 맞게 재구성하려는 연구가 이어졌습니다. 자율성이 길어질수록 모델의 능력보다 운영 구조의 품질이 결과를 좌우합니다.


ADIAS, 에이전트 개선 기록을 후보가 아닌 이슈 중심으로 남깁니다

ADIAS는 에이전트 설계를 반복 개선할 때 각 후보 버전의 성능만 비교하지 않고, 해결해야 할 이슈의 상태를 명시적으로 유지합니다. 같은 실패를 매 라운드 다시 해석하거나 효과 없던 수정이 반복되는 문제를 줄이기 위한 접근입니다.

  • 지속 이슈 상태: 이슈 ID, 생명주기, 근거, 수정과 결과의 이력을 다음 라운드까지 보존합니다.
  • 집중 수정: 현재 남아 있는 이슈와 과거 개입 결과를 바탕으로 다음 수정 대상을 고릅니다.
  • 평균 25.2 % 향상: 5개 인터랙티브 벤치마크에서 가장 강한 기준선보다 평균 성능이 높았고, 이슈 상태를 제거한 조건에서는 최대 40.7 % 하락했습니다.
📢 장기 에이전트 개선의 핵심 자산은 가장 최근 후보 코드가 아니라, 무엇을 왜 고쳤고 어떤 결과가 났는지 추적 가능한 이슈 장부입니다.

출처: ADIAS: Automated Design of Interactive Agentic Systems⁠—⁠arXiv


WebGrader, 화면이 아니라 요청한 전환이 일어났는지 채점합니다

WebGrader는 자연어로 요청된 웹 기능에서 필요한 상호작용 흐름을 자동으로 도출하고, 이를 실행 가능한 Flow Contract로 변환하는 프로그램형 채점기입니다. 시각적으로 그럴듯한 결과나 결정적 상태를 보기 전의 조기 판정 대신, 실제 브라우저 궤적에서 기능의 완료를 확인합니다.

  • 동일 궤적의 다중 증거: 소스 코드와 라이브 DOM에 행동을 연결하고 시각, DOM, 응답, 영속 상태를 함께 수집합니다.
  • 검증 스킬 진화: 실패 잔차에서 재사용 가능한 검증기를 찾고 별도 검증 페이지를 통과한 스킬만 훈련 전에 고정합니다.
  • 기능 성공률 52.01 %: WebGen-Bench에서 외형과 스크립트를 결합한 보상보다 7.88 %p 높았습니다.
📢 웹 에이전트의 평가는 결과 화면 한 장이 아니라, 사용자의 행동이 요청한 상태 변화를 실제로 만들었다는 실행 증거를 따라가야 합니다.

출처: WebGrader: Training LLMs for Web Development with Self-Evolving Programmatic Grader⁠—⁠arXiv


LivePlan, 코딩 에이전트가 흔들릴 때만 개입합니다

LivePlan은 코딩 에이전트의 긴 작업 궤적을 실시간으로 감시해 계획 이탈, 실패 행동 반복, 성급한 종료를 탐지하고 다음 행동을 교정합니다. 모든 단계에서 비싼 모델에게 재계획을 맡기지 않고, 규칙 기반 감시와 선택적 조언을 분리했습니다.

  • 판정과 조언 분리: 결정론적 모니터가 일반 궤적 신호를 검사하고 문제가 감지될 때만 조언 모델을 호출합니다.
  • 최대 15.2 % 개선: SWE-bench Verified와 Pro에서 기본 SWE-agent보다 해결률이 평균 9.9 %, 최대 15.2 % 높았습니다.
  • 인스턴스당 0.08달러 추가: 이미 성공하던 실행의 회귀를 줄이면서 중간·고난도 문제의 추가 성공에 집중했습니다.
📢 신뢰할 수 있는 감독은 매 순간 계획을 빼앗는 것이 아니라, 반복·이탈·조기 종료처럼 관찰 가능한 위험 신호가 생길 때만 최소한으로 개입합니다.

출처: Online Monitoring and Corrective Steering of Programming Agents⁠—⁠arXiv


StepJack, 무해해 보이는 여러 페이지가 하나의 공격이 됩니다

StepJack은 컴퓨터 사용 에이전트를 겨냥한 간접 프롬프트 인젝션을 여러 개의 평범해 보이는 하위 단계로 나눠, 탐색 경로의 여러 페이지에 분산하는 공격을 평가합니다. 개별 지시는 무해해 보여도 에이전트가 순서대로 실행하면 원래의 악성 목표가 완성됩니다.

  • 480개 공격 사례: 악성 목표의 실행 가능성을 유지하면서 각 하위 단계가 덜 의심스럽게 보이도록 자동 분해했습니다.
  • 연쇄 탐색 위험: 참조 체인을 안정적으로 따라간 5개 에이전트의 평균 공격 성공률이 단일 단계 31.3 %에서 3단계 36.9 %로 올랐습니다.
  • 최대 31.2 %p 상승: 6개 에이전트 중 3개는 같은 분해 깊이에서 다단계 공격에 더 취약했습니다.
📢 브라우저 에이전트의 안전 검사는 현재 페이지의 문장만 보지 말고, 여러 페이지에서 누적된 지시가 최종적으로 어떤 행동 체인을 만드는지 추적해야 합니다.

출처: StepJack: Benchmarking Computer-Use Agent Safety Against Multi-Step Indirect Prompt Injection⁠—⁠arXiv


컨텍스트 압축, 최근 행동의 영향부터 약하게 만들 수 있습니다

장기 에이전트는 컨텍스트 길이를 통제하기 위해 이전 상호작용을 반복해서 요약하지만, 이 과정이 최근 행동의 영향까지 약화해 차단된 행동과 탐색 반복을 늘릴 수 있다는 실험 결과가 나왔습니다. 연구진은 각 압축 시점 자체를 독립적인 검증 단위로 다뤘습니다.

  • 경계 단위 비교: 같은 환경 상태에서 서로 다른 요약을 적용한 뒤 폐쇄 루프 실행을 이어가 결과를 비교합니다.
  • 모델 고정: 에이전트 모델을 다시 학습하지 않고, 선호된 실행 결과를 이용해 자연어 압축 프롬프트를 최적화합니다.
  • 실행 안정성 개선: AppWorld 초기 실험에서 과제 성능, 여러 실행 간 신뢰성, 컨텍스트 대비 실행 효율이 기존 압축 기준선보다 좋아졌습니다.
📢 좋은 요약은 정보를 많이 남기는 문서가 아니라, 압축 직후 에이전트의 다음 행동이 흔들리지 않도록 결정에 필요한 인과관계를 보존하는 상태 변환입니다.

출처: Toward Reliable Context Compression for Long-Horizon Agents⁠—⁠arXiv


MemPrism, 같은 기억을 현재 과제에 맞는 관계로 다시 보여줍니다

MemPrism은 경험을 하나의 고정 형식으로 검색하는 대신, 영구 이벤트 기록과 의사결정 시점의 작업 기억을 분리합니다. 관련 정보가 저장돼 있어도 현재 판단에 맞는 구조로 정리되지 않으면 쓰이지 못하는 ‘표현 불일치’를 해결하려는 설계입니다.

  • 원본과 뷰 분리: 상호작용은 이벤트 스트림으로 보존하고, 과제마다 임시 관계형 뷰를 만듭니다.
  • 가벼운 뷰 정책: 관계 구조, 증거 범위, 결과 조건, 세분도를 고른 뒤 결정론적 구성기가 작업 기억을 렌더링합니다.
  • 긴 궤적에서 더 큰 효과: 체화·웹 에이전트 평가에서 작업이 길어질수록 성능 이점이 커졌고 메모리 토큰은 줄었습니다.
📢 에이전트 메모리의 병목은 저장 용량보다, 같은 사실을 현재 결정에 필요한 관계와 세분도로 다시 조립하는 인터페이스에 있습니다.

출처: MemPrism: Task-Conditioned Relational Memory Views for Long-Horizon Agents⁠—⁠arXiv


SkillAligner, 검색된 스킬을 고정 명령이 아닌 초안으로 다룹니다

SkillAligner는 의미상 관련 있는 스킬도 현재 과제, 실행 환경, 다른 스킬의 가정과 충돌할 수 있다는 ‘스킬-실행 부적합’을 다룹니다. 검색 결과를 그대로 컨텍스트에 붙이지 않고 실행 전에 한 번 공동 조정해 간결한 실행 가이드로 만듭니다.

  • 환경 특화: 유용한 절차 조각을 현재 도구 인터페이스와 과제 요구에 맞게 바꿉니다.
  • 충돌 해소: 여러 스킬 사이의 의존성, 모순, 중복을 한 번에 정리합니다.
  • 훈련 없는 적용: 모델을 다시 학습하지 않으면서 스킬로 인한 인스턴스별 회귀와 총 추론 비용을 함께 줄였습니다.
📢 스킬 검색의 품질은 비슷한 문서를 찾는 데서 끝나지 않고, 그 문서의 숨은 가정을 현재 실행 환경과 충돌 없이 맞추는 과정까지 포함해야 합니다.

출처: SkillAligner: Treating Retrieved Skills as Adaptable Drafts at Execution Time⁠—⁠arXiv


SkillEval, 스킬의 약점을 최종 성공률 밖에서도 진단합니다

SkillEval은 스킬이 특정 과제의 성공률을 높였는지만 평가하면 재사용성이나 문서 자체의 약점을 알기 어렵다는 문제에서 출발합니다. SKILL.md의 일반 품질 속성을 고정되고 검사 가능한 방향으로 나눠 점수화합니다.

  • 속성별 신호: 통제된 긍정·부정 스킬 쌍에서 품질 속성마다 해석 가능한 표현 방향을 학습합니다.
  • 혼입 요인 억제: 길이와 서식처럼 품질과 무관한 문서 특징이 점수에 미치는 영향을 줄입니다.
  • 수정으로 연결: 진단된 약점을 표적으로 고친 스킬은 해당 속성뿐 아니라 실제 과제 통과율도 높아졌습니다.
📢 재사용 스킬은 하나의 통과율로 평가하기보다 명확성, 적용 가능성, 절차 품질처럼 수정 가능한 신호로 분해해야 개선이 누적됩니다.

출처: SkillEval: Decomposing Agent Skill Quality into Interpretable Signals⁠—⁠arXiv


BONSAI, 현재 최고 점수보다 계속 개선될 수 있는 스킬을 찾습니다

BONSAI는 문서형 스킬을 점수 하나로만 최적화하면 우연히 높은 성능을 낸 좁은 과적합 지점에 갇힐 수 있다고 지적합니다. 각 스킬 문서를 부모로 두고 변형된 자식을 탐색하면서, 현재 성능과 주변 변형이 계속 좋은 결과를 내는 ‘진화 가능성’을 함께 봅니다.

  • 트리 기반 변형 탐색: 모든 자식 스킬은 부모 문서의 변형이며 상한 신뢰 선택 규칙으로 탐색합니다.
  • 추가 평가 비용 없음: 자식들의 평균 점수로 주변 문서 공간의 개선 가능성을 추정합니다.
  • 23.13 %p 향상: 고정된 30B 에이전트와 3개 벤치마크 평균에서 스킬 없는 조건보다 높았고, 예산을 맞춘 2개 기준선보다도 앞섰습니다.
📢 스킬 최적화는 가장 높은 한 번의 점수보다, 작은 수정에도 성능이 유지되고 다음 개선을 계속 만들어 내는 넓은 해법을 찾아야 합니다.

출처: BONSAI: Evolvability-Guided Tree Search over Skills⁠—⁠arXiv


장기 궤적 귀속, 실패를 만든 구성요소와 공격 체인을 찾습니다

장기 에이전트 궤적 귀속 벤치마크는 사용자 지시, 도구 호출, 외부 관찰, 메모리가 섞인 실행에서 어떤 구성요소가 안전하거나 위험한 행동을 만들었는지 분석합니다. 최종 성공과 실패만 기록하던 평가를 원인 위치와 연결 구조까지 확장했습니다.

  • 1,300개 이상 궤적: AgentDojo와 Agent3Sigma의 정상 행동, 위험 행동, 안전 거절을 통합 스키마로 주석했습니다.
  • 두 가지 과제: 주된 원인 구성요소를 찾는 귀속 위치화와 공격·실행 체인을 복원하는 과제를 제공합니다.
  • 새 모델로 확장: 새로운 에이전트의 궤적도 같은 형식으로 표준화하고 평가할 수 있는 주석 스킬을 공개했습니다.
📢 장기 에이전트의 감사 가능성은 실패했다는 판정에서 끝나지 않고, 어느 지시·관찰·기억이 어떤 실행 체인을 거쳐 결과를 만들었는지 재구성할 수 있어야 합니다.

출처: Long-Horizon Agent Trajectory Attribution⁠—⁠arXiv


오늘의 도구 추천

Hallmark — 클로드 코드, 커서, 코덱스용 디자인 스킬입니다. 새 UI 제작, 기존 코드 감사, 구조 재설계, 참고 디자인 분석의 4가지 흐름과 21개 테마, 57개 안티 슬롭 검사를 제공합니다. 오늘 다룬 SkillAligner와 SkillEval처럼 스킬을 단순 프롬프트가 아니라 검사 가능한 절차 문서로 운영하려는 팀이 직접 구조를 살펴보기 좋은 사례입니다.


에디터 노트

긴 작업에서 에이전트가 실패하는 이유를 “모델이 아직 덜 똑똑해서”라고만 설명하면 운영자가 바꿀 수 있는 부분이 사라집니다. 그러나 오늘의 연구들은 다른 지점을 보여줍니다. 이슈를 상태로 남기지 않아 같은 수정을 반복하고, 실제 전환을 보기 전에 통과를 선언하며, 무해한 지시들이 여러 페이지에 걸쳐 공격 체인을 만들고, 관련 있는 스킬도 환경 가정이 어긋나면 오히려 실행을 망칩니다.

장기 자율성은 한 번의 강한 추론이 아니라 상태, 증거, 개입, 귀속이 연결된 운영 루프에서 나옵니다. 좋은 에이전트 시스템은 성공했을 때만 빠른 시스템이 아니라, 흔들리기 시작한 순간을 감지하고 최소 비용으로 교정하며 실패의 원인을 다음 실행에 재사용할 수 있는 시스템입니다.

다음에 또 찾아옵니다. — 에이브랜치