No. 123

AI 에이전트의 병목은 모델 밖에 있습니다 — 하니스⁠·기억⁠·도구 경로 검증

에이전트의 성능을 좌우하는 하니스, 기억, 스킬, 도구 실행의 검증 기준을 짚습니다.

오늘의 핵심

오늘의 흐름은 AI 에이전트의 성능 병목이 모델 자체보다 모델을 둘러싼 하니스·기억·도구·스킬 관리로 이동하고 있다는 것입니다. 프롬프트와 제어 흐름을 자동으로 고치는 능력이 별도 평가 대상이 됐고, 오래된 대화 기록이나 검증되지 않은 스킬은 더 많은 경험을 쌓을수록 오히려 성능을 떨어뜨렸습니다. 멀티모달 도구 역시 호출 횟수보다 반환된 증거가 실제 답변을 바꿨는지 확인해야 합니다.


HarnessOpt-Bench, 모델을 둘러싼 하니스를 스스로 개선하는 능력 평가

HarnessOpt-Bench 연구진이 프롬프트, 도구, 제어 흐름, 메모리와 오케스트레이션 코드를 포함한 에이전트 하니스를 AI가 얼마나 잘 최적화하는지 측정하는 벤치마크를 공개했습니다. 최적화 모델은 제한된 평가 예산 안에서 하니스를 수정하고, 탐색 중 볼 수 없었던 테스트 파티션으로 최종 개선 폭을 평가받습니다.

  • 111회 평가: 5개 프런티어 모델을 4개 다운스트림 작업에서 비교했습니다.
  • 평가 경계 보호: 신뢰 실행 환경이 목표 에이전트의 자원 사용량과 후보 버전을 기록합니다.
  • 모델 차이가 더 큼: 어떤 코딩 하니스를 썼는지보다 최적화 모델의 차이가 더 뚜렷했고, 네이티브 하니스가 항상 우월하지는 않았습니다.
📢 에이전트 경쟁력은 모델 교체만으로 결정되지 않으며, 같은 모델을 감싼 프롬프트와 도구 흐름을 제한된 비용 안에서 얼마나 검증 가능하게 개선하는지가 별도 역량이 됩니다.

출처: HarnessOpt-Bench — arXiv


TRAJDEBUG, 장기 에이전트 실패에서 최초의 치명적 오류를 추적

TRAJDEBUG는 긴 에이전트 실행 기록에서 최종 실패를 일으킨 가장 이른 오류를 찾는 프레임워크입니다. 단순히 잘못된 단계를 나열하는 대신, 각 오류가 이후 단계에서 해결됐는지와 마지막 결과에 어떤 영향을 남겼는지를 추적합니다.

  • 486개 실패 궤적: Tau2Bench와 SWE-Bench Pro의 실제 도구 사용·코딩 시나리오를 사람이 주석 처리했습니다.
  • 다중 해상도 압축: 멀리 떨어진 지시, 관찰, 이전 문맥을 단계별로 압축해 판단 근거를 모읍니다.
  • 오류 생애주기: 국소 오류가 뒤에서 복구됐는지, 끝까지 영향을 미쳤는지를 구분합니다.
📢 장기 에이전트 디버깅은 마지막 오답만 고치는 작업이 아니라, 최초 오류와 복구 실패가 이어진 경로를 재구성해야 재발 방지로 연결됩니다.

출처: TRAJDEBUG — arXiv


자기진화 에이전트, 검증 없는 스킬 축적이 성능을 다시 떨어뜨립니다

자기진화 에이전트가 실행 경험에서 스킬을 계속 추출할 때 일정 규모를 넘으면 성능이 개선되지 않고 하락하는 ‘오염 전환’이 보고됐습니다. 결함 있는 스킬이 이후 스킬 생성의 참고 자료가 되면서 잘못된 추론이 여러 세대에 걸쳐 전파됐고, 원본 스킬을 나중에 삭제해도 후손 스킬에 남은 오류는 사라지지 않았습니다.

  • 사후 롤백의 한계: 오염을 만든 스킬만 제거해도 잃은 성능의 일부만 회복됐습니다.
  • 3중 사전 게이트: 구조적 유효성, 행동 무해성, 의미 일관성을 각각 다른 비평기가 검사합니다.
  • 72% pass@1: Verifier-as-Gatekeeper는 약 5배 작은 스킬 풀로 Terminal-Bench 2에서 매 라운드 개선을 유지했습니다.
📢 에이전트 기억과 스킬은 많이 저장할수록 좋아지는 자산이 아니라, 런타임 문맥에 들어가기 전에 품질을 판정해야 하는 실행 코드에 가깝습니다.

출처: When Self-Evolution Backfires — arXiv


오래된 대화 기록이 맞는 도구 선택을 뒤집을 수 있습니다

도구 호출 에이전트가 누적 대화와 실행 기록을 현재 상태로 오인하는 문제를 분리 측정한 연구가 나왔습니다. 과거 기록이 형식적으로는 정상이고 의미도 그럴듯하지만 현재 요청에는 더 이상 유효하지 않을 때, 모델이 원래 알고 있던 올바른 정책까지 잘못된 엔터티와 인터페이스 관례에 끌려갔습니다.

  • 32.1% 결정 반전: Qwen3-1.7B에서 오염된 기록이 원래 맞았던 결정의 32.1%를 뒤집었습니다.
  • 3가지 실패 층위: 의사결정 상태, 엔터티 연결, 인터페이스 실행을 분리했습니다.
  • 93.0% 정확도: 신뢰 가능한 상태를 조건으로 학습한 8B 모델은 Balanced Tool-Use Accuracy 93.0%를 기록했습니다.
📢 긴 대화의 모든 기록을 보존하는 것보다 현재 요청에 권위 있는 상태와 폐기된 흔적을 구분하는 정책이 도구 에이전트의 신뢰성에 더 중요합니다.

출처: When History Lies — arXiv


FinEvo-Bench, 금융 에이전트가 이전 업무에서 실제로 배우는지 측정

FinEvo-Bench는 독립된 단발 과제가 아니라 금융 업무를 연속으로 수행하면서 앞선 경험이 뒤의 품질과 규정 준수를 개선하는지 평가합니다. 6개 금융 도메인의 기관 제공 절차와 실제 사례를 바탕으로, 같은 절차를 공유하지만 내용은 다른 작업을 순차 배치했습니다.

  • 120개 업무: 20개 비즈니스 장면마다 서로 다른 6개 사례를 구성했습니다.
  • 진화 효과 분리: 같은 에이전트의 경험 유지 조건과 비진화 대조군을 짝지어 비교했습니다.
  • 피드백의 질: 4개 스캐폴드 모두 정답 예시보다 평가 기준 기반 피드백에서 점수가 높고 규정 위반이 적었습니다.
📢 전문 업무 에이전트의 학습은 기억을 저장했다는 기능 설명이 아니라, 뒤이은 다른 사례에서 품질이 오르고 규정 위반이 줄었다는 종단 증거로 평가해야 합니다.

출처: FinEvo-Bench — arXiv


긴 재무 문서 검색, 임베딩 Top-K보다 재생 가능한 탐색 경로가 앞섰습니다

READ 연구는 표가 대부분인 780쪽 정부 재무 보고서에서 문서를 잘라 임베딩한 뒤 가까운 청크를 꺼내는 방식의 구조적 한계를 측정했습니다. 숫자의 단위나 회계연도가 다른 줄에 있을 때 청크 경계가 의미를 끊는 문제를 피하기 위해, 에이전트가 원문을 어휘 검색·구조 탐색·범위 읽기라는 3가지 결정론적 연산으로 살피게 했습니다.

  • 숫자와 단위 분리: 수치가 단위를 나타내는 머리글에서 중앙값 13줄 떨어져 있었습니다.
  • 58.8% 정답률: 51개 검증 질문에서 READ는 밀집 검색의 15.7%보다 높았습니다.
  • 과장하지 않은 결론: BM25와는 통계적으로 구분되지 않아 ‘에이전트가 항상 우월하다’는 주장까지 확장하지 않았습니다.
📢 감사·규제 문서의 검색은 유사도 점수보다 어떤 구조를 따라 어느 범위를 읽었는지 다시 실행할 수 있어야 숫자의 단위와 시점을 검증할 수 있습니다.

출처: Beyond Top-K — arXiv


690개 스킬 검색, 지식 그래프가 강한 하이브리드 검색을 넘지 못했습니다

대규모 스킬 라이브러리에서 에이전트가 필요한 스킬과 실행 순서를 고르는 방법을 비교한 연구입니다. 어휘·임베딩 하이브리드 검색과 선행 조건·데이터 흐름·순서를 표현한 지식 그래프를 690개 스킬과 실제형 질의로 평가했습니다.

  • Top-5 73.5%: 하이브리드 검색은 117개 질의에서 정답 스킬을 상위 5개 안에 찾았습니다.
  • 그래프는 11.2%p 하락: 같은 토큰 예산에서 그래프 이웃을 섞으면 성능이 유의하게 낮아졌습니다.
  • 후보군의 상한: 그래프 간선의 98.6%는 기존 검색기가 이미 함께 노출한 스킬 사이를 연결했습니다.
📢 에이전트용 지식 그래프는 관계를 설명할 수 있지만, 같은 검색 후보에서 만든 그래프라면 찾지 못한 스킬까지 새로 발견하는 범위를 넓히지는 못합니다.

출처: Comparative Approaches to Agent Retrieval over Large Skill Libraries — arXiv


이미지 도구를 호출해도 반환된 화면을 실제로 보지 않을 수 있습니다

멀티모달 모델이 자르기·확대 같은 시각 도구를 쓸 때 반환된 이미지 증거가 답변에 인과적으로 영향을 주는지 감사한 연구입니다. 도구 사용과 직접 답변을 비교하고, 전체 관찰을 훼손하거나 한 단계의 관찰만 바꾸는 개입으로 실제 증거 기여도를 분리했습니다.

  • 6개 모델·5개 벤치마크: 세밀한 시각 인식 과제에서 도구 정책을 비교했습니다.
  • 호출하지만 보지 않음: 반환된 관찰을 바꿔도 답이 달라지지 않는 실행이 발견됐습니다.
  • 보지만 계획하지 않음: 관찰은 유용해도 도구 호출 순서가 일관되지 않은 실패도 분리했습니다.
📢 멀티모달 에이전트의 도구 사용은 호출 로그만으로 입증할 수 없으며, 반환된 시각 증거를 바꿨을 때 판단도 달라지는지 확인해야 합니다.

출처: The Illusion of Visual Tool-Use — arXiv


비디오 언어 모델, 단순한 사건 횟수도 빈도가 높아지면 놓칩니다

비디오 언어 모델의 시간 추론을 벽 충돌, 깜박임, 상태 전환이라는 통제된 3개 과제로 분해한 연구입니다. 사건 수와 빈도만 바꾼 2,190개 영상에 실행 가능한 정답 타임스탬프를 붙여 최종 숫자뿐 아니라 실제 사건을 언제 포착했는지 비교했습니다.

  • 표현 방식의 영향: 지속되는 상태 전환은 셌지만 순간적인 깜박임에는 안정적인 양수 정답 구간이 없었습니다.
  • 고빈도 구간 붕괴: 사건 수와 빈도가 모두 높은 조건에서 최종 횟수 정답률은 0.2%였습니다.
  • 프레임 증가는 불충분: 샘플링을 늘려 점수는 올랐지만 정답 사건 순서와 일치한 비율은 3.7%에 그쳤습니다.
📢 비디오 이해 점수는 최종 횟수가 우연히 맞았는지와 실제 사건 타임라인을 회수했는지를 분리해야 시간 추론의 실패 지점을 보여줍니다.

출처: The Low Frequency Trap — arXiv


AppDeltaWorld, 모바일 화면의 다음 상태를 실행 가능한 코드로 예측

AppDeltaWorld는 모바일 GUI 에이전트가 행동한 뒤 나타날 화면을 이미지나 설명으로 자유 생성하는 대신, 현재 화면에서 도달 가능한 HTML 코드 변경으로 예측하는 월드 모델입니다. 민감한 앱과 개인정보 작업에서 실제 궤적을 대량 수집하기 어려운 문제를 시뮬레이션으로 보완합니다.

  • 전이 조건 검색: 현재 화면과 행동에 맞는 앱별 HTML 구조를 찾아 다음 화면 코드 생성에 사용합니다.
  • 브라우저 렌더링: 생성한 시각 자산을 코드의 이미지 슬롯에 넣고 실행 가능한 화면으로 만듭니다.
  • 정책 학습 활용: 필터링한 폐루프 데이터를 공개 감독 데이터와 결합해 AndroidLens 등 3개 벤치마크에서 성능을 높였습니다.
📢 GUI 월드 모델은 그럴듯한 스크린샷보다 사용자의 행동으로 실제 도달 가능한 상태를 실행 코드로 만들어야 에이전트 훈련과 검증에 쓸 수 있습니다.

출처: AppDeltaWorld — arXiv


오늘의 도구 추천

Paseo — Claude Code, Codex, Copilot, OpenCode, Pi를 하나의 데스크톱·모바일·웹·CLI 인터페이스에서 실행하는 AGPL-3.0 오픈소스 오케스트레이터입니다. 에이전트는 사용자의 머신과 개발 환경에서 실행되고, 작업 상태를 다른 기기에서 확인하거나 후속 지시를 보낼 수 있습니다. 오늘 연구들이 강조한 하니스와 실행 경로를 실제 작업 단위로 관찰하기 좋은 도구입니다.


에디터 노트

오늘 연구들은 “더 좋은 모델을 연결하면 에이전트도 자동으로 좋아진다”는 기대에 제동을 겁니다. 오래된 기록은 현재 상태를 오염시키고, 검증되지 않은 스킬은 후속 스킬까지 망가뜨리며, 이미지 도구는 호출됐어도 답변에 아무 영향을 주지 않을 수 있습니다. 반대로 하니스 최적화와 오류 생애주기 추적, 사전 스킬 게이트처럼 모델 바깥을 다루는 방법은 점점 구체적인 평가 대상으로 자리 잡고 있습니다.

좋은 에이전트 시스템은 무엇을 많이 기억하고 호출했는지가 아니라, 현재 상태에 유효한 정보만 선택하고 각 도구의 결과가 최종 판단에 어떻게 기여했는지 다시 설명할 수 있는 시스템입니다. 다음 경쟁은 모델 점수표보다 실행 기록과 복구 가능성, 경험을 받아들이는 게이트의 품질에서 벌어질 것입니다.

다음에 또 찾아옵니다. — 에이브랜치