최종 점수 뒤의 실패를 봅니다 — 경로·증명·회귀로 다시 세운 에이전트 평가
명령 전달 경로의 손실부터 저장소 단위 증명, 장기 연구 에이전트와 반복 수정의 보안 회귀까지 살핍니다.
오늘의 핵심
오늘의 흐름은 에이전트의 최종 점수만으로는 실제 능력과 실패 원인을 설명할 수 없다는 것입니다. 같은 명령도 인터페이스의 직렬화와 재파싱을 거치며 무너지고, 코딩 에이전트는 함수가 아니라 저장소 전체의 구현과 증명을 함께 맞춰야 합니다. 긴 연구 작업과 월드 모델 역시 결과물 하나보다 중간 의사결정, 경험 재사용, 상태 지속성을 봐야 했습니다. 이제 평가는 모델이 무엇을 답했는지에서, 그 답이 어떤 경로로 실행되고 검증됐는지로 이동하고 있습니다.
같은 답도 명령 전달 경로가 바뀌면 성공률이 최대 73.2 %p 떨어집니다
QuoteBench는 코딩 에이전트가 만든 Bash 명령이 직렬화·래핑·재파싱되는 과정에서 어떻게 달라지는지 측정합니다. 실제 장애에서 추출한 14개 유형, 56개 단발 과제를 원시 실행 경로와 의도적으로 이스케이프가 빠진 추가 파서 경로에서 비교했습니다.
- 55.4~73.2 %p의 손실: 같은 모델 응답을 추가 파서에 통과시키자 8개 구성 모두에서 성공률이 크게 낮아졌습니다.
- 경계 공개 뒤에도 회복은 모델마다 다름: 문제를 알려주자 6개 구성은 30.4~60.7 %p를 회복했지만, 2개 구성은 회복하지 못했습니다.
- 같은 점수가 큰 손상과 보상을 숨김: GPT-5.6-sol은 겉으로 보이는 차이가 -3.6 %p였지만, 내부에는 -64.3 %p의 경로 손상과 +60.7 %p의 적응이 함께 있었습니다.
출처: QuoteBench—arXiv
저장소 전체의 코드와 증명을 함께 만드는 에이전트는 아직 63 %에 머뭅니다
Vero는 에이전트가 여러 모듈에 걸친 구현과 기계 검증 가능한 증명을 동시에 만들 수 있는지 평가하는 첫 저장소 단위 벤치마크입니다. 암호 프로토콜부터 분산 시스템까지 실제 저장소에서 가져온 43개 과제를 Lean 4 프로젝트로 구성했습니다.
- 함수보다 저장소의 일관성 평가: Python, Dafny, Verus와 Coq 프로젝트에서 가져온 다중 모듈 과제에 미리 정한 API와 수작업 명세를 제공합니다.
- 강한 에이전트도 27개만 완전 해결: 가장 좋은 구성도 43개 중 27개만 코드와 증명을 모두 완성했고, 가장 어려운 저장소에서는 어떤 명세도 닫지 못했습니다.
- 벤치마크 자체도 감사 가능: 주어진 명세가 만족 불가능하거나 참조 코드가 틀렸음을 에이전트가 형식적으로 증명해 데이터 오류를 고칠 수 있습니다.
출처: Vero—arXiv
장기 연구 에이전트는 과학자보다 공학 최적화기에 가깝습니다
Beyond Final Scores 연구는 7개 프런티어 모델을 36개 장기 AI 연구개발 과제에서 평가했습니다. 최종 점수만 비교하지 않고 문제 구도 설정, 실행, 피드백 제어와 과제 안팎의 경험 재사용을 분리해 추적했습니다.
- 같은 결과에도 병목은 다름: 비슷한 최종 점수를 낸 실행도 문제 설정, 실험 수행과 피드백 반영 중 실패 지점이 달랐습니다.
- 새 방법보다 기존 기법 조합에 강함: 실용적인 해법을 만들고 구현했지만, 최고 결과는 주로 알려진 방법의 수정과 조합에서 나왔고 방법론적 새로움은 드물었습니다.
- 경험은 자산이자 오염원: 이전 경험의 재사용이 다음 결정을 돕기도 했지만 잘못된 방향으로 이끌기도 했으며, 하네스 설계가 실행 안정성에 영향을 줬습니다.
출처: Beyond Final Scores—arXiv
AI 과학자는 원시 증거를 직접 볼 때 85 %의 비교에서 이깁니다
OmniScientist는 텍스트 요약만 받는 대신 이미지, 신호, 오디오, 비디오, 3D 구조와 궤적 같은 원시 증거를 직접 다루는 다학제 AI 과학자입니다. 지각 계층과 아이디어·실험·작성 에이전트를 결정적 파이프라인으로 연결했습니다.
- 36개 사례 모두 논문까지 완주: 5개 학문군과 4개 증거군에 걸친 실제 데이터에서 원시 자료부터 컴파일된 원고까지 전 과정을 완료했습니다.
- 주장과 수치를 코드로 검사: 새로움, 통계적 타당성, 실행 출처와 수치 추적성을 아이디어·엄밀성·주장 검사로 강제했습니다.
- 직접 지각이 모든 평가 축을 개선: 사전 계산된 스칼라 특성만 받은 변형과 비교해 7개 평가 차원 모두 좋아졌고, 일대일 판단의 85 %에서 선택됐습니다.
출처: OmniScientist—arXiv
메타 하네스가 40분 동안 스스로 포스터 제작법을 개선합니다
AutoDesign은 논문을 학술 포스터로 바꾸는 긴 디자인 작업에서 메타 하네스 최적화기가 코드 에이전트의 실행 결과를 보고 하네스를 반복 개선하는 프레임워크입니다. 사람의 디자인 선호와 실행 경험을 정적인 프롬프트가 아니라 재사용 가능한 구조에 축적합니다.
- 100개 논문에서 78.32점: 5개 학문 분야의 PosterBench에서 상용 시스템 Claude Design보다 7.45점 높았습니다.
- 7개 구성에서 일관된 전이: 학습한 DesignHarness를 결합하자 평균 점수가 54.99에서 67.39로 12.4 %p 상승했습니다.
- 비용이 드러나는 자율 루프: 40분 동안 253번의 도구 호출과 11번의 편집을 3달러 미만으로 수행해 사람 평가에서 평균 학회 포스터 품질에 도달했습니다.
출처: AutoDesign—arXiv
월드 모델은 긴 목표에서 공간과 상태를 아직 유지하지 못합니다
PlayWorld는 고정된 행동 시퀀스 대신 멀티모달 에이전트 플레이어가 목표를 향해 월드 모델과 상호작용하도록 합니다. 같은 목표라도 모델마다 필요한 행동이 달라진다는 점을 반영해 171개 시나리오를 구성했습니다.
- 사람처럼 목표를 수행하며 비교: 360도 회전 뒤 공간이 유지되는지, 물에 들어갔을 때 파문이 생기는지처럼 긴 상호작용 목표를 사용합니다.
- 4개 지속성 축: 기하 일관성, 상호작용 충실도, 시야 밖 변화와 인사이트 변화를 기본 영상 품질·제어 가능성과 함께 평가합니다.
- 9개 최신 모델 모두 장기 목표에 불안정: 특히 공간 일관성과 이전 상태가 이후 장면에 남는 지속적 상태 변화에서 약했습니다.
출처: PlayWorld—arXiv
초등 5학년까지로 지식을 제한한 5B 모델이 학습 경계를 드러냅니다
LittleLearner는 웹 전체를 학습한 모델에서 알기 어려운 사전 노출 문제를 줄이기 위해, 미국 초등학교 5학년 이후의 개념·사실·어휘를 제외한 880억 토큰 교육과정으로 처음부터 훈련한 50억 파라미터 모델입니다.
- 해석 가능한 지식 경계: 열린 답변 평가가 가능한 언어 능력을 유지하면서도 무엇을 배웠고 배우지 않았는지를 교육과정 지침에 대응시켰습니다.
- 통제된 학습 실험장 공개: LittleCurriculum과 LittleLearner를 함께 공개해 데이터 범위가 명확한 상태에서 지식 획득과 표현을 연구할 수 있게 했습니다.
- 후처리의 한계 확인: 사후 학습과 인컨텍스트 학습은 이미 가진 지식의 활용을 개선했지만 범위 밖 능력까지 높이지는 못했습니다.
출처: LittleLearner—arXiv
과학 에이전트는 397B 본체를 고치지 않고 기억 모듈로 전문화합니다
Intern-S2-Preview는 과학 문서, 이미지·텍스트와 여러 과학 코퍼스를 학습하고 도구 사용과 장기 작업까지 지원하는 과학 에이전트 기반 모델군입니다. 지도 미세조정, 다중 과제 강화학습, 에이전트 강화학습과 온폴리시 증류를 하나의 후처리 파이프라인으로 묶었습니다.
- 과학의 여러 데이터 형태를 통합: 렌더링된 논문과 멀티모달 자료에 더해 시계열의 긴 구간 이해와 수치 예측을 함께 다룹니다.
- 긴 실행의 안정성까지 학습 문제로 처리: 부분 롤아웃의 오프폴리시 교정, 적응형 길이 규제, 온라인 추측 디코딩과 실행 흔적 기반 경험 조립을 사용했습니다.
- 작은 기억 확장으로 전문화: 동결된 397B 본체를 바꾸지 않고 별도의 4B Memory Decoder를 붙여 Biology-Instructions 평균을 56.92에서 60.32로 높였습니다.
출처: Intern-S2-Preview—arXiv
모델은 모른다는 신호를 갖고도 구체적인 환각을 선택합니다
Toward a Gricean Retreat 연구는 모델이 모르는 대상에 대해 거짓 세부사항을 만드는 대신 더 일반적이지만 참인 답으로 물러날 수 있는지 조사했습니다. 대상의 친숙도와 답의 구체성을 달리한 벤치마크로 내부 표현과 실제 생성을 함께 분석했습니다.
- 지식 경계는 내부에 인코딩됨: 활성값에는 대상이 모델의 지식 안에 있는지 구분하는 신호가 있었습니다.
- 생성할 답의 구체성도 미리 드러남: 모델은 곧 만들 참조 대상이 얼마나 구체적인지도 내부적으로 예측했습니다.
- 두 신호를 행동으로 연결하지 못함: 모르는 대상에서도 올바른 일반 답을 제시받았는데 구체적인 대상을 압도적으로 선호했습니다.
출처: Toward a Gricean Retreat—arXiv
인프라 코드의 반복 수정은 고친 검사 대신 다른 보안을 깨뜨립니다
Does Fixing Break Security? 연구는 LLM이 Infrastructure-as-Code를 반복 수정할 때 이전에 통과한 CIS 보안 검사가 다시 실패하는지 조사했습니다. IaC-Eval의 5,968개 실행 시나리오와 최대 5번의 수정 이력을 분석했습니다.
- 엄격 기준에서도 3.3 %가 회귀: 측정 잡음을 포함한 표준 기준에서는 시나리오의 13.8 %, 배타적 실패만 세는 엄격 기준에서는 3.3 %가 보안 회귀를 겪었습니다.
- 구조 변경이 주된 원인: 표준 기준 회귀 원인의 79.0 %가 리소스 재구성이었고, 회귀가 생긴 수정은 코드 변경량이 2.6배 많았습니다.
- 무작정 반복하지 않을 근거: 회귀의 36.6 %는 평균 1.2회 뒤 스스로 고쳐졌지만, 전체적으로는 3번째 반복이 최적 중단 지점이었습니다.
출처: Does Fixing Break Security?—arXiv
오늘의 도구 추천
Vero — 실제 다중 모듈 저장소를 Lean 4로 옮겨 코딩 에이전트의 구현과 형식 증명을 함께 평가하는 오픈 벤치마크입니다. 테스트 몇 개를 통과하는 코드 생성에서 더 나아가 API 계약, 모듈 간 일관성과 명세 자체의 오류까지 감사하려는 팀이 저장소 단위 검증 하네스의 기준으로 살펴볼 만합니다.
에디터 노트
에이전트가 내놓은 마지막 숫자는 편리하지만, 그 숫자 하나로는 제품을 운영할 수 없습니다. 오늘 연구에서 같은 성공 점수는 명령 경로의 64.3 %p 손상과 모델의 보상을 함께 숨겼고, 반복 수정은 한 검사를 고치면서 이미 통과한 보안을 다시 깨뜨렸습니다. 연구 에이전트의 좋은 최종 결과도 그 안에서 경험이 다음 판단을 개선했는지까지 말해주지는 않았습니다.
그래서 평가의 단위는 점점 출력에서 궤적으로, 함수에서 저장소로, 장면에서 지속되는 세계로 넓어집니다. 실행 인터페이스를 끝까지 재현하고, 중간 상태를 기록하며, 코드와 명세를 함께 검증해야 실패를 모델 탓과 시스템 탓으로 나눌 수 있습니다. 더 강한 에이전트를 기다리는 것보다 먼저 할 일은, 현재 에이전트의 실패가 숨지 않는 경로를 만드는 것입니다.
다음에 또 찾아옵니다. — 에이브랜치