모델보다 실행 구조가 성능을 가릅니다 — 하네스·정책·평가의 재설계
강한 모델의 능력을 옮기는 하네스부터 기업 AI 사용, 도구 정책과 보안, 컨텍스트·추론 예산의 역효과까지 살핍니다.
오늘의 핵심
오늘의 흐름은 AI 성능의 단위가 모델에서 실행 구조로 이동하고 있다는 것입니다. 강한 모델이 만든 하네스는 약한 모델의 점수를 거의 두 배로 높였고, 실제 기업 사용은 직무와 연차 전반으로 퍼졌습니다. 그러나 API와 문서를 함께 다루는 에이전트는 추론 깊이와 정책 제약 앞에서 급격히 흔들렸고, 긴 컨텍스트와 넉넉한 토큰 예산도 항상 더 나은 결과를 보장하지 않았습니다. 이제 중요한 질문은 어떤 모델이 가장 강한가가 아니라, 어떤 하네스·데이터·정책·평가가 그 능력을 실제 결과로 바꾸는가입니다.
강한 모델이 만든 하네스, 약한 모델의 성능을 거의 두 배로 높입니다
AI4AI at Test-Time 연구는 강한 빌더 모델이 약한 타깃 모델을 위한 추론 하네스를 만들면 파라미터를 다시 학습하지 않고도 능력을 전달할 수 있는지 실험했습니다. 4개 마음이론 벤치마크에서 데이터의 5 %만으로 하네스를 다듬은 뒤 전체 테스트셋에 적용했습니다.
- 평균 0.49에서 0.91로 상승: 타깃 모델의 평균 성능이 거의 두 배가 됐고, 약한 모델일수록 이득이 컸습니다.
- 추론보다 구조가 만든 개선: 긴 사고나 다수 샘플링보다 불안정한 추론을 결정적 코드로 옮기고, 과제별 라우팅과 출력 형식을 강제한 것이 주된 개선 요인이었습니다.
- 재학습 없는 능력 이전: 강한 모델이 답을 대신 내는 것이 아니라 약한 모델이 안정적으로 일할 실행 구조를 설계했습니다.
출처: AI4AI at Test-Time—arXiv
기업 AI는 일부 전문가의 도구에서 조직 전반의 작업층으로 번집니다
How Organizations Use AI 연구는 ChatGPT Enterprise 계정 기록을 직무, 작업 분류와 기업 재무 데이터에 연결해 조직의 생성형 AI 도입을 분석했습니다. 6개월 도입 시점 표본만 1,500개 이상 조직과 1,700만 건 이상의 메시지를 포함합니다.
- 신규 도입과 사용 강도 동시 증가: 새 기업이 유입되는 동시에 기존 도입 기업 안에서도 사용량이 빠르게 늘었습니다.
- 직무와 연차 전반으로 확산: 글쓰기, 기술 작업, 커뮤니케이션과 정보 종합에 폭넓게 쓰였고 초기 경력 직원의 사용 강도가 특히 높았습니다.
- 조직별 통합 속도는 크게 다름: 규모가 크고 기업가치, 연구개발비와 판매관리비가 높은 미국 상장사에서 도입이 집중됐지만 활용 폭과 목적은 기업마다 달랐습니다.
출처: How Organizations Use AI—arXiv
API와 문서를 함께 쓰는 에이전트, 추론 깊이가 늘면 성능이 절반 넘게 떨어집니다
IBM 연구진의 VAKRA는 62개 도메인의 실행 가능한 API 8,000개 이상을 이용해 구조화된 API와 문서 검색을 넘나드는 에이전트를 평가합니다. 예측한 도구 호출을 실제 API에서 다시 실행해 여러 유효 경로를 허용하면서도 결과를 검증합니다.
- 단일 단계도 70.4 %가 최고: 가장 좋은 모델도 단일 엔드포인트형 과제에서 70.4 %에 그쳤고, 조합형 API에서는 50~51 %로 낮아졌습니다.
- 깊이에 따른 급락: 추론 단계가 늘수록 성능이 50 % 넘게 하락했습니다.
- 호출 문법보다 의미 연결이 병목: 실패는 도구 호출 자체보다 엔터티 구분, 여러 출처 사이의 근거 연결과 답할 수 없는 요청의 판단에 집중됐습니다.
출처: VAKRA—arXiv
악성 스킬은 결과를 망치지 않고도 비용과 시간을 증폭시킵니다
Convergent Detour Hijacking 연구는 제3자 에이전트 스킬의 설명과 본문을 함께 조작해, 정상 과제를 불필요하게 비싼 경로로 우회시키는 공격을 제시합니다. 공격은 최종 작업을 완료한 뒤 원래 경로로 복귀하므로 결과만 보면 이상을 찾기 어렵습니다.
- 선택과 계획의 두 지점 공격: 설명은 스킬 선택 단계에서 관련성을 가장하고, 본문은 계획 단계에서 그럴듯한 의존성을 꾸며냅니다.
- 정상 스킬까지 불필요하게 동원: 공격자 스킬이 조정자 역할을 맡아 해롭지 않은 다른 스킬들을 우회 작업에 끌어들입니다.
- 완료율을 유지한 채 자원 증폭: DeepSeek-V4-Pro 실험에서 공격 스킬이 선택된 완료 실행은 토큰 66.91 %, 실행 시간 92.45 %가 늘었습니다.
출처: Convergent Detour Hijacking—arXiv
긴 컨텍스트 학습은 모델 내부 지식을 약하게 만들 수 있습니다
Information Abundance Paradox 연구는 학습 때 관련 정보가 풍부한 긴 컨텍스트를 계속 제공하면 모델이 그 지식을 파라미터에 내재화할 유인이 줄어드는 현상을 분석했습니다. 컨텍스트가 많을수록 무조건 좋다는 가정을 정면으로 시험합니다.
- 중간 지점 이후 성능 하락: 긴 문서 사전학습에서 언어 모델링, 자연어 이해와 폐쇄형 질의응답 성능은 일정 길이까지 좋아지다가 다시 낮아졌습니다.
- 없는 정보에 더 취약: 미세조정 때 관련 컨텍스트를 늘리면 자료가 주어진 상황에서는 좋아졌지만, 테스트에서 컨텍스트가 없거나 잘못됐을 때 견고성이 떨어졌습니다.
- 학습 경로가 어텐션으로 이동: 풍부한 문맥은 파라미터 지식과 연관된 피드포워드 네트워크보다 어텐션 모듈에 더 큰 학습 압력을 만들었습니다.
출처: Information Abundance Paradox—arXiv
더 오래 생각하게 해도 모델 순위가 뒤집히고 정답률이 떨어질 수 있습니다
Who Thinks Best Depends on How Long You Let Them은 4개 모델을 3개 추론 벤치마크에서 64~4,096 토큰의 7개 생성 예산으로 평가했습니다. 총 5만 6,476회 추론 결과, 평가 예산이 모델 비교의 중립적인 조건이 아니라는 점을 보였습니다.
- 3~19 % 과제에서 역행: 잘림 효과를 통제한 뒤에도 토큰을 더 주자 정확도가 낮아지는 비단조 행동이 나타났습니다.
- 모든 벤치마크에서 순위 역전: 어떤 모델이 가장 좋은지는 허용한 생성 예산에 따라 달라졌습니다.
- 예산별 모델 상보성: 과제마다 알맞은 모델을 고르는 오라클은 최대 27.8 %p의 개선 여지를 보였지만, 예산 기반 라우터의 도메인 간 일반화는 제한적이었습니다.
출처: Who Thinks Best Depends on How Long You Let Them—arXiv
현지 의료 지식을 넣은 RAG가 최신 범용 모델과 대등해집니다
VITA 연구는 인도와 중저소득 국가의 진료 지침, 항생제 내성 데이터, 국가 처방집 제약과 자원 제한 치료 프로토콜을 검색하는 임상 RAG를 HealthBench에서 평가했습니다. 범용 모델의 세대보다 어떤 근거 코퍼스를 연결하는지가 성능을 바꿀 수 있음을 보여줍니다.
- 전체 평가에서 51.9 %: 4,023개 영어 질문에서 VITA는 가능한 루브릭 점수의 51.9 %를 얻어 비교한 범용 모델보다 높았습니다.
- 최신 모델 재평가에서는 동률: 500개 하위셋을 중립적인 오픈웨이트 심판으로 다시 채점하자 VITA와 GPT-5.5의 질문당 평균 점수 차이는 통계적으로 유의하지 않았습니다.
- 정확성과 완전성의 대가: 근거 특화 시스템은 정확성과 완전성에서 강했지만 커뮤니케이션 점수는 낮았습니다.
출처: A corpus-specific clinical RAG system matches or outperforms newer frontier LLMs on HealthBench—arXiv
ToolHazard, 도구 환경 자체에서 간접 프롬프트 공격을 생성합니다
ToolHazard는 외부 도구를 쓰는 에이전트의 간접 프롬프트 인젝션을 대규모로 평가하기 위해 상태를 가진 실행 환경, 공격 지점과 페이로드, 장기 작업을 함께 합성하는 프레임워크입니다. 수작업 환경과 미리 정한 공격 위치에 의존하던 기존 평가 범위를 넓혔습니다.
- 3개 시뮬레이터의 협업: 환경 시뮬레이터, 공격자 에이전트와 사용자 시뮬레이터가 실행 가능한 상태와 공격을 구성합니다.
- 시점과 위치가 공격력을 바꿈: 같은 유형의 인젝션도 워크플로 어느 상태에 들어가는지에 따라 성공 가능성이 달라졌습니다.
- 정렬 데이터로 재사용: 생성한 공격 데이터를 학습에 사용하자 정상 과제 효용을 유지하면서 ToolHazard-Bench와 AgentDojo 양쪽의 보안이 개선됐습니다.
출처: ToolHazard—arXiv
LLM 심판의 루브릭을 실행 가능한 평가 그래프로 바꿉니다
Graph-Structured Rubrics는 자연어 루브릭을 응답을 보기 전에 타입이 있는 평가 그래프로 컴파일합니다. 개별 기준을 판단하는 노드와 변환·집계·게이트 연산자를 명시적으로 연결하고, 유효하지 않은 그래프는 평가 전에 거부합니다.
- 기준 조합을 코드처럼 명시: 평면적인 체크리스트에 암묵적으로 남던 가중, 조건과 중단 규칙을 그래프 구조로 드러냅니다.
- 응답 독립적 컴파일: 평가할 답을 보기 전에 그래프를 만들기 때문에 특정 출력에 맞춰 루브릭 해석이 흔들리는 일을 줄입니다.
- 점수 일치도 개선: GPT-OSS-120B를 사용한 4개 점별 평가 데이터셋에서 정확한 점수 일치도가 0.62~6.75 %p 높아졌습니다.
출처: Graph-Structured Rubrics—arXiv
GPU 커널 생성도 장난감 번역이 아니라 실제 PR로 평가합니다
RealisticTritonBench는 인기 AI 프레임워크에서 Triton 커널을 수정한 실제 풀 리퀘스트를 추출해 자연어 요구사항과 재현 가능한 평가 환경을 갖춘 생성 과제로 바꿉니다. 개별 커널의 속도만 재는 대신 원래 프레임워크에 다시 통합해 엔드투엔드 테스트를 수행합니다.
- 실제 엔지니어링 맥락 보존: 단순 PyTorch-to-Triton 번역을 넘어 유지보수 요구와 주변 코드를 포함합니다.
- 프레임워크 전체에서 검증: 생성한 커널을 원래 프로젝트에 넣어 정확성과 최종 성능을 확인합니다.
- 평가 우회 차단: 모델이 허술한 수작업 검사 코드를 악용해 부풀린 점수를 얻는 문제를 줄이도록 완전한 테스트 환경을 제공합니다.
출처: RealisticTritonBench—arXiv
오늘의 도구 추천
VAKRA — IBM 연구진이 공개한 API·검색 결합형 에이전트 벤치마크입니다. 62개 도메인의 8,000개 이상 실행 가능한 API와 정책 제약 과제를 이용해 단일 호출, 여러 단계 API 추론, 문서 근거 결합을 나눠 시험할 수 있습니다. 에이전트가 도구를 호출했다는 사실이 아니라 실제 API 실행 결과와 정책 준수까지 검증하려는 팀이 평가셋과 실패 분류의 출발점으로 살펴볼 만합니다.
에디터 노트
모델을 고르는 일은 점점 쉬워지고, 모델이 일할 세계를 설계하는 일은 더 어려워집니다. 같은 약한 모델도 하네스가 바뀌면 성능이 거의 두 배가 되지만, 같은 강한 모델도 API 단계가 깊어지고 문서와 정책이 얽히면 급격히 흔들립니다. 컨텍스트와 추론 토큰을 더 주는 단순한 처방조차 내부 지식을 약하게 하거나 순위를 뒤집을 수 있습니다.
오늘의 연구들이 가리키는 운영 원칙은 분명합니다. 모델, 하네스, 근거 코퍼스, 권한 정책과 평가 그래프를 하나의 제품으로 다뤄야 합니다. 정답만 맞았는지 보지 말고 어떤 경로와 비용으로 도달했는지 기록하고, 실제 API·저장소·지역 지침 위에서 결과를 다시 실행해야 합니다. 이제 AI 시스템의 품질은 가장 강한 모델의 이름보다 그 모델이 실패해도 드러나고 고쳐질 수 있는 구조에서 만들어집니다.
다음에 또 찾아옵니다. — 에이브랜치