No. 122

AI 평가는 모델 밖으로 확장됩니다 — 기억과 추론, 도구 실행의 검증

지속 메모리와 추론 비용, 도구 실행을 포함한 AI 시스템 전체의 검증 기준을 짚습니다.

오늘의 핵심

오늘의 흐름은 AI의 평가 단위가 모델 한 번의 답변에서 기억·추론 예산·도구·실행 기록을 포함한 시스템 전체로 넓어지고 있다는 것입니다. 장기 에이전트는 경험을 저장한 사실보다 다음 작업에서 올바르게 갱신했는지를 확인해야 하고, 추론 모델은 같은 ‘더 생각하기’라도 어떤 탐색 구조와 검증 절차를 썼는지 밝혀야 합니다. 라이브 예측과 영상 조사, 의료 측정 연구도 정답률 하나보다 정보 누출과 도구 사용 경로를 분리해 보기 시작했습니다.


PAST-Bench, 에이전트의 기억이 다음 작업을 개선하는지 분리 측정

PAST-Bench 연구진이 개인형 에이전트가 이전 경험을 보존했을 때 실제로 다음 작업을 더 잘 수행하는지 측정하는 벤치마크를 공개했습니다. 같은 조건에서 경험 유지 기능을 켜고 끈 채 새로운 세션의 연속 작업을 수행해 기억 자체와 성능 향상을 구분합니다.

  • 204개 에피소드: 메모리와 절차 재사용, 정보 수집, 상태 갱신에 걸친 26개 시나리오를 평가합니다.
  • 경로까지 검증: 점수가 올랐는지뿐 아니라 저장·검색·갱신이라는 의도한 경로를 거쳐 개선됐는지 확인합니다.
  • 불균일한 효과: 7개 기반 모델과 4개 에이전트 프레임워크 모두 경험의 이점은 있었지만 역량별 편차가 컸습니다.
📢 지속 메모리의 품질은 기록을 많이 남기는지가 아니라 오래된 상태를 바꾸고 필요한 경험만 다음 실행에 연결했다는 증거로 평가해야 합니다.

출처: PAST-Bench — arXiv


추론 모델의 ‘더 생각하기’, 하나의 예산으로 비교할 수 없습니다

테스트 타임 스케일링 연구진이 추론 시간에 계산량을 늘리는 방법을 단일한 ‘예산’으로 묶으면 성능과 비용을 제대로 비교하기 어렵다고 지적했습니다. 한 경로를 길게 이어가는 방식과 여러 완성 답을 투표하는 방식, 미완성 경로를 탐색하는 방식은 통계 구조와 실패 형태가 서로 다릅니다.

  • 3가지 체계: 단일 경로 순차 확장, 완성 후보 집계, 중간 접두 경로 탐색으로 구분했습니다.
  • 시스템 단위 평가: 모델만이 아니라 후보 생성과 검증, 집계까지 포함한 전체 추론 시스템을 평가 대상으로 삼습니다.
  • 재현성 기준: 정확한 실행 재생과 확률 분포 수준의 재현을 나누고 각각 필요한 산출물을 제안했습니다.
📢 추론 성능표에 정확도와 토큰 수만 적으면 같은 비용으로 무엇을 탐색하고 어떻게 검증했는지 숨겨져 실제 서비스의 품질과 원가를 비교할 수 없습니다.

출처: Test-Time Scaling — arXiv


월드컵 라이브 예측, 프런티어 모델 평균은 우승 후보 선택과 비슷

WorldCup Arena 연구진이 2026 FIFA 월드컵 39일 동안 매 경기 시작 전에 6개 프런티어 모델의 예측을 고정해 정보 누출이 원천적으로 불가능한 평가를 진행했습니다. 104경기와 조별 우승팀 등을 포함해 총 4,494개 예측을 채점했습니다.

  • 실시간 설계: 질문 시점에 정답이 존재하지 않아 사후 데이터가 학습됐는지를 별도로 추정할 필요가 없습니다.
  • 평균 63.9%: 경기 결과 예측은 대체로 배당 시장의 우승 후보를 고르는 단순 전략과 비슷했습니다.
  • 합의의 한계: 모델끼리 의견이 같은 빈도는 정답률보다 높아 다수결이 성능을 개선하지 못했습니다.
📢 미래 예측형 AI는 과거 문제집 점수보다 질문 시점과 답변을 봉인한 라이브 평가에서 단순 기준선을 실제로 넘는지 확인해야 합니다.

출처: WorldCup Arena — arXiv


SocietyBench, 사실과 여론의 시간 흐름을 익명화해 예측 평가

SocietyBench는 실제 사건의 뉴스와 5개 플랫폼 게시물을 시간순으로 모은 뒤 인물과 조직명을 바꾸고 날짜를 일정하게 이동해, 모델이 기억한 사건명이 아니라 사회 변화의 구조를 읽는지 평가합니다. 확률 보정과 사건 발생 시점의 정확성을 별도 축으로 측정합니다.

  • 125개 예측 지점: 서로 다른 5개 사건을 중국어와 영어로 구성했습니다.
  • 최고 75점: 6개 프런티어 모델 가운데 최고 점수도 100점 만점에 75점에 머물렀습니다.
  • 에이전트 효과 부재: 같은 기반 모델을 쓴 3개 에이전트 프레임워크는 기반 모델을 넘지 못했습니다.
📢 사회적 사건을 예측하는 능력은 그럴듯한 확률과 정확한 시점을 분리해 봐야 하며, 검색 도구를 붙였다는 사실만으로 더 나은 전망이 보장되지 않습니다.

출처: SocietyBench — arXiv


Video-DeepResearch, 텍스트 검색 전에 영상 증거부터 보게 만듭니다

Video-DeepResearch 연구진이 긴 영상의 여러 장면을 확인하면서 공개 웹을 함께 조사하는 멀티모달 에이전트를 제안했습니다. 기존 모델이 시각 도구를 건너뛰고 텍스트 검색이나 내부 기억에 의존하는 문제를 줄이기 위해 인식과 웹 탐색 단계를 분리했습니다.

  • 단계적 도구 개방: 영상 프레임의 근거를 충분히 확인한 뒤 웹 검색을 사용할 수 있게 합니다.
  • 200개 복합 문제: 여러 장면과 외부 정보를 연결해야 하는 Video-DR-Bench를 함께 공개했습니다.
  • 35B-A3B 성능: 평균 정확도 64.0%로 비교 대상인 클로드 4.5 소넷의 59.0%보다 5.0%p 높았습니다.
📢 멀티모달 조사의 신뢰성은 모델의 영상 지원 여부가 아니라 실제로 어느 장면을 확인한 뒤 외부 정보와 연결했는지 실행 순서로 증명해야 합니다.

출처: Video-DeepResearch — arXiv


서로 다른 크기의 모델도 KV 캐시를 넘겨받을 수 있습니다

같은 모델 계열 안에서 작은 모델이 처리하던 대화를 큰 모델로 전환할 때, 문맥 프리필을 처음부터 다시 계산하지 않고 KV 캐시를 변환해 전달하는 방법이 제안됐습니다. 연구진은 소스와 대상 모델의 KV 표현 사이에 상당한 선형 구조가 있음을 확인했습니다.

  • 작은 보정 데이터: FineWeb‑Edu에서 가져온 1,024토큰 길이의 시퀀스 500개로 헤드별 릿지 매핑을 맞췄습니다.
  • 정확도 유지: 3개 모델 계열의 6개 조합 가운데 4개에서 원래 프리필 정확도의 73~98%를 유지했습니다.
  • 2.7~25배 가속: 전체 프리필을 다시 수행하는 것보다 빠르면서 여러 차례 대화 전환에서도 안정성을 보였습니다.
📢 비용에 따라 모델을 바꾸는 라우팅은 선택 알고리즘뿐 아니라 이미 계산한 문맥 상태를 얼마나 손실 없이 넘기는지가 지연 시간의 핵심이 됩니다.

출처: Cross-Model KV Cache — arXiv


ALiBi 어텐션, 수치 언더플로로 일부 헤드가 보지 못하는 구간 발생

긴 문맥에서 위치 정보를 더하는 ALiBi의 선형 바이어스가 부동소수점 정밀도 아래로 내려가면서 많은 어텐션 가중치를 0으로 만드는 실패가 보고됐습니다. 이 현상은 표준 벤치마크에는 작게 나타나지만 특정 토큰을 다시 찾는 능력을 크게 해칠 수 있습니다.

  • 부분적 시야 상실: 영향을 받은 어텐션 헤드는 먼 위치의 토큰을 사실상 보지 못합니다.
  • 표준 점수의 맹점: 일반 디코더 평가의 작은 변화가 패스키 검색의 큰 성능 저하를 가릴 수 있습니다.
  • 완화 방법: 4개 학습 전략 가운데 로그 스케일 거리가 가장 일관된 검색 개선을 보였습니다.
📢 긴 문맥을 지원한다는 사양은 최대 토큰 수가 아니라 실제 정밀도에서 먼 정보를 회수하는지까지 시험해야 의미가 있습니다.

출처: ALiBi Attention Failure — arXiv


LLM이 컴파일러가 놓친 최적화 단서를 제안하고 검증으로 걸러냅니다

SeGaBench 연구진이 C·C++ 코드 주변의 주석과 자료구조 규칙처럼 컴파일러 내부 표현에 없는 의미를 LLM이 찾아 최적화 산출물로 바꿀 수 있는지 평가했습니다. 모든 사례에 정답·의미 검증기와 재현 가능한 성능 측정 절차를 붙였습니다.

  • 120개 실행형 사례: 합성 문제 100개와 실제 소스 기반 문제 20개로 구성했습니다.
  • 94.8% 정확한 산출물: 가장 강한 모델은 독립 응답 기준 94.8%에서 계약을 지키는 결과를 만들었습니다.
  • 검증이 전제: 83.3%의 응답이 1.05배 이상 빨라졌지만 최적 성능과의 격차는 자주 남았습니다.
📢 LLM은 컴파일러를 대체하기보다 정적 분석이 보지 못한 의미를 제안하고 기존 검증기가 안전성과 속도를 판정하는 역할 분담에서 실용성이 커집니다.

출처: SeGaBench — arXiv


CARE-X, 흉부 엑스레이 판단에 결정론적 측정 도구 결합

CARE-X 연구진이 흉부 엑스레이 설명 생성과 병변 분류·위치 추정을 함께 학습하고, 크기와 비율이 필요한 진단에는 결정론적 측정 도구를 호출하는 비전 언어 모델을 제안했습니다. 자연스러운 보고서만 만드는 모델과 임상 판단에 필요한 구조화된 근거 사이의 간극을 줄이는 접근입니다.

  • 다중 목표 학습: 생성 모델에 분류와 공간 위치 추정 헤드를 함께 학습했습니다.
  • VQA 94.0%: ReXVQA에서 다음 비교 모델보다 6.0%p 높은 정확도를 보고했습니다.
  • 도구 호출 효과: 5개 측정 의존 질환에서 시각 인식만 사용한 기준보다 평균 F1이 43.6%p 높았습니다.
📢 고위험 AI의 신뢰성은 설명을 유창하게 만드는 것보다 측정 가능한 판단은 별도 도구로 수행하고 그 결과를 임상 기준과 연결하는 구조에서 나옵니다.

출처: CARE-X — arXiv


음악 생성은 모델 크기보다 토큰 표현이 품질을 좌우했습니다

Agogic 연구진이 데이터와 학습 예산, 디코딩을 고정하고 음악을 토큰으로 표현하는 7가지 방식만 바꿔 비교했습니다. Qwen 3.5 기반 모델을 0.8B에서 27B까지 34배 키우는 것보다 연주 시점을 세밀하게 표현하는 토큰으로 바꿀 때 분포 품질이 더 크게 개선됐습니다.

  • 10ms 연주 해상도: 음표별 세기와 여러 트랙의 질감을 담는 609개 기호의 PMT 표현을 공개했습니다.
  • 작은 모델의 역전: 0.8B PMT 모델이 27B 비트 그리드 모델보다 낮은 프레셰 음악 거리 값을 기록했습니다.
  • 데이터 공개: 25개 이상 체크포인트와 625만 개 캡션 음악 자료를 포함한 두 코퍼스를 제공합니다.
📢 생성 모델의 병목이 항상 파라미터 수에 있는 것은 아니며, 대상의 시간·구조를 어떤 토큰으로 보존하는지가 더 큰 품질 차이를 만들 수 있습니다.

출처: Agogic — arXiv


오늘의 도구 추천

string2string Studio — 문자열 정렬, 거리와 유사도, 검색, 생성 평가 지표를 브라우저에서 직접 비교하고, 점수뿐 아니라 편집 경로와 일치 구간 같은 근거를 함께 보여주는 오픈소스 도구입니다. 핵심 연산을 WebAssembly로 로컬 실행해 데이터를 업로드하지 않으며, 오늘 뉴스가 강조한 ‘점수 뒤의 계산 경로를 확인하는 평가’를 작은 입력으로 바로 실험하기 좋습니다.


에디터 노트

오늘 연구들은 서로 다른 영역을 다루지만 같은 질문으로 모입니다. 에이전트가 과거 경험을 기억했다고 말할 때 그 경험이 실제 갱신 경로를 거쳤는가, 추론 모델이 더 많은 계산을 썼을 때 무엇을 탐색했는가, 멀티모달 에이전트가 영상을 읽었다고 할 때 어느 장면을 근거로 삼았는가를 묻습니다.

이제 AI 시스템의 품질은 모델 이름 하나로 설명하기 어렵습니다. 좋은 시스템은 모델과 도구를 많이 연결한 시스템이 아니라, 기억·탐색·측정·검증의 각 단계가 어떤 결과를 만들었는지 다시 확인할 수 있는 시스템입니다. 앞으로의 경쟁력은 더 높은 단일 점수보다 운영 중 실패를 발견하고 같은 조건에서 재현할 수 있는 평가 구조에서 벌어질 것입니다.

다음에 또 찾아옵니다. — 에이브랜치