AI의 점수와 실제 성공은 다릅니다 — 증거·물리·환경으로 다시 검증하기
AI 에이전트와 월드 모델의 성능을 실제 증거, 물리 법칙, 환경 반응으로 검증하는 방법을 살핍니다.
오늘의 핵심
오늘의 흐름은 AI 시스템의 내부 점수와 현실에서의 성공을 분리해 검증하려는 움직임입니다. 에이전트는 검색했지만 근거를 쓰지 않을 수 있고, 실험 점수를 높였지만 물리 성능은 그대로일 수 있으며, 영상 월드 모델은 그럴듯한 궤적을 만들면서도 가속도와 운동량을 틀릴 수 있습니다. 이제 중요한 질문은 “점수가 올랐는가”보다 “어떤 증거와 환경 반응이 실제 판단을 바꿨는가”입니다.
검색 에이전트, 자료를 찾고도 자기 생각만 확인할 수 있습니다
Contextual Information Policy Optimization(CIPO)은 검색 에이전트가 관련 문서를 가져오는 데서 그치지 않고, 검색 결과가 이후 추론을 실제로 수정했는지 학습하도록 설계한 강화학습 방법입니다. 기존 보상은 최종 정답이나 중간 진행에 집중해, 모델이 내부 지식으로 먼저 결론을 정한 뒤 검색을 확인 절차로만 쓰는 문제를 놓쳤습니다.
- 턴 단위 근거 보상: 검색된 정보의 영향을 받은 추론 행동에 조밀한 크레딧을 줍니다.
- 정답 보상 유지: 외부 근거 사용 신호와 최종 결과 보상을 함께 최적화합니다.
- 추가 보상 모델 불필요: 사람의 과정 주석이나 별도 리워드 모델 없이 7개 벤치마크에서 평가했습니다.
출처: Contextual Information Policy Optimization for Search Agents — arXiv
HERALD, 높은 검색 보상 속 ‘인용 세탁’을 찾아냅니다
HERALD는 검색 에이전트의 보상이 답변 품질, 인용 근거, 도구 비용, 해킹 방지 항목을 섞으면서 생기는 허점을 오프라인에서 감사합니다. 높은 총점이 실제 검색 증거 사용을 보장하지 않는 상황에서, 같은 질문에 검색 삭제·가짜 문서 ID·인용 세탁 같은 개입을 적용해 보상 계약의 약한 지점을 분리합니다.
- 라벨 없는 공격 성공: 기본 보상은 검색 삭제와 가짜 ID를 막았지만, 검색하지 않은 문서를 인용하는 세탁 공격은 통과했습니다.
- 최소 수정 탐색: 3개 방어 항목의 8가지 조합을 비교해 관찰된 공격을 막는 최소 보강점을 찾았습니다.
- 성능과 견고성 분리: HotpotQA·2Wiki에서는 정답률 비열등성 기준을 통과했지만 MuSiQue에서는 통과하지 못했습니다.
출처: HERALD: Counterfactual Audits and Minimal Repairs for Proof-of-Retrieval Rewards — arXiv
OPERA, 실험 점수 상승과 물리적 개선을 분리합니다
OPERA는 언어 모델 에이전트가 광학 실험을 자동화할 때 실행 가능한 조작을 광학 연산자로 표현하고, 결과가 물리 조건에서 얼마나 벗어났는지를 잔차로 돌려주는 프레임워크입니다. 에이전트가 보는 점수와 별개로 숨겨 둔 기준에서 실제 물리 성능을 평가했습니다.
- 점수만 오른 실패: 점수 전용 피드백에서는 결정의 23.6~39.0 %가 점수 상승에도 물리 성능을 개선하지 못했습니다.
- 잔차 피드백의 차이: 연산자·잔차 피드백에서는 같은 실패가 0.9~1.9 %로 줄었습니다.
- 실험 장비 이전: 디지털 트윈에서 고른 프로토콜을 3개 실제 광학 장비로 옮겨 반복 검증했습니다.
출처: OPERA: Operator-residual feedback for reliable autonomous optical experiments with language-model agents — arXiv
GAUGE, 그럴듯한 영상과 맞는 물리를 구분합니다
GAUGE는 수치 시뮬레이터와 생성형 비디오 월드 모델이 현실의 물리를 얼마나 충실하게 재현하는지 같은 기준으로 진단하는 벤치마크입니다. 강체, 케이블, 섬유, 변형체를 아우르는 22개 통제 과제에 실제 궤적과 보정된 물리 메타데이터를 붙였습니다.
- 엔진마다 다른 실패: Isaac Sim, Genesis, Newton 가운데 모든 과제에서 일관되게 가장 충실한 엔진은 없었습니다.
- 취약한 물리 구간: 충격 접촉, 빠른 섬유 운동, 부피 변형에서 가장 큰 차이가 나타났습니다.
- 형태는 맞고 값은 틀림: 비디오 모델은 예상 방정식 형태의 궤적을 만들면서도 가속도·운동량 전달·진동 시점을 잘못 복원했습니다.
출처: GAUGE: A Measurement-Grounded Benchmark for Physical Fidelity in Simulation Engines and Video World Models — arXiv
EnvACE, 외부 환경 대신 모델 안에서 결과를 예행연습합니다
EnvACE는 장기 도구 사용 에이전트를 훈련할 때 비싼 실행 환경이나 별도 시뮬레이터 대신 ‘월드 리허설’을 사용합니다. 정책이 도구 호출을 만든 뒤 스스로 환경 역할을 맡아 예상 응답을 생성하고, 그 응답을 바탕으로 다음 행동을 선택하도록 두 역할을 함께 최적화합니다.
- 환경 관계 내재화: 행동과 환경 응답의 관계를 모델 파라미터 안에 학습합니다.
- 4개 평가군: BFCL-v4, tau²-Bench, VitaBench, FinMCP-Bench에서 환경 확장 기준선보다 높은 종합 성능을 보고했습니다.
- 실행 전 비공개 리허설: 테스트 때 실제 외부 호출을 늘리지 않고도 후보 행동의 결과를 먼저 예행연습할 수 있습니다.
출처: EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning — arXiv, EnvACE 코드 — GitHub
AgentOPSD, 긴 작업의 결정적 순간에 크레딧을 다시 배분합니다
AgentOPSD는 여러 턴에 걸친 에이전트 작업에서 최종 성공을 만든 몇 번의 중요한 결정을 찾아 학습 신호를 배분합니다. 교사와 학생 모델의 토큰 확률 차이를 턴 단위 증거로 모으고, 연속 상태 사이의 믿음 변화를 재귀적으로 갱신합니다.
- 별도 비평기 없음: 추가 크리틱이나 새 롤아웃 없이 기존 정책 최적화에 결합합니다.
- 결정적 턴 추적: 연속 턴 사이의 한계 믿음 변화로 결과를 바꾼 지점을 찾습니다.
- 89.1 % 성공률: Qwen2.5-7B 기반 ALFWorld 평가에서 89.1 %를 기록했습니다.
출처: AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning — arXiv
DASH, 추론 과정의 불일치가 커지는 흐름을 반영합니다
DASH는 추론 모델의 온폴리시 자기증류에서 교사와 학생의 차이를 각 토큰의 단일 값으로만 보지 않고, 생성 과정에서 불일치가 어떻게 변해 왔는지를 반영합니다. 지역 증류 신호와 시퀀스 평균의 차이로 전파 게이트를 만들고, 이전 단계까지 학습 가중치를 적응적으로 모읍니다.
- 시간 구조 반영: 같은 크기의 오차라도 앞선 불일치 이력에 따라 다른 감독 가중치를 줍니다.
- 9개 조건 모두 개선: 3개 수학 추론 벤치마크와 3개 모델 규모의 모든 조합에서 기본 OPSD 재실행보다 높았습니다.
- 추가 순전파 없음: OPSD가 이미 계산한 교사·학생 분포를 재사용합니다.
출처: DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models — arXiv, DASH-OPSD 코드 — GitHub
PaDoc, 문서 한 페이지를 영역별로 병렬 해독합니다
PaDoc은 문서 파서가 한 페이지의 레이아웃과 모든 영역 내용을 하나의 긴 순서로 생성하는 병목을 줄입니다. 전체 페이지 표현을 공유한 채 예측된 레이아웃을 분기 구조로 사용하고, 서로 독립적인 텍스트·수식 영역을 병렬로 해독합니다.
- 문맥 공유: 영역별 크롭을 반복 입력하지 않고 전체 페이지의 공통 프리픽스 캐시를 재사용합니다.
- OmniDocBench 94.24: 엔드투엔드 파서 중 상위권 종합 점수와 Text Edit 0.038을 기록했습니다.
- 처리량 67.4~118 % 증가: A800 한 장의 384페이지 평가에서 같은 백본 순차 기준선보다 유효 페이지 처리량이 높았습니다.
출처: PaDoc: Layout-Grounded Parallel Decoding for Document Parsing — arXiv, PaDoc 코드 — GitHub
멀티모달 CEO, 시각 정보가 많을수록 자원 배분은 나빠졌습니다
C-SUITEBENCH는 9개 프런티어 모델을 CEO 역할에 놓고 50개 비즈니스 시나리오를 텍스트 전용과 멀티모달 조건으로 비교했습니다. 시각 자료는 위험 예측과 이사회 설명의 근거를 개선했지만, 제한된 자원을 배분하는 과제에서는 모든 모델의 성능을 떨어뜨렸습니다.
- 5개 의사결정 과제: 50개 시나리오에서 텍스트와 시각 증거 조건을 짝지어 평가했습니다.
- 지각과 행동의 분리: 시각 근거를 더 잘 읽어도 제약을 지키는 행동으로 이어지지는 않았습니다.
- 신호 과밀: 각 시각 채널은 따로 도움이 됐지만 함께 제시하면 디코딩 중 제약 만족을 방해했습니다.
출처: Seeing Is Not Deciding: Can Multimodal LLMs Act as Effective CEOs? — arXiv
개인화 딥리서치, 질문을 줄이면서 조사 명세를 구체화합니다
G-STEER는 딥리서치 에이전트가 검색을 시작하기 전에 사용자의 목표, 제약, 선호, 평가 기준을 조사 명세로 정리합니다. 관련 프레이밍 요소와 근거의 충분성을 그래프로 연결하고, 기억을 찾을지 사용자에게 물을지 바로 질의를 다듬을지를 선택합니다.
- 의도 도출 그래프: 프레이밍 요소 사이의 의존성을 명시해 질문 순서를 학습합니다.
- 에이전트 본체는 그대로: 정제된 명세를 기존 딥리서치 에이전트에 입력하는 전처리 방식입니다.
- 질문 약 3분의 1: 강한 명확화 기준선보다 사용자 질문을 약 3분의 1만 하면서 더 높은 개인화 결과를 냈습니다.
출처: Personalized Deep Research Query Refinement with Graph-Scaffolded Evidence Grounding — arXiv
오늘의 도구 추천
GoShot — 코드와 터미널 출력을 이미지로 만드는 Go 기반 CLI·라이브러리입니다. Chroma 문법 강조, 줄 번호·강조, 창 프레임과 배경 설정을 지원하며 로컬에서 재현 가능한 코드 스크린샷을 만들 수 있습니다. 오늘처럼 평가 결과와 실행 증거를 공유할 때 핵심 구간을 일관된 형식으로 남기기 좋습니다.
에디터 노트
AI 평가에서 가장 위험한 순간은 점수가 낮을 때가 아니라, 점수가 높아서 더 이상 의심하지 않을 때입니다. 검색 보상은 인용 세탁을 숨길 수 있고, 실험 점수는 물리적 실패와 함께 오를 수 있으며, 영상은 그럴듯해도 운동량을 틀릴 수 있습니다. 반대로 현실의 모든 복잡성을 하나의 지표에 넣으려 하면 서로 상쇄되는 항목 때문에 취약점이 더 보이지 않게 됩니다.
앞으로의 평가 체계는 최종 점수 하나가 아니라, 근거가 판단을 바꿨는지, 환경 반응이 맞았는지, 제약과 물리 법칙을 지켰는지를 각각 개입 가능한 검사로 분리해야 합니다. 좋은 AI 시스템은 높은 숫자를 만드는 시스템이 아니라, 그 숫자가 현실의 성공과 연결됐음을 다시 실험할 수 있는 시스템입니다.
다음에 또 찾아옵니다. — 에이브랜치