No. 126

AI 성능은 정상 경로 밖에서 드러납니다 — Solar Pro 4와 실전형 평가의 전환

Solar Pro 4와 최신 연구를 통해 실제 업무, 물리 제약, 비정상 경로, 에이전트 안전에서 AI를 검증하는 흐름을 살핍니다.

오늘의 핵심

오늘의 흐름은 AI의 성능을 잘 정리된 문제의 정답률이 아니라, 실제 업무와 예외 상황에서 끝까지 유지되는 신뢰성으로 다시 정의하는 움직임입니다. 문서와 도구를 오가며 산출물을 만드는 모델부터 물리 법칙을 지키는 신경망, 익숙한 단어를 쓰지 못할 때도 무너지지 않는 언어 모델, 실패 궤적에서 안전 규칙을 고치는 에이전트까지 평가의 무대가 넓어졌습니다. 정상 경로의 높은 점수보다 중요한 것은 조건이 바뀌어도 근거, 제약, 권한과 결과의 연결이 끊어지지 않는가입니다.


Solar Pro 4, 답변이 아니라 실제 업무의 완결성을 겨냥합니다

업스테이지가 문서 읽기, 도구 실행, 코드 작업과 파일 생성을 이어가는 에이전트향 모델 Solar Pro 4를 공개했습니다. 긴 입력을 한 번에 다루고 추론 강도를 조절하면서 Excel 분석, Word 보고서, PowerPoint 발표자료처럼 서로 연결된 산출물을 끝까지 만드는 데 초점을 맞췄습니다.

  • 512K 컨텍스트와 최대 128K 출력: 영어, 한국어, 일본어 입력·출력을 지원하며 여러 문서와 데이터 파일을 한 세션에서 처리합니다.
  • 에이전트 평가 개선: Solar Pro 3 대비 Terminal-Bench v2.1은 12에서 57, 멀티턴 도구 사용 평가인 τ³-Banking은 9에서 23, 장문 추론 AA-LCR은 31에서 71로 올랐다고 업스테이지는 밝혔습니다.
  • 근거 부재를 구분: 문서에 있는 사실, 없는 정보, 서로 충돌하는 값을 각각 grounded, not-in-document, mismatch로 나눠 후속 산출물로 잘못된 값이 전파되는 것을 줄이도록 설계했습니다.
📢 실무형 에이전트의 기준은 한 번의 좋은 답이 아니라, 여러 파일과 도구를 거친 뒤에도 근거와 숫자가 바뀌지 않은 완성된 결과물을 남기는 능력입니다.

출처: Solar Pro 4⁠—⁠업스테이지


MMDiff, 멀티모달 학습이 바꾼 내부 특징을 찾아 제어합니다

MMDiff는 기본 언어 모델과 멀티모달 적응 모델의 희소 오토인코더를 비교해, 시각 학습이 어떤 내부 특징을 바꿨는지 분리합니다. 사후 설명에 머물던 특징 분석을 특정 행동의 원인을 찾고 직접 제거하거나 강화하는 제어 인터페이스로 확장했습니다.

  • 세 모델 계열 비교: LLaVA-MORE, PaliGemma 2, InternVL3.5에서 시공간 이해, OCR, 멀티모달 안전 행동을 분석했습니다.
  • 인과적 특징 제거: 발견한 특징을 제거했을 때 공간 과제는 평균 12 %, OCR은 17 % 성능이 선택적으로 낮아졌습니다.
  • 안전과 성능 제어: 멀티모달 공격 성공률은 24 % 낮추면서 VQA 성능은 유지했고, 특징 조향으로 공간 정확도와 OCR 정확도를 각각 평균 3.6 %p, 1.8 %p 높였습니다.
📢 멀티모달 모델 감사는 무엇을 표현하는지 설명하는 데서 끝나지 않고, 특정 능력과 위험을 만든 내부 특징을 분리해 실제 행동 변화로 검증해야 합니다.

출처: Multimodal Model Diffing for Feature Discovery and Control⁠—⁠arXiv


공공기관의 LLM 선택, 정확도 하나로는 결정할 수 없습니다

Grip on LLMs는 네덜란드 지방정부의 도메인 전문가, 공무원용 챗봇 사용자 조사와 자문 과정을 바탕으로 공공 행정에 필요한 모델 평가 기준을 만들었습니다. 영어 중심의 일반 벤치마크 대신 현지 언어와 공공 가치, 운영 비용을 한 화면에서 함께 비교합니다.

  • 6개 평가 축: 사실성, 정직성, 사회적 편향, 에너지 소비, 비용, 학습 데이터 투명성을 30개 이상의 다국어·네덜란드어 특화 모델에 적용했습니다.
  • 피할 수 없는 상충 관계: 품질이 높을수록 환경 영향과 비용이 커지는 경향이 나타났지만, 편향은 두 요소와 별개로 움직였습니다.
  • 사실성과 정직성 분리: 정답을 잘 맞히는 모델이 모르는 것을 잘 인정하는 것은 아니어서 두 능력을 독립적으로 봐야 했습니다.
📢 공공 부문의 모델 선정표에는 최고 점수 한 칸이 아니라, 틀릴 때의 태도와 비용·환경·투명성까지 조직의 가치로 번역한 다차원 기준이 필요합니다.

출처: From Values to Benchmarks: Evaluating Large Language Models for Governmental Use in Dutch⁠—⁠arXiv


GENCO, 빠른 예측보다 물리적으로 가능한 전력망 해를 만듭니다

GENCO는 전력 흐름, 최적 전력 흐름, 상태 추정을 하나의 신경망 구조와 공통 네트워크 표현으로 처리합니다. 단순히 기존 계산을 흉내 내는 대신 전압과 무효전력을 포함한 전체 교류 상태를 복원하고, 실제 전력망에서 요구되는 물리적 일관성을 함께 맞춥니다.

  • 통합 개발 환경: GridFM Development Framework가 합성 데이터 생성과 학습을 표준화하고, 다양한 전력망 구조의 수백만 개 시나리오를 공개합니다.
  • 전력 흐름 최대 30배 가속: Newton-Raphson보다 최대 30배 빠르면서 DC 전력 흐름과 비슷한 유효전력 균형 잔차를 기록했습니다.
  • 최적화 최대 85배 가속: IPOPT보다 최대 85배 빠른 최적 전력 흐름 결과를 보고했고, Hydro-Québec의 실제 SCADA 데이터에서도 상태 추정을 평가했습니다.
📢 산업 AI의 유용성은 기준 계산보다 빠른가만으로 정해지지 않으며, 속도를 얻은 뒤에도 도메인의 물리 법칙과 운영 가능성을 지키는지가 핵심입니다.

출처: GENCO — A Unified Neural Solver Embedded in a Development Framework for Steady-State Grid Analysis⁠—⁠arXiv


다크 소울이 게임 에이전트의 현실 격차를 드러냅니다

DSLE는 다크 소울 리마스터의 보스전 22개를 Gymnasium 형식의 컨테이너 환경으로 만든 벤치마크입니다. 미리 정리된 상태나 단순한 보상 대신 실제 게임 화면, 실시간 행동, 희소한 승리 보상 속에서 에이전트가 전투를 배워야 합니다.

  • 대표 보스 5종: 근접전, 좁은 공간, 환경 위험, 다중 표적, 빠른 최종 보스를 묶은 DSLE-5로 비교 가능한 출발점을 제공합니다.
  • 튜토리얼 이후 급격한 실패: 전문가 시스템과 진화 기준선은 튜토리얼 보스에서 각각 최고 63 %, 43 % 승률을 냈지만 나머지 4개 보스는 이기지 못했습니다.
  • 학습 비용과 성과의 간극: PPO와 DQN은 수십 시간의 실행 예산에서도 튜토리얼 최고 0.33 %, 다른 보스 0 % 승률에 머물렀습니다.
📢 에이전트 벤치마크가 현실에 가까워질수록 평균 보상보다 어디서 얼마나 버티고 무엇을 전혀 배우지 못했는지까지 실패 구조를 보여줘야 합니다.

출처: DSLE: A Learning Environment for Dark Souls Boss Encounters⁠—⁠arXiv


Decoding-Level Taboo, 익숙한 단어를 막아 모델의 우회 능력을 시험합니다

Decoding-Level Taboo는 프롬프트를 바꾸지 않고 생성 시점의 주요 후보 토큰을 단어 경계에서 동적으로 가립니다. 모델이 평소 가장 확률 높은 표현 경로를 쓰지 못하게 만들어, 복잡한 시스템 지침과 안전 규칙이 겹치는 실제 배포 환경의 비정상 경로를 재현합니다.

  • 제로 프롬프트 스트레스 테스트: 질문의 의미를 바꾸지 않은 채 로짓 공간에 직접 개입해 우회 표현을 강제합니다.
  • 정상 성능과 분리된 강건성: 열린 가중치 모델 여러 계열에서 비정상 경로 강건성은 모델 크기와 사후 명령 정렬의 영향을 크게 받았습니다.
  • 배포 전 감사 도구: 안전 가드레일이 어휘 제약이나 구조적 제한 아래에서도 유지되는지 검사하고 다양한 합성 데이터를 만드는 데 활용할 수 있습니다.
📢 모델의 언어 능력은 가장 익숙한 문장을 생성할 때가 아니라, 선호 경로가 막힌 뒤에도 의미와 안전성을 보존하며 다른 길을 찾을 때 드러납니다.

출처: Decoding-Level Taboo: A Diagnostic Stress Test for LLM Robustness⁠—⁠arXiv


높은 확신이 계속되면 탐색하지 않았다는 신호일 수 있습니다

Consilience는 외부 검증기가 없는 테스트 시간 확장에서 최종 답의 확신만으로 후보를 고르는 방식을 다시 봅니다. 복잡한 문제에서는 처음부터 끝까지 높은 확신을 보인 추론이 오히려 다른 가능성을 탐색하지 않은 채 틀린 답에 고정되는 현상을 관찰했습니다.

  • 확신의 시간 구조: 좋은 탐색은 초기에 낮은 확신으로 여러 경로를 열고, 마지막에 높은 확신으로 수렴해야 한다고 봅니다.
  • 비대칭 평가: 초기의 과도한 확신에는 불이익을 주고 최종 단계의 확실성은 엄격하게 요구하는 조합 지표를 사용합니다.
  • 검증기 없는 선택 개선: 대학원 수준 수학과 자유 형식 코드 생성에서 기존의 확신 기반 후보 선택보다 나은 결과를 보고했습니다.
📢 추론 과정의 신뢰도는 마지막 숫자 하나보다, 초기에 불확실성을 인정하고 탐색한 뒤 증거가 쌓이면서 확신이 높아지는 궤적으로 평가해야 합니다.

출처: Consilience for Verifier-Free Test⁠-⁠Time Scaling⁠—⁠arXiv


BDH-CQ, 작은 모델이 잠재 공간에서 반복 추론합니다

BDH-CQ는 추론 과정을 문장으로 길게 출력하는 대신, 입력 예시로 순환 메모리를 계속 갱신하고 고차원 잠재 공간에서 반복 계산합니다. 인컨텍스트 학습과 잠재 추론을 결합해 작은 모델의 비용 대비 추론 성능을 높였습니다.

  • 연속 메모리 갱신: 추론 시 제공된 예시가 순환 상태를 바꾸고, 모델은 이 상태를 이용해 새 질의의 변환 규칙을 적용합니다.
  • 통제된 개념 분석: ARC와 유사한 개입 실험으로 예시에서 무엇을 배웠고 어떤 변환을 일관되게 적용하는지 분리했습니다.
  • 150M 매개변수의 효율: ARC-AGI-1 공개 평가에서 pass@2 29.5 %, 과제당 계산 비용 0.0007달러를 보고했습니다.
📢 추론 비용을 줄이는 길은 생각을 짧게 말하게 만드는 것만이 아니라, 반복 계산을 언어 토큰 밖의 작은 순환 상태로 옮기는 데서도 나옵니다.

출처: BDH-CQ: In-Context Learning with Recurrent Latent Reasoning⁠—⁠arXiv


SHE, 실패 궤적에서 에이전트의 안전 경계를 고칩니다

Safety Harness Evolution은 에이전트 안전을 모델 가중치만의 문제가 아니라 컨텍스트, 메모리, 도구, 권한과 실행 제어를 묶는 하네스의 문제로 다룹니다. 실제 실행 실패를 어느 구성요소가 만들었는지 귀속한 뒤 해당 안전 경계만 국소적으로 갱신합니다.

  • 4개 안전 책임 분리: 시스템 프롬프트, 규칙 은행, 안전 메모리, 도구 정책을 독립된 진화 대상으로 나눕니다.
  • 궤적 기반 개선 루프: 실패를 구조화된 진단으로 바꾸고, 수정 후보를 안전성과 정상 업무 유용성으로 함께 검증합니다.
  • 공격 성공률 3.1배 감소: Agent-SafetyBench에서 정적 SafeHarness 대비 공격 성공률을 3.1배 낮추면서 정상 유용성도 높였다고 보고했습니다.
📢 에이전트 안전 규칙은 배포일에 고정되는 문서가 아니라, 실패의 원인을 프롬프트·메모리·도구 권한별로 나눠 계속 수정하는 운영 자산입니다.

출처: SHE: Trajectory-driven Safety Harness Evolution for LLM Agents⁠—⁠arXiv


ElasticBack, 평소에는 잠든 단일 스킬 백도어를 만듭니다

ElasticBack은 에이전트가 필요할 때 불러오는 스킬 문서 하나에 조건부 백도어를 심는 공격입니다. 스킬 안의 악성 규칙과 사용자 질의의 평범해 보이는 트리거가 함께 나타날 때만 동작해, 정상 과제에서는 숨어 있다가 특정 조건에서 페이로드를 실행합니다.

  • 가중치 없는 공급망 공격: 모델을 미세조정하거나 여러 스킬을 결합하지 않고 문서 규칙과 질의 트리거만 사용합니다.
  • 결합 최적화: 규칙을 먼저 고정한 뒤 은밀성 제약이 있는 유전 탐색으로 트리거를 진화시킵니다.
  • 기존 검사 회피: 3개 목표 행동, 목표별 50개 스킬, 4개 에이전트 LLM 실험에서 정상 정확도를 유지하면서 높은 공격 성공률과 거의 0에 가까운 오탐률을 보고했습니다.
📢 스킬 보안은 설치할 때 문서가 수상한지만 보는 것으로 부족하며, 정상 질의와 결합했을 때만 활성화되는 조건부 행동까지 격리 환경에서 검사해야 합니다.

출처: ElasticBack: Stealthy Conditional Backdoor in LLM-Agent Skills via Coupled Trigger-Rule Optimization⁠—⁠arXiv


오늘의 도구 추천

Instatic — 비주얼 편집기, 콘텐츠 엔진, 미디어, 인증, 폼, 플러그인과 배포기를 하나의 Bun 서버에 담은 MIT 라이선스 셀프호스팅 CMS입니다. SQLite와 Postgres를 지원하며, 편집기 런타임을 결과 페이지에 남기지 않고 시맨틱 HTML과 작은 CSS를 정적 페이지처럼 출력합니다. 오늘의 주제처럼 도구가 실제 결과물까지 책임지되 산출물의 구조와 소유권을 사용자가 검증할 수 있어야 한다는 점에서 살펴볼 만합니다.


에디터 노트

좋은 벤치마크는 모델이 잘하는 일을 더 깨끗하게 보여주는 무대가 아닙니다. 문서에 답이 없고, 가장 익숙한 단어를 쓸 수 없으며, 실시간 화면에서 보상이 드물고, 물리 법칙을 어기면 아무리 빠른 답도 쓸 수 없는 상황을 만들어야 합니다. 오늘의 연구들은 바로 그 불편한 조건에서 성능과 안전의 차이를 드러냈습니다.

Solar Pro 4가 보여주는 실무 산출물의 연결, MMDiff의 인과적 특징 제어, GENCO의 물리 일관성, SHE와 ElasticBack이 드러낸 하네스·스킬 공급망 문제는 같은 질문으로 이어집니다. AI를 어디까지 믿을 수 있는지는 정상 입력에서 낸 최고 점수가 아니라, 경로가 흔들렸을 때 무엇을 보존하고 무엇을 멈추는지로 판단해야 합니다. 이제 평가는 모델의 순위를 매기는 표를 넘어, 실제 배포에서 실패를 발견하고 수정하는 운영 설계가 되어가고 있습니다.

다음에 또 찾아옵니다. — 에이브랜치