주간 AI 브리핑 — 2026년 33주차
Grok 4.6과 Solar Pro 4, 실행 하네스 연구가 모델 경쟁을 장기 작업의 완결성과 검증 가능한 경로 경쟁으로 바꿨습니다.
이번 주 핵심
이번 주 AI 산업은 더 큰 모델보다 끝까지 일하고, 그 과정을 다시 검증할 수 있는 실행 구조에 무게를 실었습니다. Grok 4.6과 Solar Pro 4는 긴 코딩·문서·도구 작업의 완결성을 전면에 내세웠고, 하네스 연구는 작은 모델도 코드화된 라우팅과 검증 규칙을 만나면 성능이 크게 달라질 수 있음을 보였습니다. 동시에 명령 전달 경로, 스킬 공급망, 다국어 정책과 반복 수정에서 최종 점수만으로는 보이지 않는 실패가 드러났습니다.
1. Grok 4.6이 긴 에이전트 작업과 작동하는 결과물을 겨냥했습니다
스페이스XAI는 여러 단계의 조사·코딩·지식 작업과 인터랙티브 결과물 제작에 초점을 맞춘 Grok 4.6을 공개했습니다. 모델 규모 확대보다 보충 학습과 에이전트 강화학습을 늘려 복잡한 프로젝트의 계획과 중간 검사를 오래 유지하는 방향입니다.
- 에이전트 지표: CursorBench v3.2 69.9 %, FrontierCode v1.1 Extended 61.3 %, APEX-Agents 57.5 %를 보고했습니다.
- 실행 환경 학습: 지식 작업, 코딩, CAD와 웹 개발 환경에서 에이전트 강화학습을 진행했습니다.
- API 가격: 100만 입력 토큰당 2달러, 출력 토큰당 6달러부터 시작합니다.
출처: Introducing Grok 4.6 — 스페이스XAI
2. Solar Pro 4가 한국어 실무 산출물의 연결과 근거 보존을 내세웠습니다
업스테이지는 문서 읽기, 도구 실행, 코드 작업과 파일 생성을 이어가는 에이전트향 Solar Pro 4를 공개했습니다. Excel 분석에서 Word 보고서와 PowerPoint 자료로 이어지는 작업에서도 근거와 수치를 보존하는 데 초점을 맞췄습니다.
- 긴 입출력: 512K 컨텍스트와 최대 128K 출력을 지원하며 영어·한국어·일본어를 다룹니다.
- 에이전트 평가 상승: Solar Pro 3 대비 Terminal-Bench v2.1은 12에서 57, τ³-Banking은 9에서 23, AA-LCR은 31에서 71로 올랐다고 밝혔습니다.
- 근거 상태 분리: 문서 내 사실, 문서에 없는 정보와 충돌 값을 각각 구분해 후속 산출물로 오류가 번지는 일을 줄이도록 설계했습니다.
출처: Solar Pro 4 — 업스테이지
3. 강한 모델이 만든 하네스가 약한 모델의 성능을 0.49에서 0.91로 높였습니다
AI4AI at Test-Time은 강한 빌더 모델이 약한 타깃 모델을 위한 추론 하네스를 설계하면 가중치를 다시 학습하지 않고도 능력을 이전할 수 있는지 시험했습니다. AutoDesign도 결과 피드백을 코드와 규칙으로 축적해 긴 디자인 작업의 하네스를 스스로 개선했습니다.
- 구조가 만든 개선: 4개 마음이론 벤치마크에서 타깃 모델의 평균 성능이 0.49에서 0.91로 올랐습니다.
- 결정적 실행 규칙: 불안정한 추론을 코드로 옮기고 과제별 라우팅과 출력 형식을 강제한 것이 핵심이었습니다.
- 반복 학습의 비용 공개: AutoDesign은 40분 동안 253번의 도구 호출과 11번의 편집을 3달러 미만으로 수행했습니다.
출처: AI4AI at Test-Time — arXiv, AutoDesign — arXiv
4. 기업 AI가 일부 전문가의 도구에서 조직 전반의 작업층으로 확산했습니다
ChatGPT Enterprise 사용 기록을 분석한 연구는 신규 기업의 도입과 기존 조직 내부의 사용 강도가 함께 늘고 있음을 보여줬습니다. 6개월 도입 시점 표본만 1,500개 이상 조직과 1,700만 건 이상의 메시지를 포함합니다.
- 업무 범위 확대: 글쓰기, 기술 작업, 커뮤니케이션과 정보 종합 전반으로 사용이 퍼졌습니다.
- 초기 경력층의 높은 강도: 조직 안에서는 초기 경력 직원의 사용 강도가 특히 높았습니다.
- 통합 격차: 기업 규모와 연구개발·판매관리비가 큰 곳에 도입이 집중됐지만 실제 활용 폭과 목적은 조직마다 달랐습니다.
출처: How Organizations Use AI — arXiv
5. 코딩 에이전트 평가는 답변에서 실행 경로와 저장소 증명으로 넓어졌습니다
QuoteBench는 같은 Bash 답변도 직렬화·래핑·재파싱 경로에 따라 성공률이 최대 73.2 %p 떨어질 수 있음을 보였습니다. Vero는 평가 단위를 함수에서 다중 모듈 저장소로 넓혀 구현과 기계 검증 가능한 증명을 함께 요구했습니다.
- 인터페이스 손실: 추가 파서를 거친 8개 구성 모두에서 성공률이 55.4~73.2 %p 낮아졌습니다.
- 저장소 단위 한계: Vero의 가장 좋은 구성도 43개 과제 중 27개만 코드와 증명을 모두 완성했습니다.
- 실제 상태 채점: WebGrader는 화면 모양이 아니라 브라우저 궤적, DOM, 응답과 영속 상태가 요청한 전환을 만들었는지 확인합니다.
출처: QuoteBench — arXiv, Vero — arXiv, WebGrader — arXiv
6. 장기 에이전트는 항상 재계획하기보다 흔들릴 때만 교정합니다
LivePlan은 코딩 에이전트의 계획 이탈, 실패 행동 반복과 성급한 종료를 결정론적으로 감시하고 문제가 감지될 때만 조언 모델을 호출합니다. VibeLifeBench는 이 원칙을 수 주간 변하는 생활 환경으로 확장해 언제 행동하고 질문하며 침묵할지 평가했습니다.
- 선택적 개입: SWE-bench Verified와 Pro에서 기본 SWE-agent보다 해결률이 평균 9.9 %, 최대 15.2 % 높았습니다.
- 낮은 감독 비용: 인스턴스당 추가 비용은 0.08달러였습니다.
- 지속 상태 평가: VibeLifeBench는 22개 모의 서비스와 200개 과제에서 최종 상태, 행동 시점과 암묵적 제약 준수를 채점합니다.
출처: Online Monitoring and Corrective Steering of Programming Agents — arXiv, VibeLifeBench — arXiv
7. 에이전트 공격은 한 문장보다 여러 단계와 스킬 공급망에 숨었습니다
StepJack은 여러 페이지의 무해해 보이는 지시가 순서대로 실행될 때 하나의 악성 행동을 만드는 공격을 보여줬습니다. ElasticBack과 Convergent Detour Hijacking은 제3자 스킬이 특정 조건에서만 백도어를 작동시키거나 정상 완료를 유지한 채 비용과 시간을 늘릴 수 있음을 드러냈습니다.
- 다단계 인젝션: StepJack의 안정적 탐색 에이전트 5개는 평균 공격 성공률이 단일 단계 31.3 %에서 3단계 36.9 %로 올랐습니다.
- 조건부 스킬 백도어: ElasticBack은 스킬 규칙과 평범한 질의 트리거가 함께 나타날 때만 악성 행동을 실행합니다.
- 보이지 않는 자원 탈취: 우회 스킬이 선택된 완료 실행은 토큰 66.91 %, 실행 시간 92.45 %가 늘었습니다.
출처: StepJack — arXiv, ElasticBack — arXiv, Convergent Detour Hijacking — arXiv
8. 다국어 지원은 같은 안전성과 도구 정책을 보장하지 못했습니다
저자원 언어 안전 연구는 영어로 만든 거부 정렬이 트위어, 하우사어, 암하라어와 스와힐리어에 거의 전달되지 않음을 보였습니다. 별도 도구 연구에서도 같은 과제를 다른 언어로 요청하면 최전선 모델의 행동 정책이 달라졌습니다.
- 거부 신호 10 % 미만: 대부분의 언어·모델 조합에서 유해 프롬프트가 영어 거부 표현의 10 %도 유지하지 못했습니다.
- 행동 정책 71~73 % 유지: 자체 실행 변동성을 보정해도 4개 최전선 모델은 언어 간 도구 행동의 약 4분의 3만 보존했습니다.
- 평가기의 영향: 다국어 궤적 추출 예시 2개를 추가하자 한 모델의 측정 정확도가 26배 높아졌습니다.
출처: The Illusion of Cross-Lingual Safety in Low-Resource Languages — arXiv, Actions Speak Louder than Words — arXiv
9. AI 과학자는 최종 점수보다 원시 증거와 탐색 궤적으로 평가받기 시작했습니다
Beyond Final Scores는 7개 프런티어 모델의 36개 장기 연구개발 과제에서 문제 구도 설정, 실행, 피드백 제어와 경험 재사용을 나눠 추적했습니다. OmniScientist는 요약된 특징 대신 이미지·신호·오디오·비디오와 3D 구조 같은 원시 증거를 직접 다뤘습니다.
- 공학적 강점: 장기 연구 에이전트는 새로운 방법의 발명보다 알려진 기법의 수정과 조합에서 강했습니다.
- 원시 증거의 효과: OmniScientist는 36개 사례를 모두 논문까지 완주했고 직접 지각 변형이 일대일 판단의 85 %에서 선택됐습니다.
- 추적 가능한 주장: 새로움, 통계적 타당성, 실행 출처와 수치를 코드 기반 검사로 연결했습니다.
출처: Beyond Final Scores — arXiv, OmniScientist — arXiv
10. 월드 모델은 그럴듯한 영상보다 물리와 지속 상태에서 흔들렸습니다
GAUGE는 시뮬레이터와 생성형 비디오 월드 모델을 실제 궤적과 물리 메타데이터로 비교했고, PlayWorld는 에이전트가 목표를 수행하는 동안 공간과 상태가 유지되는지 시험했습니다.
- 물리 수치의 오류: 비디오 모델은 방정식 형태를 닮은 궤적을 만들면서도 가속도, 운동량 전달과 진동 시점을 잘못 복원했습니다.
- 엔진별 다른 실패: 22개 통제 과제에서 모든 물리 구간을 일관되게 잘 처리한 시뮬레이션 엔진은 없었습니다.
- 장기 지속성 부족: PlayWorld의 최신 모델 9개 모두 공간 일관성과 이전 행동 결과가 남는 상태 변화에서 불안정했습니다.
출처: GAUGE — arXiv, PlayWorld — arXiv
11. API와 문서를 함께 쓰는 에이전트는 추론 단계가 깊어지자 성능이 절반 넘게 떨어졌습니다
IBM의 VAKRA는 62개 도메인의 실행 가능한 API 8,000개 이상을 이용해 API 호출과 문서 검색을 넘나드는 에이전트를 실제 실행으로 평가했습니다. 호출 문법보다 엔터티 구분, 근거 연결과 답할 수 없는 요청의 판단이 병목이었습니다.
- 단일 단계 상한: 가장 좋은 모델도 단일 엔드포인트형 과제에서 70.4 %에 그쳤습니다.
- 조합형 API 하락: 여러 API를 묶는 과제에서는 50~51 %로 낮아졌습니다.
- 깊이의 비용: 추론 단계가 늘수록 성능이 50 % 넘게 떨어졌습니다.
출처: VAKRA — arXiv
12. 에이전트의 컨텍스트와 스킬은 더 많이 저장하는 문제에서 다시 조립하는 문제로 바뀌었습니다
장기 에이전트 연구는 최근 행동의 인과관계를 잃지 않는 압축, 현재 과제에 맞춘 기억 뷰와 실행 환경에 맞춘 스킬 조정을 강조했습니다. 한편 저장소 지침은 이유를 잃은 규칙이 삭제되지 않아 계속 비대해졌습니다.
- 압축의 새 기준: 정보량보다 압축 직후 다음 행동의 안정성을 독립적으로 검증합니다.
- 스킬은 초안: SkillAligner는 검색된 스킬의 가정을 현재 도구와 다른 스킬에 맞게 공동 조정합니다.
- 규칙 부채: 1,867개 저장소에서 지침은 생애 동안 평균 226 % 늘었지만 이유를 함께 기록하자 과잉 증가율이 211.3 %에서 1.4 %로 줄었습니다.
출처: Toward Reliable Context Compression for Long-Horizon Agents — arXiv, SkillAligner — arXiv, Why Does CLAUDE.md Keep Growing? — arXiv
13. 현지 의료 지식을 연결한 RAG가 최신 범용 모델과 대등해졌습니다
VITA는 인도와 중저소득 국가의 진료 지침, 항생제 내성 데이터, 국가 처방집과 자원 제한 치료 프로토콜을 검색하는 임상 RAG입니다. 범용 모델의 세대보다 어떤 근거 코퍼스를 연결하는지가 고위험 지역 서비스의 성능을 바꿀 수 있음을 보여줬습니다.
- 전체 평가 51.9 %: 4,023개 영어 질문에서 가능한 HealthBench 루브릭 점수의 51.9 %를 얻었습니다.
- 최신 모델과 통계적 동률: 500개 하위셋 재평가에서 VITA와 GPT-5.5의 질문당 평균 점수 차이는 유의하지 않았습니다.
- 남은 균형 문제: 근거 특화 시스템은 정확성과 완전성에 강했지만 커뮤니케이션 점수는 낮았습니다.
출처: A corpus-specific clinical RAG system matches or outperforms newer frontier LLMs on HealthBench — arXiv
14. 더 오래 생각하게 해도 모델 순위가 뒤집히고 정답률이 낮아졌습니다
4개 모델을 3개 추론 벤치마크와 64~4,096 토큰의 7개 생성 예산에서 비교한 연구는 평가 예산이 중립적인 조건이 아님을 보였습니다. 총 5만 6,476회 추론에서 더 많은 토큰이 항상 더 좋은 답으로 이어지지 않았습니다.
- 비단조 성능: 잘림 효과를 통제한 뒤에도 3~19 % 과제에서 토큰이 늘자 정확도가 낮아졌습니다.
- 모든 벤치마크에서 순위 역전: 가장 좋은 모델은 허용한 생성 예산에 따라 달라졌습니다.
- 라우팅 잠재력: 과제마다 모델을 고르는 오라클은 최대 27.8 %p 개선 여지를 보였지만 도메인 간 일반화는 제한적이었습니다.
출처: Who Thinks Best Depends on How Long You Let Them — arXiv
15. 장기 AI 수학 연구가 인간 전문가의 검증과 함께 실제 경계를 좁혔습니다
AI 연구 시스템은 그로텐디크 상수의 하한과 상한을 개선하는 장기 탐색에서 가설 생성, 계산 실험과 문헌 연결을 맡았고 인간 전문가는 아이디어를 실제 증명으로 검증했습니다. 독립적인 자동 연구보다 검증 가능한 형태로 통찰을 넘기는 협업 사례입니다.
- 양쪽 경계 개선: 하한을 6π/11까지 높이고 상한을 기존 공식에서 10⁻⁴ 낮춘 값까지 좁혔습니다.
- 전문가 검토: 분야 전문가가 AI의 아이디어를 새롭다고 평가하고 실제 증명과 경계 개선으로 연결했습니다.
- 환경 설계 공개: 문제 표현, 피드백과 검증 환경이 돌파구에 미친 영향도 함께 정리했습니다.
출처: Long-Horizon AI Research for Grothendieck Constant — arXiv
이번 주 데이터
| 신호 | 이번 주 수치 | 의미 |
|---|---|---|
| Solar Pro 4 컨텍스트 / 최대 출력 | 512K / 128K 토큰 | 긴 문서·도구 작업의 완결성 경쟁 |
| AI4AI 하네스 적용 평균 성능 | 0.49 → 0.91 | 가중치보다 실행 구조가 만든 능력 이전 |
| QuoteBench 추가 파서 손실 | 55.4~73.2 %p | 인터페이스 경계가 숨기는 모델 성능 |
| VAKRA 단일 / 조합 API 최고 성능 | 70.4 % / 50~51 % | 추론 깊이와 근거 연결의 병목 |
| 다국어 도구 행동 정책 유지율 | 71~73 % | 번역 품질과 행동 일관성의 차이 |
| 우회 스킬의 토큰 / 시간 증가 | 66.91 % / 92.45 % | 정상 완료 뒤에 숨은 공급망 비용 |
다음 주 주목할 것
- Grok 4.6과 Solar Pro 4의 공개 API에서 장기 코딩·문서 작업 지표가 실제 사용자 평가로 재현되는지
- 하네스·스킬 마켓이 서명, 격리 실행, 권한·비용 추적 같은 공급망 통제를 도입하는지
- 기업 AI 도입 지표가 계정 수를 넘어 직무별 워크플로 통합과 품질·생산성 증거로 구체화되는지
- 다국어 에이전트 평가가 답변 번역뿐 아니라 도구 호출, 거부, 비용과 중단 정책까지 포함하는지
- 추론 모델 제공사가 토큰 예산별 정확도와 비단조 구간을 가격 정보와 함께 공개하는지
다음 주 월요일에 다시 돌아옵니다. — 에이브랜치