긴 작업을 완성하는 AI의 조건 — Grok 4.6과 운영 맥락의 귀환
Grok 4.6과 최신 에이전트 연구를 통해 장기 작업, 조직 맥락, 검증 가능한 행동과 지속 가능한 스킬의 조건을 살핍니다.
오늘의 핵심
오늘의 흐름은 더 강한 모델을 만드는 경쟁이 긴 작업을 끝까지 완성하는 운영 구조를 만드는 경쟁으로 이동하고 있다는 것입니다. 장기 에이전트를 겨냥한 Grok 4.6, 조직의 서비스·소유권·설계 결정을 연결하는 Xirp, 수학 연구와 생활 업무를 몇 주 동안 이어가는 벤치마크가 같은 질문을 던집니다. 에이전트가 실제로 유용해지려면 생성 능력뿐 아니라 맥락을 잃지 않는 기억, 언어가 바뀌어도 유지되는 행동 정책, 스스로 검증할 수 있는 주장과 관리 가능한 지침이 필요합니다.
Grok 4.6, 긴 에이전트 작업과 시각적 결과물을 겨냥합니다
스페이스XAI가 여러 단계에 걸친 조사·코딩·지식 작업과 인터랙티브 결과물 제작에 초점을 맞춘 Grok 4.6을 공개했습니다. 모델 규모보다 보충 학습과 에이전트 강화학습을 늘려 복잡한 프로젝트를 오래 유지하고 중간 결과를 점검하는 능력을 다듬었다고 설명합니다.
- 에이전트 성능 향상: CursorBench v3.2 69.9 %, FrontierCode v1.1 Extended 61.3 %, APEX-Agents 57.5 %를 보고했습니다.
- 사후학습 중심 개선: Grok 4.5가 다시 생성한 추론·하네스별 SFT 궤적을 모델 기반 검사로 걸러 학습하고, 지식 작업·코딩·CAD·웹 개발 환경에서 에이전트 RL을 진행했습니다.
- API와 도구 동시 제공: Cursor, Grok Build, API와 파트너 플랫폼에서 제공하며 가격은 100만 입력 토큰당 2달러, 출력 토큰당 6달러부터 시작합니다.
출처: Introducing Grok 4.6—스페이스XAI
Xirp, 코딩 에이전트에 조직의 기억을 연결합니다
스포티파이가 서비스 카탈로그 플랫폼 Portal의 조직 맥락을 코딩 에이전트에 연결하는 Xirp 베타를 공개했습니다. 에이전트가 현재 파일만 읽는 대신 서비스 소유자, 상·하류 의존성, 문서와 과거 설계 결정을 함께 조회하도록 해 매 세션을 실제 시스템 맥락에서 시작하게 합니다.
- 공유 컨텍스트 계층: 작업 항목, 세션과 문서를 Workspace에 보존해 다음 엔지니어나 에이전트가 이어받을 수 있습니다.
- 작업 중 문서화: 코딩 세션에서 생긴 지식을 문서로 만들고 이후 세션의 입력으로 되돌려 오래된 README 의존을 줄입니다.
- 모델 독립성: Claude, Gemini, Codex를 바꿔도 조직 맥락을 유지하고 로컬·원격 실행을 지원합니다.
출처: Xirp — Know your systems, so your agents can too—Spotify
AI 수학 연구, 긴 탐색을 인간 전문가의 검증과 결합합니다
연구진은 그로텐디크 상수의 알려진 하한과 상한을 개선한 과정에서 AI 연구 시스템이 어떻게 새로운 통찰을 만들었는지 사례 연구로 정리했습니다. 단일 문제 풀이가 아니라 장기간의 가설 생성, 계산 실험, 문헌 연결과 전문가 검토를 결합한 인간-AI 수학 협업입니다.
- 양쪽 경계 개선: 정확한 값이 알려지지 않은 그로텐디크 상수에 대해 하한을 6π/11까지, 상한을 기존 공식에서 10⁻⁴ 낮춘 값까지 좁혔습니다.
- 전문가가 새롭다고 본 통찰: AI 시스템이 낸 아이디어를 분야 전문가가 검토하고 실제 증명과 경계 개선으로 연결했습니다.
- 조건 설계의 중요성: 연구진은 모델 능력뿐 아니라 AI가 돌파구에 도달할 수 있도록 문제 표현, 피드백과 검증 환경을 만드는 경험을 함께 공개했습니다.
출처: Long-Horizon AI Research for Grothendieck Constant—arXiv
GUI 에이전트, 배포 뒤 실패를 반성하고 스스로 적응합니다
Test-Time Self-Evolving은 처음 보는 인터페이스에서 GUI 에이전트가 좌표 선택에 실패한 뒤 그 이유를 반성하고, 별도 정답 라벨 없이 자신의 가중치에 교훈을 반영하는 프레임워크입니다. 배포 시점에 고정된 시각적 그라운딩 모델을 탐색·평가·반성·내재화의 폐쇄 루프로 바꿉니다.
- 반성 기반 평가: 멀티모달 모델 Reflector가 클릭 위치와 결과를 평가하고 실패 원인을 추론합니다.
- 온폴리시 자기증류: 고수준 반성을 조건부 자기 교사의 토큰 단위 감독으로 바꿔 현재 모델에 학습시킵니다.
- 평균 7.4 % 개선: 6개 GUI 그라운딩 벤치마크에서 기반 모델보다 평균 정확도가 7.4 % 높아졌습니다.
출처: Test-Time Self-Evolving GUI Visual Grounding—arXiv
AI가 내놓은 확률 주장, 스스로 일관성을 증명하게 합니다
How to Verify Consistency of Probabilistic Claims는 예측 모델이 수많은 조건부 확률을 답할 때 그 주장들이 하나의 가능한 확률분포와 양립하는지 효율적으로 확인하는 방법을 제안합니다. 모든 경우를 열거하는 대신 모델과 증명 오라클의 일부 지점만 읽는 대화형 검증을 구성했습니다.
- 지수적으로 많은 주장 검증: 확률 회로와 신뢰도 회로가 암묵적으로 나타내는 방대한 주장을 다항 시간 검증기가 소수의 질의로 검사합니다.
- 희소 증명서 구성: 명시적 확률 주장들의 근사 일관성이 NP에 속함을 보이고 짧은 증명서가 존재하는 조건을 제시합니다.
- 안전 예측의 기초: 원치 않는 결과의 가능성을 솔직하게 보고하는 모델이 자신의 예측 체계가 모순되지 않음을 증명하도록 하는 첫 단계입니다.
출처: How to Verify Consistency of Probabilistic Claims—arXiv
저자원 언어에서는 영어의 안전 정렬이 거의 전달되지 않습니다
LoDNA 연구는 트위어, 하우사어, 암하라어와 스와힐리어에서 영어로 만든 거부 안전성이 얼마나 유지되는지 조사했습니다. 같은 뜻을 문자 그대로 번역한 질문과 문화 맥락에 맞게 현지화한 질문을 함께 사용해 표면적 번역 평가를 넘어섰습니다.
- 거부 신호 10 % 미만: 대부분의 언어·모델 조합에서 유해 프롬프트가 영어 거부 표현의 10 %도 유지하지 못했습니다.
- 의미는 알지만 안전 경로에 연결하지 못함: 번역·현지화 프롬프트의 의미 표현은 유사했지만 층을 지날수록 안전 메커니즘과의 연결이 벌어졌습니다.
- 문화적 현지화 평가: 단순 번역과 실제 문화 맥락을 반영한 질문을 구분해 다국어 안전의 겉보기 일반화를 점검했습니다.
출처: The Illusion of Cross-Lingual Safety in Low-Resource Languages—arXiv
도구 에이전트는 언어가 바뀌면 행동 정책의 4분의 1을 잃습니다
Actions Speak Louder than Words는 8개 모델, 6개 도구 벤치마크, 41개 언어에서 238만 회 실행을 분석해 최종 답이 아니라 실제 도구 호출 궤적을 비교했습니다. 같은 과제를 다른 언어로 요청했을 때 최전선 모델조차 자신의 행동 정책을 완전히 보존하지 못했습니다.
- 정규화 뒤 71~73 % 유지: 4개 최전선 모델은 자체 반복 실행의 변동성을 보정해도 언어 간 행동 정책의 약 4분의 3만 유지했습니다.
- 영어 피벗의 구조적 영향: 비영어 작업을 영어를 거쳐 처리하는 경로가 행동 결정에 인과적으로 중요했고, 지시만으로 이를 버리지 못했습니다.
- 평가 코드도 실패 원인: 단일 궤적 추출 정규식이 다국어 실패를 만들어냈고, 예시 2개를 넣자 한 모델의 측정 정확도가 26배 뛰었습니다.
출처: Actions Speak Louder than Words—arXiv
CLAUDE.md가 계속 커지는 이유는 맥락 없는 규칙을 지우기 어렵기 때문입니다
Catastrophic Remembering 연구는 에이전트 코딩 지침이 실패를 겪을 때마다 새 규칙을 더하지만, 그 규칙의 이유가 사라지면 삭제 위험을 판단할 수 없어 끝없이 비대해지는 현상을 분석했습니다. 이를 지속학습의 파국적 망각과 반대되는 파국적 기억이라고 이름 붙였습니다.
- 1,867개 저장소 분석: 24만 7,694개 지침 수명을 추적하자 프롬프트는 생애 동안 평균 226 % 늘었고 커밋마다 순수 4.9개 지침이 추가됐습니다.
- 오래될수록 삭제되지 않음: 지침의 나이가 들수록 제거 가능성이 낮아져, 근거를 잃은 규칙이 영구 제약처럼 남았습니다.
- 주석이 과잉 규칙 99.3 % 제거: 규칙이 필요한 이유를 주석으로 보존한 통제 환경에서는 과잉 지침 증가율이 211.3 %에서 1.4 %로 줄었습니다.
출처: Why Does CLAUDE.md Keep Growing?—arXiv
SkillZip, 스킬의 예외를 잃지 않고 반복 구조를 압축합니다
SkillZip은 성공 절차와 실패 수정이 누적되며 비대해진 에이전트 스킬을 평가 실행 없이 압축하는 방법입니다. 단순 요약 대신 트리거, 워크플로우, 도구 계약, 출력 의무와 드문 예외를 구조적으로 추출하고 반복 규칙만 공통 절차로 올립니다.
- 설명 한 번, 참조 여러 번: 같은 규칙은 적용 범위의 상위 위치에 한 번 두고 반복 행동은 공유 절차로 묶으며 차이만 예외로 남깁니다.
- 하드 커버리지 제약: 모든 트리거, 워크플로우 간선, 도구 요구와 출력 필드가 압축 결과에 보존되도록 합니다.
- 지속적 압축: 한 번에 정리하는 모드와 새 수정이 들어올 때 전체 기록을 다시 파싱하지 않고 갱신하는 Zip-on-Write 모드를 제안합니다.
출처: SkillZip—arXiv
VibeLifeBench, 몇 주 동안 먼저 움직이고 침묵할 줄 아는지를 묻습니다
VibeLifeBench는 개인 비서 에이전트를 짧은 채팅이 아니라 22개 모의 서비스가 계속 변하는 수 주짜리 생활 환경에 놓습니다. 사용자가 매번 알려주지 않는 변화와 암묵적 제약 속에서 언제 행동하고, 질문하고, 아무것도 하지 않을지를 스스로 결정해야 합니다.
- 10개 생활 영역 200개 과제: 세계의 시간이 독립적으로 흐르고 일부 변화는 알림 없이 일어나 재확인이 필요합니다.
- 남긴 결과만 평가: 최종 상태, 행동 시점과 암묵적 제약 준수를 에이전트가 실제 서비스에 남긴 흔적으로 채점합니다.
- 최전선 모델도 낮은 점수: 7개 최전선 모델 모두 생활형 지속 과제에서 낮은 성능을 보여 현재 개인 비서의 장기 신뢰성 격차를 드러냈습니다.
출처: VibeLifeBench—arXiv
오늘의 도구 추천
HOP — HWP와 HWPX 문서를 열고 편집하며 PDF 내보내기·인쇄·파일 연결을 지원하는 MIT 라이선스 데스크톱 앱입니다. macOS, Windows와 Linux용 설치 파일을 제공하고 오픈소스 HWP 엔진 rhwp를 기반으로 합니다. 오늘의 주제처럼 AI 에이전트가 실제 조직 문맥에서 일하려면 한국 업무 현장의 핵심 문서 형식도 열고 검증 가능한 결과물로 내보낼 수 있어야 한다는 점에서 살펴볼 만합니다.
에디터 노트
에이전트를 오래 일하게 만드는 일은 컨텍스트 창을 키우는 것으로 끝나지 않습니다. 조직의 설계 이유를 찾을 수 있어야 하고, 자신이 낸 확률과 클릭을 검증해야 하며, 언어가 달라져도 같은 도구 정책을 유지해야 합니다. 실패를 막으려고 추가한 지침은 왜 존재하는지 함께 기록하고, 반복은 압축하되 예외는 잃지 않아야 합니다.
Grok 4.6의 보충 학습, Xirp의 조직 기억, 장기 수학 연구와 VibeLifeBench는 서로 다른 층을 다루지만 결론은 같습니다. 강한 에이전트는 오래 생각하는 모델이 아니라, 오래 일하는 동안 맥락·행동·검증·기억을 함께 관리하는 시스템입니다. 이제 경쟁력은 모델을 호출하는 순간보다 그 호출들이 쌓여도 조직의 판단과 결과가 더 나아지는 운영 구조에서 만들어집니다.
다음에 또 찾아옵니다. — 에이브랜치