주간 AI 브리핑 — 2026년 28주차
GPT-5.6과 GPT-Live가 공개되고, 업무 에이전트 경쟁은 실행 환경·관측성·보안·비용 통제로 확장됐습니다.
이번 주 핵심
1. GPT-5.6, 성능 계층과 도구 호출을 하나의 제품군으로 묶었습니다
OpenAI는 GPT-5.6을 Sol·Terra·Luna 3개 계층으로 출시하고, 코드가 도구 호출을 조율하는 Programmatic Tool Calling을 도입했습니다. 단일 최고 모델보다 작업 난도와 비용에 맞춘 계층 선택, 복잡한 도구 흐름의 효율화가 핵심입니다.
- 3단계 모델 계층: 빠른 일상 작업부터 고난도 추론까지 하나의 제품군에서 선택하게 했습니다.
- 도구 호출 최적화: 모델이 매 단계 왕복하는 대신 코드로 여러 도구를 조율해 지연과 토큰 사용을 줄입니다.
- 배포 속도: Microsoft 365 Copilot과 GitHub Copilot이 곧바로 세 모델을 채택했습니다.
출처: GPT-5.6: Frontier intelligence that scales with your ambition — OpenAI, OpenAI’s GPT-5.6 Sol, Terra, and Luna are now available in GitHub Copilot — GitHub Changelog
2. ChatGPT Work와 Claude Cowork, 채팅창을 상시 업무 공간으로 확장했습니다
OpenAI는 문서·스프레드시트·웹앱을 만드는 ChatGPT Work를 공개했고, Anthropic은 Claude Cowork를 모바일과 웹으로 확장했습니다. 두 회사 모두 답변 생성보다 여러 표면에서 이어지는 장기 업무 수행을 제품의 중심에 놓았습니다.
- 산출물 중심 UX: 대화 결과가 설명문에 머물지 않고 편집 가능한 업무 결과물로 이어집니다.
- 기기 간 연속성: 데스크톱에서 시작한 작업을 모바일과 웹에서 확인하고 이어가는 흐름이 강화됐습니다.
- 상시 위임 경쟁: 사용자가 앱을 열어 질문할 때만 작동하는 도구에서, 업무 상태를 계속 보유하는 에이전트로 이동합니다.
출처: ChatGPT is now a partner for your most ambitious work — OpenAI, Claude Cowork — Anthropic, Anthropic is launching Claude Cowork on mobile and web — The Verge
3. GPT-Live, 실시간 음성을 별도 모델·안전 시스템으로 끌어올렸습니다
OpenAI는 양방향 음성 대화를 위한 GPT-Live를 공개하고 별도 시스템 카드를 내놨습니다. 음성 에이전트의 품질 기준이 음성 인식과 합성의 조합을 넘어, 끼어들기·감정·지연시간·실시간 안전 대응을 함께 다루는 방향으로 바뀌었습니다.
- 실시간 상호작용: 사용자의 말이 끝나기만 기다리지 않고 자연스럽게 주고받는 대화를 지향합니다.
- 독립 안전 표면: 음성 사칭, 정서적 의존, 유해 발화 같은 위험을 텍스트와 다른 제품 요구사항으로 다뤘습니다.
- 인터페이스 전환: 음성이 입력 기능을 넘어, 항상 켜진 개인·업무 에이전트의 핵심 인터페이스가 됩니다.
출처: Introducing GPT-Live — OpenAI, GPT-Live System Card — OpenAI Deployment Safety Hub
4. OpenAI와 Broadcom, 추론 전용 칩으로 비용 경쟁을 하드웨어까지 내렸습니다
OpenAI와 Broadcom은 LLM 추론에 최적화한 첫 Intelligence Processor Jalapeno를 공개했습니다. AI 서비스 비용의 큰 비중을 차지하는 응답 생성 단계에서 공급망과 단위 경제성을 직접 통제하려는 움직임입니다.
- 추론 특화 설계: 범용 학습 가속기와 달리 대규모 서비스의 반복 응답 생성에 초점을 맞췄습니다.
- 공급망 다변화: 모델 기업이 칩 설계 통찰과 다세대 컴퓨트 로드맵을 함께 확보합니다.
- 수직 통합: 모델 계층, 도구 호출 효율, 전용 하드웨어가 하나의 비용 최적화 전략으로 연결됩니다.
출처: OpenAI and Broadcom unveil LLM-optimized inference chip — OpenAI
5. 앨버타 정부의 Claude Code 점검, 에이전트의 공공 부문 규모를 보여줬습니다
캐나다 앨버타 주정부는 Claude Code를 활용해 27개 부처의 약 1,280개 애플리케이션과 3,400개 저장소를 보안 점검했습니다. 약 50개 에이전트가 4억 6,600만 줄을 20시간 안에 분석하며 레거시 코드와 보안 부채를 대규모로 다루는 사례를 만들었습니다.
- 대규모 병렬화: 사람이 순차적으로 보기 어려운 저장소 전체를 여러 에이전트가 나눠 점검했습니다.
- 발견에서 수정까지: 취약점 탐지뿐 아니라 테스트와 일부 수정 작업으로 이어졌습니다.
- 정부형 통제: 레드팀·블루팀 역할과 보안 기준, 공공 문구 검토를 운영 구조에 포함했습니다.
출처: Government of Alberta uses Claude to find and fix cybersecurity vulnerabilities across government systems — Anthropic
6. 코딩 에이전트의 작업 단위가 길어지며 원격 실행 표면이 커졌습니다
OpenAI는 Codex 사용 데이터에서 30분 이상 걸릴 작업의 위임이 늘었다고 분석했습니다. GitHub는 모바일에서 원격 Copilot CLI 세션 알림과 병합 충돌 해결을 지원했고, AWS는 WorkSpaces for AI agents를 공개했습니다.
- 긴 작업 위임: 에이전트 가치는 짧은 답변보다 여러 도구를 거쳐 끝내는 작업의 길이로 측정되기 시작했습니다.
- 원격 감독: 개발자는 자리를 비운 뒤에도 모바일로 진행 상태를 보고 개입할 수 있습니다.
- 격리된 실행 환경: 장기 에이전트가 안전하게 브라우저·코드·도구를 쓰는 전용 데스크톱이 인프라 제품이 됩니다.
출처: How agents are transforming work — OpenAI, GitHub Mobile: Live notifications for Copilot CLI sessions — GitHub Changelog, AWS Weekly Roundup: Claude Sonnet 5 on AWS, Amazon WorkSpaces for AI agents, AWS service availability updates, and more — AWS News Blog
7. GitHub와 VS Code, 에이전트 세션을 기업 관측 대상으로 만들었습니다
GitHub는 Copilot agent session streaming을 공개 프리뷰로 열었고, VS Code와 Copilot CLI는 OpenTelemetry 기반 사용량 관측 경로를 제공했습니다. 에이전트의 도구 호출, 비용, 작업 흐름을 기존 SIEM과 모니터링 체계에 넣을 수 있게 됐습니다.
- 세션 이벤트 스트리밍: 기업은 에이전트 활동을 외부 이벤트 수집기와 보안 시스템으로 보낼 수 있습니다.
- 표준 telemetry: OpenTelemetry를 통해 특정 도구 전용 대시보드에 갇히지 않고 조직 관측 체계와 연결합니다.
- 감사 가능성: 결과물뿐 아니라 어떤 세션이 어떤 호출과 비용을 만들었는지 추적하는 기반이 생겼습니다.
출처: Copilot agent session streaming is now in public preview — GitHub Changelog, Monitor agent usage with OpenTelemetry — Visual Studio Code Docs
8. CodeQL과 npm, AI 시대의 개발 공급망 기본값을 강화했습니다
CodeQL 2.26.0은 시스템 프롬프트 인젝션 탐지를 추가했고, npm v12는 설치 스크립트와 원격 의존성 실행을 기본 차단했습니다. AI가 코드를 만들고 외부 도구를 호출하는 흐름이 늘면서 보안이 사후 검토가 아닌 개발 도구의 기본 정책으로 이동했습니다.
- 프롬프트 인젝션 정적 분석: 코드 속 시스템 프롬프트와 외부 입력의 위험한 연결을 쿼리로 탐지합니다.
- 설치 단계 최소 권한: 패키지 설치만으로 임의 스크립트가 실행되는 공급망 공격면을 줄입니다.
- 자동화 친화 게이트: 사람이 매번 판단하지 않아도 CI와 패키지 관리자가 위험한 경로를 기본 차단합니다.
출처: CodeQL 2.26.0 adds Kotlin 2.4.0 support and AI prompt injection detection — GitHub Changelog, npm install-time security and GAT bypass2fa deprecation — GitHub Changelog
9. 에이전트 비용 통제가 사용자·세션·모델 라우팅 단위로 세분화됐습니다
GitHub는 기업이 사용자별 AI 예산 상태를 API로 조회하게 했고, VS Code는 에이전트 비용 가시성을 강화했습니다. 오픈소스 Weave Router는 프롬프트별 최적 모델 선택을 자동화하며 비용과 품질 사이의 운영 문제를 별도 계층으로 끌어냈습니다.
- 사용자별 예산 상태: 조직은 누가 한도에 접근했거나 사용을 중단했는지 자동화 시스템에서 확인할 수 있습니다.
- 작업 중 비용 피드백: 개발자는 세션이 진행되는 동안 모델 사용 비용을 더 직접적으로 봅니다.
- 동적 모델 선택: 모든 요청에 최고가 모델을 쓰는 대신 난도에 따라 모델을 배정합니다.
출처: Per-user states for multi-user budgets in the REST API — GitHub Changelog, GitHub Copilot in Visual Studio Code, June 2026 releases — GitHub Changelog, workweave/router — GitHub
10. Cloudflare, AI 트래픽 통제와 리소스 과금을 한 운영면에 놓았습니다
Cloudflare는 AI 크롤러를 Search·Agent·Training으로 나눠 제어하게 하고, x402 기반 Monetization Gateway 대기자 명단을 열었습니다. 웹 운영자가 AI 접근을 일괄 허용하거나 차단하는 대신 목적별 정책과 호출별 보상을 설계하는 방향입니다.
- 목적별 접근 정책: 검색 노출은 허용하고 학습 수집은 제한하는 식의 세분화가 가능합니다.
- 에이전트 전용 범주: 자동화된 웹 행동이 검색 크롤러와 다른 운영 대상으로 자리 잡았습니다.
- 기계 간 결제: 페이지, 데이터셋, API, MCP 도구에 에이전트가 직접 지불하는 과금층을 제안했습니다.
출처: Your site, your rules: new AI traffic options for all customers — Cloudflare Blog, Announcing the Monetization Gateway: charge for any resource behind Cloudflare via x402 — Cloudflare Blog
11. Claude의 J-space와 SWE-Bench Pro 감사, AI 평가의 내부를 다시 봤습니다
Anthropic은 Claude 내부의 언어화 가능한 표현이 공유되는 J-space 연구를 공개했고, OpenAI는 SWE-Bench Pro 과제의 약 30 %가 깨졌다고 분석했습니다. 모델의 답과 벤치마크 점수를 그대로 신뢰하기보다, 추론 과정과 평가 데이터 자체를 감사해야 한다는 흐름입니다.
- 추론 관측성: 여러 계층과 토큰 사이에서 공유되는 언어화 가능한 작업 공간을 분석했습니다.
- 평가 데이터 결함: 불완전한 테스트와 환경 문제는 모델 성능을 실제보다 낮거나 왜곡되게 측정할 수 있습니다.
- 검증 대상 확대: 모델뿐 아니라 benchmark, harness, 실행 환경도 지속적인 품질 관리 대상이 됩니다.
출처: A global workspace in language models — Anthropic, Verbalizable Representations Form a Global Workspace in Language Models — Transformer Circuits, Separating signal from noise in coding evaluations — OpenAI
12. Claude Science, 범용 모델에서 검증 가능한 도메인 워크벤치로 이동했습니다
Anthropic은 문헌 조사, 데이터 분석, 그림 생성, 원고 작성을 한 환경에 묶은 Claude Science를 공개했습니다. PubMed·Jupyter·R·클러스터 터미널 같은 연구 도구와 감사 가능한 산출물을 결합해 과학자의 실제 작업 흐름을 겨냥했습니다.
- 도구 통합: 연구자가 오가던 데이터·코드·문헌 환경을 하나의 에이전트 작업대로 묶습니다.
- 재현 가능한 결과: 최종 답변보다 코드, 기록, 그림, 원고가 어떤 과정에서 나왔는지 남기는 데 초점을 둡니다.
- 도메인 앱 경쟁: 범용 채팅 모델 위에 산업별 도구와 검증 방식을 품은 제품이 성장 축이 됩니다.
출처: Claude Science, an AI workbench for scientists — Anthropic
13. TypeScript 7.0, AI 개발 시대의 도구 체감 속도를 네이티브 포트로 높였습니다
Microsoft는 Go 기반 네이티브 포트인 TypeScript 7.0을 정식 출시했습니다. 대규모 코드베이스에서 타입 검사와 언어 서비스가 빨라지면 사람의 편집 루프뿐 아니라 에이전트가 탐색·수정·검증을 반복하는 시간도 줄어듭니다.
- 네이티브 성능: 컴파일러와 언어 서비스의 병목을 구현 언어 전환으로 크게 낮췄습니다.
- 대형 저장소 효과: 프로젝트가 클수록 편집 피드백과 CI 검증 시간 단축의 가치가 커집니다.
- 에이전트 반복 속도: 코딩 에이전트가 타입 오류를 확인하고 패치를 수정하는 루프도 함께 빨라집니다.
출처: Announcing TypeScript 7.0 — Microsoft Developer Blogs
14. Workers Cache, AI 앱의 실행 비용을 엣지 캐시 문제로 바꿨습니다
Cloudflare는 Worker 엔트리포인트 앞에 전용 계층형 캐시를 두는 Workers Cache를 출시했습니다. 캐시 적중 시 Worker 코드 자체가 실행되지 않아 서버 렌더링과 에이전트 앱의 지연시간·CPU 비용을 함께 줄일 수 있습니다.
- 실행 전 캐시: 애플리케이션 코드가 시작되기 전에 응답해 불필요한 Worker 실행을 없앱니다.
- 표준 HTTP 제어: Wrangler 설정과
Cache-Control헤더로 정책을 코드 가까이에서 관리합니다. - AI 앱 단위 경제성: 모델 호출 전후의 SSR, API 조합, 도구 결과 캐시가 전체 서비스 비용에 미치는 영향이 커집니다.
출처: Your Worker can now have its own cache in front of it — Cloudflare Blog
15. SkillOpt·Memora·A2A Gateway, 에이전트 운영층을 모듈화했습니다
Microsoft Research는 외부 스킬을 평가 루프로 개선하는 SkillOpt와 장기 기억을 다루는 Memora를 공개했고, AWS는 에이전트 발견·라우팅·접근 제어를 위한 서버리스 A2A 게이트웨이를 제안했습니다. 모델 외부의 지침, 기억, 통신이 독립된 시스템 구성 요소로 자리 잡고 있습니다.
- 스킬 최적화: 사람이 감으로 고치던 지침 파일을 평가 결과에 따라 반복 개선합니다.
- 장기 기억 관리: 구체적 사건과 추상적 지식을 균형 있게 보존하는 표현을 연구합니다.
- 에이전트 간 통제: 여러 에이전트의 발견, 라우팅, 인증과 접근 제어를 중앙 게이트웨이로 다룹니다.
출처: SkillOpt: Agent skills as trainable parameters — Microsoft Research, Memora: A Harmonic Memory Representation Balancing Abstraction and Specificity — Microsoft Research, Building a serverless A2A gateway for agent discovery, routing, and access control — AWS Machine Learning Blog
다음 주 주목할 것
- GPT-5.6의 Sol·Terra·Luna 계층이 실제 API 가격과 latency, 코딩 에이전트 기본 모델 선택에 어떤 변화를 만드는지
- ChatGPT Work와 Claude Cowork가 장기 작업의 권한·승인·실패 복구 방식을 어떻게 구체화하는지
- GPT-Live의 실시간 음성 안전 정책이 API와 타사 음성 에이전트 생태계로 확장되는지
- CodeQL의 프롬프트 인젝션 탐지가 실제 저장소와 CI에서 어떤 오탐·탐지 사례를 만드는지
- Cloudflare의 AI 트래픽 분류와 x402 과금이 콘텐츠 제공자·에이전트 사업자의 실제 계약으로 이어지는지
다음 주 월요일에 다시 돌아옵니다. — 에이브랜치