No. 137

에이전트에게 열쇠를 맡깁니다 — GPT-5.6⁠·고용⁠·Instinct

GPT-5.6는 하네스에서 비용을 줄이고, 주니어 고용은 19 % 낮아지고, Instinct는 약관으로 경보를 켭니다.

오늘의 핵심

오늘의 흐름은 에이전트에게 어떤 열쇠를 맡길지가 성능·고용·사생활을 한꺼번에 움직인다는 것입니다. 오픈AI는 GPT-5.6 계열을 AWS의 개발 에이전트 Kiro에 넣으며 구조화된 맥락이 비용을 크게 줄인다고 밝혔고, 스탠퍼드는 AI 노출 직군 22~25세 고용이 비노출 직군보다 19 % 낮아졌다는 갱신 판을 냈습니다. 같은 날 개인 어시스턴트 Instinct는 마법 같다는 찬사와 영구 라이선스 약관 논란을 동시에 받았습니다.


GPT-5.6는 Kiro 안에서 토큰값을 다시 셉니다

오픈AI는 GPT-5.6 계열(Sol·Terra·Luna)을 AWS의 소프트웨어 개발 에이전트 Kiro에 넣었다고 발표했습니다. 요구사항·기술 설계·작업 단위로 맥락을 먼저 정리해 주는 스펙 주도 방식이 모델을 받쳐, 같은 일을 더 적은 비용으로 끝냅니다.

  • 약 82 % 비용 감소: Terminal⁠-⁠Bench 2.1에서 GPT-5.6 Terra가 Kiro 안에서 성공한 과제를 완수할 때 비용이 대략 82 % 줄었다고 적었습니다. 오픈AI와 AWS는 Kiro 환경과 모델을 같이 최적화했습니다.
  • 검문소가 있는 자율성: 제품 아이디어를 구현 계획으로 바꾸고, 다단계 코딩을 맡기고, 속성 기반 테스트로 정합성을 확인하고, 변경 전 체크포인트에서 검수하게 합니다. 문을 다 여는 방식이 아니라 검문소를 세우는 방식으로 자율성을 넓힙니다.
  • 하네스 경쟁의 확장: 어제 Ox Alpha가 라우터에서 먼저 나타났다면, 오늘은 개발 에이전트 환경이 모델의 성적표를 다시 씁니다. 토큰당 성능이 아니라 환경까지 합친 가성비가 채택 조건이 됩니다.
📢 같은 모델도 어떤 하네스에 들어가느냐로 영수증이 달라집니다. 개발 도구를 고르는 일이 모델을 고르는 일과 같은 자리로 올라왔습니다.

출처: Advancing price-performance for developers with GPT-5.6 in Kiro⁠—⁠OpenAI


허깅페이스는 130억 달러 매물이 아니라 기반시설입니다

비즈니스 인사이더는 허깅페이스가 130억 달러 안팎의 기업가치로 인수 제안을 받았고, 은행들과 제안 검토를 논의 중이라고 전했습니다. 테크크런치는 협상 상대와 성사 여부는 확인되지 않았다고 짚었습니다.

  • 3년 만에 약 3배: 2023년 마지막 투자 때 포스트머니 기업가치는 45억 달러였습니다. 올해 초에는 70억 달러 가치를 매긴 엔비디아의 5억 달러 투자를 지배적 투자자 문제로 거절한 이력도 있습니다.
  • 커뮤니티가 곧 책임: CEO 클레망 들랑게는 수익성에 가깝다며, 사용자가 모델과 데이터를 맡긴 플랫폼의 장기 책임을 강조했습니다. 공동체 인프라가 매물로 오르는 것 자체를 부담으로 보는 시각입니다.
  • 기반시설 인수 시즌: 스트라이프가 라우터 OpenRouter를 70억 달러에 인수하기로 한 흐름과 겹칩니다. 토큰이 흐르는 관문의 다음 역이 모델 허브라는 계산이 시장에 나와 있습니다.
📢 라우터에 이어 허브까지 인수 대상이 되는 이유는 같습니다. 모델을 다시 훈련하는 것보다, 모델이 지나가는 관문을 사는 게 싸 보입니다.

출처: Hugging Face reportedly in talks to be acquired for $13B⁠—⁠TechCrunch


스탠퍼드 갱신 판: AI 노출 직군 주니어 고용이 19 % 낮습니다

스탠퍼드 경제학자팀의 ‘Canaries in the Coal Mine’ 2026년 8월 판은 작년 논문을 새 데이터와 정제된 통계로 갱신했습니다. AI 영향을 많이 받는 직군의 22~25세 고용이, 덜 받는 직군 또래보다 19 % 낮다는 결론은 작년 13 %보다 벌어졌습니다.

  • 급여 데이터로 본 사다리: ADP가 집계하는 익명화 고빈도 급여 데이터를 쓰고, AI 노출도는 기존 노동시장 영향 지표와 실제 Claude 사용을 반영한 앤트로픽 경제지수를 함께 봤습니다.
  • 2022년 이후 누적: 청년 고용은 노출 상위 40 % 직군에서 약 11 % 줄었고, 하위 60 % 직군에서는 10 % 늘었습니다. 연장자 세대는 지금까지 거의 무영향입니다.
  • 전체는 고요, 입구는 요동: 경제 전체로는 고용 차이가 크지 않지만, 입사 연차가 얇은 자리부터 대체 압력이 보입니다. 사다리가 아래 칸부터 걷히는 그림입니다.
📢 AI 고용 충격은 아직 실업률 전체가 아니라 입구에서 먼저 나타납니다. 신입 교육이 조직의 미래 인력 투자라면, 지금 그 투자가 비워지고 있습니다.

출처: AI is hitting entry-level jobs hardest, Stanford study finds⁠—⁠Ars Technica, Canaries in the Coal Mine?⁠—⁠Stanford Digital Economy Lab


ChatGPT Work는 비개발자 책상으로 에이전트를 옮깁니다

테크크런치는 오픈AI가 개발자용 Codex를 변형한 ChatGPT Work로 화이트칼라 전 직군을 노린다고 분석했습니다. 데스크톱 앱 수석 엔지니어는 메일·Slack·전화·Notion·Figma를 에이전트에 연결하고 “일을 위해서라면 개인적 손해를 감수하겠다”고 말했습니다.

  • 월 20달러의 확장: 지난달 나온 ChatGPT Work는 최저 구독에서도 쓸 수 있습니다. 오래 도는 에이전트일수록 토큰을 더 태워, 사용자당 매출 구조에 유리합니다.
  • 코딩 다음은 문서 작업: 회계·투자·의사처럼 컴퓨터로 일하는 직군에 다단계 과제를 맡기는 게 목표입니다. 오픈AI 안에서도 커뮤니케이션·재무 팀이 먼저 쓰기 시작했다고 전했습니다.
  • 수직 경쟁자의 벽: 법률의 Harvey, 영업의 Clay처럼 모델 중립으로 붙는 회사들이 이미 자리를 잡았습니다. 카탈리니는 핵심 보완자산을 잡지 못하면 가치가 다른 곳으로 흐른다고 경고했습니다.
📢 에이전트의 시장은 코드 편집기 안에서 이미 증명됐습니다. 남은 질문은 성능이 아니라, 비개발자가 무엇을 맡길 신뢰의 근거를 주느냐입니다.

출처: OpenAI is building AI agents for everything. Will everyone use them?⁠—⁠TechCrunch


General Intuition는 게임 액션 라벨을 로봇 손으로 옮깁니다

테크크런치는 General Intuition가 60억 달러 프리머니 기업가치로 새 투자를 협의 중이라고 전했습니다. 새 투자자로 Valor Equity Partners, Point72 Ventures, Seven Seven Six가, 기존의 Khosla Ventures와 General Catalyst가 참여합니다.

  • 몇 주 만의 2.6배: 6월에 23억 달러 기업가치로 3억 2천만 달러를 받은 뒤 이어지는 협의로, 거래에 가까운 소식통은 초과 청약 상태라고 전했습니다.
  • 게임 클립이 교재: 작년 10월 게임 클립 플랫폼 Medal에서 스핀아웃했고, 수억 시간 플레이 영상과 어떤 버튼을 언제 눌렀는지의 액션 라벨을 초기 데이터로 씁니다. 코슬라는 이 라벨이 ‘직관의 창발’ 열쇠라고 봤습니다.
  • 자금은 로봇으로: 범용 모델 개선과 로봇 구현체 연구, 컴퓨트(CoreWeave 협력)와 채용에 쓸 계획입니다. 시뮬레이션에서 배운 이동 능력을 물리 세계로 옮기는 단계입니다.
📢 물리 AI의 학습 데이터는 창고가 아니라 게임 기록에서 나오고 있습니다. 플레이 영상과 액션 라벨이 로봇의 교과서가 되는 속도에 투자가 따라붙습니다.

출처: Valor, Point72 back General Intuition at $6B valuation as AI startup pushes into robotics⁠—⁠TechCrunch


대만 기소: B300 서버 74대가 중국으로 넘어갔습니다

대만 커룽(Keelung) 검찰은 미국 수출 통제를 위반해 고사양 AI 서버를 중국에 넘긴 혐의로 9명을 배임·문서위조 혐의로 기소했습니다. 대만 플러스와 로이터는 피의자에 엔비디아 시니어 매니저와 슈퍼마이크로 직원 2명이 포함된다고 전했습니다.

  • 130대 중 74대 반출: 공범들은 B300 서버 130대를 대만 시설에 설치·가동한 것처럼 서류를 조작했습니다. 이 중 74대는 중국 고객에게 전달됐고, 56대는 세관이 이상을 감지해 막았습니다.
  • 이어지는 수사: 미국은 3월 슈퍼마이크로 공동창업자 월리 리아오를 2024년부터 25억 달러 규모 서버 밀수 혐의로 체포한 바 있습니다. 대만 수사는 최소 12곳을 압수수색했습니다.
  • 회사의 입장: 슈퍼마이크로는 협조 중이며 회사 자체는 수사 대상이 아니라고 밝혔습니다. 젠슨 황은 5월 슈퍼마이크로에 문제를 해결하라고 촉구한 이력이 있습니다.
📢 최신 가속기의 수요 격차가 클수록, 통제의 실제 효력은 관세율이 아니라 물류 현장의 서류 검증에 달립니다. 밀수 뉴스는 곧 희소성 뉴스입니다.

출처: Nvidia senior manager linked to Supermicro scheme smuggling AI servers to China⁠—⁠Ars Technica


Instinct는 마법 같다는 찬사와 영구 라이선스 논란을 같이 받습니다

아직 비공개 테스트인 개인 어시스턴트 Instinct가 ‘마법 같다’, ‘OpenClaw 이후 가장 설렌다’는 반응과 함께 프라이버시 논란에 올랐습니다. 전 시에라 연구원 노아 신이 이끄는 샌프란시스코 팀이 만들었습니다.

  • 사생활 전체를 연결: 이메일·메시지·캘린더와 기기의 오디오·위치·화면·커서·키보드 입력까지 읽고, 문자와 WhatsApp으로 지시를 받아 예약·쇼핑·정리를 대신합니다.
  • 영구·철회 불가 라이선스: 이용약관은 사용자 자료에 대해 접근·저장·복제·게시·수정까지 포함한 영구 권한을 회사에 주고, 모델 학습에도 쓸 수 있게 허용합니다. 사용자를 대리해 구속력 있는 계약도 맺을 수 있습니다.
  • 끊어도 남는 흔적: 접속을 끊은 뒤에도 수신함 요약이 이어진 사례, 삭제 요청이 거부된 Gmail 기록 사례가 공개됐습니다. 팀은 뒤늦게 외부 데이터 삭제 도구를 추가했습니다.
📢 자율성의 대가는 청구서가 아니라 약관에서 먼저 청구됩니다. 무엇을 읽고 무엇을 지우는지가 제품 데모만큼 중요한 시대입니다.

출처: Instinct’s powerful AI assistant is raising privacy and security concerns⁠—⁠TechCrunch


AI 코드 리뷰 400번: 반복 리뷰는 커버리지, 수정 루프는 부채입니다

긱뉴스에 오른 edgelog의 실험 기록은 ‘AI 리뷰를 몇 번 돌려야 하나’를 약 400회의 LLM 호출로 측정했습니다. 결론은 리뷰 반복과 리뷰-수정 루프가 전혀 다른 일이라는 것입니다.

  • 34 %→61 %→76 %: 같은 코드를 그대로 두고 리뷰만 반복하면 실제 결함 커버리지가 오릅니다. 어떤 결함은 10번 중 1번만 발견됐습니다.
  • 수정 루프의 역설: 리뷰-수정 루프를 섞자 계약 준수율 개선은 0이었고 코드량만 24~152 % 불어났습니다. 조용해진 리뷰어도 구조화된 프롬프트를 주면 다른 실패 모드를 계속 찾아냈습니다.
  • 가장 강한 처방은 저장소 접근: 파일 하나만 줬을 때 오탐률은 29 %였지만, 호출자·헤더·초기화 경로를 읽게 하자 같은 오탐 4개가 두 모델 모두에서 사라졌습니다. 반복 횟수보다 맥락이 먼저입니다.
📢 AI 리뷰의 수확 체감은 호출 횟수가 아니라 리뷰어에게 어떤 맥락을 여느냐로 결정됩니다. 고치라고 시키기 전에, 읽을 공간부터 열어주는 게 순서입니다.

출처: AI 코드 리뷰는 몇 번 돌려야 할까⁠—⁠edgelog.dev


SonicMoE 해부: MoE 시대의 병목은 점점 커널로 내려갑니다

트릴리언 랩스의 긴 글은 SonicMoE를 사례로 GPU 커널 설계가 왜 연구 속도와 비용을 가르는지 풀었습니다. 프롤로그·메인루프·에필로그로 나눠 병목이 연산인지 메모리 접근인지부터 진단합니다.

  • 학습 특유의 벽: 역전파를 위해 activation을 보관해야 해서, 대규모 언어 모델에서는 모델 파라미터보다 activation 메모리가 더 큰 경우가 많습니다. 체크포인팅으로 메모리와 재계산을 맞바꿉니다.
  • MoE는 이동이 문제: 최신 프론티어 모델은 전문가를 작고 많이 쓰는 방향으로 갔고, 토큰마다 전문가를 고르며 중간 텐서와 GPU 간 데이터 이동이 늘었습니다. 같은 구조라도 커널 설계에 따라 학습 효율이 갈립니다.
  • 몇 %가 수백 시간: GPU는 가장 비싼 연구 자원이라, 학습 속도를 몇 %만 올려도 수백 GPU 시간이 절약됩니다. 모델 구조만큼 시스템 최적화가 경쟁력이라는 정리입니다.
📢 모델 구조 논쟁이 fine-grained MoE로 수렴할수록, 다음 병목은 아래 층으로 내려갑니다. 연구 차이는 논문의 아이디어가 아니라 커널 프로파일에서 나기 시작합니다.

출처: SonicMoE로 보는 GPU 커널 최적화⁠—⁠Trillion Labs Research


Gemma 4 Good 챌린지, 로봇 팔이 1등을 받았습니다

구글은 Kaggle에서 진행한 Gemma 4 Good 챌린지의 수상작을 공개했습니다. 제약 있는 일상 하드웨어에서 돌아가는 모델 활용이 조건이었고, 참가자들은 LiteRT·Cactus·Ollama·llama.cpp·Unsloth를 썼습니다.

  • 1등 GEM-4: Gemma 4 31B가 영상 훈련 클립에 라벨을 붙이고, 경량 E2B 컨트롤러가 시각 관찰과 언어 지시를 물리 동작으로 바꿉니다. 노약자·장애인의 일상 동작을 돕는 로봇 파이프라인입니다.
  • 2·3등도 로컬 우선: 음성으로 조종하는 교육용 화이트보드 Trido는 저사양 노트북에서 로컬 E2B로 마인드맵과 퀴즈를 만듭니다. 야생 생태 연구용 PenguinAgent는 SAM 3와 SigLip 2 입력을 26B 모델로 합쳐 오프라인 분석을 지원합니다.
  • 공통분모는 배치: 수상작 모두 데이터가 로컬에 머물고 저전력 기기에서 돌아가게 만들었다는 점이 겹칩니다. 튜닝과 도구 체인이 아니라 사용 현장의 제약을 먼저 설계한 결과입니다.
📢 오픈 모델의 승부처는 벤치마크 점수가 아니라 누구의 기기에서 돌아가는지입니다. 관문을 지나지 않아도 쓸 수 있는 모델의 쓰임이 먼저 늘고 있습니다.

출처: How developers build AI for good with Gemma 4⁠—⁠Google Blog


오늘의 도구 추천

srelens — Rust 코어로 만든 로컬 우선 쿠버네티스 컨트롤룸입니다. Tauri v2와 React 19로 여러 클러스터의 조사·분석·안전한 조치를 한 창에서 처리하고, MCP 서버를 얹어 AI 에이전트에게도 같은 시야를 줍니다. SRE와 플랫폼 엔지니어가 터미널·대시보드·로그를 오가며 맥락을 잃는 문제를 데스크톱 하나로 줄이려는 시도라, 에이전트 운영자에게 특히 눈여겨볼 만합니다.


에디터 노트

어제는 일을 어디로 보낼지가 제품이라고 적었습니다. 오늘은 그 다음 질문입니다. 어떤 열쇠를 맡길지가 곧 제품의 가격이자 위험입니다. Kiro는 요구사항이라는 검문소를 세우고 비용 82 %를 돌려받았고, Instinct는 같은 권한을 약관부터 넓혀 경보를 받았습니다. 스탠퍼드 장부는 그 이득이 가장 아래 칸 사다리부터 흔들고 있다고 적습니다.

허깅페이스 협상은 반대 방향의 같은 질문입니다. 커뮤니티가 맡긴 모델과 데이터라는 열쇠를, 이번엔 누가 보관할지가 130억 달러의 조건이 됐습니다. 도구를 고르든 회사를 사든, 오늘의 판단 기준은 하나로 모입니다. 맡긴 열쇠를 되돌려 받을 절차가, 그 문서의 어디에 있는지입니다.

다음에 또 찾아옵니다. — 에이브랜치