No. 121

AI의 다음 병목은 실행 구조입니다 — 확산형 생성⁠·한국어 모델⁠·에이전트 검증

확산형 언어 모델의 속도 도약과 한국어 경량 모델, 장기 실행 에이전트의 검증 구조를 짚습니다.

오늘의 핵심

오늘의 흐름은 AI 경쟁의 병목이 답변을 만드는 모델에서 그 답변을 빠르고 오래, 검증 가능하게 실행하는 구조로 이동하고 있다는 것입니다. 구글 딥마인드의 디퓨전젬마는 토큰을 순서대로 만드는 관행에 도전했고, 크래프톤과 카카오는 한국어 음성·경량 모델의 배포 선택지를 넓혔습니다. 에이전트 연구에서는 상태를 외부에 두고, 실행 결과를 독립 검증하며, 스킬 변경의 효과까지 측정하는 방법이 구체화되고 있습니다.


구글 딥마인드 디퓨전젬마, H100 한 장에서 초당 약 1,500 토큰 생성

구글 딥마인드 연구진이 다음 토큰을 하나씩 예측하는 대신 256개 토큰 블록을 반복해서 다듬는 오픈웨이트 언어 모델 디퓨전젬마(DiffusionGemma)를 공개했습니다. 평균적으로 한 번의 순전파에서 약 20개 토큰을 만들며, 단일 엔비디아 H100에서 초당 약 1,500개 출력 토큰을 기록했습니다.

  • 확산형 디코딩: 여러 토큰을 병렬로 수정해 자기회귀 모델의 순차 생성 병목을 줄입니다.
  • 효율적 전환: 25.2B 전체·3.8B 활성 파라미터의 젬마 4를 출발점으로 삼아, 원 모델 학습 토큰 예산의 10% 미만으로 전환했습니다.
  • 기능 유지: 사고 모드와 멀티모달 입력, 긴 문맥을 유지하면서 자기회귀 생성도 작은 성능 저하로 지원합니다.
📢 생성 속도가 모델 크기와 별개의 경쟁 축이 되면 실시간 에이전트와 대량 배치 작업의 원가는 더 좋은 GPU보다 디코딩 방식을 어떻게 설계했는지에 따라 달라집니다.

출처: DiffusionGemma Technical Report — Google DeepMind on arXiv


크래프톤, 한·영 음성 이해와 생성을 묶은 A.X K2 Raon-Speech 공개

크래프톤이 약 21.2B 전체·3.5B 활성 파라미터의 한국어·영어 이중언어 음성 언어 모델 A.X K2 Raon-Speech를 공개했습니다. 음성 인식과 합성, 음성 질의응답, 멀티모달 대화와 도구 호출을 하나의 체크포인트에서 처리합니다.

  • 통합 음성 모델: SK텔레콤 A.X K2 Light 텍스트 백본에 자체 학습한 음성 인코더와 오디오 코덱을 결합했습니다.
  • 한국어 성능: 30B 이하 공개 음성 언어 모델 비교에서 한국어 종합 점수 0.72로 1위를 기록했다고 밝혔습니다.
  • 배포 조건: 체크포인트는 CC BY-NC 4.0으로 제공되며, BF16 가중치가 약 42.4 GB라 80 GB GPU 또는 다중 GPU 구성이 권장됩니다.
📢 한국어 음성 AI가 인식과 합성을 따로 조립하는 단계에서 대화·감정·도구 호출을 한 모델로 묶는 단계로 넘어가면서 국내 서비스의 음성 에이전트 실험 비용이 낮아집니다.

출처: A.X K2 Raon-Speech — KRAFTON on Hugging Face


카카오 카나나-2, 1.3B까지 압축한 한국어 경량 모델 4종 공개

카카오가 카나나-2 SLM의 3B·1.3B 베이스와 인스트럭트 모델 4종을 공개했습니다. 3B 모델을 직접 사전학습한 뒤 단계적 가지치기와 증류로 1.3B 모델을 만들고, 긴 문맥의 메모리 비용을 줄이는 혼합 어텐션 구조를 적용했습니다.

  • 온디바이스 지향: 1.3B 인스트럭트 모델을 기기 내 배포가 가능한 선택지로 제시했습니다.
  • 긴 문맥 효율: 32K 문맥에서 슬라이딩 윈도 어텐션을 사용해 전체 어텐션만 쓸 때보다 KV 캐시를 최대 약 72.7% 줄였다고 보고했습니다.
  • 한국어 토큰화: 이전 세대보다 한국어 토큰화 효율을 30% 이상 개선했고, 사전·사후 학습에 카카오 사용자 데이터는 쓰지 않았다고 명시했습니다.
📢 작은 한국어 모델의 가치는 단순히 파라미터 수를 줄이는 데 있지 않고, 긴 문맥과 도구 호출을 유지하면서 사내·기기 환경에 실제로 배포할 수 있는 비용선을 만드는 데 있습니다.

출처: Kanana-2 SLM — Kakao Corp. on Hugging Face


오픈AI, ChatGPT Work의 반복 업무를 재사용 가능한 스킬로 전환

오픈AI 아카데미가 ChatGPT Work로 여러 자료를 모아 장기 프로젝트를 수행하고, 검토를 거친 흐름을 재사용 가능한 스킬로 바꾸는 실습을 공개했습니다. 단발성 대화와 장기 실행 작업을 구분하고 결과를 확인·수정하는 과정을 제품 사용의 핵심으로 제시합니다.

  • 작업 선택: 짧은 질문은 Chat, 여러 자료와 단계가 필요한 프로젝트는 Work로 구분하는 기준을 다룹니다.
  • 완결형 사례: 흩어진 자료로 오프사이트 계획 워크북을 만들고 업무 데이터에서 리더십 프레젠테이션을 완성하는 흐름을 보여줍니다.
  • 스킬 전환: 반복 가능한 작업 절차를 스킬로 저장해 다음 프로젝트에서 같은 검토 지점을 재사용합니다.
📢 기업형 AI의 가치는 한 번의 좋은 답변보다 여러 자료를 다루는 절차와 검토 기준을 재사용 가능한 운영 자산으로 축적할 때 커집니다.

출처: Get started with ChatGPT Work — OpenAI Academy


EU, AI 리터러시 의무의 감독·집행 단계 진입

유럽연합 집행위원회가 AI 시스템 제공자와 도입 조직의 직원 교육 의무에 대한 감독·집행 규칙이 8월 3일부터 적용된다고 안내했습니다. 특정 교육 시간이나 단일 자격을 요구하지는 않지만, 조직은 사용자의 지식과 경험, AI 시스템의 위험을 고려해 리터러시 조치를 마련해야 합니다.

  • 의무는 유지: 디지털 옴니버스 개정 뒤에도 제공자와 배포자의 AI 리터러시 지원 의무는 남았습니다.
  • 고정 기준은 없음: 모든 조직에 동일한 ‘충분한 수준’을 강제하지 않고 역할과 위험에 맞는 조치를 요구합니다.
  • 운영 증거 필요: 정책 문서만 갖추기보다 실제 사용자가 모델의 한계와 검토 책임을 이해하도록 교육·사례·절차를 연결해야 합니다.
📢 AI 교육이 권장 활동에서 감독 가능한 운영 의무로 바뀌면 기업은 도구를 배포한 사실뿐 아니라 누가 어떤 위험을 이해하고 사용할 수 있는지를 증명해야 합니다.

출처: AI Literacy — Questions & Answers — European Commission


LongHorizon-Harness, 에이전트 상태를 대화 밖으로 꺼내 성능 향상

LongHorizon-Harness 연구진이 장기 작업의 핵심을 더 긴 문맥이 아니라 명시적인 상태 관리 문제로 재정의했습니다. 관리자·실행자·감사자로 역할을 나누고, 환경에서 독립적으로 확인된 사실만 외부 상태에 반영하는 Manage-Execute-Audit 루프를 제안했습니다.

  • 신선한 실행 문맥: 실행자는 매 단계 필요한 하위 작업만 받아 누적된 자기평가 오류의 영향을 줄입니다.
  • 읽기 전용 감사: 다음 단계로 넘어가기 전에 별도 감사자가 실제 환경 상태를 확인합니다.
  • 벤치마크 향상: Qwen 3.7 Plus는 WeaveBench에서 51.8%에서 80.7%, Terminal-Bench 2.1에서 69.7%에서 77.2%로 올랐습니다.
📢 장기 에이전트의 신뢰성은 모든 기억을 한 대화에 쌓는 데서 나오지 않고, 작업 상태와 실행 증거를 분리해 다음 단계의 입력을 깨끗하게 유지하는 데서 나옵니다.

출처: LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks — arXiv


DeepVoyager-VL, 검색 중간 단계에도 이미지를 다시 불러오는 멀티모달 에이전트

베이징대 연구진 등이 긴 검색 과정에서 이미지가 첫 입력이나 최종 답변에만 머물지 않고 다음 검색을 결정하는 증거로 작동하도록 한 DeepVoyager-VL을 제안했습니다. 에이전트가 필요한 시점에 이미지를 다시 불러오고 시각 증거를 따라 후속 검색을 이어갑니다.

  • 비전 인 더 루프: 텍스트 추론 도중 능동적으로 이미지를 획득하고 필요한 시각 정보를 다시 읽습니다.
  • 긴 탐색 데이터: 중간 시각 의존성과 긴 추론 사슬을 포함한 문제를 멀티모달 이벤트 그래프로 합성했습니다.
  • 10개 벤치마크: 강화학습 없이 합성 데이터로 미세조정한 뒤 10개 멀티모달 검색 평가에서 효과를 확인했습니다.
📢 멀티모달 에이전트가 실제 조사 도구가 되려면 이미지를 한 번 설명하는 능력보다 시각 증거가 부족할 때 스스로 다시 찾고 다음 질문을 바꾸는 능력이 중요합니다.

출처: DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents — Peking University et al. on arXiv


Skill-α, 에이전트 스킬의 각 편집이 실제 성공률을 높였는지 측정

중국홍콩대 연구진 등이 문서나 실행 경험에서 에이전트 스킬을 만드는 과정을 연속적인 편집 문제로 다루는 Skill-α를 제안했습니다. 변경 전후의 스킬로 같은 고정 질의를 실행해 결과를 비교하는 ‘롤백 보상’으로 각 편집의 가치를 평가합니다.

  • 편집 단위 학습: 완성된 스킬 전체를 한 번에 채점하지 않고 개별 변경이 하위 작업에 미친 영향을 봅니다.
  • 두 가지 입력: 문서에서 스킬을 만들거나 실제 실행 경험을 스킬로 정리하는 경우를 모두 다룹니다.
  • 성공률 개선: GPT-4o 작업자 기준으로 강한 기존 방법보다 CL-Bench에서 3.3%p, tau2-bench에서 6.7%p 높였습니다.
📢 스킬 파일이 늘어날수록 중요한 것은 지침을 더 길게 쓰는 일이 아니라 한 줄의 변경이 실제 작업 성공률을 높였는지 재현 가능한 질의로 확인하는 일입니다.

출처: Progressive Agent Skill Generation via Reinforcement Learning — CUHK Database Group et al. on arXiv


메타라우팅 연구, 에이전트 작업 선택은 비용과 문장 변화에 함께 흔들려

에이전트가 바로 답할지, 검색·코드 실행·위임·검증을 조합할지 고르는 예산 인식 메타라우터와 실행형 벤치마크가 제안됐습니다. 학습된 라우터는 익숙한 테스트에서는 높은 성공률과 낮은 비용을 보였지만 표현이 바뀐 도전 세트에서는 정적 규칙보다 크게 약해졌습니다.

  • 실행 결과 채점: 선택한 작업을 실제로 수행한 뒤 결과를 기계적으로 확인합니다.
  • 비용 절감: 보류 테스트에서 정적 워크플로보다 비용을 43% 줄이면서 100% 성공했습니다.
  • 일반화 한계: 어휘가 달라진 도전 세트에서는 성공률이 75.9%로 내려가 정적 라우팅의 93.5%에 미치지 못했습니다.
📢 에이전트 라우팅은 평균 비용을 줄이는 것만으로 완성되지 않으며, 사용자가 같은 의도를 다른 말로 표현해도 안전한 실행 경로를 고르는지 별도로 시험해야 합니다.

출처: Learning Compositional Meta-Routing for Agentic Workflows — arXiv


Leak It, 평균 점수에 가려진 문서별 학습 데이터 유출을 추적

블랙박스 언어 모델에서 여러 출력을 샘플링해 학습 문서의 식별자가 그대로 재생성되는지를 측정하는 연구와 감사 도구 Leak It이 공개됐습니다. 연구진은 전체 AUC 하나로 유출 위험을 요약하면 일부 문서에서 발생하는 실제 원문 추출을 놓칠 수 있다고 지적했습니다.

  • 문서별 귀속: 잘못된 접두어 대조군과 비교해 특정 문서 때문에 식별자가 재생성됐는지 확인합니다.
  • 모델 규모 효과: Pythia에서 문서별 식별자 유출은 410M의 5.6%에서 6.9B의 16.6%로 증가했습니다.
  • 도메인 차이: 식별자 유출은 코드에서 일반 문장보다 약 3배 강했고, 16토큰 접두어만으로도 관찰됐습니다.
📢 개인정보 감사가 평균 공격 정확도만 보면 다수의 안전한 문서가 소수의 심각한 원문 유출을 가리므로, 모델 평가는 문서·도메인별 추출 가능성을 함께 보고해야 합니다.

출처: Leak It: A Probabilistic Approach to Training-Data Extraction from Black-Box Language Models — arXiv


오늘의 도구 추천

LobeHub — 여러 AI 에이전트를 팀처럼 구성하고 예약 실행, 프로젝트·워크스페이스, 보고와 편집 가능한 개인 메모리를 한곳에서 관리하는 오픈소스 에이전트 운영 도구입니다. 사용자가 계속 접속하지 않아도 정해진 시간에 작업을 실행하면서 소유권과 상태를 볼 수 있어, 오늘 뉴스가 공통으로 보여준 ‘모델보다 실행 구조’라는 변화를 직접 시험하기 좋습니다.


에디터 노트

오늘은 서로 다른 층의 기술이 같은 방향을 가리켰습니다. 디퓨전젬마는 토큰 생성 순서를 바꿔 속도의 상한을 밀었고, 국내 모델은 한국어 음성과 기기 내 실행의 비용을 낮췄습니다. 에이전트 연구는 더 긴 프롬프트 대신 외부 상태, 독립 감사, 스킬 변화 측정과 라우팅 일반화를 다루기 시작했습니다.

이 변화가 말해주는 것은 분명합니다. 좋은 AI 제품은 가장 강한 모델을 붙인 제품이 아니라 생성·상태·권한·검증을 각각 측정 가능한 구조로 만든 제품입니다. 모델이 빨라지고 작아질수록 차이는 답변 한 번의 품질보다 며칠 동안 작업을 이어가도 상태를 잃지 않고, 잘못된 실행을 발견하며, 결과의 근거를 되짚을 수 있는지에서 벌어집니다.

다음에 또 찾아옵니다. — 에이브랜치