No. 131

목표와 실행 조건이 맞아야 성능이 됩니다 — 증류⁠·양자화⁠·예측⁠·로봇의 정렬

추측 디코딩부터 임상 예측, 보안 토폴로지와 로봇 시연까지 목표와 실행 조건의 정렬을 살핍니다.

오늘의 핵심

오늘의 흐름은 학습 때 최적화한 목표와 실제 실행 때 마주치는 조건이 어긋나면 좋은 점수도 성능으로 이어지지 않는다는 것입니다. 미래 프레임을 본 교사로 인과적 비디오 모델을 가르치거나, 평균 분산을 줄인 회전으로 토큰별 양자화를 최적화하면 수학적 목표는 달성해도 실제 추론은 나빠질 수 있습니다. 반대로 디코딩 경로, 환자 사건, 보안 정책과 로봇의 손 기술을 실행 조건에 맞춰 설계하면 더 작은 모델과 적은 감독으로도 신뢰할 수 있는 결과를 만들 수 있습니다.


DARTree는 초안 토큰을 나무로 펼쳐 손실 없이 최대 9.73배 빠르게 생성합니다

DARTree는 확산 모델이 한 번에 제안한 토큰을 단일 사슬로 고치지 않고, 자기회귀 보정 헤드를 후보 나무 전체에 적용하는 학습 없는 추측 디코딩 방식입니다. 깊이마다 모든 노드를 한 배치로 점수화한 뒤 검증할 경로만 선택합니다.

  • 검증 한 번에 최대 12.97 토큰 수락: 같은 설정에서 DFlash보다 98.6 %, Domino보다 27.9 % 더 긴 수락 길이를 기록했습니다.
  • 수학·코드·대화 7개 벤치마크: 4개 모델·온도 조합 모두에서 평균 수락 길이와 속도 향상이 가장 높았습니다.
  • 원래 분포를 보존하는 가속: 자기회귀 모델의 출력을 바꾸지 않으면서 로컬 기준 최대 9.73배 속도를 보고했습니다.
📢 생성 가속의 병목은 초안을 빨리 만드는 것만이 아니라, 후보마다 앞서 선택된 토큰의 조건을 유지한 채 많은 경로를 한꺼번에 검증하는 데 있습니다.

출처: DARTree⁠—⁠arXiv


1B 모델 Mimir는 허용 가능한 데이터만으로 덴마크어 최고 성능을 겨냥합니다

DFM Mimir v1은 계층적 추론 모델 구조를 사용해 처음부터 학습한 10억 파라미터 언어 모델입니다. 연구팀은 출처와 사용 조건을 확인할 수 있는 사후 학습 데이터만으로 영어·수학·코드와 덴마크어 능력을 함께 끌어올렸습니다.

  • 161개 데이터셋으로 학습: 비허용 데이터에 의존하지 않는 공개 모델 개발 경로를 제시했습니다.
  • 20개 벤치마크에서 비교: 기존 HRM⁠-⁠Text 1B를 앞서고 Qwen 3.5 4B, Gemma 4 E2B 같은 더 큰 모델과 경쟁했다고 보고했습니다.
  • 덴마크어에 집중한 공개 모델: 덴마크어 평가에서 새로운 최고 성능을 주장하며 가중치를 Hugging Face에 공개했습니다.
📢 작은 언어권의 모델 경쟁력은 무조건 더 많은 데이터를 모으는 데서만 나오지 않습니다. 데이터 사용 권리와 언어별 평가를 설계 목표로 고정하는 일이 모델의 실제 공공성을 만듭니다.

출처: DFM Mimir v1⁠—⁠arXiv


사전학습 데이터의 영향은 초반 문학에서 후반 STEM으로 이동합니다

Measuring Task⁠-⁠Agnostic Training Data Influence는 특정 다운스트림 과제를 고르지 않고도 각 학습 예시가 최종 모델로 가는 경로에 얼마나 기여했는지 추정합니다. 중간 체크포인트의 그래디언트가 최종 파라미터까지의 거리를 얼마나 줄였는지를 사용합니다.

  • 재학습 없이 영향 추정: 기존 학습 실행의 체크포인트만으로 데이터별 영향 변화를 계산합니다.
  • 18개 Pythia·PolyPythia 설정 분석: 모델 구성 전반에서 학습 단계에 따른 질적 변화가 반복됐습니다.
  • 영향 데이터의 시간적 교차: 초반에는 문학 관련 데이터가, 후반에는 STEM 데이터가 최종 파라미터 방향과 더 강하게 정렬됐습니다.
📢 데이터 가치는 고정된 품질 점수가 아닙니다. 같은 예시도 모델이 기초 표현을 만드는 시기와 전문 능력을 다듬는 시기에 서로 다른 역할을 하므로 학습 순서까지 데이터 전략에 포함해야 합니다.

출처: Training Data Influence⁠—⁠arXiv


방어적 부스팅은 예측 실패까지 사후 증거로 바꿉니다

Defensive Booster는 적응적으로 변하는 이진 결과를 온라인에서 확률 예측할 때, 기존 두 부스팅 방식이 따로 제공하던 보장을 한 알고리즘에 묶습니다. 잘 맞는 약한 가설이 있을 때는 오차를 줄이고, 없을 때도 최선의 결합 예측과 경쟁합니다.

  • 두 종류의 보장을 동시에 확보: 모든 시퀀스에서 Brier 점수를 통제하면서 약한 학습 조건이 성립하면 분류 오차도 같은 속도로 낮춥니다.
  • 실패를 hard⁠-⁠core 인증서로 변환: 높은 오차가 계속되면 현재 가설군으로는 약한 학습 조건이 성립하지 않는다는 사후 증거를 만듭니다.
  • 약한 학습기 하나만 유지: 큰 학습기 앙상블을 유지하는 기존 방식보다 계산 부담을 줄였습니다.
📢 신뢰할 수 있는 예측기는 맞았을 때의 점수뿐 아니라 틀렸을 때 무엇이 부족했는지를 설명해야 합니다. 실패 조건을 인증하는 장치가 운영 중 모델 교체와 인간 개입의 기준이 됩니다.

출처: Defensive Boosting⁠—⁠arXiv


임상 월드 모델은 수술 뒤 90일의 불규칙한 사건으로 위험을 갱신합니다

Intervention⁠-⁠Aware Clinical World Model은 시술 전 정보에서 결과를 한 번에 예측하지 않습니다. 기준 영상으로 만든 3D 잠재 상태를 약물 변경, 재시술, 생리 측정과 경과 시간 순서에 따라 계속 업데이트합니다.

  • 심방세동 절제술 회복을 모델링: DECAAF⁠-⁠II의 90일 회복 구간 기록을 장기 재발 위험에 반영했습니다.
  • 내부 반복 교차 검증: 재발 예측에서 AUROC 0.756, AUPRC 0.777을 보고했습니다.
  • 추론 때 후속 MRI 불필요: 학습 때만 후속 영상을 감독 신호로 쓰고, 추론에서는 흉터 범위 MAE 2.971 %p를 달성했습니다.
📢 의료 예측의 상태는 진료 첫날에 고정되지 않습니다. 비동기적으로 쌓이는 사건을 시간순으로 반영해야 모델의 위험 점수가 실제 치료 경로와 함께 움직일 수 있습니다.

출처: Clinical World Model⁠—⁠arXiv


TopoIntent는 자연어 보안 요구를 실행 가능한 네트워크로 컴파일합니다

TopoIntent는 사업 요구, 규제와 위험 가정을 네트워크 구역, 경계 장비, 경로와 접근 제어 정책으로 변환합니다. 스키마 계약과 참조 아키텍처 검색으로 생성을 제한한 뒤 CIS Controls 기준을 검사하고 Mininet·iptables로 내보냅니다.

  • 구조를 보존하며 누락을 추가 보수: 해결되지 않은 항목은 자동으로 감추지 않고 수동 검토 대상으로 표시합니다.
  • 실행 가능한 정책 테스트: 생성 결과에서 도달 가능성과 허용·차단 규칙을 직접 시험할 수 있습니다.
  • 보류 시나리오에서 검증: 토폴로지 수준 CIS 충족률을 0.78에서 1.00으로, 한 번의 피드백 뒤 ACL 정책 통과율을 0.78에서 0.88로 높였습니다.
📢 자연어에서 보안 설정을 생성하는 것보다 중요한 것은 생성물을 실행하고 위반을 재현하는 것입니다. 정책 의도와 실제 패킷 경로 사이에 테스트 가능한 계약이 필요합니다.

출처: TopoIntent⁠—⁠arXiv


CROP은 학생 모델이 배워야 할 토큰을 반사실 비교로 고릅니다

CROP은 학생 모델의 현재 출력 전체에 같은 비중으로 교사 신호를 주지 않습니다. 원문, 의미가 같은 바꿔쓰기와 의미가 달라진 반사실 질문을 비교해 과제의 의미 변화에 민감한 응답 위치를 선별합니다.

  • 불확실성과 과제 관련성을 분리: 단순히 교사와 학생이 다른 토큰이 아니라 입력 의미와 연결된 토큰을 찾습니다.
  • 같은 학생 롤아웃에서 비교: 출력 경로를 고정해 문장 변화가 각 위치에 미치는 영향을 측정합니다.
  • 두 교사·학생 설정에서 개선: 가장 강한 비⁠-⁠CROP 선별기보다 종합 성능을 각각 1.92점과 2.96점 높였습니다.
📢 지식 증류의 효율은 더 많은 정답 토큰을 복사하는 데 있지 않습니다. 과제의 조건이 바뀔 때 판단을 실제로 바꾸는 토큰에 감독을 집중해야 합니다.

출처: CROP⁠—⁠arXiv


비디오 학생 모델은 미래를 본 교사에게 배우면 인과성이 깨집니다

Context⁠-⁠Matched Distillation은 순차 비디오를 만드는 학생 모델을 전체 영상을 한꺼번에 보는 양방향 교사로 감독할 때 생기는 정보 불일치를 다룹니다. 각 프레임이 생성되는 시점에 알 수 있었던 과거와 제어 신호만 교사도 보게 합니다.

  • 교사와 학생의 정보 경계 통일: 인과적 교사로 초기화부터 증류, 추론까지 같은 시간 조건을 유지합니다.
  • 실제 생성된 접두사에서 채점: 학생이 만든 캐시 문맥 아래에서 다음 목표를 평가해 학습과 배포의 상태를 맞춥니다.
  • 짧고 긴 비디오 모두 확장: 프레임·청크 단위와 카메라 조건 생성에서 최신 자기회귀 방식 중 최고 수준의 종합 성능을 보고했습니다.
📢 배포 때 볼 수 없는 미래 정보로 학습 점수를 높이면 모델은 실제 실행에서 재현할 수 없는 규칙을 배웁니다. 감독 신호도 제품의 정보 시간표를 따라야 합니다.

출처: Context⁠-⁠Matched Distillation⁠—⁠arXiv


수학적으로 최적인 회전도 4비트 양자화에서는 더 나쁠 수 있습니다

RoPE⁠-⁠Aligned Q/K Rotations 연구는 RoPE의 2차원 주파수 쌍을 보존하며 채널 분산을 최소화하는 회전을 유도했습니다. 그러나 동적 W4A4KV4 양자화에 적용하자 전체 헤드를 섞는 Hadamard 방식보다 정확도가 나빠졌습니다.

  • 분석 목표는 정확히 최소화: 위치 평균 공분산에서 더 큰 채널 분산을 줄이는 각도를 수학적으로 구하고 구현이 이를 달성함을 확인했습니다.
  • 4개 체크포인트에서 perplexity 증가: 짧은 문맥과 긴 문맥 모두에서 쌍별 회전만 쓴 설정이 더 나빴습니다.
  • 목표 함수와 실제 스케일 규칙의 불일치: 평균 2차 모멘트를 줄였지만 양자화기는 토큰별 그룹 범위로 스텝을 정했습니다.
📢 최적화 대상이 실제 시스템의 오차를 만드는 변수와 다르면 증명된 최적해도 제품 성능을 해칩니다. 압축 기법은 대리 지표보다 런타임 스케일링 규칙에 맞춰 검증해야 합니다.

출처: RoPE⁠-⁠Aligned Q/K Rotations⁠—⁠arXiv


NestDex는 손 기술을 보조자로 써 로봇 시연의 부담을 줄입니다

NestDex는 사람이 로봇 팔과 모든 손가락을 동시에 조종하게 하지 않습니다. 작업자는 팔과 1자유도 클러치를 다루고, 내측 손 정책이 고유감각 이력에 맞춰 손가락 동작을 수행하며 비전·언어 선택기가 단계별 기술을 고릅니다.

  • 시연 수집과 배포 정책을 분리: 보조 기술로 모은 시연을 사용해 팔과 손을 함께 제어하는 외측 시각운동 정책을 학습합니다.
  • 배포 때 보조 정책 불필요: 최종 정책은 데이터 수집에 쓰인 내측 정책 없이 독립적으로 동작합니다.
  • 실물 정교 조작으로 평가: 연구팀은 시연의 신뢰성과 효율이 개선되고 자율 정책 학습으로 이어졌다고 보고했습니다.
📢 로봇 데이터의 품질은 사람에게 더 정밀한 조작을 요구한다고 높아지지 않습니다. 이미 배운 저수준 기술을 시연 인터페이스에 넣으면 사람은 과제 의도에 집중할 수 있습니다.

출처: NestDex⁠—⁠arXiv


오늘의 도구 추천

celld — Deno가 공개한 Apache⁠-⁠2.0 기반의 셀프호스팅 분산 Durable Objects 런타임입니다. Cloudflare Workers 번들을 자체 서버의 V8에서 실행하고 객체마다 SQLite 데이터베이스를 두며, S3 호환 저장소나 Google Cloud Storage를 영속 원본으로 사용합니다. 별도 컨트롤 플레인이나 합의 서비스 없이 객체 소유권과 복제를 운영해 Workers 코드를 유지하면서 실행 위치와 데이터 저장소를 직접 통제하려는 팀이 살펴볼 만합니다.


에디터 노트

오늘 연구들은 서로 다른 분야에서 같은 함정을 보여줍니다. 평균 분산을 줄이는 회전, 전체 영상을 보는 교사의 점수, 시술 전 한 번의 위험 예측처럼 계산하기 편한 목표는 실제 시스템이 움직이는 조건을 빠뜨리기 쉽습니다. 숫자가 좋아졌다는 사실보다 그 숫자가 만들어진 정보 경계와 실행 경로를 먼저 물어야 합니다.

반대로 DARTree는 후보마다 앞선 토큰 조건을 보존하고, 임상 월드 모델은 회복 중 사건을 시간순으로 반영하며, TopoIntent는 보안 요구를 실제 네트워크 테스트로 이어 갑니다. 신뢰성은 더 복잡한 모델의 부산물이 아니라 학습 목표, 사용 가능한 정보와 검증 표면을 같은 방향으로 맞춘 결과입니다.

다음에 또 찾아옵니다. — 에이브랜치