에이전트의 성능보다 운영 신뢰성이 중요해졌습니다 — CrewAI·vLLM·MLflow
CrewAI와 vLLM의 운영 개선, ChatGPT·Opus 5 장애, 멀티모달 평가 도구의 진화를 짚습니다.
오늘의 핵심
오늘의 흐름은 AI 에이전트의 경쟁이 새로운 능력 추가에서 실패를 드러내고 복구하는 운영 신뢰성으로 이동하는 변화입니다. CrewAI는 최신 오픈AI 모델과 Responses API의 연결 오류를 한 번에 손봤고, LiteLLM은 평가 모델이 실행되지 않아도 통과하던 보호 장치의 빈틈을 막았습니다. vLLM·MLflow·Langfuse도 각각 분산 캐시, 멀티모달 평가, SDK 전환 관측을 보강하며 실제 운영에서 생기는 마찰을 줄였습니다.
CrewAI 1.15.7, GPT‑5.6·Responses API 연결과 스킬 관측성을 함께 보강
CrewAI가 1.15.7을 공개하며 최신 오픈AI 모델을 Responses API 경로로 호출할 때 발생하던 404·400 오류와 도구 호출 문제를 수정했습니다. 런타임이 레지스트리 스킬을 올바른 CrewAI+ 클라이언트로 해석하고, 스킬 사용 이벤트를 관측 시스템에 내보내는 기능도 추가했습니다.
- 최신 모델 호환성: Responses 전용 모델을 올바른 경로로 보내고
tools와reasoning_effort조합의 오류를 복구합니다. - 스킬 실행 추적: 어떤 스킬이 실제 런타임에서 사용됐는지 이벤트로 기록할 수 있습니다.
- 보안 업데이트:
bedrock-agentcore의존성을 올려 CVE-2026-16796 패치를 반영했습니다.
출처: CrewAI 1.15.7 — CrewAI GitHub
ChatGPT 대화 오류, 완화 뒤에도 복구 상태 모니터링 지속
오픈AI는 7월 26일 오전 7시 9분 KST부터 일부 사용자가 ChatGPT 대화를 불러오거나 이어가지 못하는 간헐적 오류를 조사했습니다. 원인을 확인한 뒤 오류율을 낮추는 완화 조치를 적용했으며, 현재 상태 페이지에서는 대화 복구 상황을 모니터링하고 있습니다.
- 영향 표면: 새 답변 생성뿐 아니라 기존 대화를 로드하거나 계속 진행하는 흐름이 영향을 받았습니다.
- 단계적 대응: 조사, 원인 식별, 완화 적용, 복구 모니터링 순으로 상태를 갱신했습니다.
- 장기 작업 위험: 대화 상태에 의존하는 에이전트는 중간 결과 저장과 재개 지점이 필요합니다.
출처: Elevated errors affecting ChatGPT conversations — OpenAI Status
Claude Opus 5 오류율 상승, 1시간 27분 만에 복구
앤트로픽은 7월 26일 오후 6시 17분 KST부터 Claude Opus 5의 오류율이 높아지는 문제를 조사했습니다. 약 28분 뒤 원인을 식별했고 수정 적용과 모니터링을 거쳐 오후 7시 44분에 복구를 완료했습니다.
- 영향 시간: 공식 상태 기록 기준 약 1시간 27분 동안 사건이 열려 있었습니다.
- 복구 절차: 원인 식별 뒤 수정 사항을 배포하고 약 10분간 결과를 관찰했습니다.
- 모델별 격리: 전체 Claude 서비스가 아니라 Opus 5에 한정된 장애로 공지됐습니다.
출처: Elevated errors for Opus 5 — Anthropic Status
vLLM, GPU 사이에서 KV 캐시를 직접 찾고 가져오는 P2P 계층 도입
vLLM이 원격 피어 사이에서 KV 캐시 블록을 조회하고 전달하는 범용 P2P 보조 계층을 병합했습니다. 기존 프리필·디코드 분리 경로를 대칭형 구조로 확장해, 엔진이 다른 피어의 캐시를 가져오는 동시에 자신의 캐시도 제공할 수 있습니다.
- 직접 조회: 소비자가 필요한 블록을 질의하면 생산자가 로컬 티어링 관리자에서 적중 여부를 확인합니다.
- 검증 수치: 2개 파드 실험에서 외부 prefix cache hit rate 97.0 %를 기록했습니다.
- 재계산 감소: 원격 GPU가 이미 계산한 KV 블록을 재사용해 긴 프롬프트의 중복 연산을 줄입니다.
출처: Generic P2P secondary tier for KV-cache offloading — vLLM GitHub
Agno 2.8.4, 사람·장소·조직을 장기 기억으로 연결하는 Second Brain 강화
에이전트 프레임워크 Agno가 2.8.4에서 엔터티 메모리 구조를 크게 개편했습니다. 사용자별 기억과 별도로 사람·장소·조직 같은 엔터티를 공유 지식으로 저장하고, 새 정보가 들어오면 기존 기록을 갱신하거나 병합할 수 있게 했습니다.
- 엔터티 중심 기억: 대화 원문만 쌓는 대신 지속적으로 등장하는 대상을 구조화해 관리합니다.
- 도구 기반 갱신: 에이전트가 엔터티를 생성·검색·수정·삭제하는 명시적 작업을 수행합니다.
- 실행 안정성: 중첩 executor 요구사항 직렬화와 스킬 경로의
null인수 처리도 수정했습니다.
출처: Agno v2.8.4 — Agno GitHub
MLflow 평가 에이전트, 트레이스 속 이미지를 직접 보고 판정
MLflow가 {{ trace }} 기반 평가 모델이 실행 트레이스에 첨부된 이미지를 실제 픽셀로 확인할 수 있도록 get_span_image 도구를 추가했습니다. 기존에는 이미지가 첨부 참조 문자열로만 전달돼 멀티모달 모델을 사용해도 시각 결과를 평가할 수 없었습니다.
- 멀티모달 전달: 이미지 첨부를 base64 데이터 URL로 읽어 평가 모델의 사용자 메시지에 전달합니다.
- 공급자 변환: Anthropic과 Gemini 형식에 맞는 네이티브 이미지 블록으로 변환합니다.
- 안전한 한도: 기본 10 MiB 크기 제한을 두고 지나치게 큰 이미지는 다운로드 전에 거부합니다.
출처: Let trace judges see images via get_span_image — MLflow GitHub
LiteLLM, 실행되지 않은 LLM 평가 가드레일이 요청을 통과시키던 문제 수정
LiteLLM이 프록시에서 지정한 평가 모델의 공급자와 자격 증명을 찾지 못하면 LLM-as-a-Judge 가드레일이 조용히 실패하고 요청을 통과시키던 문제를 수정했습니다. 이제 호출 시점에 Router를 조회해 별칭·와일드카드 모델과 실제 배포 자격 증명을 연결합니다.
- Fail-open 차단: 평가 모델이 실행되지 않았는데도 검사가 성공한 것처럼 흐르던 경로를 바로잡았습니다.
- 별칭 해석: 프록시의 공개 모델 이름과
anthropic/*같은 와일드카드를 실제 배포로 라우팅합니다. - 판정 파싱: 마크다운 코드 펜스나 주변 설명이 포함된 JSON 판정도 구조화해 읽습니다.
출처: Resolve judge model credentials via lazy Router lookup — LiteLLM GitHub
Langfuse v4, SDK 전환이 끝났는지 트래픽으로 판별
Langfuse가 v4 마이그레이션 과정에서 프로젝트가 새 SDK로 완전히 전환됐는지, 구버전과 신버전이 섞였는지를 실제 수집 이벤트로 판별하도록 개선했습니다. Python·JavaScript SDK의 이름, 버전, API 키와 최초·최근 관측 시점을 묶어 전환 상태를 표시합니다.
- 혼합 버전 감지: 일부 서버만 새 SDK를 쓰는 상태를 완료로 잘못 표시하지 않습니다.
- OTel 안내: 지연된 이중 쓰기 경로를 계속 사용하는 OpenTelemetry 트래픽에 필요한 헤더를 안내합니다.
- 노이즈 제외: 내부 writer, 백필, 점수 전용 트래픽은 잘못된 경고를 만들지 않도록 분리합니다.
출처: Improve SDK migration detection — Langfuse GitHub
Hugging Face TRL, VLM도 텍스트 데이터라면 packing 허용
Hugging Face TRL이 비전언어모델(VLM)을 미세조정할 때 데이터에 이미지가 없으면 packing과 padding_free를 사용할 수 있도록 수정했습니다. 이전에는 실제 데이터 형식과 관계없이 모델이 VLM이라는 이유만으로 짧은 텍스트 시퀀스를 묶는 최적화를 막았습니다.
- 데이터 기준 판단: 모델 종류가 아니라 학습 데이터에 이미지 열이 있는지 확인합니다.
- 처리량 개선 여지: 짧은 텍스트 SFT에서 중요한 packing 최적화를 VLM 체크포인트에도 적용합니다.
- 기존 안전성 유지: 이미지 데이터셋에서는 동일한 제한과 오류가 계속 적용됩니다.
출처: Allow packing and padding-free on VLMs with text-only data — Hugging Face TRL GitHub
오픈AI Codex, 복잡한 MCP 스키마 처리를 위해 재귀 한도 확대
오픈AI Codex가 MCP 서버 라이브러리와 바이너리의 Rust 재귀 한도를 256으로 높였습니다. 깊게 중첩된 MCP 타입과 생성 코드가 컴파일 과정에서 기존 한도를 넘는 문제를 줄이기 위한 작은 운영 수정입니다.
- 적용 범위: MCP 서버 라이브러리와 실행 바이너리 두 크레이트에 같은 한도를 적용했습니다.
- 복잡한 도구 스키마: 중첩된 요청·응답 타입이 많은 서버의 컴파일 여유를 넓힙니다.
- 호환성 유지: 프로토콜 동작이나 공개 API를 바꾸지 않고 빌드 경계만 조정했습니다.
출처: Raise the MCP server recursion limit — OpenAI Codex GitHub
오늘의 도구 추천
neko-master — 로컬 게이트웨이의 네트워크 트래픽을 WebSocket으로 수집해 실시간 대시보드와 연결 관계로 보여주는 오픈소스 도구입니다. 에이전트와 MCP 서버가 어떤 외부 호스트에 접속하는지 확인하고 싶을 때, 별도 클라우드 서비스 없이 자신의 네트워크 데이터로 흐름을 관찰할 수 있습니다.
에디터 노트
주말의 업데이트는 화려한 모델 발표보다 운영의 약한 연결 고리를 보여줬습니다. 대화가 끊기고, 평가 모델이 실행되지 않고, 이미지 결과를 보지 못하며, 구버전 SDK가 남아 있는 문제는 모두 데모에서는 잘 드러나지 않습니다. 하지만 에이전트가 실제 업무를 맡으면 바로 비용과 신뢰의 문제로 바뀝니다. 앞으로의 경쟁력은 더 똑똑한 모델을 연결하는 속도와 함께, 실패를 보이게 만들고 상태를 복구하며 검증이 실제로 수행됐음을 증명하는 능력에서 나올 것입니다.
다음에 또 찾아옵니다. — 에이브랜치