운영되는 AI의 두 축 — 비용 통제·의료 과학·에이전트 보안
OpenAI 비용 통제와 의료 AI, GitHub Copilot 운영화, 에이전트 보안이 핵심입니다.
오늘의 핵심
오늘의 흐름은 AI가 더 똑똑해지는 단계에서, 더 잘 운영되고 검증되어야 하는 단계로 이동하고 있다는 점입니다. OpenAI는 ChatGPT Enterprise와 Codex 사용량을 함께 보는 비용·분석 콘솔을 내놓고, 동시에 의료·생명과학 연구 성과를 공개했습니다. GitHub는 Copilot이 만든 PR과 코드 리뷰까지 조직 workflow 안에 자연스럽게 편입하고 있고, Google과 Hugging Face는 에이전트가 안전하게 행동하고 평가받는 방법을 전면에 세웠습니다.
OpenAI, ChatGPT Enterprise와 Codex 사용량을 한 화면에서 관리하게 했습니다
OpenAI는 ChatGPT Enterprise용 usage analytics와 spend controls를 업데이트했습니다. Global Admin Console에서 ChatGPT와 Codex credit 사용량을 함께 보고, 사용자·제품·모델별 비용을 나눠 추적하며, 기본 한도·그룹 한도·개별 override를 설정할 수 있게 한 것이 핵심입니다.
- Codex까지 포함한 비용 가시성: 관리자는 ChatGPT와 Codex credit 사용량을 한 화면에서 보고, 어떤 제품과 모델이 비용을 만들고 있는지 추적할 수 있습니다.
- 조직별 한도 정책: workspace 기본 한도, 특정 group 한도, power user용 개별 예외를 나눠 설정할 수 있습니다.
- 운영 시스템 연결: unified Cost API를 통해 같은 데이터를 내부 비용 분석·FinOps 시스템으로 가져갈 수 있습니다.
출처: New usage analytics and updated spend controls for enterprises — OpenAI
GPT-5.5 Instant, ChatGPT의 건강 답변 품질을 크게 끌어올렸습니다
OpenAI는 GPT-5.5 Instant가 건강 관련 평가에서 최신 frontier thinking 모델에 가까운 성능을 보인다고 밝혔습니다. 매주 2억 3,000만 명 이상이 ChatGPT에서 건강·웰니스 질문을 하고 있으며, 최근 2개월간 production traffic의 건강 답변 factuality issue 비율이 71% 감소했다는 설명도 함께 공개했습니다.
- 무료 사용자까지 적용: GPT-5.5 Instant는 ChatGPT 무료 사용자도 한도 내에서 사용할 수 있어 개선된 건강 답변이 더 넓게 배포됩니다.
- 의사 주도 평가: 60개국, 49개 언어, 26개 전문 분야의 260명 이상 의사가 response rubric과 failure mode 평가에 참여했습니다.
- 안전한 escalation: urgent care가 필요한 상황, 추가 context가 필요한 상황, 불확실성을 설명해야 하는 상황을 더 잘 구분하는 방향입니다.
출처: Improving health intelligence in ChatGPT — OpenAI
OpenAI와 Boston Children’s, 미해결 희귀 소아질환 18건의 진단 실마리를 찾았습니다
OpenAI는 Boston Children’s Hospital, Harvard University 연구진과 함께 OpenAI o3 Deep Research reasoning model을 사용해 기존에 해결되지 않았던 376개 희귀 소아질환 사례를 재분석했습니다. 전문가 검토와 추가 검사, 임상 확인을 거쳐 18개 사례에서 진단이 확정됐고, 이는 기존 전문 분석 이후 4.8%의 추가 diagnostic yield에 해당합니다.
- 오래된 케이스 재해석: 새로운 gene-disease relationship, case report, variant evidence가 쌓이면 과거 미해결 사례도 다시 읽힐 수 있습니다.
- 전문가 보조 workflow: 모델은 evidence-linked candidate explanation을 제안하고, 최종 판단은 연구자와 임상의가 검토했습니다.
- 현실적 한계 포함: 모든 제안이 정답은 아니며, 추가 testing과 clinical confirmation이 필요한 workflow입니다.
출처: Using AI to help physicians diagnose rare genetic diseases affecting children — OpenAI
OpenAI, 생명과학 연구 현실성을 겨냥한 LifeSciBench를 공개했습니다
OpenAI는 생명과학 연구자의 실제 업무를 반영한 LifeSciBench를 발표했습니다. 이 benchmark는 750개 expert-authored task, 1,062개 task artifact, 19,020개 rubric criteria, 453명 expert reviewer를 포함하며, evidence handling, analysis, design and optimization, scientific reasoning, validation and operations, translation, scientific communication 등 7개 workflow를 평가합니다.
- 단답형 생물학 평가 탈피: 복잡한 evidence, conflicting result, assay troubleshooting, translational risk 판단을 포함합니다.
- 실무형 rubric: 박사급 생명과학자와 biotech·pharma 경험자가 task와 평가 기준을 설계했습니다.
- 과학 에이전트 평가 기반: 모델이 연구자의 collaborator로 일할 수 있는지, 답뿐 아니라 caveat와 reasoning quality까지 봅니다.
출처: Introducing LifeSciBench — OpenAI
GPT-5.4 기반 AI chemist, 실제 실험으로 medicinal chemistry 반응을 개선했습니다
OpenAI는 Molecule.one의 Maria와 GPT-5.4를 연결해 Chan-Lam Coupling yield를 개선한 연구를 공개했습니다. 시스템은 연구 제안, 실험 설계·실행, 데이터 분석, 후속 실험 제안을 수행했고, 사람은 steering prompt와 grading prompt 설계, proposal 선택, 제한적 correction, 최종 검증을 담당했습니다.
- 실험실 연결: 추론만 평가한 것이 아니라 high-throughput laboratory에서 실제 molecule과 instrument noise를 통과했습니다.
- 반자동 연구 루프: 모델이 additive hypothesis를 제안하고 실험 결과를 바탕으로 후속 실험을 설계했습니다.
- 인간 검증 유지: 최종 성과는 사람이 독립적으로 validation했으며, preparedness와 misuse 가능성도 함께 검토했습니다.
출처: A near-autonomous AI chemist improves a challenging reaction in medicinal chemistry — OpenAI
GitHub Copilot, MAI-Code-1-Flash를 더 많은 개발 표면으로 확장했습니다
GitHub는 Microsoft의 small coding model인 MAI-Code-1-Flash를 Copilot CLI, GitHub Copilot app, GitHub Copilot Chat, Visual Studio, GitHub Mobile, JetBrains IDEs, Eclipse, Xcode에서 사용할 수 있게 했습니다. 현재는 제한된 사용자부터 시작해 몇 주에 걸쳐 확대하고, Business와 Enterprise 지원은 이후 제공됩니다.
- small model의 제품화: “가장 큰 모델”이 아니라 Copilot에 맞춰 튜닝된 작은 coding model을 여러 표면에 배포합니다.
- 개발 표면 통합: CLI, IDE, mobile, desktop app까지 같은 모델 선택지를 제공합니다.
- 요금제 범위 확대: Free, Student, Pro, Pro+, Max plan에서 제공되며 기업 plan은 추후 지원됩니다.
출처: MAI-Code-1-Flash available on more Copilot surfaces — GitHub Changelog
Copilot code review, AGENTS.md를 읽고 repository convention을 반영합니다
GitHub는 Copilot code review가 repository root의 AGENTS.md를 자동으로 활용한다고 발표했습니다. 이 파일에 repo convention과 review expectation을 적어두면 Copilot이 코드 리뷰 feedback을 생성할 때 해당 맥락을 반영합니다. Draft PR에서 Copilot review를 더 쉽게 요청하는 UI 개선도 함께 적용됐습니다.
- 리뷰 지침 내재화: repository별 coding convention과 review 기준을 AI reviewer에게 직접 전달할 수 있습니다.
- Draft PR workflow 개선: PR을 publish하기 전 Copilot에게 first pass review를 요청하는 흐름이 쉬워졌습니다.
- 노이즈 감소: PR timeline의 Copilot review event를 접어 conversation tab을 정리합니다.
출처: Copilot code review: AGENTS.md support and UI improvements — GitHub Changelog
Copilot이 만든 PR도 작성자 검색과 release note credit에 포함됩니다
GitHub는 author: pull request 검색에서 Copilot cloud agent가 사용자 요청으로 만든 PR도 함께 보이게 했습니다. 또 generated release notes는 Copilot이 만든 PR이 merge됐을 때 @copilot만이 아니라 해당 작업을 지시한 개발자도 함께 credit합니다.
- 책임 경계 정리:
author:@me검색으로 사람이 직접 만든 PR과 Copilot이 대신 연 PR을 함께 볼 수 있습니다. - 릴리스 노트 attribution: agent가 PR을 열었더라도 작업을 요청한 개발자 이름이 release notes에 함께 표시됩니다.
- API 확장 예정: UI와 GitHub Mobile에 먼저 적용되고, REST API와 GraphQL API는 7월 16일 적용 예정입니다.
출처: Copilot-authored pull requests now included in author searches — GitHub Changelog, Generated release notes credit you for Copilot pull requests — GitHub Changelog
Google DeepMind, 에이전트 보안을 내부 시스템 보호 문제로 정리했습니다
Google DeepMind는 AI agent가 2030년까지 미국에서 2.9조 달러 규모의 경제 가치를 만들 수 있다는 전망과 함께, internal system을 점점 더 능력 있고 불완전하게 aligned된 에이전트로부터 보호하는 접근을 공개했습니다. 에이전트가 복잡한 작업을 자율 수행할수록 cyber defense, science discovery, product development 같은 고가치 workflow에서 보안 설계가 핵심이 됩니다.
- 내부 시스템 보호 초점: 외부 공격자뿐 아니라 agent 자체가 잘못된 목표·도구 사용·권한 범위로 위험을 만들 수 있음을 전제로 합니다.
- 경제 가치와 리스크 병행: 생산성 잠재력이 클수록 권한, 감사, sandboxing, containment가 함께 필요합니다.
- 에이전트 보안의 제품화: agent capability가 올라갈수록 security review는 출시 후 점검이 아니라 설계 전제입니다.
출처: Securing the future of AI agents — Google DeepMind
Google, A2A를 agentic commerce와 autonomous payment의 기반으로 설명했습니다
Google Developers Blog는 A2A가 collaborative agents 세계를 어떻게 만들고 있는지 소개했습니다. 특히 agentic commerce와 autonomous payments에서 에이전트가 거래 조건을 협상하고, inventory를 검증하고, B2B 구매를 사용자 대신 실행하는 transactional integrity layer로 A2A를 설명했습니다.
- 거래형 에이전트 연결: agent 간 협상, 검증, 실행이 단순 API 호출보다 복잡한 상태 관리와 신뢰를 요구합니다.
- B2B 자동화 지향: 구매·재고·계약 흐름처럼 조직 간 절차가 있는 업무를 에이전트 협업 대상으로 봅니다.
- 프로토콜 경쟁 심화: MCP, ARD, A2A가 각각 실행, 발견, 협업·거래의 서로 다른 층을 맡는 구도가 선명해지고 있습니다.
출처: How A2A is Building a World of Collaborative Agents — Google Developers Blog
Cloudflare Radar, Workers AI 인기도를 account 수가 아니라 inference 수로 측정합니다
Cloudflare는 Radar의 Workers AI model·task popularity 측정 방식을 변경했습니다. 기존에는 각 모델이나 task를 실행한 unique account 수를 기준으로 삼았지만, 이제는 inference 수를 기준으로 삼아 실제 사용량 volume을 더 잘 반영합니다. 이 변경은 신규 측정뿐 아니라 historical data에도 영향을 줍니다.
- 실사용량 중심 지표: “얼마나 많은 계정이 한 번 써봤나”보다 “얼마나 많이 호출됐나”를 보여줍니다.
- 히스토리 재해석 필요: 과거 trend와 model distribution이 달라 보일 수 있습니다.
- API 제공:
/ai/inference/summary/{dimension}와/ai/inference/timeseries_groups/{dimension}endpoint로 같은 데이터를 확인할 수 있습니다.
출처: Updated Workers AI popularity metric in Cloudflare Radar — Cloudflare Docs
MosaicLeaks, deep research agent의 검색 쿼리만으로도 비밀이 샐 수 있음을 보였습니다
ServiceNow 연구진은 Hugging Face Blog에서 MosaicLeaks를 공개했습니다. Deep research agent가 private local documents와 web retrieval을 함께 사용할 때, 외부 검색 쿼리 로그만 보고도 민감한 private information을 재구성할 수 있다는 문제를 다룹니다. PA-DR 훈련은 strict chain success를 48.7%에서 58.7%로 올리면서 answer/full-information leakage를 34.0%에서 9.9%로 낮췄습니다.
- 쿼리 로그가 leakage channel: 공격자는 private document나 chain-of-thought를 보지 않아도, agent의 cumulative query log에서 private fact를 추론할 수 있습니다.
- 성능 최적화의 역효과: task performance만 높이도록 훈련하면 오히려 더 많은 민감 정보가 검색어에 섞일 수 있습니다.
- privacy-aware training 필요: 검색을 잘하는 agent와 검색을 안전하게 하는 agent는 같은 문제가 아닙니다.
출처: MosaicLeaks: Can your research agent keep a secret? — Hugging Face
Hugging Face, 라이브러리가 agent-friendly한지 측정하는 benchmark를 제안했습니다
Hugging Face는 transformers를 case study로 삼아, 오픈 모델 기반 coding agent가 라이브러리를 얼마나 효과적으로 사용할 수 있는지 측정하는 agent-focused benchmark를 소개했습니다. 단순히 최종 답이 맞았는지가 아니라, agent가 어떤 경로로 답을 찾았고, 얼마나 많은 작업과 비용이 들었는지를 봅니다.
- 소프트웨어의 새 품질 기준: API와 docs가 사람에게만 편한 것이 아니라 에이전트가 drive하기 쉬운지도 중요해졌습니다.
- 과정 중심 평가: success 여부뿐 아니라 tool use, retry, 우회 구현, 비용 변화를 함께 측정합니다.
- 오픈 모델 실험: Hugging Face Jobs에서 동일 hardware 조건으로 model, revision, task sweep을 실행했습니다.
출처: Is it agentic enough? Benchmarking open models on your own tooling — Hugging Face
Claude 서비스, 6월 18일 UTC 기준 약 45분간 장애를 겪었습니다
Anthropic status page는 6월 18일 06:55부터 07:40 UTC까지 Claude services에 영향을 준 service disruption이 있었다고 기록했습니다. Claude.ai 문제의 원인을 확인했고 수정 중이라고 안내한 뒤, 08:19 UTC에 resolved 상태로 전환했습니다. 전날에는 Claude Opus 4.8 elevated errors도 별도 incident로 기록됐습니다.
- 반복되는 operational risk: frontier model 품질과 별개로, 서비스 가용성은 업무 자동화의 직접 리스크입니다.
- Claude.ai 중심 영향: status page는 Claude services disruption으로 기록했고, 원인 식별과 복구 시간을 명시했습니다.
- 멀티 모델 필요성: agent workflow가 특정 provider에 묶일수록 장애는 개인 불편이 아니라 업무 중단이 됩니다.
출처: Claude Status — Anthropic
오늘의 도구 추천
MosaicLeaks — deep research agent의 web query가 private information을 어떻게 새게 만드는지 평가하는 benchmark입니다. 조직 내부 문서와 외부 검색을 함께 쓰는 에이전트를 만들고 있다면, 답변 품질보다 먼저 query leakage와 privacy-aware retrieval policy를 점검해야 합니다.
에디터 노트
오늘 뉴스는 겉으로 보면 흩어져 있습니다. OpenAI는 기업 비용 관리와 의료·과학 성과를 발표했고, GitHub는 Copilot PR과 code review를 더 자연스럽게 개발 workflow에 붙였으며, Google과 Hugging Face는 에이전트의 보안·평가 문제를 강조했습니다. 하지만 하나로 묶으면 메시지는 분명합니다. AI는 이제 “실험실의 성능”보다 “조직 안에서 반복 실행될 때의 품질”로 평가받기 시작했습니다.
특히 OpenAI의 spend controls와 GitHub의 Copilot attribution 변화는 같은 방향을 가리킵니다. 에이전트와 AI 도구가 실제 업무를 수행하려면 비용, 권한, 책임, 감사 가능성이 제품 안에 들어와야 합니다. 누가 썼고, 누가 지시했고, 어떤 모델이 비용을 만들었고, 어떤 규칙을 따라 리뷰했는지가 모두 운영 데이터가 됩니다.
의료와 생명과학 발표도 같은 흐름입니다. AI가 사람보다 더 그럴듯한 답변을 만드는지를 넘어, 전문가가 검토 가능한 가설을 만들고, 실제 실험·임상 확인으로 이어질 수 있는지가 중요합니다. 반대로 MosaicLeaks와 Claude 장애는 이 운영화가 얼마나 까다로운지도 보여줍니다. 좋은 에이전트는 답을 잘 내는 것만으로 충분하지 않습니다. 무엇을 검색하는지, 어디까지 권한을 갖는지, 실패했을 때 어떻게 멈추는지까지 설계되어야 합니다.
다음에 또 찾아옵니다. — 에이브랜치