지난주 AI 업계의 큰 발표만 나열하면 익숙한 그림이 됩니다. OpenAI는 더 싸고 빠른 GPT-6 모델을 내놓았고, Anthropic은 Claude의 최상위 모델을 갱신했습니다. 그러나 가격표와 벤치마크를 한 겹 걷어내면 더 중요한 변화가 보입니다.
모델 호출 비용은 내려가고, 반복되는 문맥은 캐시되며, 에이전트는 이전보다 훨씬 많은 후보를 만들어낼 수 있게 됐습니다. 동시에 실제 작업의 성패는 검증 비용, 권한 통제, 관측 가능성에 더 크게 좌우됩니다. 좋은 모델을 고르는 문제에서, 한 건의 검증된 결과를 얼마나 싸고 안전하게 만들 수 있는가의 문제로 경쟁 축이 이동하고 있습니다.
이번 호는 2회차 발행 직전 공개돼 빠졌던 9월 22~23일의 강한 후보 네 건을 다시 묶었습니다. 여기에 소셜에서 화제가 됐지만 공식 자료로 확인할 수 있었던 중국 AI 생태계의 두 가지 신호를 별도 레이더로 정리했습니다.
1. GPT-6 Sol·Luna와 Claude Opus 5.5, 토큰 가격에서 작업당 비용으로
PROOF LEVEL 03 · 공식 발표 확인
사실 요약
OpenAI는 9월 22일 GPT-6 Sol과 GPT-6 Luna를 공개했습니다. 표준 API 가격은 100만 토큰 기준으로 Sol이 입력 2달러·캐시 입력 0.20달러·출력 10달러, Luna가 입력 0.10달러·캐시 입력 0.01달러·출력 0.50달러입니다. 두 모델 모두 텍스트와 이미지 입력을 받고 텍스트를 출력하며, Responses API와 Chat Completions API에서 사용할 수 있습니다. OpenAI는 GPT-5.6의 프로모션 가격보다 50% 낮다고 설명했습니다.
같은 날 Anthropic은 Claude Opus 5.5를 발표했습니다. 기본 100만 토큰 컨텍스트, 최대 12만8천 토큰 출력, 항상 켜지는 적응형 사고를 제공하며 가격은 100만 토큰당 입력 4달러·출력 20달러·캐시 쓰기 5달러·캐시 읽기 0.20달러입니다. Anthropic은 전형적인 작업에서 Opus 5보다 비용이 40% 낮고 출력 속도가 30% 이상 빠르다고 밝혔습니다. 두 회사가 공개한 성능과 효율 수치는 각사의 자체 측정 결과이며 독립 재현 결과는 아닙니다.
Opus 5.5로 이전할 때는 API 동작 차이도 있습니다. thinking을 직접 켜거나 끄는 대신 해당 필드를 생략하고 effort로 제어해야 하며, 일부 tool_choice 모드는 오류를 반환할 수 있어 auto와 엄격한 도구 사용을 조합해야 합니다.
개발자에게 중요한 점
두 발표의 공통점은 최고 성능 모델 하나로 모든 요청을 처리하라는 메시지가 아닙니다. Luna처럼 매우 저렴한 모델, Sol처럼 중간 가격대의 작업 모델, Opus처럼 긴 문맥과 복잡한 추론을 담당하는 모델을 업무 단계별로 섞는 선택지가 넓어졌습니다.
이제 모델 비교의 단위도 100만 토큰 가격에서 벗어나야 합니다. 재시도 횟수, 도구 호출 실패, 사람이 다시 검토하는 시간까지 더한 검증 완료 작업 한 건의 비용이 실제 운영비에 가깝습니다.
Lee's Take
새 모델이 나올 때마다 전체 시스템을 갈아타는 방식은 점점 비효율적입니다. 먼저 분류·추출·초안은 저비용 모델, 복잡한 계획과 최종 검토는 고성능 모델로 분리하고, 같은 평가 세트에서 성공률과 재시도 비용을 측정해야 합니다. 가격 인하의 이익은 모델 이름을 바꾸는 순간이 아니라 라우팅과 검증 규칙을 바꾸는 순간 생깁니다.
이번 주 해볼 일
- 실제 업무 30~50건으로 작은 평가 세트를 만들고 모델별 성공률, 지연, 총 토큰, 사람 검토 시간을 기록합니다.
- 단순 단계는 Luna급 저비용 모델로 내리고, 실패하거나 위험도가 높은 요청만 Sol·Opus급으로 승격합니다.
- Opus 5.5 이전 전
thinking,effort,tool_choice사용 코드를 회귀 테스트합니다.
원문: OpenAI — Introducing GPT-6 Sol and Luna · OpenAI API changelog · Anthropic — Claude Opus 5.5 · Anthropic API release notes
2. 프롬프트 구조가 운영 인프라가 되다
PROOF LEVEL 03 · 공식 발표 확인
사실 요약
OpenAI는 9월 22일 GPT-6의 프롬프트 캐시 개선을 공개했습니다. 이번 변화의 중심에는 Prompt Caching Dashboard와 진단 도구가 있습니다. 모델, 도구, 설정, 입력 가운데 무엇이 바뀌어 캐시 미스가 발생했는지, 몇 개 토큰이 영향을 받았는지 확인할 수 있습니다. 적절한 방식을 사용하면 추론 강도나 허용 도구를 조정하면서도 캐시를 유지할 수 있습니다.
비용 혜택도 커졌습니다. 캐시 대상이 되는 공통 접두부는 30분 안에 재사용할 경우 공유될 수 있고, 캐시된 입력 토큰에는 최대 90% 할인이 적용됩니다. 명시적 캐시 중단점과 사전 워밍도 지원합니다.
개발자에게 중요한 점
에이전트는 시스템 지침, 도구 정의, 저장소 규칙처럼 긴 공통 문맥을 반복해서 보냅니다. 이 접두부의 내용과 순서가 안정적이어야 같은 실행을 재현하고 변경 영향을 추적할 수 있습니다. 요청마다 표현과 배열이 달라진다면 비용만 늘어나는 것이 아니라 어떤 변경이 동작 차이를 만들었는지도 설명하기 어려워집니다.
캐시 적중률은 이런 구조적 안정성을 드러내는 운영 지표입니다. 모델 단가가 같아도 공통 접두부를 일관되게 관리하는 팀과 그렇지 않은 팀은 비용과 지연뿐 아니라 배포의 예측 가능성에서도 차이가 납니다.
다만 캐시는 오래된 상태를 재사용하는 장치가 아닙니다. 변경이 잦은 사용자 입력과 도구 결과는 뒤쪽에 두고, 안정적인 지침과 스키마를 앞쪽에 배치해야 합니다. 캐시를 위해 정확성을 희생하면 할인보다 재작업 비용이 더 커집니다.
Lee's Take
프롬프트 최적화는 문장을 짧게 다듬는 일이 아닙니다. 시스템 프롬프트와 도구 스키마를 버전이 있는 배포 자산으로 관리하고, 변경이 품질과 캐시 적중률에 미친 영향을 함께 보는 일에 가깝습니다. 프롬프트도 이제 코드처럼 변경 이유, 소유자, 회귀 테스트가 필요한 운영 인프라입니다.
이번 주 해볼 일
- 시스템 프롬프트와 도구 스키마를 고정된 순서로 직렬화하고 변경 이력과 버전을 부여합니다.
- 캐시 적중률, 캐시 입력 비용, 전체 지연, 평가 품질을 배포 전후로 함께 비교합니다.
- 모델·도구·설정 변경이 캐시를 깨뜨리는지 진단 도구로 확인한 뒤 점진적으로 배포합니다.
원문: OpenAI — Better prompt caching for GPT-6
3. Anthropic의 ART 연구가 보여준 ‘가설은 싸게, 검증은 비싸게’
PROOF LEVEL 03 · 공식 발표 및 연구 한계 확인
사실 요약
Anthropic은 9월 23일 Claude 에이전트가 새로운 효소 시스템 후보를 찾는 연구를 공개했습니다. 약 950개의 에이전트가 21시간 동안 2억1천만 토큰을 사용해 20만 개가 넘는 역전사효소를 모으고, 3,500개의 후보 시스템을 만든 뒤 실험할 20개로 줄였습니다. 연구진은 이 과정에서 반복 배열과 파트너 유전자를 동반하는 array-associated reverse transcriptases, 즉 ART를 확인했습니다.
제목만 보면 AI가 완전히 새로운 생물학적 기능을 자율 발견한 것처럼 읽힐 수 있지만 경계선은 분명합니다. 기반이 된 역전사효소 자체는 이미 알려져 있었고, ART의 주된 생물학적 기능은 아직 밝혀지지 않았습니다. 실험은 배열이 서로 다른 짧은 RNA로 발현된다는 점을 보여줬으며, 추가 연구가 진행 중입니다. 결과는 프리프린트 단계이고 모든 실험실 작업은 사람이 수행했습니다.
개발자에게 중요한 점
이 연구의 핵심은 에이전트 수가 아니라 검증 깔때기입니다. 값싼 병렬 탐색으로 후보 공간을 크게 만들고, 계산 검토로 줄인 다음, 가장 비싼 실제 실험은 극소수 후보에만 사용했습니다. 소프트웨어에서도 같은 구조를 적용할 수 있습니다. 여러 수정안을 생성하되 정적 분석, 테스트, 샌드박스 실행을 거쳐 사람 리뷰에 올라오는 후보 수를 줄이는 방식입니다.
Lee's Take
에이전트가 과학자나 엔지니어를 대체했다는 서사보다, 제한된 검증 예산을 어디에 쓸지 바꿨다는 해석이 정확합니다. 생성 비용이 계속 내려갈수록 병목은 아이디어가 아니라 신뢰할 수 있는 반증과 외부 검증으로 이동합니다. 에이전트 시스템의 경쟁력은 몇 개 후보를 만들었는지가 아니라 잘못된 후보를 얼마나 일찍, 싸게 탈락시키는지에서 나옵니다.
후보를 대량으로 만들 수 있게 되면 검증만으로는 충분하지 않습니다. 어떤 결과를 실제 행동으로 옮길 수 있는지 통제하고, 그 실행 과정을 재구성할 수 있어야 합니다.
이번 주 해볼 일
- 업무 흐름을 후보 생성, 자동 검증, 외부 검증, 사람 승인 네 단계로 나눕니다.
- 각 단계의 탈락률과 비용을 기록해 가장 비싼 검증 전에 오류가 걸러지는지 확인합니다.
- 에이전트가 만든 주장에는 근거, 반례 탐색 결과, 미해결 불확실성을 함께 제출하게 합니다.
원문: Anthropic — Claude discovers a novel enzyme system
4. GitHub가 보여준 조직 도입의 조건: 기본값, 샌드박스, 추적
PROOF LEVEL 03 · 공식 발표 확인
사실 요약
GitHub는 9월 24일 Copilot Business와 Enterprise를 위한 전역 기본 정책을 발표했습니다. 관리자는 현재와 미래의 대상 기능을 기본 활성화, 기본 비활성화, 조직별 결정 중 하나로 정할 수 있습니다. 이미 명시적으로 선택한 설정은 유지되고 프리뷰 기능은 계속 옵트인이며, 새 기본 정책은 28일의 준비 기간을 거쳐 10월 22일부터 적용됩니다.
9월 25일 주간 업데이트에는 Copilot 앱의 로컬 샌드박스와 OpenTelemetry 지원이 포함됐습니다. 공개 프리뷰인 로컬 샌드박스는 에이전트가 접근할 수 있는 파일, 네트워크, 자격 증명을 제한합니다. OpenTelemetry 연동은 에이전트 활동을 기존 모니터링 체계로 보낼 수 있게 합니다. JetBrains의 보조 승인 기능은 낮은 위험의 호출을 자동 승인하고 높은 위험의 동작에는 사람 승인을 요구합니다.
개발자에게 중요한 점
저렴한 모델과 안정적인 프롬프트 인프라는 에이전트가 생성하고 실행하는 후보의 수를 빠르게 늘립니다. 사용량이 늘수록 프롬프트의 주의 문구만으로는 권한 사고를 막기 어렵습니다. 실제 파일·네트워크·비밀 접근을 차단하는 실행 경계와, 도구 호출·승인·실패를 재구성할 기록이 필요합니다.
Lee's Take
AI 기능의 기본값은 편의 설정이 아니라 권한 정책입니다. 빠른 모델을 도입하기 전에 어떤 동작을 자동 승인할지, 외부 변경은 누가 확인할지, 한 작업의 흔적을 끝까지 연결할 수 있는지부터 정해야 합니다. 단가가 낮아진 만큼 안전장치 없는 실행도 더 빠르게 늘어날 수 있습니다.
이번 주 해볼 일
- 10월 22일 전에 Copilot의 현재 명시적 설정과 전역 기본 정책을 검토합니다.
- 에이전트가 필요한 파일 경로, 네트워크 목적지, 자격 증명을 최소 허용 목록으로 작성합니다.
- 삭제·배포·비밀 접근은 자동 승인에서 제외하고 도구 호출과 사람 승인에 같은 추적 ID를 붙입니다.
원문: GitHub — Default enablement of Copilot features · GitHub — Copilot weekly releases, September 21
중국 AI 레이더 — 소셜에서 포착하고 공식 자료로 확인한 두 가지
아래 두 소식은 X와 개발자 커뮤니티의 반응을 조사 단서로 삼았지만, 수치와 기능은 공식 저장소·모델 카드·문서에서 확인된 내용만 적었습니다. 출처를 확인하기 어려운 벤치마크 캡처와 로컬 속도 비교는 제외했습니다.
Qwen-Image-2.1: 결과물만큼 빠른 배포 생태계
Alibaba Qwen 팀은 9월 20일 Qwen-Image-2.1을 공개했습니다. 텍스트 이미지 생성과 편집을 하나의 모델로 다루며, 7B 규모의 비주얼 구성 요소, 네이티브 투명 RGBA 생성·편집, 최대 10개 참조 이미지, 네이티브 2K 출력을 지원합니다. Diffusers, ComfyUI, vLLM-Omni, SGLang이 출시 시점부터 지원됐다는 점도 눈에 띕니다.
소셜에서 화제가 된 이미지 사례보다 개발자에게 중요한 신호는 ‘첫날부터 돌릴 수 있는가’입니다. 모델 사용료뿐 아니라 배포까지 걸리는 통합 시간과 호환성 작업도 검증된 결과 한 건의 비용에 포함되기 때문입니다. 다만 라이선스는 Apache 2.0이 아니라 Qwen Research License입니다. 제품 적용 전 상업적 사용과 배포 조건을 반드시 별도로 검토해야 합니다.
원문: Qwen-Image-2.1 GitHub · Hugging Face model card · Qwen 공식 블로그 · Qwen 공식 X 발표
Kimi CLI 세대교체: 설치 편의보다 업데이트 경로를 먼저 볼 것
Moonshot AI는 기존 Python 기반 kimi-cli를 9월 23일 아카이브하고 Node.js·네이티브 바이너리 기반 Kimi Code CLI로 이전했습니다. 공식 마이그레이션 도구는 설정, MCP 서버, 세션 기록을 옮기지만 OAuth 자격 증명과 MCP 승인은 옮기지 않으며 기존 데이터도 남겨둡니다.
운영 관점에서 더 주의할 대목은 업데이트 경로입니다. 기존 kimi-cli 1.52.0 변경 기록에는 인수 없이 kimi를 실행하면 확인 없이 CDN의 설치 스크립트를 내려받아 실행하고, CDN 스크립트 변경이 패키지 릴리스 없이 반영될 수 있다고 적혀 있습니다. 새 설치 문서는 스크립트가 체크섬을 검증한다고 설명하지만, 관리 환경에서는 설치 스크립트를 검토·고정하거나 패키지 관리자와 승인된 아티팩트 경로를 사용하는 편이 안전합니다. 이는 침해가 있었다는 주장이 아니라 공식 문서에 나온 실행·업데이트 방식에 대한 공급망 점검 포인트입니다.
원문: Kimi CLI changelog · Kimi Code migration guide · Kimi Code releases
모델 가격은 내려가고 프롬프트는 운영 인프라가 되며, 에이전트가 만들어내는 후보의 수는 빠르게 늘고 있습니다. 그럴수록 검증 깔때기, 실행 권한, 관측 기록, 공급망의 신뢰 경로가 제품의 실제 성능을 좌우합니다.
모델 성능과 호출 가격만으로는 제품의 차이를 설명하기 어려워지고 있습니다. 어떤 작업을 어떤 모델에 맡길지, 공통 문맥을 어떻게 관리할지, 생성된 후보를 어떻게 검증할지, 에이전트에 어디까지 권한을 줄지는 각 제품과 조직이 직접 설계해야 합니다. 앞으로의 차이는 모델 선택보다 이 운영 구조에서 벌어질 가능성이 큽니다.