IT

앤트로픽 Claude Opus 4.7 출시 — 무엇이 달라졌나? 성능, 기능, 경쟁 구도 완벽 분석

ylood 2026. 4. 19. 05:03

앤트로픽 Claude Opus 4.7 출시 — 무엇이 달라졌나? 성능, 기능, 경쟁 구도 완벽 분석


1. Claude Opus 4.7, 왜 지금 주목해야 하는가

2026년 4월 16일, 앤트로픽(Anthropic)이 Claude Opus 4.7을 공식 출시했다. 이전 모델인 Claude Opus 4.6 출시 이후 불과 약 2개월 만의 업그레이드다.

이 글은 앤트로픽 Claude Opus 4.6 출시 분석Claude Sonnet 4.6 출시 분석의 후속편이다. Opus 4.7이 전작 대비 무엇이 바뀌었는지, 경쟁 모델과 어떻게 다른지, 그리고 개발자와 일반 사용자에게 실질적으로 어떤 영향을 미치는지를 종합적으로 분석한다.

결론부터 말하면, Opus 4.7은 코딩과 소프트웨어 엔지니어링에서 현존 공개 모델 중 최강이라는 타이틀을 탈환했다. 하지만 동시에 논란의 여지도 적지 않다. 새 토크나이저로 인한 "보이지 않는 가격 인상", 장문맥 성능의 심각한 퇴보, 그리고 미공개 내부 모델 Mythos Preview와의 성능 격차가 공개적으로 인정된 최초의 사례이기도 하다.


2. 공식 발표 핵심 요약 — 출시 배경과 Mythos의 그림자

출시 개요

항목 내용
출시일 2026년 4월 16일
모델 ID claude-opus-4-7
컨텍스트 윈도우 입력 1M 토큰 / 출력 128K 토큰
API 가격 입력 $5 / 출력 $25 (100만 토큰당)
사용 가능 플랫폼 Claude.ai, API, Amazon Bedrock, Google Vertex AI, Microsoft Foundry, GitHub
전작 대비 업그레이드 주기 약 2개월 (Opus 4.6 이후)

Mythos Preview — 앤트로픽이 공개적으로 인정한 "더 강한 모델"

이번 발표에서 가장 주목할 점 중 하나는 앤트로픽이 Mythos Preview라는 미공개 내부 모델의 존재를 공식적으로 언급했다는 것이다. CNBC와 Axios 등 주요 매체에 따르면, 앤트로픽은 Opus 4.7이 Mythos Preview보다 "덜 광범위하게 유능하다(less broadly capable)"고 인정했다.

Mythos Preview의 벤치마크는 충격적이다.

  • SWE-bench Verified: 93.9% (Opus 4.7의 87.6%보다 6.3pp 높음)
  • Mozilla Firefox 147 JavaScript 엔진 취약점 익스플로잇: Opus 4.6이 수백 번 시도 중 2번 성공한 반면, Mythos Preview는 181번 성공, 레지스터 제어까지 29번 달성

Mythos Preview는 현재 Project Glasswing 파트너에게만 방어적 사이버보안 목적으로 제한 공개되어 있다. 이는 앤트로픽이 "너무 강력한 모델은 제한적으로만 공개한다"는 안전 우선 전략을 실행하고 있음을 보여준다.


3. Opus 4.6 vs Opus 4.7 — 무엇이 달라졌나

핵심 변경 요약

앤트로픽은 Opus 4.7의 개선 영역을 크게 네 가지로 제시했다.

  1. 고급 소프트웨어 엔지니어링: 가장 어려운 코딩 작업에서의 성능 향상
  2. 비전 능력: 이미지 해상도 한계 3배 이상 확대
  3. 지시 따르기(Instruction Following): 더 정밀한 지시 준수
  4. 메모리: 장기 멀티세션 작업에서의 맥락 유지 능력 향상

Opus 4.6 vs 4.7 핵심 비교표

항목 Opus 4.6 Opus 4.7 변화
SWE-bench Verified 80.8% 87.6% +6.8pp
SWE-bench Pro 53.4% 64.3% +10.9pp
SWE-bench Multilingual 77.8% 80.5% +2.7pp
CursorBench 58% 70% +12pp
Visual-acuity 54.5% 98.5% +44pp
GPQA Diamond - 94.2% -
MRCR (장문맥 검색) 78.3% 32.2% -46.1pp
최대 이미지 해상도 ~840px 장변 2,576px 장변 3배 이상
컨텍스트 윈도우 1M 토큰 1M 토큰 동일
토크나이저 기존 업데이트 동일 입력 시 1.0~1.35배 토큰

특히 눈에 띄는 것은 비전 성능의 도약이다. Visual-acuity가 54.5%에서 98.5%로 44포인트나 상승한 것은 사실상 완전히 다른 수준의 시각 인식 능력을 의미한다. 반면 MRCR 벤치마크의 급락(78.3% -> 32.2%)은 매우 우려스러운 퇴보로, 이 부분은 뒤에서 자세히 다룬다.


4. 벤치마크 심층 분석 — 숫자가 말하는 진짜 실력

코딩: 가장 두드러진 강점

Opus 4.7의 가장 큰 강점은 단연 소프트웨어 엔지니어링이다.

  • SWE-bench Pro +10.9pp: Opus 4.5에서 4.6으로의 향상이 약 5pp였다는 점을 고려하면, 4.6에서 4.7로의 개선 속도가 2배 이상 가속되었다
  • Rakuten-SWE-Bench: 실제 프로덕션 환경의 태스크에서 Opus 4.6 대비 3배 더 많은 작업 해결, Code Quality와 Test Quality에서 두 자릿수 향상
  • 93개 코딩 태스크 벤치마크: 전체 해결률 13% 향상, Opus 4.6과 Sonnet 4.6 모두 해결하지 못한 4개 태스크 추가 해결

벤치마크 전체 성적표

앤트로픽이 보고한 14개 벤치마크 중 12개에서 Opus 4.7이 승리했다. 가장 큰 폭의 향상을 보인 영역은 다음과 같다.

  • MCP-Atlas: +14.6pp (에이전트 도구 활용)
  • CharXiv-R: +13.6pp (학술 차트 이해)
  • SWE-bench Pro: +10.9pp (고난도 코딩)

약점: MRCR 붕괴

그러나 모든 수치가 장밋빛은 아니다. MRCR(Multi-hop Retrieval and Contextual Reasoning) 벤치마크에서 Opus 4.7은 32.2%를 기록했다. Opus 4.6의 78.3% 대비 46.1포인트 하락이다.

MRCR(Multi-Round Context Recall)은 긴 문서 내에 묻혀 있는 정보를 찾아 추론하는 능력을 측정한다. 1M 토큰 컨텍스트에서 78.3%에서 32.2%로 급락한 것은 단순한 변동이 아니라 구조적 퇴보다. 실제로 여러 개발자가 Opus 4.7에 긴 문서를 입력한 후 모델이 "읽었다"고 응답하지만, 생성된 출력이 내용과 실질적으로 무관한 경우가 보고되고 있다.

다만 앤트로픽은 이에 대해 공식 입장을 밝혔다. MRCR 벤치마크가 방해 요소(distractor)를 비현실적으로 쌓아올리는 방식이어서 실제 사용 패턴을 반영하지 못한다는 것이다. 앤트로픽은 MRCR을 GraphWalks라는 새로운 벤치마크로 대체할 예정이며, GraphWalks에서 Opus 4.7은 멀티홉 순회(multi-hop traversal)에서 개선을 보인다고 설명했다.

주의할 점
앤트로픽의 해명에도 불구하고, "긴 문서에서 유사한 항목들을 구분해내는 능력"이 실질적으로 약화된 것은 사실이다. 장문맥 검색/추론이 핵심인 워크로드에서는 Opus 4.7 마이그레이션 전 반드시 충분한 테스트를 수행해야 한다.

5. 경쟁 모델 3파전 — GPT-5.4, Gemini 3.1 Pro와 비교

2026년 4월 현재, AI 프론티어 모델은 Claude Opus 4.7, OpenAI의 GPT-5.4(3월 5일 출시), Google의 Gemini 3.1 Pro(2월 출시)가 치열한 3파전을 벌이고 있다.

3모델 벤치마크 비교표

벤치마크 Claude Opus 4.7 GPT-5.4 Gemini 3.1 Pro
SWE-bench Verified 87.6% - 80.6%
SWE-bench Pro 64.3% 57.7% 54.2%
GDPVal-AA (Elo) 1753 1674 1314
에이전트 검색 79.3% 89.3% -

영역별 승자

각 모델이 다른 영역에서 강점을 보이고 있어, 단순한 "최강 모델" 논쟁은 무의미해지고 있다.

  • 코딩/소프트웨어 엔지니어링: Claude Opus 4.7 압도적 우위
  • 에이전트 검색(Agentic Search): GPT-5.4 우위 (89.3% vs 79.3%)
  • 지식 업무: Claude Opus 4.7 우위 (GDPVal-AA Elo 1753)
  • 가격 효율성: Gemini 3.1 Pro 압도적 우위

가격 비교표

모델 입력 ($/M토큰) 출력 ($/M토큰) 비고
Claude Opus 4.7 $5 $25 토크나이저 변경으로 실질 비용 증가
GPT-5.4 - - Gemini보다 약 20% 비쌈
Gemini 3.1 Pro $2 $12 Claude 대비 약 60% 저렴

VentureBeat는 이 상황을 "근소한 차이로 가장 강력한 공개 LLM 타이틀을 탈환했다"고 표현했다. 핵심은, 이제 "어떤 모델이 최고인가"보다 "내 워크로드에 어떤 모델이 가장 적합한가"를 따져야 하는 시대가 되었다는 것이다.


6. 개발자를 위한 핵심 변경사항 — xhigh, ultrareview, Task Budget

Opus 4.7에는 개발자 생산성을 직접적으로 높이는 새로운 기능들이 추가되었다.

xhigh 노력 레벨

기존에 low, medium, high, max의 4단계였던 추론 깊이(effort level)에 xhigh(extra high) 단계가 신설되었다. high와 max 사이에 위치하며, 추론의 깊이와 응답 속도 간 트레이드오프를 더 세밀하게 제어할 수 있다.

Claude Code에서는 xhigh가 모든 플랜(Pro, Max, Teams, Enterprise)의 기본값으로 설정되었다. 이는 Opus 4.7이 높은 노력 레벨에서 특히 더 많이 사고(think)하며, 에이전트 작업의 후반 턴에서 신뢰성이 크게 향상된다는 점을 반영한 결정이다.

/ultrareview 명령어

Claude Code에 새로 추가된 /ultrareview 명령어는 회의적인 시니어 엔지니어가 코드를 리뷰하는 것처럼 작동한다. 버그 탐지에 특화되어 있으며, Pro와 Max 사용자는 청구 주기당 3회 무료로 사용할 수 있다.

Task Budget (퍼블릭 베타)

API 사용자를 위한 Task Budget 기능이 퍼블릭 베타로 도입되었다. 이 기능을 사용하면 에이전트 워크플로우에서 모델이 자율적으로 여러 파일과 도구를 넘나들 때 토큰 사용량 상한선을 설정할 수 있다. 예측 불가능한 비용 폭주를 방지하는 핵심 안전장치다.

개발자 마이그레이션 체크리스트
  • 토크나이저 변경으로 동일 프롬프트의 토큰 수가 최대 35% 증가할 수 있음 -- 비용 재산정 필수
  • Opus 4.7은 지시를 더 정밀하게 따르므로, Opus 4.6에 맞춰 튜닝한 프롬프트는 재조정 필요
  • 높은 노력 레벨에서 출력 토큰이 더 많아지므로, 응답 시간과 비용 영향 테스트 필요
  • MRCR 퇴보를 고려해, 장문맥 검색/추론 워크로드는 이전 전 충분한 테스트 권장

7. API 가격의 함정 — "동결"이라는 말의 이면

앤트로픽은 Opus 4.7의 API 가격이 Opus 4.6과 동일하다고 발표했다. 입력 100만 토큰당 $5, 출력 100만 토큰당 $25. 장문맥 프리미엄도 없이 1M 토큰 컨텍스트 윈도우를 표준 가격에 제공한다.

하지만 여기에 함정이 있다.

새 토크나이저의 영향

Opus 4.7은 업데이트된 토크나이저를 사용한다. 동일한 텍스트를 입력해도 기존보다 1.0~1.35배 더 많은 토큰으로 변환된다. 이는 콘텐츠 유형에 따라 다르다.

즉, 명목 가격은 같지만 실제 요청당 비용은 0~35% 증가할 수 있다. Finout의 분석은 이를 "변하지 않은 가격표 뒤의 진짜 비용 이야기"라고 표현했다.

출력 토큰 증가도 비용에 영향

Opus 4.7은 높은 노력 레벨(xhigh, max)에서 더 많이 사고하고 더 많은 출력 토큰을 생성한다. 특히 에이전트 세팅의 후반 턴에서 이 경향이 두드러진다. 출력 토큰 단가가 입력의 5배($25 vs $5)인 점을 고려하면, 이 역시 무시할 수 없는 비용 요소다.

실용적 조언
기존 Opus 4.6 워크로드를 운영 중이라면, 마이그레이션 전에 반드시 동일 프롬프트로 토큰 소비량을 비교 테스트해야 한다. 가격표가 같다고 해서 청구서도 같을 것이라고 가정하면 안 된다.

8. 비전과 멀티모달 — 해상도 3배의 의미

Opus 4.7의 비전 능력은 이번 업그레이드에서 가장 극적인 개선을 보인 영역이다.

해상도 한계의 도약

  • 이전: 약 840px 장변
  • 현재: 2,576px 장변 (약 3.75 메가픽셀)
  • 개선 폭: 3배 이상

이는 실질적으로 무엇을 의미하는가? 기존에는 고해상도 스크린샷이나 기술 다이어그램을 입력하면 세부 사항이 뭉개져서 정확한 분석이 어려웠다. Opus 4.7에서는 웹페이지의 전체 스크린샷, 회로 설계도, 건축 도면 같은 고밀도 시각 자료를 원본에 가까운 해상도로 처리할 수 있게 되었다.

Visual-acuity의 도약

Visual-acuity 벤치마크가 54.5%에서 98.5%로 상승한 것은 단순한 수치 개선이 아니다. 거의 완벽에 가까운 시각 인식 정확도에 도달했다는 의미다. PDF 문서 분석, UI/UX 스크린샷 리뷰, 기술 도표 해석 등의 작업에서 체감 품질 차이가 매우 클 것으로 예상된다.


9. 안전성과 정렬 — 사이버보안 차등 감소라는 실험

앤트로픽은 트랜스포머 아키텍처 기반의 대규모 언어 모델이 갖는 위험성, 특히 사이버보안 영역에서의 악용 가능성을 가장 심각하게 받아들이는 회사 중 하나다. Opus 4.7에는 이러한 철학이 구체적인 기술적 조치로 구현되었다.

사이버보안 차등 감소(Differential Reduction)

앤트로픽은 훈련 과정에서 모델의 공격적 사이버 능력을 선별적으로 약화시키는 실험을 진행했다. 이는 Constitutional AI의 연장선상에 있는 접근법으로, 모델이 "무엇을 할 수 있는가"를 사전에 제한하는 것이다.

Cyber Verification Program

새로운 사이버 검증 프로그램(Cyber Verification Program)이 도입되었다. 악의적 용도로만 사용되고 합법적 방어 목적이 거의 없는 사이버보안 활동을 자동으로 탐지하고 차단하는 시스템이다. 합법적 보안 목적으로 모델을 사용하려는 전문가는 공식 검증 과정을 거쳐야 한다.

정렬 평가 결과

시스템 카드에 따르면, Opus 4.7의 정렬 상태는 다음과 같이 평가된다.

  • 전체 평가: "대체로 잘 정렬되고 신뢰할 수 있으나, 완전히 이상적이지는 않다"
  • Opus 4.6 대비 개선: 정직성, 악성 프롬프트 주입(prompt injection) 방어에서 향상
  • 기만, 아첨(sycophancy), 악용 협조: 낮은 수준 유지

이는 Mythos Preview와의 대비에서 더 의미가 있다. Mythos의 사이버 능력(Firefox 취약점 익스플로잇 181회 성공)이 너무 강력했기 때문에, 공개 모델인 Opus 4.7에서는 의도적으로 이러한 능력을 제한한 것이다.


10. 시장 반응과 논란 — 칭찬과 비판 사이

Opus 4.7에 대한 시장 반응은 양분되어 있다.

긍정적 반응

  • 코딩 벤치마크에서의 압도적 개선은 실체가 있다
  • 비전 능력의 도약은 그동안 Claude의 약점으로 지적되던 부분을 정면 해결
  • SWE-bench Pro에서의 10.9pp 향상은 Opus 4.5 -> 4.6(약 5pp)보다 2배 빠른 개선 속도로, 앤트로픽의 개발 가속화를 보여준다
  • 가격 동결(명목상)은 경쟁사 대비 합리적이라는 평가

비판과 논란

Startup Fortune이 보도한 커뮤니티 백래시는 네 가지 핵심 쟁점을 다룬다.

  1. 토크나이저 변경에 의한 스텔스 가격 인상: 가격표는 같지만 같은 프롬프트에 더 많은 토큰이 소비되어 실질 비용 증가
  2. MRCR 벤치마크 급락: 장문맥 검색 성능이 78.3%에서 32.2%로 붕괴했으나, 앤트로픽이 이를 적극적으로 언급하지 않았다는 비판
  3. 사고 깊이 거버넌스 논란: 노력 레벨(effort level) 시스템이 사용자의 추론 깊이를 인위적으로 제한하는 것 아닌가 하는 의문
  4. Claude Code 제품 안정성: 출시 초기 일부 기능적 문제 보고
균형 잡힌 시각
칭찬과 비판 모두 근거가 있다. 성능 개선은 벤치마크로 입증되었고, 비용 우려는 토크나이저 변경이라는 객관적 사실에 기반한다. 사용자로서 중요한 것은 자신의 워크로드에 맞는 모델을 선택하고, 마이그레이션 전 비용과 성능을 반드시 테스트하는 것이다.

11. AI 경쟁 구도에서의 의미 — 3파전의 현재와 미래

현재 구도: "범용 최강"은 사라졌다

2026년 4월 현재, AI 모델 경쟁은 명확한 결론이 없는 3파전으로 고착되었다.

  • 앤트로픽 Claude: 코딩과 에이전트 작업에서 최강, 안전성 중시
  • OpenAI GPT-5.4: 에이전트 검색과 범용성에서 강세
  • Google Gemini 3.1 Pro: 가격 효율성에서 압도적 우위

이는 "가장 똑똑한 모델을 고르는" 시대에서 "특정 워크로드에 가장 효율적인 모델을 고르는" 시대로의 전환을 의미한다.

Mythos가 시사하는 미래

앤트로픽이 Mythos Preview의 존재를 공개적으로 인정한 것은 두 가지를 시사한다.

첫째, 모델 능력의 프론티어는 공개된 것보다 훨씬 앞에 있다. Mythos의 SWE-bench Verified 93.9%는 현재 공개 모델 중 최고인 Opus 4.7(87.6%)을 크게 앞선다.

둘째, 앤트로픽은 "너무 강한 모델은 공개하지 않는다"는 원칙을 실행하고 있다. 이는 AI 안전성 논쟁에서 앤트로픽의 입장을 가장 직접적으로 보여주는 사례다. 성능 경쟁에서 1등을 할 수 있음에도 의도적으로 제한하는 것은 상업적으로는 불리하지만, 장기적 신뢰 구축에는 기여할 수 있다.

개발자와 기업이 선택해야 할 것

최종적으로, Opus 4.7의 출시가 의미하는 바는 명확하다. 모델 선택이 점점 더 복잡해지고 있다. 단일 모델에 올인하기보다, 작업 유형에 따라 여러 모델을 전략적으로 활용하는 멀티모델 전략이 현실적인 최선이 되어가고 있다.

  • 고난도 코딩, 에이전트 워크플로우 -> Claude Opus 4.7
  • 대규모 검색 기반 작업 -> GPT-5.4
  • 비용 민감한 대량 처리 -> Gemini 3.1 Pro
  • 높은 보안 요구사항 -> Claude Opus 4.7 (사이버보안 세이프가드)