클로드 오퍼스 4.6 출시 총정리 — 에이전트 팀, 1M 토큰 컨텍스트, 적응형 사고까지
"가장 똑똑한 모델이 업그레이드되었습니다." 2026년 2월 5일, 앤트로픽(Anthropic)이 자사의 최상위 AI 모델인 클로드 오퍼스 4.6(Claude Opus 4.6) 을 공개했습니다. 앤트로픽 공식 발표에 따르면, 이번 모델은 이전 모델인 Opus 4.5의 코딩 능력을 개선한 것으로, 더 신중하게 계획하고, 에이전트 작업을 더 오래 지속하며, 대규모 코드베이스에서 더 안정적으로 작동하고, 스스로의 실수를 잡아내는 코드 리뷰 및 디버깅 능력이 향상되었습니다. 특히 Opus 급 모델로는 최초로 1M(백만) 토큰 컨텍스트 윈도우 를 베타로 지원합니다. 벤치마크 성과: 어디서 가장 강한가 앤트로픽에 따르면, Opus 4.6은 에이전트 코딩 평가인 Terminal-Bench 2.0 에서 65.4%로 업계 최고 점수를 기록했고, 복잡한 다학제 추론 시험인 Humanity's Last Exam 에서도 모든 프론티어 모델을 앞질렀습니다. 경제적으로 가치 있는 지식 업무(금융, 법률 등)를 평가하는 GDPval-AA 에서는 OpenAI의 GPT-5.2를 약 144 Elo 포인트 차이로, 이전 모델 Opus 4.5를 190 포인트 차이로 앞섰습니다. 온라인에서 찾기 어려운 정보를 검색하는 BrowseComp 에서도 84.0%로 1위를 기록했습니다. 다만, 소프트웨어 엔지니어링 벤치마크인 SWE-bench Verified 에서는 80.8%로, 이전 모델 Opus 4.5(80.9%)와 사실상 동일한 수준을 유지했습니다. 이는 이번 업데이트가 코드 생성 정확도 자체보다는 에이전트 능력과 장기 작업 지속성에 초점을 맞췄음을 시사합니다. 컴퓨터 사용(Computer Use) 능력을 측정하는 OSWorld 벤치마크에서는 72.7%로 Opus 4.5(66.3...