라벨이 AI 모델 비교인 게시물 표시

Gemini 3.1 Pro 출시 — ARC-AGI-2 77.1%로 추론 2배 도약, 가격은 동결 | 벤치마크·가격·실사용 반응 총정리

2026년 2월 19일, Google은 플래그십 AI 모델의 업그레이드 버전 Gemini 3.1 Pro 를 프리뷰로 출시했습니다. 2025년 11월 Gemini 3 Pro 공개 이후 정확히 3개월 만의 업데이트로, 핵심 추론 벤치마크인 ARC-AGI-2에서 77.1% 를 기록해 전작(31.1%) 대비 2배 이상의 추론 성능 도약 을 보여줍니다. 독립 평가 기관 Artificial Analysis의 Intelligence Index에서 1위 를 차지하며 Anthropic Claude Opus 4.6을 제치고 "세계에서 가장 지능적인 AI 모델" 자리를 되찾았습니다( Artificial Analysis, 2026-02-19 ). 가격은 Gemini 3 Pro와 완전히 동일 하게 유지되어, 사실상 추가 비용 없이 대규모 성능 업그레이드를 받는 셈입니다. 이 글은 Gemini 3.1 Pro의 핵심 스펙, 벤치마크 성적표, API 가격, 사용 가능 플랫폼, 그리고 커뮤니티의 솔직한 실사용 반응까지 — 오늘 공개된 정보를 팩트 기반으로 분석합니다. 벤치마크 숫자의 화려함 뒤에 숨은 한계도 함께 짚겠습니다. AI 모델 경쟁의 현재 — 왜 3개월 만에 또 업그레이드인가 2025년 11월 Gemini 3 Pro가 출시됐을 때, Google은 LMArena 리더보드 1위(1501 Elo)를 차지하며 잠시 왕좌에 올랐습니다. 하지만 수 주 안에 OpenAI와 Anthropic이 각각 GPT-5.2와 Claude Opus 4.5/4.6을 출시하며 즉시 추월했습니다. VentureBeat는 이를 "왕좌를 빼앗겼다가 되찾는 패턴" 이라고 표현합니다( VentureBeat, 2026-02-19 ). Reddit r/singularity에서 한 사용자는 "한 주는 Claude가 최고, 다음 주엔 다른 모델이 넘...

GPT-5.3-Codex 출시 총정리 — 스스로를 만든 첫 모델, Terminal-Bench 77.3%, 실시간 협업까지

"코드를 작성하는 에이전트에서, 컴퓨터로 거의 모든 일을 수행하는 에이전트로." 2026년 2월 5일, OpenAI가 GPT-5.3-Codex 를 공개했습니다. 같은 날 앤트로픽의 Claude Opus 4.6이 출시되면서, 두 회사의 최신 모델이 불과 수십 분 간격으로 세상에 나오는 이례적인 상황이 벌어졌습니다. OpenAI 공식 발표에 따르면, GPT-5.3-Codex는 GPT-5.2-Codex의 프론티어급 코딩 성능과 GPT-5.2의 추론·전문 지식 역량을 하나의 모델에 결합한 것으로, 이전 대비 25% 더 빠르게 작동합니다. 연구, 도구 사용, 복잡한 실행이 수반되는 장시간 작업을 처리할 수 있으며, 작업 도중에도 동료처럼 맥락을 잃지 않고 상호작용할 수 있습니다. 가장 주목할 점: 스스로를 만드는 데 참여한 최초의 모델 OpenAI는 GPT-5.3-Codex가 "자신을 만드는 데 핵심적 역할을 한 최초의 모델" 이라고 밝혔습니다. Codex 팀이 초기 버전을 활용하여 자체 학습 과정을 디버깅하고, 배포를 관리하며, 테스트 결과와 평가를 진단하게 했는데, Codex가 자체 개발을 얼마나 가속화했는지에 팀이 놀랐다고 전했습니다. 구체적으로, 연구팀은 Codex를 사용해 학습 과정을 모니터링하고 디버깅했으며, 학습 전반에 걸친 패턴을 추적하고, 상호작용 품질에 대한 심층 분석을 수행하고, 수정안을 제안하는 데 활용했습니다. 엔지니어링 팀은 Codex로 하네스를 최적화하고, 사용자에게 영향을 미치는 엣지 케이스가 발생했을 때 컨텍스트 렌더링 버그를 식별하고 낮은 캐시 적중률의 근본 원인을 찾았습니다. 출시 과정에서도 GPT-5.3-Codex가 트래픽 급증에 맞춰 GPU 클러스터를 동적으로 확장하고 지연 시간을 안정적으로 유지하는 데 도움을 주고 있다고 합니다. ...

클로드 오퍼스 4.6 출시 총정리 — 에이전트 팀, 1M 토큰 컨텍스트, 적응형 사고까지

"가장 똑똑한 모델이 업그레이드되었습니다." 2026년 2월 5일, 앤트로픽(Anthropic)이 자사의 최상위 AI 모델인 클로드 오퍼스 4.6(Claude Opus 4.6) 을 공개했습니다. 앤트로픽 공식 발표에 따르면, 이번 모델은 이전 모델인 Opus 4.5의 코딩 능력을 개선한 것으로, 더 신중하게 계획하고, 에이전트 작업을 더 오래 지속하며, 대규모 코드베이스에서 더 안정적으로 작동하고, 스스로의 실수를 잡아내는 코드 리뷰 및 디버깅 능력이 향상되었습니다. 특히 Opus 급 모델로는 최초로 1M(백만) 토큰 컨텍스트 윈도우 를 베타로 지원합니다. 벤치마크 성과: 어디서 가장 강한가 앤트로픽에 따르면, Opus 4.6은 에이전트 코딩 평가인 Terminal-Bench 2.0 에서 65.4%로 업계 최고 점수를 기록했고, 복잡한 다학제 추론 시험인 Humanity's Last Exam 에서도 모든 프론티어 모델을 앞질렀습니다. 경제적으로 가치 있는 지식 업무(금융, 법률 등)를 평가하는 GDPval-AA 에서는 OpenAI의 GPT-5.2를 약 144 Elo 포인트 차이로, 이전 모델 Opus 4.5를 190 포인트 차이로 앞섰습니다. 온라인에서 찾기 어려운 정보를 검색하는 BrowseComp 에서도 84.0%로 1위를 기록했습니다. 다만, 소프트웨어 엔지니어링 벤치마크인 SWE-bench Verified 에서는 80.8%로, 이전 모델 Opus 4.5(80.9%)와 사실상 동일한 수준을 유지했습니다. 이는 이번 업데이트가 코드 생성 정확도 자체보다는 에이전트 능력과 장기 작업 지속성에 초점을 맞췄음을 시사합니다. 컴퓨터 사용(Computer Use) 능력을 측정하는 OSWorld 벤치마크에서는 72.7%로 Opus 4.5(66.3...