2월 6일 거의 동시에 두 모델이 발표됐다. 2월 3일에 Sonnet 5가 나올 것 같다하더니 이거 기다리다가 Opus 4.6이 먼저 나와버렸다.

 

오랫동안 새로운 모델을 기다려왔는데, 뭐가 좋아졌는지 살펴보자.

 

Claude Opus 4.6

https://www.anthropic.com/news/claude-opus-4-6

 

Claude Opus 4.6

We’re upgrading our smartest model. Across agentic coding, computer use, tool use, search, and finance, Opus 4.6 is an industry-leading model, often by wide margin.

www.anthropic.com

 

1M 토큰 컨텍스트를 제공한다(베타). 코드베이스가 크더라도 이제 더 안정적으로 작동한다.

 

Opus 4.6 지표

 

여러 지표들이 있지만 우리에게 중요한건 코딩 능력(Agentic coding). Opus 4.5랑 크게 달라진건 없어보인다.

다른 능력들은 확실히 높아진게 보인다.

 

여기서 GDPval-AA 벤치마크는 금융, 법률 등 실제 전문직 업무를 평가하는 테스트라고 한다. 활용도는 높을 듯 하다

 

 

그리고 장문의 컨텍스트에서 성능이 떨어지는 현상인 context rot 이 전에 비해 나아졌다고 한다.

 

API로 사용할 때 200K 토큰까지는 기존 Opus와 가격이 동일하고, 200K 토큰을 초과하면 가격에 프리미엄이 붙는다. (엄청 비싸다)

 

GPT-5.3-Codex

https://openai.com/index/introducing-gpt-5-3-codex/

 

Introducing GPT-5.3-Codex

GPT-5.3-Codex is a Codex-native agent that pairs frontier coding performance with general reasoning to support long-horizon, real-world technical work.

openai.com

 

이 모델은 자기 개발에 실질적으로 기여한 첫 모델이라고 한다.초기 버전이 학습 과정을 디버깅하고 배포를 관리하고 평가 결과 분석까지 수행했다고 한다.

 

속도가 기존보다 25% 더 빨라졌다고 한다

Codex 5.3 지표

SWE-Bench Pro(소프트웨어 엔지니어링을 수행하는 AI 에이전트를 더 엄격하고 현실적으로 평가하기 위해 설계된 벤치마크)는 크게 높아지진 않았다.

그런데 훨씬 적은 토큰으로 높은 성능을 냈다!

 

Terminal-Bench(터미널에서 작업하는 능력)이 획기적으로 향상됐다

 

정리

이번 버전은 메이저 버전이 바뀌지 않아서 그런가 코딩적인 능력보다는 다른 능력에 집중한 것 같다.

그래도 좋아진 부분들이 많으니 체감이 될 것 같다.

 


새벽부터 새로운 버전으로 코딩을 해보는 중이다. 아직까진 드라마틱하게 좋아졌다! 라고는 못느끼고 있다.

뭔가 클로드는 좀 더 느려진 것 같고, 코덱스는 확실히 빨라진 것 같다.