Claude Opus 4.6 그리고 GPT-5.3-Codex 등장
2월 6일 거의 동시에 두 모델이 발표됐다. 2월 3일에 Sonnet 5가 나올 것 같다하더니 이거 기다리다가 Opus 4.6이 먼저 나와버렸다.
오랫동안 새로운 모델을 기다려왔는데, 뭐가 좋아졌는지 살펴보자.
Claude Opus 4.6
https://www.anthropic.com/news/claude-opus-4-6
Claude Opus 4.6
We’re upgrading our smartest model. Across agentic coding, computer use, tool use, search, and finance, Opus 4.6 is an industry-leading model, often by wide margin.
www.anthropic.com
1M 토큰 컨텍스트를 제공한다(베타). 코드베이스가 크더라도 이제 더 안정적으로 작동한다.

여러 지표들이 있지만 우리에게 중요한건 코딩 능력(Agentic coding). Opus 4.5랑 크게 달라진건 없어보인다.
다른 능력들은 확실히 높아진게 보인다.
여기서 GDPval-AA 벤치마크는 금융, 법률 등 실제 전문직 업무를 평가하는 테스트라고 한다. 활용도는 높을 듯 하다


그리고 장문의 컨텍스트에서 성능이 떨어지는 현상인 context rot 이 전에 비해 나아졌다고 한다.
API로 사용할 때 200K 토큰까지는 기존 Opus와 가격이 동일하고, 200K 토큰을 초과하면 가격에 프리미엄이 붙는다. (엄청 비싸다)
GPT-5.3-Codex
https://openai.com/index/introducing-gpt-5-3-codex/
Introducing GPT-5.3-Codex
GPT-5.3-Codex is a Codex-native agent that pairs frontier coding performance with general reasoning to support long-horizon, real-world technical work.
openai.com
이 모델은 자기 개발에 실질적으로 기여한 첫 모델이라고 한다.초기 버전이 학습 과정을 디버깅하고 배포를 관리하고 평가 결과 분석까지 수행했다고 한다.
속도가 기존보다 25% 더 빨라졌다고 한다

SWE-Bench Pro(소프트웨어 엔지니어링을 수행하는 AI 에이전트를 더 엄격하고 현실적으로 평가하기 위해 설계된 벤치마크)는 크게 높아지진 않았다.

그런데 훨씬 적은 토큰으로 높은 성능을 냈다!

Terminal-Bench(터미널에서 작업하는 능력)이 획기적으로 향상됐다
정리
이번 버전은 메이저 버전이 바뀌지 않아서 그런가 코딩적인 능력보다는 다른 능력에 집중한 것 같다.
그래도 좋아진 부분들이 많으니 체감이 될 것 같다.
새벽부터 새로운 버전으로 코딩을 해보는 중이다. 아직까진 드라마틱하게 좋아졌다! 라고는 못느끼고 있다.
뭔가 클로드는 좀 더 느려진 것 같고, 코덱스는 확실히 빨라진 것 같다.