Argon은 공개 벤치마크 18개 중 13개에서 앞서거나 비겼지만 터미널 작업은 Opus 5.5가 낫다
X 첫 글 28시간 전@demishassabis ♥ 1,537
Google DeepMind가 공개한 표에서 Argon은 Vals Index 68.9%로 GPT-6 Astra(63.1%), Claude Fable 5.1(65.8%), Claude Opus 5.5(67.0%)보다 높다. 기업 업무를 보는 AutomationBench는 51.3%로 Astra 41.4%와 Opus 5.5 42.5%를 앞서고, 법률 에이전트 벤치마크는 19.6%로 Astra 5.4%, Opus 5.5 3.8%를 크게 앞선다. 실제 소프트웨어 엔지니어링을 재는 DeepSWE v1.1은 77.9%로 Astra 74.1%, Opus 5.5 74.2%보다 높다. 긴 영상 이해 LVBench는 91.7%이고, 취약점 수정 CWE-bench는 68%로 Astra와 같다.
뒤처지는 곳도 표에 그대로 있다. 터미널 작업을 보는 Terminal-Bench 4.0은 Opus 5.5가 66.4%로 Argon의 57.4%보다 9점 높고, FrontierSWE v2는 Astra가 65.5%로 Argon의 55.0%보다 앞선다. 모두 Google이 직접 공개한 수치라 독립 검증은 아직 나오지 않았다.