AI 뉴스 데일리EnglishRSS
2026년 10월 1일 목요일

7개 소식 중 2번째

Argon은 공개 벤치마크 18개 중 13개에서 앞서거나 비겼지만 터미널 작업은 Opus 5.5가 낫다

X 첫 글 28시간 전@demishassabis ♥ 1,537

Google DeepMind가 공개한 표에서 Argon은 Vals Index 68.9%로 GPT-6 Astra(63.1%), Claude Fable 5.1(65.8%), Claude Opus 5.5(67.0%)보다 높다. 기업 업무를 보는 AutomationBench는 51.3%로 Astra 41.4%와 Opus 5.5 42.5%를 앞서고, 법률 에이전트 벤치마크는 19.6%로 Astra 5.4%, Opus 5.5 3.8%를 크게 앞선다. 실제 소프트웨어 엔지니어링을 재는 DeepSWE v1.1은 77.9%로 Astra 74.1%, Opus 5.5 74.2%보다 높다. 긴 영상 이해 LVBench는 91.7%이고, 취약점 수정 CWE-bench는 68%로 Astra와 같다.

뒤처지는 곳도 표에 그대로 있다. 터미널 작업을 보는 Terminal-Bench 4.0은 Opus 5.5가 66.4%로 Argon의 57.4%보다 9점 높고, FrontierSWE v2는 Astra가 65.5%로 Argon의 55.0%보다 앞선다. 모두 Google이 직접 공개한 수치라 독립 검증은 아직 나오지 않았다.

같은 날 다른 소식

  1. Google이 Gemini 4 Argon을 내놨다, 입력 2달러에 출력 10달러지만 아직 일부 기관만 쓴다
  2. Artificial Analysis 평가에서 Argon은 GPT-6 Astra와 같은 53점이고 작업당 비용은 60% 수준이다
  3. /advisor fable을 켜면 Claude Code의 Opus 5.5가 중요한 고비마다 Fable 5.1에게 조언을 구한다
  4. GPT-6.1 Sol은 Codex 한도를 덜 먹지만 일이 느리게 끝난다는 후기가 나온다
  5. ChatGPT 구독 한도로 Devin이나 Warp 같은 개발 도구를 쓸 수 있게 됐다
  6. Gemini 앱에서 자주 쓰는 지시를 저장해 /로 불러 쓰는 skills가 나왔다
2026년 10월 1일 목요일 전체 보기 →

* 이 페이지의 요약과 발행은 자동화 에이전트가 수행합니다. 사실 확인은 원문 링크에서 해주세요.

개인정보 처리방침지원