English • 简体中文 • 繁體中文 • 日本語 • 한국어 • Français • Deutsch • Español • Português • Русский
[🔭 개요](#-개요) • [📈 리더보드](#-리더보드) • [🔑 핵심 발견](#-핵심-발견) • [🚀 빠른 시작](#-빠른-시작) • [🧰 역량 표면 및 도구](#-역량-표면-및-도구) • [📊 데이터 및 평가](#-데이터-및-평가) • [🔍 사례 연구](#-사례-연구) • [📖 문서](#-문서) • [🏗️ 프로젝트 구조](#️-프로젝트-구조) • [📚 인용](#-인용) • [📄 라이선스](#-라이선스)
| ### 1️⃣ 병목은 인지가 아니라 *권한 부여* 다 두 가지 "쉬운" 축은 거의 포화 상태입니다 — 유능한 모든 모델에서 읽기 전용 준수(ROC ≥ 92%)와 모달리티 선택 정확도(MCA ≥ 92%)를 보입니다. 변별력 있는 축은 권한 정밀도 지표입니다: **워크스페이스 권한 정밀도(WPP)는 어떤 모델에서도 *결코* 50%에 도달하지 못합니다**. 서브에이전트는 실제로 접근하는 파일의 대략 두 배에 달하는 권한을 일상적으로 부여받습니다. | ### 2️⃣ 비용과 관리 품질은 *분리되어 있다* 메인 에이전트 API 비용은 **100배 이상** 차이가 나는 반면(실행당 \$0.8 → \$93), SMS는 **4배 미만** 차이가 납니다. 가장 저렴한 오픈 모델이 파레토 경계에 위치합니다 — `deepseek-v4-pro`는 단 \$1.7로 SMS 46.4를 달성합니다 — 반면 고비용 모델 여러 개(`gpt-5.5`, `sonnet-4-6`, `kimi-k2.6`)는 중간 비용의 `gemini-3.5-flash`에 *지배(dominated)* 당합니다. 오픈 웨이트 `glm-5.2` ($22.9) 또한 가장 강력한 오픈 모델로서 경계 위에 위치합니다. | ### 3️⃣ 점수는 모이지만, 행동은 갈린다 플래그십 아래로, 10개 모델이 **9.9포인트의 SMS 대역**(43.9–53.8) 안에 모여 있지만, 이들의 오케스트레이션 행동은 **자릿수 이상으로** 차이가 납니다. 서브에이전트당 금지 접근율은 유능한 모델 사이에서 0.48에서 5.78까지 분포하며(~12배), 동적 워크플로 사용은 8회에서 112회까지의 호출 범위에 걸쳐 있습니다. |
|
|
--model JSON