English • 简体中文 • 繁體中文 • 日本語 • 한국어 • Français • Deutsch • Español • Português • Русский
[🔭 概要](#-概要) • [📈 リーダーボード](#-リーダーボード) • [🔑 主要な発見](#-主要な発見) • [🚀 クイックスタート](#-クイックスタート) • [🧰 機能サーフェスとツール](#-機能サーフェスとツール) • [📊 データと評価](#-データと評価) • [🔍 ケーススタディ](#-ケーススタディ) • [📖 ドキュメント](#-ドキュメント) • [🏗️ プロジェクト構成](#-プロジェクト構成) • [📚 引用](#-引用) • [📄 ライセンス](#-ライセンス)
| ### 1️⃣ ボトルネックは知覚ではなく *権限付与* にある 2 つの「容易な」軸はほぼ飽和しています — すべての有能なモデルにおいて読み取り専用遵守(ROC ≥ 92%)とモダリティ選択精度(MCA ≥ 92%)が高い値を示します。識別力のある軸は権限の精度に関する指標です:**Workspace-Permission Precision (WPP) はどのモデルでも 50% に *到達しません*。** サブエージェントには、実際にアクセスするファイルのおよそ 2 倍が日常的に付与されています。 | ### 2️⃣ コストと管理品質は *分離している* メインエージェントの API コストは **100 倍以上**(実行あたり \$0.8 → \$93)に及ぶ一方、SMS は **4 倍未満** にとどまります。最も安価なオープンモデルはパレートフロンティア上に位置し — `deepseek-v4-pro` はわずか \$1.7 で SMS 46.4 に到達します — 一方でいくつかの高コストモデル(`gpt-5.5`、`sonnet-4-6`、`kimi-k2.6`)は中コストの `gemini-3.5-flash` に *支配されています*。オープンウェイトの `glm-5.2`($22.9)も最強のオープンモデルとしてフロンティア上に位置します。 | ### 3️⃣ スコアは集中し、振る舞いは分岐する フラッグシップを下回る 10 モデルは **9.9 ポイントの SMS 帯**(43.9〜53.8)に集中していますが、それらのオーケストレーション挙動は **1 桁以上** 異なります。サブエージェントあたりの禁止アクセス率は、有能なモデル間で 0.48 から 5.78(約 12 倍)に及び、動的ワークフローの利用は 8 から 112 回の呼び出しに及びます。 |
|
|
--model JSON