English • 简体中文 • 繁體中文 • 日本語 • 한국어 • Français • Deutsch • Español • Português • Русский
[🔭 Обзор](#-обзор) • [📈 Таблица лидеров](#-таблица-лидеров) • [🔑 Ключевые выводы](#-ключевые-выводы) • [🚀 Быстрый старт](#-быстрый-старт) • [🧰 Поверхность возможностей и инструменты](#-поверхность-возможностей-и-инструменты) • [📊 Данные и оценивание](#-данные-и-оценивание) • [🔍 Разбор примеров](#-разбор-примеров) • [📖 Документация](#-документация) • [🏗️ Структура проекта](#️-структура-проекта) • [📚 Цитирование](#-цитирование) • [📄 Лицензия](#-лицензия)
| ### 1️⃣ Узкое место — *предоставление привилегий*, а не восприятие Две «лёгкие» оси почти насыщены — соответствие режиму только-чтение (ROC ≥ 92%) и точность выбора модальности (MCA ≥ 92%) для каждой способной модели. Различающие оси — это метрики точности привилегий: **точность разрешений на рабочее пространство (WPP) *никогда* не достигает 50%** ни для одной модели. Субагентам регулярно предоставляется примерно вдвое больше файлов, чем они фактически затрагивают. | ### 2️⃣ Стоимость и качество управления *развязаны* Стоимость API главного агента охватывает **более 100×** (\$0.8 → \$93 за прогон), тогда как SMS охватывает **менее 4×**. Самые дешёвые открытые модели находятся на границе Парето — `deepseek-v4-pro` достигает SMS 46.4 всего за \$1.7, — в то время как несколько дорогих моделей (`gpt-5.5`, `sonnet-4-6`, `kimi-k2.6`) *доминируются* среднеценовой `gemini-3.5-flash`. Модель с открытыми весами `glm-5.2` ($22.9) также попадает на границу как сильнейшая открытая модель. | ### 3️⃣ Баллы кластеризуются, поведение расходится Ниже флагмана десять моделей группируются в **полосе SMS шириной 9.9 пункта** (43.9–53.8), однако их поведение оркестрации различается **более чем на порядок**. Частота запрещённых обращений на одного субагента варьируется от 0.48 до 5.78 среди способных моделей (~12×), а использование динамических рабочих процессов — от 8 до 112 вызовов. |
|
|
--model