English • 简体中文 • 繁體中文 • 日本語 • 한국어 • Français • Deutsch • Español • Português • Русский
[🔭 Visão Geral](#-visão-geral) • [📈 Placar](#-placar) • [🔑 Principais Descobertas](#-principais-descobertas) • [🚀 Início Rápido](#-início-rápido) • [🧰 Superfície de Capacidades e Ferramentas](#-superfície-de-capacidades-e-ferramentas) • [📊 Dados e Avaliação](#-dados-e-avaliação) • [🔍 Estudos de Caso](#-estudos-de-caso) • [📖 Documentação](#-documentação) • [🏗️ Estrutura do Projeto](#️-estrutura-do-projeto) • [📚 Citação](#-citação) • [📄 Licença](#-licença)
| ### 1️⃣ O gargalo é a *concessão de privilégios*, não a percepção Os dois eixos "fáceis" estão quase saturados — conformidade somente leitura (ROC ≥ 92%) e precisão de escolha de modalidade (MCA ≥ 92%) para todo modelo capaz. Os eixos discriminantes são as métricas de precisão de privilégio: a **Workspace-Permission Precision (WPP) *nunca* atinge 50%** para nenhum modelo. Rotineiramente, os subagentes recebem cerca de duas vezes os arquivos que realmente acessam. | ### 2️⃣ Custo e qualidade de gestão estão *desacoplados* O custo de API do agente principal varia **mais de 100×** (\$0.8 → \$93 por execução), enquanto o SMS varia **menos de 4×**. Os modelos abertos mais baratos ficam na fronteira de Pareto — `deepseek-v4-pro` atinge SMS 46.4 por apenas \$1.7 — enquanto vários modelos de alto custo (`gpt-5.5`, `sonnet-4-6`, `kimi-k2.6`) são *dominados* pelo `gemini-3.5-flash` de custo médio. O `glm-5.2` de peso aberto ($22.9) também chega à fronteira como o modelo aberto mais forte. | ### 3️⃣ As pontuações se agrupam, os comportamentos divergem Abaixo do modelo principal, dez modelos se agrupam em uma **faixa de SMS de 9,9 pontos** (43.9–53.8), mas seus comportamentos de orquestração diferem em **mais de uma ordem de magnitude**. A taxa de acesso proibido por subagente varia de 0.48 a 5.78 entre os modelos capazes (~12×), e o uso de fluxo de trabalho dinâmico varia de 8 a 112 invocações. |
|
|
--model