English • 简体中文 • 繁體中文 • 日本語 • 한국어 • Français • Deutsch • Español • Português • Русский
[🔭 Visión general](#-visión-general) • [📈 Clasificación](#-clasificación) • [🔑 Hallazgos clave](#-hallazgos-clave) • [🚀 Inicio rápido](#-inicio-rápido) • [🧰 Superficie de capacidades y herramientas](#-superficie-de-capacidades-y-herramientas) • [📊 Datos y evaluación](#-datos-y-evaluación) • [🔍 Casos de estudio](#-casos-de-estudio) • [📖 Documentación](#-documentación) • [🏗️ Estructura del proyecto](#️-estructura-del-proyecto) • [📚 Citación](#-citación) • [📄 Licencia](#-licencia)
| ### 1️⃣ El cuello de botella es la *concesión de privilegios*, no la percepción Los dos ejes "fáciles" están casi saturados — cumplimiento de solo lectura (ROC ≥ 92%) y precisión de elección de modalidad (MCA ≥ 92%) para todo modelo capaz. Los ejes discriminantes son las métricas de precisión de privilegios: la **Workspace-Permission Precision (WPP) *nunca* alcanza el 50%** para ningún modelo. A los subagentes se les conceden de forma rutinaria aproximadamente el doble de archivos de los que realmente tocan. | ### 2️⃣ El coste y la calidad de gestión están *desacoplados* El coste de la API del agente principal abarca **más de 100×** (\$0.8 → \$93 por ejecución) mientras que el SMS abarca **menos de 4×**. Los modelos abiertos más baratos se sitúan en la frontera de Pareto — `deepseek-v4-pro` alcanza un SMS de 46.4 por tan solo \$1.7 — mientras que varios modelos de alto coste (`gpt-5.5`, `sonnet-4-6`, `kimi-k2.6`) son *dominados* por `gemini-3.5-flash`, de coste medio. El `glm-5.2` de pesos abiertos ($22.9) también aterriza en la frontera como el modelo abierto más potente. | ### 3️⃣ Las puntuaciones se agrupan, los comportamientos divergen Por debajo del modelo insignia, diez modelos se agrupan dentro de una **banda de SMS de 9.9 puntos** (43.9–53.8), pero sus comportamientos de orquestación difieren en **más de un orden de magnitud**. La tasa de acceso prohibido por subagente varía de 0.48 a 5.78 entre los modelos capaces (~12×), y el uso de flujos de trabajo dinámicos varía de 8 a 112 invocaciones. |
|
|
--model