English • 简体中文 • 繁體中文 • 日本語 • 한국어 • Français • Deutsch • Español • Português • Русский
[🔭 Aperçu](#-aperçu) • [📈 Classement](#-classement) • [🔑 Conclusions clés](#-conclusions-clés) • [🚀 Démarrage rapide](#-démarrage-rapide) • [🧰 Surface de capacités et outils](#-surface-de-capacités-et-outils) • [📊 Données et évaluation](#-données-et-évaluation) • [🔍 Études de cas](#-études-de-cas) • [📖 Documentation](#-documentation) • [🏗️ Structure du projet](#️-structure-du-projet) • [📚 Citation](#-citation) • [📄 Licence](#-licence)
| ### 1️⃣ Le goulot d'étranglement est l'*octroi de privilèges*, pas la perception Les deux axes « faciles » sont quasiment saturés — conformité en lecture seule (ROC ≥ 92 %) et exactitude du choix de modalité (MCA ≥ 92 %) pour tout modèle compétent. Les axes discriminants sont les métriques de précision des privilèges : la **précision des permissions d'espace de travail (WPP) n'atteint *jamais* 50 %** pour aucun modèle. Les sous-agents se voient régulièrement accorder environ deux fois plus de fichiers qu'ils n'en touchent réellement. | ### 2️⃣ Le coût et la qualité de gestion sont *découplés* Le coût d'API de l'agent principal s'étend sur **plus de 100×** (\$0.8 → \$93 par passe) tandis que le SMS s'étend sur **moins de 4×**. Les modèles ouverts les moins chers se situent sur la frontière de Pareto — `deepseek-v4-pro` atteint un SMS de 46.4 pour seulement \$1.7 — tandis que plusieurs modèles à coût élevé (`gpt-5.5`, `sonnet-4-6`, `kimi-k2.6`) sont *dominés* par le `gemini-3.5-flash` à coût moyen. Le modèle à poids ouverts `glm-5.2` ($22.9) atterrit lui aussi sur la frontière comme le modèle ouvert le plus performant. | ### 3️⃣ Les scores se regroupent, les comportements divergent Sous le modèle phare, dix modèles se regroupent dans une **bande de SMS de 9,9 points** (43.9–53.8), pourtant leurs comportements d'orchestration diffèrent de **plus d'un ordre de grandeur**. Le taux d'accès interdits par sous-agent varie de 0,48 à 5,78 parmi les modèles compétents (~12×), et l'usage des flux de travail dynamiques varie de 8 à 112 invocations. |
|
|
--model