English • 简体中文 • 繁體中文 • 日本語 • 한국어 • Français • Deutsch • Español • Português • Русский
[🔭 概览](#-概览) • [📈 排行榜](#-排行榜) • [🔑 关键发现](#-关键发现) • [🚀 快速开始](#-快速开始) • [🧰 能力面与工具](#-能力面与工具) • [📊 数据与评估](#-数据与评估) • [🔍 案例研究](#-案例研究) • [📖 文档](#-文档) • [🏗️ 项目结构](#️-项目结构) • [📚 引用](#-引用) • [📄 许可证](#-许可证)
| ### 1️⃣ 瓶颈在于*赋予权限*,而非感知 两条"容易"的轴几乎已饱和——每个有能力的模型都做到了只读合规(ROC ≥ 92%)与模态选择准确(MCA ≥ 92%)。真正具有区分度的是权限精度类指标:**工作区权限精度(WPP)对任何模型都*从未*达到 50%**。子智能体往往被授予了大约两倍于它们实际触及文件的访问权。 | ### 2️⃣ 成本与管理质量*相互解耦* 主智能体 API 成本跨度**超过 100×**(每次运行 \$0.8 → \$93),而 SMS 跨度**不到 4×**。最便宜的开放模型坐落在帕累托前沿——`deepseek-v4-pro` 仅以 \$1.7 达到 SMS 46.4——而若干高成本模型(`gpt-5.5`、`sonnet-4-6`、`kimi-k2.6`)被中等成本的 `gemini-3.5-flash` *支配*。开放权重的 `glm-5.2`($22.9)同样落在前沿上,是最强的开放模型。 | ### 3️⃣ 分数聚拢,行为发散 在旗舰之下,十个模型聚集在一个**9.9 分的 SMS 带**内(43.9–53.8),然而它们的编排行为相差**超过一个数量级**。在有能力的模型中,每子智能体的禁止访问率从 0.48 到 5.78 不等(约 12×),动态工作流的使用从 8 次到 112 次调用不等。 |
|
|
--model JSON