English • 简体中文 • 繁體中文 • 日本語 • 한국어 • Français • Deutsch • Español • Português • Русский
[🔭 概覽](#-概覽) • [📈 排行榜](#-排行榜) • [🔑 主要發現](#-主要發現) • [🚀 快速開始](#-快速開始) • [🧰 能力面向與工具](#-能力面向與工具) • [📊 資料與評測](#-資料與評測) • [🔍 案例研究](#-案例研究) • [📖 文件](#-文件) • [🏗️ 專案結構](#️-專案結構) • [📚 引用](#-引用) • [📄 授權](#-授權)
| ### 1️⃣ 瓶頸在於 *權限授予*,而非感知 兩個「容易」的面向幾乎已達飽和——對每個具備能力的模型而言,唯讀遵從度(ROC ≥ 92%)與模態選擇準確率(MCA ≥ 92%)皆然。具區辨力的面向是權限精確度指標:**工作區權限精確度(WPP)對任何模型都 *從未* 達到 50%**。子代理被授予的檔案,往往大約是其實際存取數量的兩倍。 | ### 2️⃣ 成本與管理品質彼此 *脫鉤* 主代理 API 成本跨距 **超過 100×**(每次執行 \$0.8 → \$93),而 SMS 跨距 **不到 4×**。最便宜的開放模型位於柏拉圖前緣(Pareto frontier)——`deepseek-v4-pro` 僅以 \$1.7 即達到 SMS 46.4——而數個高成本模型(`gpt-5.5`、`sonnet-4-6`、`kimi-k2.6`)卻被中等成本的 `gemini-3.5-flash` *支配*。開放權重的 `glm-5.2`($22.9)也落在前緣上,是最強的開放模型。 | ### 3️⃣ 分數聚攏,行為分歧 在旗艦之下,十個模型聚攏在 **9.9 分的 SMS 區間**(43.9–53.8)內,但其編排行為的差異卻 **超過一個數量級**。在具備能力的模型之間,每個子代理的禁止存取率介於 0.48 至 5.78(約 12×),而動態工作流程的使用量介於 8 至 112 次呼叫。 |
|
|
--model JSON 設定