評估
·
1 分钟阅读时长
評估問題
核心問題只有一個:AFP 帶來的可靠性提升,是否足以合理化額外的結構與成本?
這件事應該用測試回答,而不是先假設成立。
基線設計
目前評估計畫比較四種條件,並盡量固定模型、任務、工具、證據集合與測試日期:
- 只有模型 — 不加入額外治理結構。
- 一般指令 — 使用一般 Custom Instructions 或任務說明。
- AFP — 在相同任務上套用 AFP 工作流程。
- AFP + 治理控制 — 視任務加入明確證據閘門、人工覆核條件與回歸檢查。
Validity Gate 先於 Quality Gate
每一筆結果必須先確認題目、證據、rubric、模型可見前提與比較條件有效,再判斷模型品質。若測試本身無效、Provider 阻擋或 grader 有爭議,不得直接算成 AFP 或基線的失敗。
公開結果至少區分:
MODEL_PASSMODEL_FAILPROVIDER_BLOCKINFRA_ERRORINVALID_TESTGRADER_DISPUTE
模型品質通過率只使用:
MODEL_PASS ÷(MODEL_PASS + MODEL_FAIL)
其他狀態必須保留並另外報告,不得悄悄丟棄。
指標
最低限度應記錄:
- 任務正確率或 rubric 分數;
- 最差結果與致命失敗;
- 多次執行的變異程度;
- 無依據但高確信的主張;
- 漏掉的反證;
- 工具呼叫次數;
- Token 使用量;
- 完成時間。
高風險工作流程不能只看平均分數。即使平均表現很好,只要仍存在嚴重且未被攔截的失敗,系統仍可能不適合使用。
實驗控制
有效比較應在可行範圍內固定:
相同模型 · 相同任務 · 相同工具 · 相同證據 · 相同評估日期
無法固定的差異必須記錄。共同 A/B 比較使用同一個使用者可見成果標準,不以 AFP 內部術語、固定章節或逐字措辭作為基線必須通過的門檻。
公開 Pilot Protocol v0.1
第一版公開 protocol 已定義為文字層 Pilot,用來先驗證比較方法、失敗分類與評分流程;它不測真實網頁搜尋、檔案操作或 Agent 外部行動,因此不能被引用為完整 Agent 能力證據。
閱讀 AFP Benchmark Protocol v0.1 →
報告原則
AFP 在可重現比較支持之前,不應宣稱已被實證證明優於其他方法。負面結果、混合結果、原始輸出、grader 理由與排除項目都應一起公開。
目前狀態
評估狀態:Pilot Protocol v0.1 已公開;正式 benchmark 分數尚未發布。