評估

· 1 分钟阅读时长

評估問題

核心問題只有一個:AFP 帶來的可靠性提升,是否足以合理化額外的結構與成本?

這件事應該用測試回答,而不是先假設成立。

基線設計

目前評估計畫比較四種條件,並盡量固定模型、任務、工具、證據集合與測試日期:

  1. 只有模型 — 不加入額外治理結構。
  2. 一般指令 — 使用一般 Custom Instructions 或任務說明。
  3. AFP — 在相同任務上套用 AFP 工作流程。
  4. AFP + 治理控制 — 視任務加入明確證據閘門、人工覆核條件與回歸檢查。

Validity Gate 先於 Quality Gate

每一筆結果必須先確認題目、證據、rubric、模型可見前提與比較條件有效,再判斷模型品質。若測試本身無效、Provider 阻擋或 grader 有爭議,不得直接算成 AFP 或基線的失敗。

公開結果至少區分:

  • MODEL_PASS
  • MODEL_FAIL
  • PROVIDER_BLOCK
  • INFRA_ERROR
  • INVALID_TEST
  • GRADER_DISPUTE

模型品質通過率只使用:

MODEL_PASS ÷(MODEL_PASS + MODEL_FAIL)

其他狀態必須保留並另外報告,不得悄悄丟棄。

指標

最低限度應記錄:

  • 任務正確率或 rubric 分數;
  • 最差結果與致命失敗;
  • 多次執行的變異程度;
  • 無依據但高確信的主張;
  • 漏掉的反證;
  • 工具呼叫次數;
  • Token 使用量;
  • 完成時間。

高風險工作流程不能只看平均分數。即使平均表現很好,只要仍存在嚴重且未被攔截的失敗,系統仍可能不適合使用。

實驗控制

有效比較應在可行範圍內固定:

相同模型 · 相同任務 · 相同工具 · 相同證據 · 相同評估日期

無法固定的差異必須記錄。共同 A/B 比較使用同一個使用者可見成果標準,不以 AFP 內部術語、固定章節或逐字措辭作為基線必須通過的門檻。

公開 Pilot Protocol v0.1

第一版公開 protocol 已定義為文字層 Pilot,用來先驗證比較方法、失敗分類與評分流程;它不測真實網頁搜尋、檔案操作或 Agent 外部行動,因此不能被引用為完整 Agent 能力證據。

閱讀 AFP Benchmark Protocol v0.1 →

報告原則

AFP 在可重現比較支持之前,不應宣稱已被實證證明優於其他方法。負面結果、混合結果、原始輸出、grader 理由與排除項目都應一起公開。

目前狀態

評估狀態:Pilot Protocol v0.1 已公開;正式 benchmark 分數尚未發布。