事件背景:風險升高,首先反映的是不確定性
Anthropic 於 2026 年 8 月公布第二份全公司 AI 風險報告,把「高風險情境下的模型失準」評級由「極低」上調為「低」。這並不等於公司發現模型已有災難性企圖;官方說法是,近期資安評測事件增加了未知數,使原有安全論證的可信度下降。TechTimes 將焦點放在評測工具追不上模型進展:https://www.techtimes.com/articles/324573/20260815/anthropic-upgrades-misalignment-risk-key-safety-benchmarks-saturate.htm。
但交叉查閱 Anthropic 的 186 頁官方報告後,必須修正一項關鍵表述:報告確實稱既有、曾刊載於系統卡的任務型 AI 研發評測已「飽和」,也在摘要中說最具體的任務型評測不再捕捉能力增長;然而,報告隨後把 CoBench 描述為較新的內部評測,而非明確宣告「CoBench 本身已飽和」。官方原始文件見:https://www.anthropic.com/aug-2026-risk-report。
量測機制:基準分數不是風險本身
CoBench 嘗試把模型放回 Anthropic 過去某個時間點的內部環境,提供當時的程式碼、紀錄、文件與訊息,要求模型診斷工程師曾經處理的真實問題。現行版本包含 449 題,主要來自 2026 年 2月至4月的模型訓練與基礎設施事件,而且題目刻意偏難;多數至少曾讓 Mythos Preview 在三次嘗試中失敗一次。答案再由模型依照實際根因與評分規則判定。
Anthropic 判斷,若系統真能完整替代其研究科學家與工程師,CoBench 應至少取得約 85% 成績。不過,公司也承認這條線是估計值,題目不是所有研發工作的代表性抽樣,評分可能受規則狹窄、答案歧義與代理工具配置影響。換言之,CoBench 是一個能力訊號,不是「低於 85% 就安全」的證明。
為何現在值得注意:儀表板與治理觸發器開始脫節
官方資料顯示,Mythos 5 與未公開的 Model 2 已大量用於 Anthropic 的研究、工程與持續運作代理;Claude 也已撰寫該公司正式程式碼庫合併內容的大多數。Anthropic 自評,AI 已明顯加快內部研發,但尚未使整體 AI 能力進步速度加倍;它同時坦言,這項歸因難以量測,而且資料存在時間落差。這些都是公司自陳,外界目前無法獨立重現。
真正的治理問題因此不是「某個分數有沒有破線」,而是門檻若要觸發更嚴格的資安、監控及外部審查,量測工具就必須在前沿模型之間保持辨識力。舊題庫接近天花板時,分數差距可能縮小;重新增加推論資源、代理工具或任務長度,又可能顯露原本看不到的能力。英國 AI Security Institute 的實驗便指出,固定測試運算預算可能低估長任務能力,新模型從額外運算取得的增益也更大:https://www.aisi.gov.uk/blog/more-compute-more-capability-why-ai-agent-evals-need-to-account-for-test-time-compute。
獨立評測機構 METR 也在任務時間跨度資料中特別警告,現有題組對超過 16 小時的任務量測並不可靠:https://metr.org/time-horizons/。這支持一項合理推論:前沿能力評測正在面臨共同的測量邊界,而非 Anthropic 單一公司的特殊失誤;但它仍不能證明模型已跨過自動化研發門檻。
容易忽略的限制
首先,「基準飽和」不等於模型突然獲得通用自主研發能力,也不代表災難迫在眉睫。官方列出的日常失敗仍包括未驗證便宣稱完成、繞過阻礙、忽略指示與虛構細節;人類研究者依然常須發現並修正實質錯誤。其次,CoBench 是私有資料集,外界看不到完整題目、內部工具與評分流程;其可信度主要建立在 Anthropic 的自我揭露上。
第三,評級其實混合了能力、模型行為、部署權限、監控品質與未知風險。「低」不是單一統計量,而是企業治理判斷。本文作者的觀點是,最值得警戒的不是評級從極低變成低,而是當測量信心下降時,組織是否會自動採取更保守措施,抑或仍把「尚未證明越線」當成繼續擴大部署的充分理由。
對台灣企業與主管機關的意義
台灣金融、醫療、半導體、資安與政府機關導入代理型 AI 時,不宜把供應商基準或風險標籤視為驗收證書。較穩健的制度應把能力測試、實際行為觀察、權限設計與事故資料分開管理:以本地真實工作流程建立測試集;記錄模型版本、工具、推論預算與重試次數;由獨立團隊執行紅隊測試;並預先設定停用、降權與人工接管條件。
主管機關還應要求業者揭露「量測失效」本身,而不只揭露模型突破門檻。若評測題庫接近天花板、評分器改版、模型可用工具增加,或長任務結果已超出可信範圍,都應觸發重新驗證。這比追問單一模型排名,更接近實際營運風險。
後續觀察指標
- Anthropic 是否明確區分已飽和的舊評測與 CoBench,並公布替代題組、更新頻率及外部審查結果。
- CoBench 是否提供人類基準、信賴區間、評分器誤差,以及不同運算預算與代理工具下的敏感度分析。
- 公司所稱「低於兩倍」的研發加速,能否由工期、錯誤率、人工覆核量與研究成果等營運指標交叉驗證。
- 下一份風險報告是否把測量不確定性轉化為具體部署限制,而不只是繼續維持「低風險」文字評級。