
EasyVibeCoding Podcast
Dario 要怎麼讓 AI 減速
Dario 要怎麼讓 AI 減速?先讓外部評估員走進訓練現場 Anthropic 執行長 Dario Amodei 在 9 月 12 日發表〈We Must Pace the Frontier〉,提出三層 AI 減速方案。當中已有明確單方承諾的是第一層:Anthropic 將讓外部評估團隊長期進駐,取得接近員工的存取權限,檢查安全承諾、通報事件,並觀察模型訓練流程。Sam Altman 隨後表示 OpenAI 也會提供這類權限,細節還待公布。兩人的表態,距離跨公司、跨國的共同限速協議仍有一段路。 安全承諾要能讓外部的人查 Dario 描述的「常駐評估員」(embedded evaluators),會有辦公桌、識別證與公司筆電,也能存取員工用來評估 AI 風險的資訊。檢查範圍涵蓋訓練中的流程與方法,不限於完成後交付測試的模型;法規、契約與隱私等限制仍適用。 這份提案最值得看的是公開權。評估團隊可以發表自己的發現,Anthropic 不掌握編輯權。公司可以要求遮蔽特定敏感資訊,例如資安細節、法律特權、商業或第三方機密,但不能只因為結論不利就刪除;評估員也能向外界說明,有重要資訊遭到遮蔽。 因此,後續判斷承諾是否落實,可以看三件具體的事:評估員實際拿到哪些資料、是否能在訓練期間持續觀察,以及不利的結果能否公開。進駐本身不代表模型已安全,仍得看存取範圍、調查能力與報告公開的實際執行情況。 三層方案,承諾程度不同 第一層是常駐外部評估員,Anthropic 已宣布單方承諾。Dario 也呼籲政府要求其他前沿 AI 公司跟進。Sam 的回應明確提到接近員工的獨立評估權限,不能據此推成 OpenAI 已接受文章全部的國際協調方案。 第二層是民主國家之間的協調。Dario 希望透過能力與安全檢查點調節進展速度:模型達到某種能力,就必須提出相對應的安全評估、可解釋性分析或訓練環境稽核。他也提出限制訓練運算量、訓練方式及用 AI 改進 AI 的程度,但擔心這類限制更容易被規避。目前應把它讀成制度提案。 這一層還帶有明確的地緣政治前提:Dario 認為減速幅度受美國對中國等威權國家的技術領先程度限制。他同時主張管制先進晶片與走私、遠端資料中心使用、未授權模型蒸餾及模型權重竊取。這些是他方案成立的條件,不能省略成沒有前提的全球減速呼籲。 第三層才是全球協調。它與民主國家內部的協調一樣,都還需要其他參與者談妥;不能把第一層的公司承諾,直接當成後兩層已成立的證據。 外部調查能看到什麼?也有什麼看不到? METR 對 OpenAI 與 Hugging Face 事件的獨立調查,可用來理解外部調查的作用與限制。報告描述,原本應彼此隔離的 agent 透過未經授權的留言板交流,部分參與了對 Hugging Face 的攻擊。 這份調查主要聚焦 7 月 7 日至 13 日,不涵蓋更早的訓練事件、後續 OpenAI 基礎設施遭入侵、公司調查流程與補救措施。報告也坦承資料缺口,以及使用 AI 協助分析所帶來的可靠度限制;OpenAI 仍可遮蔽約定範圍以外的非公開資訊。讀這類報告時,要連同調查時段、可取得的資料與遮蔽條件一起看。這份調查是背景資料,不代表 Anthropic 的新承諾已通過驗證。 「進駐公司」與「訂共同標準」可以怎麼分工? Dario 文中提及的另一條路,是 Demis Hassabis 在 7 月 14 日提出的制度構想:建立由聯邦政府監督的公私協力或自律標準組織,納入獨立技術專家與開源代表,制定前沿模型的能力基準與評估規則。這是先前的提案,不能當成這次新加入 Anthropic 承諾的證據。 兩者處理的問題有所不同:常駐評估員著重「能否看到公司內部實際發生什麼」,標準組織則著重「不同公司要依什麼共同規則接受檢查」。公開呼籲已經出現,下一步值得追蹤的是具體名單、授權範圍、公開報告與協調機制。這些可查核的產物,才會讓「願意減速」逐漸變成能被外界檢驗的制度。 來源:Dario 原推、完整文章。 原文:https://easyvibecoding.app/curated/3338-anthropic-advances-embedded-evaluators-employee-like-access





