返回行业动态
研究前沿

Anthropic 首次量化 AI 自研进度:Claude 主导其 26% 的模型研发,并提议三组跨实验室披露指标

Anthropic 于 2026 年 9 月 17 日在 Anthropic Institute 发布《Measurements for understanding the pace of AI development inside frontier labs》,首次以量化方式公开其内部 AI 研发自动化程度,并提出三组建议全体前沿实验室定期公布的指标。按其自报数据,截至 2026 年 8 月,Claude 已「主导」其 26% 的 AI 研发工作,较 2 月的不足 1% 大幅跃升;超过 90% 的研发工作达到「协作」及以上水平,但尚无任何被测工作实现完全自主。公司同时公开了约 3 万个内部智能体的监督数据与安全算力占比,并承认全部数字为自报、尚未经独立核实。

来源:Anthropic Institute(Anthropic 官方研究机构)原标题:Measurements for understanding the pace of AI development inside frontier labs查看原文
高度自动化的数据中心运维车间:中央自动化作业轨道向纵深延伸,两侧银灰色工业机械臂悬停错落,深色网孔机柜立面密布青绿与琥珀色指示灯,抛光地面倒映灯光

图片来源:北京拓实科技原创(AI 生成封面)

发生了什么

2026 年 9 月 17 日,Anthropic 在 Anthropic Institute 发布《Measurements for understanding the pace of AI development inside frontier labs》。该文并未发布新模型,而是把 CEO Dario Amodei 此前提出的「为前沿发展留出缓冲」主张,转译为外部可追踪的量化标尺,并首次按这套标尺公开了自家数据。文中明确表示,公司将定期发布这些测量结果,后续还会把独立第三方评估员嵌入内部流程。

三组指标与自报数据

Anthropic 提出的测量分为三个维度。数据快照均为 2026 年 8 月,其中算力一项取自 7 月 13 日至 20 日的一周:

  • AI 主导的研发占比:采用 Epoch AI 的 AL0–AL5 自动化量表。Claude「主导」(AL4,即人类仅给出高层目标并负责监督)的 AI 研发工作占 26%,而 2026 年 2 月尚不足 1%;达到「协作」(AL3)及以上水平的工作占比超过 90%;没有任何被测工作达到完全自主(AL5)。
  • 智能体监督:在其最常用的内部平台上,任意时刻约有 30000 个研究/工程智能体在运行。2026 年 8 月共产生逾 10 亿次决策,在线监视器对动作执行前 100% 拦截审查,阻断率约 0.002%(约每 47000 次阻断一次);离线监视器每周标记约 10 万条对话记录,经分类器去噪后约 50 条最高优先级记录升级至人工复核。
  • 算力分配:样本周内约 6% 的 AI 研发算力用于安全工作;若仅统计由 AI 主导的研发,该比例约为 12%。

方法与可信度边界

任务清单的构建方式值得注意。Anthropic 在 2026 年 7 月每周随机抽取各部门 20% 的员工,由 Claude 研究智能体读取 Slack 记录与内部文档,汇出约 15000 项细粒度任务,再聚合成含 542 个节点(其中 378 个叶节点)的层级树,并冻结为基线。每个节点由独立 Claude 评委依据同期或更早的证据打分。Anthropic 同时公布了一致性检验结果:模型评分与任务归属员工的评分完全一致率为 59%,而人类评审者之间的一致率仅 35%;两者相差不超过一级的比例为 97%。

为什么重要

这是前沿实验室首次把「AI 在多大程度上参与自身研发」这一此前只有定性讨论的问题,变成有量表、有区间、有基线的公开数字。对产业而言,其意义不在 26% 这个数值本身,而在于披露本身开始具备标准形态:一旦指标定义公开,不公布或口径含糊就会成为信息劣势。文中亦明确,指标的目标之一是让研发节奏在必要时触发强制测试窗口,并在人类仍掌握主导权时让社会参与节奏决策。

不确定之处

  • 数据为自报。Anthropic 在文中承认全部数字未经独立核实,将其定位为供他方采纳或质疑的起点;第三方评估员的嵌入机制仍属计划,尚未落地执行。
  • 量表定性存在主观空间。文中承认「协作」与「主导」的边界判定依赖评委模型,边界案例存疑。
  • 基线冻结会系统性影响读数。任务树冻结在 7 月,指数上升只反映既有工作被自动化,不反映新出现的工作类型;Anthropic 表示将定期重建并重新版本化。
  • 算力占比只衡量支出,不衡量工作量。效率提升会压低安全算力占比,却不代表安全投入减少;且该数字来自单周快照,不含趋势。
  • 跨实验室可比性尚未成立。目前无共享测量方法,各家均以自研模型进行自评。
编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。